FP16, BF16, FP8 и типы вычислений
Формат весов и формат вычислений — связанные, но не одинаковые параметры.
FP16 экономит память относительно FP32 и широко поддерживается. У него ограниченный диапазон значений, поэтому некоторые операции требуют дополнительной осторожности.
BF16 занимает те же 2 байта, но имеет больший диапазон и часто удобнее для обучения и современных моделей. Поддержка зависит от поколения GPU.
FP8 уменьшает память и трафик, но требует совместимого железа, kernels и конкретной реализации модели. Название FP8 само по себе не гарантирует одинаковое качество и скорость.
GGUF Q4/Q6 описывает квантизованные веса. Внутренние активации, KV-кэш и отдельные слои могут оставаться в более высокой точности.