FP16, BF16, FP8 и типы вычислений

Формат весов и формат вычислений — связанные, но не одинаковые параметры.

FP16 экономит память относительно FP32 и широко поддерживается. У него ограниченный диапазон значений, поэтому некоторые операции требуют дополнительной осторожности.

BF16 занимает те же 2 байта, но имеет больший диапазон и часто удобнее для обучения и современных моделей. Поддержка зависит от поколения GPU.

FP8 уменьшает память и трафик, но требует совместимого железа, kernels и конкретной реализации модели. Название FP8 само по себе не гарантирует одинаковое качество и скорость.

GGUF Q4/Q6 описывает квантизованные веса. Внутренние активации, KV-кэш и отдельные слои могут оставаться в более высокой точности.