Квантизация

Уменьшение точности весов ради меньшей памяти и более быстрого запуска.

Q4, Q5, Q6 и Q8: не просто уровни «качества». Конкретные форматы K-quants, AWQ, GPTQ, EXL2 и GGUF используют разные вычислительные ядра и совместимость.

Q4 часто является практическим минимумом для больших локальных LLM. Q5/Q6 дают больше запаса качества, но требуют больше VRAM.

Квантизация моделей изображений и текстовых энкодеров устроена иначе, поэтому нельзя переносить оценки LLM один к одному.