Квантизация
Уменьшение точности весов ради меньшей памяти и более быстрого запуска.
Q4, Q5, Q6 и Q8: не просто уровни «качества». Конкретные форматы K-quants, AWQ, GPTQ, EXL2 и GGUF используют разные вычислительные ядра и совместимость.
Q4 часто является практическим минимумом для больших локальных LLM. Q5/Q6 дают больше запаса качества, но требуют больше VRAM.
Квантизация моделей изображений и текстовых энкодеров устроена иначе, поэтому нельзя переносить оценки LLM один к одному.