Квантизация
Уменьшение точности весов ради меньшей памяти и более быстрого запуска.
Q4, Q5, Q6 и Q8 — не просто уровни «качества». Конкретные форматы K-quants, AWQ, GPTQ, EXL2 и GGUF имеют разные kernels и совместимость.
Q4 часто является практическим минимумом для больших локальных LLM. Q5/Q6 дают больше запаса качества, но требуют больше VRAM.
Квантизация image-моделей и текстовых энкодеров устроена иначе, поэтому нельзя переносить оценки LLM один к одному.