Квантизация

Уменьшение точности весов ради меньшей памяти и более быстрого запуска.

Q4, Q5, Q6 и Q8 — не просто уровни «качества». Конкретные форматы K-quants, AWQ, GPTQ, EXL2 и GGUF имеют разные kernels и совместимость.

Q4 часто является практическим минимумом для больших локальных LLM. Q5/Q6 дают больше запаса качества, но требуют больше VRAM.

Квантизация image-моделей и текстовых энкодеров устроена иначе, поэтому нельзя переносить оценки LLM один к одному.