Llama 3.1 70B
Крупная dense-модель, для которой главным вопросом становится не запуск как таковой, а объём VRAM, контекст и межкарточный обмен.
Для чего подходит
- сильный локальный ассистент
- сложная аналитика и документы
- код и агенты
- сервер для нескольких внутренних задач
Ограничения
- Q4 требует порядка десятков гигабайт только под веса
- CPU-offload резко снижает скорость
- multi-GPU чувствителен к PCIe и стратегии split