Какие модели запускаются на 8 ГБ VRAM
На 8 ГБ разумно запускать компактные LLM 3–7B в Q4, использовать контекст 4K–8K и закрывать другие GPU-приложения. Большой контекст, несколько пользователей и дополнительные visual AI-компоненты быстро съедают запас.
Примеры моделей
- DeepSeek-R1-Distill-Qwen-7B — 7.6B
- Gemma 3 4B — 4.3B
- Llama 3.1 8B — 8.0B
- Llama 3.2 3B — 3.2B
- Qwen3 4B — 4.0B
Наличие 8 ГБ VRAM не гарантирует запуск любой 8B-модели: память также занимают KV-кэш, runtime и служебные буферы.