Какие модели запускаются на 8 ГБ VRAM
На 8 ГБ разумно запускать компактные LLM 3-7B в Q4, использовать контекст 4K-8K и закрывать другие GPU-приложения. Большой контекст, несколько пользователей и дополнительные visual AI-компоненты быстро съедают запас.
Примеры моделей
- DeepSeek-R1-Distill-Qwen-7B: 7.6B
- Gemma 3 4B: 4.3B
- Llama 3.1 8B: 8.0B
- Llama 3.2 3B: 3.2B
- Qwen3 4B: 4.0B
Наличие 8 ГБ VRAM не гарантирует запуск любой 8B-модели: память также занимают KV-кэш, runtime и служебные буферы.