Локальные ИИ-модели
Выберите модель и посмотрите требования к видеокарте, оперативной памяти и диску.
- DeepSeek-R1-Distill-Qwen-14B — Средняя reasoning-модель, которая лучше удерживает многошаговые задачи, чем 7B, но ещё помещается в 12–16 ГБ при Q4.
- DeepSeek-R1-Distill-Qwen-32B — Крупная reasoning-модель для 24–48 ГБ VRAM или грамотно собранной multi-GPU системы.
- DeepSeek-R1-Distill-Qwen-7B — Компактная reasoning-модель, перенёсшая часть поведения DeepSeek-R1 в базу Qwen.
- Gemma 3 12B — Мультимодальная модель среднего размера, удобная для документов, изображений и длинных контекстов.
- Gemma 3 27B — Старшая Gemma 3 для качественного мультимодального анализа; комфортный класс начинается примерно с 24 ГБ.
- Gemma 3 4B — Компактная мультимодальная модель: понимает текст и изображения, поддерживает длинный контекст и много языков.
- Llama 3.1 70B — Крупная dense-модель, для которой главным вопросом становится не запуск как таковой, а объём VRAM, контекст и межкарточный обмен.
- Llama 3.1 8B — Один из эталонных размеров для домашнего сервера: достаточно сильный, чтобы быть полезным, и достаточно лёгкий для 8–12 ГБ в Q4.
- Llama 3.2 3B — Компактная instruction-модель для локального помощника, классификации, извлечения данных и простых агентов.
- Mistral Small 3.1 24B — Сильная 24B instruction-модель с мультимодальностью и длинным контекстом; хороший ориентир для 24-ГБ класса.
- Mixtral 8x7B — Классическая MoE-модель: около 47B весов, но на токен активируется существенно меньше параметров.
- Phi-4 14B — Компактная по современным меркам 14B-модель, сфокусированная на качественных синтетических данных, reasoning и STEM.
- Qwen3 14B — Средний класс, который уже заметно сильнее 7–8B моделей, но ещё реалистичен для одной 12–16-ГБ карты в Q4.
- Qwen3 30B-A3B — MoE-модель: по памяти ведёт себя как 30B, а по вычислениям на токен ближе к активным 3.3B параметров.
- Qwen3 32B — Сильная dense-модель для кода и reasoning; Q4 находится у границы 24 ГБ с учётом KV-кэша и runtime.
- Qwen3 4B — Быстрая компактная модель с хорошей многоязычностью и режимами обычного ответа и рассуждения.
- Qwen3 8B — Сбалансированный локальный универсал для русскоязычного чата, кода, RAG и инструментальных вызовов.
- FLUX.1-dev — Качественный FLUX-профиль для детализированной генерации, но полная сборка требует серьёзного VRAM budget.
- FLUX.1-schnell — Быстрый distilled FLUX для генерации за малое число шагов; удобен для интерактивных workflow.
- FLUX.2 [klein] 4B — Компактная 4B-модель Black Forest Labs для быстрой генерации, редактирования и multi-reference workflow.
- Qwen-Image — Foundation-модель генерации и редактирования с сильным пониманием текста, компоновки и типографики, включая китайский и английский.
- Qwen-Image Edit — Профиль редактирования: изменение объектов, стиля и текста при сохранении структуры исходного изображения.
- Stable Diffusion 1.5 — Самый лёгкий и зрелый классический diffusion-стек с огромной библиотекой LoRA, ControlNet и custom checkpoints.
- Stable Diffusion 3.5 Medium — Современная diffusion-transformer модель среднего размера с лучшим пониманием prompt и типографики, чем SDXL.
- Stable Diffusion XL 1.0 — Зрелая универсальная модель 1024×1024 с большой экосистемой и предсказуемыми ComfyUI workflow.
- Wan 2.2 I2V A14B — Тяжёлая image-to-video модель для 480p/720p; типичный кандидат для block swap и нескольких GPU.
- Wan 2.2 TI2V 5B — Облегчённая text/image-to-video модель, рассчитанная на более доступные GPU, чем 14B-варианты.