Понятный справочник по локальному ИИ
Короткие объяснения без предположения, что читатель уже знает терминологию.
- Batch и параллельные пользователи — Batch увеличивает throughput, но добавляет KV-кэш и меняет задержку одного запроса.
- CPU-offload — Перенос части весов из VRAM в системную RAM. Запускает больше, но не делает RAM равной VRAM.
- CUDA, ROCm и Vulkan — Объём VRAM одинаков, но доступность оптимизированных kernels и custom nodes различается.
- ControlNet, IP-Adapter и LoRA — Дополнительные компоненты улучшают контроль, но добавляют память и время.
- FP16, BF16, FP8 и типы вычислений — Формат весов и формат вычислений — связанные, но не одинаковые параметры.
- KV-кэш — Память истории разговора, растущая вместе с контекстом и параллельными запросами.
- LoRA и QLoRA: требования к памяти — Обучение адаптера требует памяти не только под исходные веса.
- MoE и активные параметры — Почему 30B-A3B хранит около 30B весов, но считает примерно 3B на токен.
- Multi-GPU без мифов — Несколько карт могут дать память, throughput или параллельные задачи — это три разных сценария.
- PCIe, линии и топология multi-GPU — Физически установить несколько карт недостаточно: важны линии PCIe, расстояние между слотами и обмен между GPU.
- Prompt processing и decode TPS — Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.
- VAE и tiled VAE — Кодирование и декодирование изображения может стать пиковым потребителем VRAM на высоком разрешении.
- VRAM: память видеокарты — VRAM определяет, какая часть модели и её рабочего состояния помещается непосредственно на GPU.
- Веса модели — Главный файл модели и главный потребитель памяти.
- Как выбрать runtime — Один и тот же файл модели ведёт себя по-разному в llama.cpp, Ollama, vLLM и Transformers.
- Как читать результат калькулятора — Статус «помещается» отвечает только на вопрос о памяти; производительность и совместимость проверяются отдельно.
- Как читать точность расчёта — Память можно оценить сравнительно хорошо; скорость без одинакового benchmark — только диапазон.
- Квантизация — Уменьшение точности весов ради меньшей памяти и более быстрого запуска.
- Контекст — Сколько токенов модель может видеть одновременно — и сколько памяти это реально стоит.
- Минимальный протокол benchmark — Результат ценен только вместе с параметрами, которые позволяют его повторить.
- Несколько GPU в ComfyUI — Чаще полезно размещать компоненты или очереди, а не складывать VRAM арифметически.
- Питание и охлаждение AI-станции — TDP карт нельзя просто сложить и выбрать блок питания ровно на получившееся число.
- Почему пик VRAM в ComfyUI меняется — Память workflow определяется последовательностью узлов и тем, какие компоненты одновременно остаются на GPU.
- Пропускная способность памяти — Почему 24 ГБ на медленной карте и 24 ГБ на быстрой — не одно и то же.
- Системная RAM и offload — При выгрузке части модели оперативная память становится рабочим хранилищем, а не просто запасом.
- Токены: как модель считает текст — Токен — фрагмент текста. Контекст, скорость и цена памяти считаются в токенах, а не в страницах.
- Что означают 3B, 8B, 14B и 70B — B — миллиарды параметров. Размер влияет на файл модели, требования к памяти, скорость и потенциальное качество.
- Что такое локальный ИИ — Модель работает на вашем компьютере: файлы хранятся локально, а скорость и ограничения зависят от железа.