Понятный справочник по локальному ИИ
Короткие объяснения без предположения, что читатель уже знает терминологию.
- CUDA, ROCm и Vulkan: Объём VRAM одинаков, но доступность оптимизированных вычислительных ядер и пользовательских узлов различается.
- ControlNet, IP-Adapter и LoRA: Дополнительные компоненты улучшают контроль, но добавляют память и время.
- FP16, BF16, FP8 и типы вычислений: Формат весов и формат вычислений: связанные, но не одинаковые параметры.
- KV-кэш: Память истории разговора, растущая вместе с контекстом и параллельными запросами.
- LoRA и QLoRA: требования к памяти: Обучение адаптера требует памяти не только под исходные веса.
- PCIe, линии и топология нескольких видеокарт: Физически установить несколько карт недостаточно: важны линии PCIe, расстояние между слотами и обмен между видеокартами.
- VAE и обработка по фрагментам: Кодирование и декодирование изображения может стать пиковым потребителем VRAM на высоком разрешении.
- VRAM: память видеокарты: VRAM определяет, какая часть модели и её рабочего состояния помещается непосредственно на GPU.
- Веса модели: Главный файл модели и главный потребитель памяти.
- Как выбрать среду запуска: Один и тот же файл модели может работать по-разному в llama.cpp, Ollama, vLLM и Transformers.
- Как читать результат калькулятора: Статус «помещается» отвечает только на вопрос о памяти; производительность и совместимость проверяются отдельно.
- Как читать точность расчёта: Память оценивается сравнительно точно. Скорость без одинакового тестового профиля показывается только диапазоном.
- Квантизация: Уменьшение точности весов ради меньшей памяти и более быстрого запуска.
- Контекст: Сколько токенов модель может видеть одновременно: и сколько памяти это реально стоит.
- Минимальный протокол измерения: Результат полезен только вместе с параметрами, которые позволяют повторить тест.
- Модели с экспертами и активные параметры: Почему 30B-A3B хранит около 30B весов, но считает примерно 3B на токен.
- Несколько GPU в ComfyUI: Обычно полезнее распределять отдельные компоненты или независимые задания, чем просто складывать объём памяти.
- Несколько видеокарт: память и скорость: Несколько видеокарт могут увеличить доступную память, общую пропускную способность или число параллельных задач. Это разные режимы работы.
- Обработка входного текста и скорость генерации: Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.
- Питание и охлаждение рабочей станции для ИИ: TDP карт нельзя просто сложить и выбрать блок питания ровно на получившееся число.
- Почему пик VRAM в ComfyUI меняется: Пиковое потребление памяти зависит от последовательности узлов и от того, какие компоненты одновременно находятся на видеокарте.
- Пропускная способность памяти: Почему 24 ГБ на медленной карте и 24 ГБ на быстрой: не одно и то же.
- Размер пакета и параллельные пользователи: Размер пакета увеличивает общую пропускную способность, но добавляет KV-кэш и меняет задержку одного запроса.
- Размещение части модели в оперативной памяти: Часть весов переносится из видеопамяти в системную RAM. Это позволяет запустить более крупную модель, но снижает скорость.
- Системная RAM и размещение части модели: При выгрузке части модели оперативная память становится рабочим хранилищем, а не просто запасом.
- Токены: как модель считает текст: Токен: фрагмент текста. Контекст, скорость и цена памяти считаются в токенах, а не в страницах.
- Что означают 3B, 8B, 14B и 70B: B: миллиарды параметров. Размер влияет на файл модели, требования к памяти, скорость и потенциальное качество.
- Что такое локальный ИИ: Модель работает на вашем компьютере: файлы хранятся локально, а скорость и ограничения зависят от железа.