Как выбрать среду запуска

Один и тот же файл модели может работать по-разному в llama.cpp, Ollama, vLLM и Transformers.

llama.cpp подходит для GGUF, гибкого распределения слоёв между процессором и видеокартой, а также проверки разных квантизаций на рабочей станции.

Ollama упрощает установку, хранение моделей и запуск API. Для воспроизводимого теста фиксируйте версию Ollama и фактически используемую вычислительную среду.

vLLM рассчитан прежде всего на серверное обслуживание: непрерывное формирование пакетов, страничное управление вниманием и распределение по нескольким видеокартам. Требования к совместимости выше, но при нескольких одновременных запросах пропускная способность обычно лучше.

Transformers удобен для исследований, дообучения и нестандартного кода. Потребление памяти зависит от реализации механизма внимания, типа данных и настроек настроек распределения по устройствам.