Как выбрать runtime
Один и тот же файл модели ведёт себя по-разному в llama.cpp, Ollama, vLLM и Transformers.
llama.cpp — базовый вариант для GGUF, CPU/GPU-offload и гибкого распределения слоёв между картами. Он хорошо подходит для локальной рабочей станции и проверки новых квантизаций.
Ollama упрощает установку, хранение моделей и запуск API, но часть низкоуровневых параметров скрывает. Для воспроизводимого benchmark фиксируйте версию Ollama и фактический backend.
vLLM предназначен прежде всего для серверного обслуживания: continuous batching, paged attention и tensor parallel. Требования к совместимости GPU и модели строже, зато throughput при нескольких запросах обычно выше.
Transformers удобен для исследования, fine-tuning и нестандартного кода. Потребление памяти сильно зависит от attention implementation, dtype и accelerate/device_map.