Обработка входного текста и скорость генерации

Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.

Обработка входного текста обрабатывает уже существующий контекст параллельно. На него сильнее влияют вычислительная мощность, длина входного текста и размер пакета.

Генерация ответа создаёт токены последовательно. Для локального чата именно скорость генерации чаще определяет ощущение скорости ответа.

Задержка первого токена включает очередь, обработку входного текста и подготовку среды запуска. Для серверного API эта метрика иногда важнее максимальной скорости генерации.

Сравнивайте результаты только при одинаковой модели, квантизации, контексте, среде запуска и размере пакета и способе замера.