Обработка входного текста и скорость генерации
Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.
Обработка входного текста обрабатывает уже существующий контекст параллельно. На него сильнее влияют вычислительная мощность, длина входного текста и размер пакета.
Генерация ответа создаёт токены последовательно. Для локального чата именно скорость генерации чаще определяет ощущение скорости ответа.
Задержка первого токена включает очередь, обработку входного текста и подготовку среды запуска. Для серверного API эта метрика иногда важнее максимальной скорости генерации.
Сравнивайте результаты только при одинаковой модели, квантизации, контексте, среде запуска и размере пакета и способе замера.