Prompt processing и decode TPS
Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.
Prompt processing обрабатывает уже существующий контекст параллельно. На него сильнее влияют вычислительная мощность, длина prompt и размер batch.
Decode генерирует токены последовательно. Для локального чата именно decode TPS чаще определяет ощущение скорости ответа.
Time to first token включает очередь, обработку prompt и подготовку runtime. Для серверного API эта метрика иногда важнее максимального decode TPS.
Сравнивайте результаты только при одинаковой модели, quant, context, runtime, batch и способе замера.