Prompt processing и decode TPS

Это две разные фазы инференса, поэтому одной цифры «токенов в секунду» недостаточно.

Prompt processing обрабатывает уже существующий контекст параллельно. На него сильнее влияют вычислительная мощность, длина prompt и размер batch.

Decode генерирует токены последовательно. Для локального чата именно decode TPS чаще определяет ощущение скорости ответа.

Time to first token включает очередь, обработку prompt и подготовку runtime. Для серверного API эта метрика иногда важнее максимального decode TPS.

Сравнивайте результаты только при одинаковой модели, quant, context, runtime, batch и способе замера.