Batch и параллельные пользователи

Batch увеличивает throughput, но добавляет KV-кэш и меняет задержку одного запроса.

При нескольких одновременных последовательностях runtime хранит отдельное состояние KV-кэша. Поэтому память растёт примерно пропорционально числу активных последовательностей.

Больший batch может эффективнее загружать GPU и повышать суммарный throughput, но не обязательно ускоряет ответ одного пользователя.

Для чат-сервиса оценивайте как минимум TTFT, decode TPS одного запроса, total throughput и peak VRAM при ожидаемой конкуренции.