Batch и параллельные пользователи
Batch увеличивает throughput, но добавляет KV-кэш и меняет задержку одного запроса.
При нескольких одновременных последовательностях runtime хранит отдельное состояние KV-кэша. Поэтому память растёт примерно пропорционально числу активных последовательностей.
Больший batch может эффективнее загружать GPU и повышать суммарный throughput, но не обязательно ускоряет ответ одного пользователя.
Для чат-сервиса оценивайте как минимум TTFT, decode TPS одного запроса, total throughput и peak VRAM при ожидаемой конкуренции.