KV-кэш

Память истории разговора, растущая вместе с контекстом и параллельными запросами.

Во время attention модель хранит key/value tensors для уже обработанных токенов. Это позволяет не пересчитывать всю историю при каждом новом токене.

KV-кэш зависит от числа слоёв, hidden size, GQA/MQA, precision кэша, длины контекста и количества одновременных последовательностей.

Поэтому модель, которая помещается при 4K, может перестать помещаться при 64K или при четырёх параллельных пользователях.