KV-кэш
Память истории разговора, растущая вместе с контекстом и параллельными запросами.
Во время attention модель хранит key/value tensors для уже обработанных токенов. Это позволяет не пересчитывать всю историю при каждом новом токене.
KV-кэш зависит от числа слоёв, hidden size, GQA/MQA, precision кэша, длины контекста и количества одновременных последовательностей.
Поэтому модель, которая помещается при 4K, может перестать помещаться при 64K или при четырёх параллельных пользователях.