KV-кэш
Память истории разговора, растущая вместе с контекстом и параллельными запросами.
Во время механизма внимания модель хранит тензоры ключей и значений для уже обработанных токенов. Это позволяет не пересчитывать всю историю при каждом новом токене.
KV-кэш зависит от числа слоёв, размера скрытого состояния, GQA/MQA, точности кэша, длины контекста и количества одновременных последовательностей.
Поэтому модель, которая помещается при 4K, может перестать помещаться при 64K или при четырёх параллельных пользователях.