KV-кэш

Память истории разговора, растущая вместе с контекстом и параллельными запросами.

Во время механизма внимания модель хранит тензоры ключей и значений для уже обработанных токенов. Это позволяет не пересчитывать всю историю при каждом новом токене.

KV-кэш зависит от числа слоёв, размера скрытого состояния, GQA/MQA, точности кэша, длины контекста и количества одновременных последовательностей.

Поэтому модель, которая помещается при 4K, может перестать помещаться при 64K или при четырёх параллельных пользователях.