Размещение части модели в оперативной памяти
Часть весов переносится из видеопамяти в системную RAM. Это позволяет запустить более крупную модель, но снижает скорость.
llama.cpp и другие среды запуска могут оставить часть слоёв на CPU. Это помогает избежать ошибки нехватки памяти.
Скорость падает из-за более медленной памяти и передачи данных по PCIe. Чем больше доля данных в оперативной памяти, тем менее интерактивной становится модель.
Для комфортной работы важны объём RAM, пропускная способность памяти CPU и число реально выгруженных слоёв.