Размещение части модели в оперативной памяти

Часть весов переносится из видеопамяти в системную RAM. Это позволяет запустить более крупную модель, но снижает скорость.

llama.cpp и другие среды запуска могут оставить часть слоёв на CPU. Это помогает избежать ошибки нехватки памяти.

Скорость падает из-за более медленной памяти и передачи данных по PCIe. Чем больше доля данных в оперативной памяти, тем менее интерактивной становится модель.

Для комфортной работы важны объём RAM, пропускная способность памяти CPU и число реально выгруженных слоёв.