CPU-offload

Перенос части весов из VRAM в системную RAM. Запускает больше, но не делает RAM равной VRAM.

llama.cpp и другие runtime могут оставить часть слоёв на CPU. Это помогает избежать OOM.

Скорость падает из-за более медленной памяти и передачи данных по PCIe. Чем больше доля offload, тем менее интерактивной становится модель.

Для комфортной работы важны объём RAM, пропускная способность памяти CPU и число реально выгруженных слоёв.