CPU-offload
Перенос части весов из VRAM в системную RAM. Запускает больше, но не делает RAM равной VRAM.
llama.cpp и другие runtime могут оставить часть слоёв на CPU. Это помогает избежать OOM.
Скорость падает из-за более медленной памяти и передачи данных по PCIe. Чем больше доля offload, тем менее интерактивной становится модель.
Для комфортной работы важны объём RAM, пропускная способность памяти CPU и число реально выгруженных слоёв.