LoRA и QLoRA: требования к памяти

Обучение адаптера требует памяти не только под исходные веса.

Во время LoRA хранятся базовая модель, обучаемые адаптеры, активации, градиенты и состояния оптимизатора. Поэтому размер файла модели не равен пиковому VRAM.

QLoRA уменьшает память базовых весов, но вычисления и часть служебных данных остаются в более высокой точности.

Gradient checkpointing снижает память за счёт повторного вычисления активаций и увеличивает время обучения.

Для оценки нужны sequence length, micro-batch, gradient accumulation, rank LoRA, optimizer и target modules.