LoRA и QLoRA: требования к памяти
Обучение адаптера требует памяти не только под исходные веса.
Во время LoRA хранятся базовая модель, обучаемые адаптеры, активации, градиенты и состояния оптимизатора. Поэтому размер файла модели не равен пиковому VRAM.
QLoRA уменьшает память базовых весов, но вычисления и часть служебных данных остаются в более высокой точности.
Gradient checkpointing снижает память за счёт повторного вычисления активаций и увеличивает время обучения.
Для оценки нужны sequence length, micro-batch, gradient accumulation, rank LoRA, optimizer и target modules.