LoRA и QLoRA: требования к памяти

Обучение адаптера требует памяти не только под исходные веса.

Во время LoRA хранятся базовая модель, обучаемые адаптеры, активации, градиенты и состояния оптимизатора. Поэтому размер файла модели не равен пиковому VRAM.

QLoRA уменьшает память базовых весов, но вычисления и часть служебных данных остаются в более высокой точности.

Сохранение только части промежуточных состояний снижает память за счёт повторного вычисления активаций и увеличивает время обучения.

Для оценки нужны sequence length, размер микропакета, накопление градиента, rank LoRA, оптимизатор и целевые модули.