LoRA и QLoRA: требования к памяти
Обучение адаптера требует памяти не только под исходные веса.
Во время LoRA хранятся базовая модель, обучаемые адаптеры, активации, градиенты и состояния оптимизатора. Поэтому размер файла модели не равен пиковому VRAM.
QLoRA уменьшает память базовых весов, но вычисления и часть служебных данных остаются в более высокой точности.
Сохранение только части промежуточных состояний снижает память за счёт повторного вычисления активаций и увеличивает время обучения.
Для оценки нужны sequence length, размер микропакета, накопление градиента, rank LoRA, оптимизатор и целевые модули.