Qwen3 30B-A3B
MoE-модель: по памяти ведёт себя как 30B, а по вычислениям на токен ближе к активным 3.3B параметров.
Для чего подходит
- быстрый reasoning при наличии 20+ ГБ
- код и агенты
- multi-GPU рабочие станции
- высокая скорость после загрузки
Ограничения
- активные параметры нельзя использовать для расчёта размера весов
- offload экспертов может давать неровную производительность