Multi-GPU без мифов
Несколько карт могут дать память, throughput или параллельные задачи — это три разных сценария.
Model parallelism делит одну модель между GPU. Data parallelism держит копию модели на каждой карте и увеличивает число одновременных запросов.
Для LLM SLI не требуется: распределение выполняет runtime. Скорость зависит от PCIe/NVLink, одинаковости карт и метода split.
Смешанные NVIDIA+AMD обычно следует считать отдельными workers, а не единым backend.