CUDA, ROCm и Vulkan
Объём VRAM одинаков, но доступность оптимизированных kernels и custom nodes различается.
CUDA остаётся наиболее широко поддерживаемым стеком в PyTorch, vLLM и экосистеме ComfyUI. Это не означает, что любая NVIDIA-карта одинаково эффективна: важны архитектура и поддерживаемые dtype.
ROCm развивается и хорошо работает на поддерживаемых AMD GPU под Linux, но конкретная модель, runtime или custom node могут требовать проверки совместимости.
Vulkan-бэкенды полезны для переносимости и некоторых потребительских карт, однако набор оптимизаций и производительность могут отличаться от CUDA/ROCm.
DirectML подходит для части Windows-сценариев, но обычно не является первым выбором для максимальной производительности локального AI.