Пропускная способность памяти

Почему 24 ГБ на медленной карте и 24 ГБ на быстрой — не одно и то же.

При token-by-token LLM inference веса постоянно читаются из VRAM, поэтому memory bandwidth часто ограничивает decode speed.

Широкая шина и быстрая память особенно важны для больших dense-моделей.

Tensor compute важнее при больших batch и обучении; для одиночного чата bandwidth часто заметнее рекламных TFLOPS.