Para una infraestructura existente, la arquitectura Hopper puede ser adecuada, en particular H100 si 640 GB de memoria GPU son suficientes. De lo contrario, H200 gestiona mejor los modelos grandes, los contextos largos y una caché KV de gran tamaño. DGX B200 es la opción más equilibrada para dar el salto a Blackwell en entrenamiento, ajuste fino e inferencia en producción. DGX B300 es necesario cuando son críticos los 288 GB en cada GPU, los modelos de razonamiento y las cargas con alta concurrencia. Sin embargo, las ventajas de los sistemas de gama más alta solo se aprovechan cuando la red, la alimentación eléctrica, la refrigeración, el almacenamiento y, por supuesto, el equipo de operaciones están preparados.
NVIDIA DGX servers
Cuatro servidores DGX y tres etapas de evolución
DGX H100 y H200 pertenecen a la generación Hopper. Ambos servidores incorporan ocho aceleradores conectados mediante NVLink y NVSwitch, pero H200 dispone de una cantidad de memoria HBM3e considerablemente mayor. Por tanto, el paso de H100 a H200 resuelve principalmente las limitaciones de capacidad del modelo y ancho de banda de memoria, en lugar de cambiar toda la arquitectura.
DGX B200 marca la transición a Blackwell: más memoria, NVLink/NVSwitch de quinta generación y compatibilidad por hardware con FP4. DGX B300 utiliza Blackwell Ultra. Su principal diferencia frente a B200 son los 288 GB de memoria por GPU en lugar de 180 GB, además de un mayor rendimiento FP4 en modo denso y una red de hasta 800 Gbit/s por adaptador.
No confunda DGX B200 y B300 con NVL72
DGX B200 y B300 son servidores independientes de 10U con ocho aceleradores. DGX GB200 NVL72 y GB300 NVL72 son sistemas a escala de rack con decenas de aceleradores y una arquitectura de interconexión distinta. Sus resultados de pruebas, consumo energético y requisitos de red no pueden trasladarse automáticamente a un solo DGX.
Especificaciones principales
| Parámetro | DGX H100 | DGX H200 | DGX B200 | DGX B300 |
|---|---|---|---|---|
| Arquitectura | Hopper | Hopper | Blackwell | Blackwell Ultra |
| GPU | 8 × H100 SXM | 8 × H200 SXM | 8 × B200 SXM | 8 × B300 SXM |
| Memoria por GPU | 80 GB | 141 GB | 180 GB | 288 GB |
| Memoria GPU total | 640 GB | 1.128 GB | 1.440 GB | 2.304 GB |
| FP8 | aproximadamente 32 PFLOPS con dispersión | aproximadamente 32 PFLOPS con dispersión | 72 PFLOPS con dispersión | 72 PFLOPS con dispersión |
| FP4 | sin FP4 nativo de Blackwell | sin FP4 nativo de Blackwell | 144/72 PFLOPS, modo disperso/denso | 144/108 PFLOPS, modo disperso/denso |
| Interconexión de GPU | NVLink/NVSwitch 4 | NVLink/NVSwitch 4 | NVLink/NVSwitch 5 | NVLink/NVSwitch 5 |
| Red del clúster | hasta 8 × 400 Gbit/s | hasta 8 × 400 Gbit/s | hasta 8 × 400 Gbit/s | hasta 8 × 800 Gbit/s |
| Memoria del sistema | 2 TB | 2 TB | 2 TB, hasta 4 TB | 2 TB, hasta 4 TB |
| Altura | 8U | 8U | 10U | 10U |
| Potencia máxima | 10,2 kW | 10,2 kW | 14,3 kW | hasta 15 kW |
Los petaflops no pueden utilizarse como una clasificación simple. FP8 y FP4 son formatos distintos, mientras que las cifras con dispersión solo se alcanzan con una estructura de datos y un soporte de software adecuados. Por ejemplo, B200 y B300 ofrecen ambos 144 PFLOPS de rendimiento FP4 con dispersión, pero sus cifras en modo denso son de 72 y 108 PFLOPS, respectivamente.
La capacidad de B300 se indica a veces como 2,1 o 2,3 TB. La capacidad física exacta es de ocho módulos de 288 GB, es decir, 2.304 GB; la diferencia se debe al redondeo y al método utilizado para convertir las unidades.
Qué ha cambiado de Hopper a Blackwell Ultra
La memoria por GPU importa más que la suma total
La memoria de ocho aceleradores no se convierte en un conjunto unificado totalmente transparente. El modelo se distribuye entre las GPU y los datos se transfieren mediante NVLink y NVSwitch. Por ello, los 288 GB de cada GPU B300 ayudan a:
- alojar capas grandes y expertos sin una partición excesiva;
- reducir el paralelismo tensorial y el número de intercambios de datos;
- dejar más espacio para la caché KV y los búferes;
- ejecutar varias instancias del modelo o varios adaptadores;
- reducir la fragmentación de memoria.
En estos escenarios, la capacidad de un solo acelerador puede ser más importante que el rendimiento de cálculo máximo de todo el sistema.
FP4 no acelera todos los modelos
BF16, FP16 y FP8 siguen siendo importantes para el entrenamiento. FP4 en Blackwell está orientado principalmente a la inferencia de alto rendimiento y a determinadas operaciones de entrenamiento. Para utilizarlo se necesitan pesos cuantizados correctamente, un motor compatible y la validación de la calidad de salida.
Una menor precisión puede degradar la calidad de generación o el funcionamiento de determinadas capas. Por tanto, H200 y B300 no pueden compararse únicamente por el rendimiento FP4.
La red de B300 requiere una infraestructura nueva
B300 utiliza ocho adaptadores ConnectX-8 de hasta 800 Gbit/s. Esto es importante para el entrenamiento distribuido y el servicio de modelos en varios nodos, pero no aporta ventajas en una red antigua de 400 Gbit/s. La transición puede requerir nuevos conmutadores, ópticas, cables, configuración de RDMA y un almacenamiento más rápido.
Cuánta memoria necesita realmente un LLM
Para realizar una estimación inicial de la memoria de los pesos, puede utilizarse la siguiente aproximación:
- BF16 o FP16 — aproximadamente 2 bytes por parámetro;
- FP8 o INT8 — aproximadamente 1 byte por parámetro;
- almacenamiento de 4 bits — aproximadamente 0,5 bytes por parámetro.
Un modelo de 70.000 millones de parámetros en BF16 utiliza aproximadamente 140 GB solo para los pesos, mientras que uno de 400.000 millones de parámetros utiliza unos 800 GB. El consumo real es mayor debido a los metadatos, la alineación y los espacios de trabajo de las bibliotecas.
El tamaño del archivo del modelo no es el cálculo completo
Durante la inferencia, la memoria también es utilizada por:
- la caché KV de los tokens ya procesados;
- el contexto de entrada y el contexto generado;
- las secuencias simultáneas;
- los tensores temporales y los búferes CUDA;
- el procesamiento por lotes;
- los adaptadores LoRA;
- el margen reservado para el sistema de orquestación.
La caché KV crece rápidamente con contextos largos y muchos usuarios. Por ello, un modelo puede funcionar en una prueba individual, pero no sostener una carga de producción.
El ajuste fino requiere más memoria
El ajuste fino completo requiere almacenar los pesos, los gradientes, las activaciones y los estados del optimizador. La huella total de memoria es muchas veces mayor que la de los pesos por sí solos. LoRA y QLoRA reducen los requisitos porque entrenan pequeñas matrices adicionales, mientras que el modelo base puede almacenarse con una precisión reducida.
La frase «el modelo cabe en H200» no significa que sea posible realizar en él un ajuste fino completo. También deben tenerse en cuenta la longitud de la secuencia, el tamaño del lote, el método de optimización y el esquema de distribución entre GPU.
DGX para entrenar modelos grandes
H100 y H200
Hopper es adecuado cuando la organización ya utiliza versiones compatibles de CUDA, contenedores y bibliotecas. Ampliar un clúster existente suele ser más sencillo que cambiar al mismo tiempo los aceleradores, la red y el entorno de software.
H200 es preferible a H100 cuando:
- el modelo no cabe en 80 GB de una sola GPU;
- es necesario reducir el tamaño del lote;
- las secuencias largas consumen demasiada memoria;
- los datos se descargan con frecuencia en la memoria del sistema;
- se necesita más margen para las activaciones.
Si la carga cabe con holgura en 640 GB y escala bien, sustituir H100 únicamente para pasar a una generación más reciente puede no resultar rentable.
B200 y B300
B200 es adecuado para un nuevo clúster de uso general que combine entrenamiento, ajuste fino e inferencia. Es una elección razonable cuando la organización está preparada para actualizar la pila de software, pero todavía no necesita 288 GB en cada GPU.
B300 está justificado para modelos con contextos largos, grandes mezclas de expertos y ajuste fino completo. Puede resultar especialmente útil cuando la memoria adicional permite ejecutar el modelo en menos nodos o reducir el grado de paralelismo.
En el entrenamiento multinodo, el cuello de botella puede ser la red, la lectura del conjunto de datos, las operaciones colectivas o la escritura de puntos de control. Si las GPU permanecen inactivas esperando datos, pasar de B200 a B300 no proporcionará una aceleración proporcional.
LoRA, QLoRA y ajuste fino completo
H100 o H200 suelen ser suficientes para LoRA y QLoRA. H200 resulta más cómodo para un modelo grande, un contexto largo, varios adaptadores y un lote de mayor tamaño.
B200 es más adecuado para un entorno con varios proyectos: su memoria adicional permite ejecutar más experimentos en paralelo y reduce la descarga de datos en la memoria del sistema. B300 es necesario cuando la carga requiere:
- ajuste fino completo de LLM grandes;
- varios experimentos exigentes al mismo tiempo;
- la longitud máxima de secuencia;
- lotes de gran tamaño;
- menos nodos por carga de trabajo.
Con una utilización baja, la ventaja de B300 no compensa el coste. A veces, varios servidores más asequibles son más fáciles de repartir entre equipos y simplifican el mantenimiento de la redundancia y la tolerancia a fallos.
Qué DGX elegir para inferencia
La inferencia de un modelo tiene dos etapas. Primero, el servidor procesa toda la solicitud de entrada; después, los tokens de respuesta se generan de forma secuencial. La primera etapa depende en mayor medida del rendimiento de cálculo y de la longitud de entrada, mientras que la segunda depende del ancho de banda de memoria y de la capacidad de la caché KV.
Por tanto, una única cifra de tokens por segundo no es suficiente. Un servicio de producción debe tener en cuenta:
- el tiempo hasta el primer token;
- la latencia entre tokens;
- el número de solicitudes simultáneas;
- la longitud de entrada y salida;
- la estabilidad durante los picos de carga.
H100 frente a H200
H100 es adecuado para modelos pequeños y medianos, contextos moderados y una infraestructura ya existente. H200 es mejor cuando crece la caché KV, aumenta el número de secuencias simultáneas o el modelo debe dividirse demasiado entre las GPU.
Como ambos sistemas pertenecen a la generación Hopper, el paso a H200 puede aumentar la capacidad sin cambiar por completo el entorno de software.
B200 frente a B300
B200 es una plataforma Blackwell equilibrada para inferencia de gran volumen y cargas mixtas. B300 aporta valor cuando coinciden un modelo grande, un contexto largo y muchos usuarios. Esto es habitual en modelos de razonamiento y agentes de IA con largas cadenas de acciones.
La memoria adicional permite mantener una caché KV mayor y reducir la partición del modelo. Sin embargo, el resultado depende del motor de inferencia, la cuantización y las bibliotecas: un contenedor antiguo puede no aprovechar las ventajas de Blackwell Ultra.
RAG y agentes de IA
RAG incluye la creación de embeddings, la recuperación desde la base de datos, el reranking, el ensamblaje del contexto y la generación. También pueden añadirse llamadas a herramientas y ciclos repetidos de razonamiento.
La GPU acelera la generación y parte del proceso de reranking, pero la latencia puede estar determinada por la CPU, la RAM, NVMe, la red o la base de datos. Una recuperación lenta no será más rápida después de sustituir H200 por B300.
H100/H200 son adecuados para sistemas RAG maduros con cargas controladas. B200 encaja mejor en una nueva plataforma de producción donde la generación y el ajuste fino se ejecutan conjuntamente. B300 es útil para contextos largos, muchos agentes y un gran número de cadenas simultáneas.
Las CPU de DGX participan en la preparación de datos y en las operaciones de entrada/salida. Estas operaciones son similares a las cargas gestionadas por servidores Intel Xeon, por lo que la CPU no debe considerarse un componente secundario de una plataforma RAG.
Laboratorio de IA multiusuario
En un laboratorio, la utilización efectiva es más importante que el rendimiento récord de un solo modelo. Los recursos se asignan mediante contenedores, Slurm o Kubernetes; los modos MIG compatibles permiten dividir las GPU en instancias de cálculo aisladas.
Deben tenerse en cuenta los límites de memoria, las prioridades de los trabajos, la duración de los experimentos, la competencia por los recursos NVMe y de red, así como las horas de GPU realmente utilizadas.
B300 resulta cómodo cuando varios equipos ejecutan modelos grandes con regularidad. Con una demanda irregular, varios sistemas H100/H200 o incluso servidores GPU convencionales de menor densidad pueden ser más prácticos: los proyectos interfieren menos entre sí y el fallo de un nodo no detiene todo el laboratorio.
Un DGX o un clúster
Un solo servidor es más fácil de desplegar y mantener. Es adecuado para un modelo grande o una carga de entrenamiento que quepa en la memoria del nodo. NVLink interno proporciona comunicación de alta velocidad sin una red externa.
Limitaciones de un único DGX:
- el mantenimiento requiere detener o trasladar la carga;
- un fallo afecta a todos los modelos alojados;
- la capacidad máxima está limitada a un solo sistema;
- las etapas de procesamiento no pueden escalarse de forma independiente.
Un clúster permite crear réplicas, distribuir el entrenamiento y separar el procesamiento de entrada de la generación. Para ello se necesitan balanceo de carga, almacenamiento compartido e InfiniBand o Ethernet con RDMA.
Duplicar el número de servidores rara vez duplica el rendimiento: parte del tiempo se emplea en la sincronización y el intercambio de tensores. La eficiencia depende del modelo, la estrategia de paralelismo y la topología de red.
Alimentación, refrigeración y despliegue
DGX H100/H200 ocupan 8U y consumen hasta 10,2 kW. B200/B300 ocupan 10U; su potencia máxima es de 14,3 y 15 kW, respectivamente. La planificación del rack debe tener en cuenta:
- la potencia disponible y la capacidad de reserva;
- la distribución entre PDU y fases;
- el número de conexiones eléctricas;
- la densidad térmica y el flujo de aire;
- la temperatura del aire de entrada;
- el peso del equipo.
Cuatro sistemas B300 ocupan físicamente 40U, pero su carga máxima se aproxima a 60 kW antes de incluir la red y el almacenamiento. Disponer de espacio libre en el rack no es suficiente si la instalación no puede evacuar esa cantidad de calor.
B300 está disponible con conexión a PDU o a una barra colectora de corriente continua. La versión con fuentes de alimentación utiliza doce módulos con redundancia N+N. El sistema pesa aproximadamente 168 kg con las fuentes de alimentación, por lo que se necesitan guías y equipos de elevación adecuados para la instalación.
Dónde se pierde rendimiento: red y almacenamiento
La red externa se vuelve crítica cuando el entrenamiento o el modelo se distribuyen entre varios sistemas DGX. B300 proporciona hasta ocho conexiones de 800 Gbit/s, pero requiere conmutadores, cables y una configuración compatibles. En una red de 400 Gbit/s, parte de las capacidades de ConnectX-8 queda sin utilizar.
El almacenamiento debe atender conjuntos de datos, versiones de modelos, puntos de control, registros, bases de conocimiento y copias de seguridad. Las unidades NVMe locales de DGX son útiles como caché rápida, pero no sustituyen a un almacenamiento compartido y tolerante a fallos con rendimiento suficiente tanto dentro del propio sistema de almacenamiento como a través de la red de acceso.
Si los datos se leen lentamente o el guardado de puntos de control bloquea el entrenamiento durante periodos prolongados, las GPU permanecen inactivas. Por ello, la red y el almacenamiento deben dimensionarse junto con los nodos de cálculo, no después de comprarlos.
Compatibilidad de la pila de software
Hopper resulta atractivo por sus controladores maduros, contenedores preparados y bibliotecas. Esto reduce el riesgo de migración, especialmente cuando se utilizan extensiones CUDA personalizadas.
Para Blackwell y Blackwell Ultra, compruebe:
- las versiones de CUDA y de los controladores;
- las imágenes de contenedor;
- las bibliotecas de cálculo distribuido;
- la compatibilidad con FP4 y FP8;
- los kernels de cálculo personalizados;
- el motor de inferencia y la orquestación.
La compatibilidad no implica la misma eficiencia. Una aplicación puede ejecutarse en B300 sin utilizar FP4, las mejoras del mecanismo de atención o un esquema de comunicación óptimo. Debe compararse el flujo de trabajo completo: carga del modelo, latencia, velocidad de generación, consumo de memoria y escalado.
Coste total de propiedad
Además del servidor, el proyecto incluye red, ópticas, PDU, mejoras de alimentación, refrigeración, racks, almacenamiento, soporte, electricidad y el trabajo del equipo de operaciones.
Las plataformas deben compararse no solo por el precio de compra, sino también por los costes operativos. Entre las métricas de coste útiles se incluyen:
- una hora de utilización real de las GPU;
- un ciclo de entrenamiento;
- un millón de tokens con una latencia determinada;
- atender al número necesario de usuarios;
- la formación del equipo;
- el tiempo de inactividad y la recuperación después de un fallo.
B300 puede resultar más económico si sustituye varios nodos o reduce la comunicación entre servidores. Sin embargo, con una utilización del 20–30 %, las capacidades adicionales pueden no compensar el coste de la plataforma más reciente. No se trata de un umbral universal, sino de una razón para medir de antemano el perfil de la carga.
Cuándo es mejor elegir otro servidor GPU
DGX es una plataforma integrada con una topología de GPU, una red, una pila de software y soporte de NVIDIA definidos. Otro servidor puede ofrecer una mejor relación calidad-precio cuando no se necesita el máximo rendimiento por nodo, pero sí unidades adicionales, una combinación diferente de GPU, CPU específicas, una red no estándar o integración en un parque existente.
Para este tipo de proyectos, pueden considerarse servidores Dell para IA. Hay configuraciones disponibles con ocho GPU NVIDIA B300, ocho B200 u ocho H200. Deben compararse la topología de GPU, el almacenamiento, la red, la certificación y el soporte, no solo el modelo del acelerador.
Elección de DGX según la carga
| Escenario | Opción preferida | Por qué |
|---|---|---|
| Ampliación de un clúster Hopper | H100/H200 | Menos cambios en el entorno de software y de red |
| H100 no ofrece memoria suficiente | H200 | 141 GB por GPU y 1.128 GB por servidor |
| LoRA y QLoRA | H200 o B200 | Margen suficiente sin necesidad de adquirir B300 |
| Ajuste fino completo de un LLM grande | B200 o B300 | Más memoria para gradientes y estados del optimizador |
| Nuevo clúster de uso general | B200 | Una transición equilibrada a Blackwell |
| Contexto largo y caché KV de gran tamaño | H200, B200 o B300 | La elección depende del modelo y del número de usuarios |
| Modelos de razonamiento y agentes de IA | B300 | 288 GB por GPU y más espacio para secuencias |
| Inferencia con alta carga | B200 o B300 | FP4 con una pila de software optimizada |
| Laboratorio multiusuario | H200 o B200 | Equilibrio entre memoria, madurez y coste |
| Potencia limitada en el rack | H100 o H200 | Menor carga máxima |
La tabla ofrece una orientación, pero no sustituye las pruebas del modelo con el contexto, el tamaño de lote, el número de usuarios y los requisitos de latencia previstos.
Errores habituales al comparar
- Tratar FP4, FP8 y los modos denso y disperso como métricas equivalentes.
- Evaluar la memoria total sin tener en cuenta la capacidad por GPU.
- Contar solo los pesos y olvidar la caché KV, las activaciones y los búferes.
- Aplicar las cifras de NVL72 a un único DGX.
- Observar los tokens por segundo sin considerar el tiempo hasta el primer token.
- Esperar una aceleración lineal al añadir un segundo nodo.
- Comprar adaptadores de 800 Gbit/s sin una red compatible.
- Ignorar la alimentación y la refrigeración del rack.
- No verificar la compatibilidad de Blackwell en la pila de software.
- Elegir B300 para una carga limitada por la CPU, la red o el almacenamiento.
Qué NVIDIA DGX elegir
Fuente de la imagen: NVIDIA
DGX H100 es adecuado para infraestructuras Hopper maduras y cargas para las que 640 GB de memoria GPU son suficientes. H200 es la mejor opción dentro de Hopper para modelos grandes, contextos largos y una caché KV de gran tamaño. B200 es el principal punto de entrada a Blackwell y resulta adecuado para la mayoría de los nuevos clústeres con cargas mixtas. B300 debe elegirse cuando se necesita el máximo margen de memoria, modelos de razonamiento, ajuste fino completo y una alta demanda simultánea.
Comience por el tamaño del modelo, la precisión de los pesos, los requisitos de la caché KV, la longitud del contexto, el número de usuarios y el método de ajuste fino. Después, evalúe la red, el almacenamiento, la alimentación, la refrigeración y la utilización. Este cálculo mostrará si la nueva generación ofrecerá una ventaja real o simplemente añadirá una capacidad costosa que no se utilizará.