Iniciar sesión

Configurador DELL 17G

Configurador DELL 16G

Configurador DELL 15G

Configurador DELL 14G

Configurador HPE Gen12

Configurador HPE Gen11

Configurador HPE Gen10 Plus

Configurador HPE Gen10

Solicitud de reparación bajo garantía

En caso de un problema, proporcionaremos diagnóstico y reparaciones en el sitio de instalación del servidor. De forma gratuita.

Idioma

Servidor Blackwell para LLM: RTX PRO 6000, B200 o B300: cuando necesita un servidor GPU asequible y una plataforma de IA empresarial.

Servidores Blackwell con RTX PRO 6000, B200 y B300

Para la mayoría de los sistemas RAG empresariales, los asistentes de IA locales y la inferencia de modelos de hasta 70.000 millones de parámetros, un servidor con una o varias RTX PRO 6000 es un punto de partida razonable. La B200 es necesaria cuando un modelo grande debe distribuirse entre aceleradores estrechamente interconectados y, al mismo tiempo, atender muchas solicitudes. La B300 se justifica cuando los requisitos de memoria de GPU, contexto largo y densidad de inferencia para modelos de razonamiento son todavía mayores. Una H100 o H200 puede resultar más rentable si la carga de trabajo ya encaja dentro de sus capacidades y existe una plataforma lista para usar a un precio inferior.

Blackwell abarca varias clases de hardware. La RTX PRO 6000 es una tarjeta PCIe independiente para un servidor GPU de propósito general. Las B200 y B300 suelen adquirirse como parte de una plataforma HGX, en la que ocho aceleradores SXM están conectados mediante NVLink y NVSwitch. Por eso, la comparación debe incluir no solo las GPU, sino también la arquitectura del servidor, el tamaño del modelo, la carga prevista, el número de usuarios y los requisitos del centro de datos.

AI servers with NVIDIA RTX PRO 6000, B200 and B300 GPUs

Servidor para IA
Nuevo
En existencia
Supermicro AS-A126GS-TNBR 8SFF/NVMe + 2SFF
Servidor Supermicro AS-A126GS-TNBR
2× AMD EPYC 9005/9004 (SP5 (LGA 6096)) / 6144GB
Precio
1 180 551 €
975 662 €
+ 204 889 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
Supermicro SYS-212GB-FNR 4NVMe
Servidor Supermicro SYS-212GB-FNR
2x Intel Xeon Platinum 8558 (48c/96t, 2.1GHz-4GHz, 330W) / 384GB / 2x BP
Precio
236 924 €
195 805 €
+ 41 119 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
Gigabyte G294-A22-AAP2 8SFF
Servidor GIGABYTE G294-A22-AAP2
1x Intel Xeon 6944P (72c/144t, 1.8GHz-3.9GHz, 350W) / 1152GB / 2x BP
Precio
148 946 €
123 096 €
+ 25 850 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
ASUS XA NB3I-E12 10NVMe
Servidor ASUS XA NB3I-E12 10NVMe
2x Intel Xeon 6 6767P (64C 336M Cache 2.40 GHz)/ 2x 1.92TB NVMe Gen5 PM9D3a/ 1x NVIDIA HGX B300 8-GPU server/ 32kh 128GB DDR5 RDIMM 6400MHz (Support up to 32 DIMM 4TB xrtov DDR5)/ 10x 3200W Titanium
Precio
890 670 €
736 091 €
+ 154 579 € IVA
Incluye envío a través de la UE
Añadir a la cesta

Tres niveles de servidores Blackwell

RTX PRO 6000 Blackwell Server Edition

La RTX PRO 6000 Server Edition dispone de 96 GB de memoria GDDR7 con corrección de errores, un ancho de banda de aproximadamente 1,6 TB/s y un consumo configurable de hasta 600 W. La tarjeta está diseñada para refrigeración por aire o líquida de nivel servidor y es adecuada no solo para LLM, sino también para vídeo, 3D, gemelos digitales y otras cargas de trabajo, incluidas las aplicaciones de ingeniería.

Un servidor puede configurarse con una, dos, cuatro u ocho tarjetas, distribuyendo los recursos entre distintos servicios. Por ejemplo, una GPU puede ejecutar un modelo generativo, la segunda encargarse de los embeddings y el reranking, y la tercera procesar imágenes.

La Server Edition no debe confundirse con la Workstation Edition ni con la Max-Q Workstation Edition. Tienen la misma capacidad de memoria, pero difieren en diseño, refrigeración y niveles de potencia permitidos. Para un servidor en rack se necesita una versión cuya compatibilidad haya sido confirmada por el fabricante del sistema.

B200

La B200 es un acelerador para centros de datos con 180 GB de HBM3e. En una configuración HGX típica, ocho GPU B200 están instaladas en una placa base común y conectadas mediante NVLink/NVSwitch. Esta arquitectura está diseñada para cargas de trabajo en las que un único modelo o proceso de entrenamiento intercambia datos continuamente entre varias GPU.

HBM3e no solo proporciona una mayor capacidad, sino también un ancho de banda de memoria superior. Esto es importante al leer los pesos de un modelo grande, formar lotes amplios de solicitudes y ejecutar inferencia distribuida.

B300 y GB300

La B300 pertenece a la generación Blackwell Ultra. Una sola GPU incorpora físicamente hasta 288 GB de HBM3e, mientras que un nodo con ocho aceleradores proporciona alrededor de 2,3 TB de memoria GPU agregada. Algunos fabricantes pueden indicar unos 270 GB de memoria utilizable por GPU, porque una parte de la capacidad se reserva para funciones del sistema y fiabilidad.

La B300 está orientada a modelos grandes, incluidos los modelos de razonamiento, así como a cargas con contexto largo y alta concurrencia. Un ancho de banda de hasta 8 TB/s por GPU permite trabajar con mayor rapidez con los pesos del modelo y un KV cache de gran tamaño.

Es importante señalar que B300 y GB300 no son lo mismo. La B300 puede funcionar en un servidor HGX con procesadores Intel Xeon o AMD EPYC. La GB300 combina Blackwell Ultra con un procesador Grace y se utiliza en plataformas especializadas Grace Blackwell a escala de rack, incluida NVL72.

Por qué ocho RTX PRO 6000 no equivalen a ocho B200

Por qué ocho RTX PRO 6000 no equivalen a ocho B200

Ocho RTX PRO 6000 proporcionan 768 GB de memoria GDDR7 física, pero esta memoria sigue distribuida entre tarjetas PCIe independientes. La aplicación debe dividir explícitamente el modelo, los datos o las solicitudes entre las GPU.

En HGX, la memoria también se encuentra físicamente en aceleradores separados. La diferencia es que NVLink y NVSwitch permiten una comunicación de alta velocidad entre ellos. La arquitectura HGX oficial especifica 180 GB para la B200, 288 GB para la B300 y hasta 1,8 TB/s de ancho de banda de GPU a GPU.

Criterio RTX PRO 6000 Server Edition HGX B200 HGX B300
Formato Tarjeta PCIe independiente 8 GPU SXM en una placa HGX 8 GPU SXM Blackwell Ultra
Memoria por GPU 96 GB GDDR7 ECC 180 GB HBM3e Hasta 288 GB HBM3e
Interconexión entre GPU A través de la topología PCIe NVLink y NVSwitch NVLink y NVSwitch
Escalabilidad Flexible, desde una GPU Nodo estrechamente interconectado Nodo estrechamente interconectado
Cargas principales IA privada, RAG, LoRA, vídeo y 3D Modelos grandes, entrenamiento, alta concurrencia Contexto largo, modelos de razonamiento, densidad máxima
Riesgo de sobrecoste Comprar muchas tarjetas sin resolver el cuello de botella de comunicación Infrautilizar un nodo costoso No aprovechar la memoria adicional

Si cada GPU atiende un modelo o una cola de solicitudes independiente, un servidor PCIe escala de forma eficiente. Sin embargo, con paralelismo tensorial, los cálculos de una misma capa se distribuyen entre varias GPU y las activaciones deben intercambiarse continuamente. La interconexión pasa entonces a formar parte de la ruta de cálculo, lo que proporciona a HGX una ventaja fundamental.

En ocasiones, dos servidores con cuatro RTX PRO 6000 cada uno pueden ser mejores que un único nodo con ocho GPU: aumenta la tolerancia a fallos y resulta más sencillo distribuir servicios independientes. Para un único modelo monolítico, en cambio, este diseño incrementa los requisitos de la red entre servidores.

¿Cuánta memoria GPU necesita realmente un LLM?

Se puede realizar una estimación inicial a partir del tamaño de los pesos del modelo:

  • BF16 o FP16 — aproximadamente 2 bytes por parámetro;
  • FP8 o INT8 — alrededor de 1 byte;
  • almacenamiento de 4 bits — alrededor de 0,5 bytes;
  • se necesita un margen adicional para búferes, datos de servicio y el motor de inferencia.

Un modelo de 70.000 millones de parámetros ocupa aproximadamente 140 GB en BF16, 70 GB en formato de 8 bits y 35 GB en formato de 4 bits. Esto no significa que cualquier archivo de ese tamaño vaya a ejecutarse con seguridad: el consumo de memoria depende de la arquitectura, la cuantización, la longitud del contexto, el tamaño del lote y el motor de software.

Un modelo de 405.000 millones de parámetros requiere más de 200 GB solo para los pesos, incluso en formato de 4 bits. Sin embargo, alojar los pesos es únicamente la primera parte del cálculo.

KV cache

Durante la generación, el modelo almacena representaciones intermedias de los tokens anteriores en el KV cache, es decir, la caché de claves y valores. Su tamaño aumenta con:

  • la longitud del contexto;
  • el número de secuencias simultáneas;
  • el número de capas y la dimensión del modelo;
  • la precisión utilizada para almacenar la caché.

Un modelo puede funcionar de forma estable para un solo usuario y agotar la memoria con decenas de sesiones simultáneas. Por ello, 96 GB suelen ser suficientes para un asistente interno, pero pueden resultar insuficientes para un servicio de gran volumen que procese documentos extensos.

La memoria adicional de la B300 se utiliza a menudo no para pesos más grandes, sino para atender más solicitudes sin descargar el KV cache en la RAM del sistema o en un almacenamiento de red.

Modelos Mixture of Experts

En los modelos MoE, solo se activa una parte de los bloques para procesar cada token. Esto reduce los cálculos, pero aun así es necesario almacenar el conjunto completo de pesos. Por tanto, la memoria necesaria no puede estimarse únicamente a partir del número de parámetros activos.

En las cargas MoE importan el número total de parámetros, la cantidad de expertos activos, el método de distribución y el volumen de comunicación entre las GPU.

Cuándo es suficiente la RTX PRO 6000

La RTX PRO 6000 es una GPU de servidor versátil para cargas en las que la flexibilidad importa más que la densidad máxima. Una o dos tarjetas suelen cubrir las necesidades de una empresa sin tener que atender a miles de usuarios simultáneos.

Entre los escenarios adecuados se encuentran:

  • un asistente empresarial y RAG;
  • generación y análisis de código;
  • inferencia de modelos 7B–70B en un formato optimizado;
  • ajuste fino con LoRA y QLoRA;
  • reconocimiento de voz y procesamiento de vídeo;
  • modelos multimodales de tamaño moderado;
  • varios servicios de IA independientes;
  • un proyecto piloto sin un perfil de carga fiable.

La ventaja de una plataforma PCIe es la posibilidad de empezar con una configuración más pequeña. Por ejemplo, un Dell PowerEdge XE7740 con RTX PRO 6000 puede servir como base para varios aceleradores sin pasar directamente a HGX. Conviene comprobar de antemano el número de tarjetas compatibles, sus requisitos de potencia, la refrigeración y la distribución de las líneas PCIe.

Cuatro u ocho RTX PRO 6000 están justificadas cuando las GPU realizan tareas independientes para distintos modelos, clientes o colas. Si un único modelo grande se distribuye entre todas las tarjetas, el ancho de banda del bus PCIe puede limitar la escalabilidad.

Cuándo la B200 se convierte en una elección justificada

La B200 es necesaria cuando la carga de trabajo puede aprovechar las ventajas de HGX, y no simplemente cuando requiere muchas GPU:

  • el modelo no cabe en un único acelerador;
  • una solicitud se procesa en varias GPU;
  • se realiza el ajuste fino completo de todos los pesos del modelo;
  • la velocidad de las operaciones colectivas es importante;
  • el servicio atiende a muchos usuarios;
  • se utilizan lotes grandes de solicitudes;
  • varios nodos HGX se combinan en un clúster.

El Dell PowerEdge XE9780 con ocho GPU B200 es una plataforma de IA estrechamente interconectada. HBM3e permite alojar pesos de gran tamaño y ampliar el KV cache, mientras que NVLink/NVSwitch reduce la sobrecarga al distribuir el modelo dentro del nodo.

Sin embargo, la B200 no elimina los cuellos de botella del resto del sistema. Se necesitan suficiente RAM, unidades NVMe rápidas, una red de almacenamiento, conectividad de alta velocidad entre nodos y una pila de software que utilice el paralelismo de forma eficiente. Si los datos se suministran lentamente o las GPU permanecen inactivas entre solicitudes, un servidor HGX costoso no ofrecerá la rentabilidad esperada.

Cuándo está justificada la B300

La B300 resuelve principalmente problemas de capacidad y densidad. Es necesaria cuando la B200 ya limita el tamaño del modelo, la longitud del contexto o el número de secuencias simultáneas.

Entre las cargas adecuadas se encuentran:

  • modelos densos y MoE de gran tamaño;
  • modelos de razonamiento con una generación interna prolongada;
  • inferencia de gran volumen con un KV cache amplio;
  • contexto largo con alta concurrencia;
  • ajuste fino completo de modelos grandes;
  • infraestructura diseñada para ofrecer el máximo rendimiento por rack;
  • un proyecto con un ciclo de vida largo y utilización continua.

Un PowerEdge XE9780 con B300 tiene sentido cuando la HBM adicional permite evitar la descarga de la caché, reducir el número de servidores o mantener la cantidad de sesiones necesaria.

La B300 es excesiva para un sistema RAG pequeño, varios modelos 7B–70B o cargas poco frecuentes. Las cifras máximas suelen indicarse para FP4 y cargas LLM; no pueden compararse directamente con BF16, FP16 o FP64. La baja precisión solo resulta útil cuando el modelo y la pila de software la admiten sin una pérdida de calidad inaceptable.

AI servers with NVIDIA RTX PRO 6000, B200 and B300 GPUs

Servidor para IA
Nuevo
En existencia
ASUS ESC8000A-E13 SKU1 6SFF/NVMe
Servidor ASUS ESC8000A-E13 SKU1
2x AMD EPYC 9575F (64c/128t, 3.3GHz-5GHz, 400W) / 768GB
Precio
207 674 €
171 631 €
+ 36 043 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
Supermicro AS-5126GS-TNRT2 2SFF+8NVMe
Servidor Supermicro AS-5126GS-TNRT2
2x AMD EPYC 9554 (64/128, 3.1GHz-3.75GHz, 360W) / 1536GB
Precio
257 058 €
212 445 €
+ 44 613 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
NVIDIA DGX B200
Servidor NVIDIA DGX B200
2x Intel Xeon Platinum 8570 (56c/112t, 2.1GHz-4GHz, 350W) / 2000GB
Precio
1 019 360 €
842 446 €
+ 176 914 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
ASUS XA NB3I-E12 10NVMe
Servidor ASUS XA NB3I-E12 10NVMe
2x Intel Xeon 6 6767P (64C 336M Cache 2.40 GHz)/ 2x 1.92TB NVMe Gen5 PM9D3a/ 1x NVIDIA HGX B300 8-GPU server/ 32kh 128GB DDR5 RDIMM 6400MHz (Support up to 32 DIMM 4TB xrtov DDR5)/ 10x 3200W Titanium
Precio
890 670 €
736 091 €
+ 154 579 € IVA
Incluye envío a través de la UE
Añadir a la cesta

Cómo cambia la elección según la carga de trabajo

Elección de un servidor Blackwell según la carga de trabajo

IA privada

Para un asistente local, la búsqueda en datos internos y varios modelos especializados, una o dos RTX PRO 6000 suelen ser suficientes. Es más importante organizar correctamente el acceso a los datos, la separación de usuarios, el registro de eventos y la redundancia.

Una B200 o B300 resulta lógica cuando la plataforma atiende a miles de empleados, varios departamentos utilizan modelos grandes al mismo tiempo y una interrupción afecta a procesos críticos.

RAG

RAG (Retrieval-Augmented Generation, donde el modelo trabaja con una base de conocimiento externa) no es, por sí solo, un motivo para comprar automáticamente una B200 o B300. La canalización incluye:

  • extracción y limpieza de documentos;
  • embeddings;
  • una base de datos vectorial y búsqueda;
  • reranking;
  • el modelo generativo.

El cuello de botella puede estar en la indexación, la calidad de búsqueda, el almacenamiento o la preparación de documentos. Para muchos sistemas empresariales, una RTX PRO 6000 es suficiente para la generación, mientras que una GPU más pequeña o incluso una CPU puede encargarse de las etapas auxiliares.

Se necesita una B200/B300 cuando el modelo es grande, el volumen de solicitudes es elevado, los documentos generan un contexto largo y el objetivo de latencia no permite descargar datos de la memoria GPU.

Inferencia

La inferencia tiene dos objetivos distintos: la latencia mínima para un usuario individual y el máximo rendimiento global del servidor.

Deben evaluarse los siguientes aspectos:

  • el tiempo hasta el primer token;
  • la velocidad de generación posterior;
  • la latencia durante los picos de carga;
  • el número de secuencias simultáneas;
  • el rendimiento del nodo completo;
  • la proporción de solicitudes que supera el tiempo de respuesta permitido.

La mejor GPU para una sola solicitud no ofrece necesariamente el menor coste por millón de tokens bajo una carga de gran volumen.

Ajuste fino y modelos multimodales

LoRA y QLoRA modifican una proporción relativamente pequeña de los parámetros y requieren menos memoria que un ajuste fino completo. La RTX PRO 6000 suele ser suficiente para adaptar modelos pequeños y medianos.

Las B200 y B300 son necesarias cuando se actualizan todos los pesos, se utilizan lotes grandes, el entrenamiento se ejecuta en varias GPU o el ciclo debe completarse dentro de plazos estrictos.

La RTX PRO 6000 también es adecuada para cargas mixtas que incluyen texto, imágenes, vídeo, 3D y gráficos profesionales. La B200/B300 no se elige porque haya imágenes en la entrada, sino por la escala del modelo, los requisitos de entrenamiento y la concurrencia.

Qué determina el rendimiento además de la GPU

CPU, RAM, NVMe, red, alimentación y refrigeración de un servidor GPU

Procesadores y memoria del sistema

La CPU realiza la tokenización, la preparación de datos, el procesamiento de la API, el enrutamiento de solicitudes y las operaciones RAG. Un número excesivo de núcleos no acelera automáticamente el modelo, pero un procesador poco potente o una topología PCIe deficiente pueden limitar el suministro de datos.

La RAM es necesaria para cargar los pesos, las cachés, los conjuntos de datos, la base de datos vectorial y las partes del modelo que puedan descargarse. En un sistema de doble socket, la memoria debe distribuirse de manera uniforme entre los canales y los nodos NUMA.

NVMe y red

Las unidades NVMe rápidas reducen los tiempos de carga de modelos y checkpoints, y aceleran los conjuntos de datos y la caché local. Son importantes el rendimiento sostenido con cargas mixtas, la resistencia de escritura, la protección frente a fallos y la capacidad para varias versiones del modelo.

En un servidor independiente, la red atiende a los clientes, el almacenamiento y la administración. En un clúster B200/B300, pasa a formar parte del sistema de cálculo. Una red lenta entre nodos reduce la eficiencia del entrenamiento distribuido, aunque las GPU dentro de cada nodo estén conectadas mediante NVLink.

Alimentación y refrigeración

Una sola RTX PRO 6000 consume hasta 600 W, por lo que ocho tarjetas pueden necesitar hasta 4,8 kW únicamente para las GPU. Los procesadores, la memoria, las unidades, las tarjetas de red y los ventiladores añaden más consumo.

El DGX B300 es un sistema de 10U con un consumo aproximado de 14,5 kW, doce fuentes de alimentación y una disipación térmica de unos 49.500 BTU/h. Requiere un rack preparado, PDU adecuadas, suficiente flujo de aire y la comprobación del peso permitido.

Incluso un servidor HGX refrigerado por aire no puede considerarse un nodo de rack convencional que pueda instalarse en cualquier centro de colocación. Deben evaluarse la potencia disponible por rack, la redundancia, la temperatura del aire de entrada y la capacidad de refrigeración del centro de datos.

Economía: calcular el coste del servicio completo

El precio de la GPU es solo una parte del gasto. El coste total incluye el servidor, la red, las unidades NVMe, el almacenamiento externo, el espacio de rack, la electricidad, la refrigeración, las licencias, el soporte, la redundancia y el trabajo de los ingenieros.

Es más útil comparar las plataformas mediante las siguientes métricas:

  • coste por millón de tokens;
  • tokens por segundo por servidor y por vatio;
  • coste por sesión de usuario;
  • duración del ajuste fino;
  • utilización real de las GPU;
  • coste del tiempo de inactividad.

Un servidor con RTX PRO 6000 utilizado al 70–80 % puede ser más rentable que un HGX B300 utilizado solo al 10–15 %. Sin embargo, para una inferencia de gran volumen que funcione las 24 horas, la B200 o B300 puede reducir el coste por token gracias a una mayor densidad y a un menor número de nodos.

Un servidor PCIe de propósito general resulta más sencillo de ampliar y reasignar a otras cargas. HGX es más adecuado para un clúster estandarizado con una utilización elevada y constante, y con tiempos de inactividad costosos.

Cuándo una H100 o H200 es más racional que Blackwell

Hopper sigue siendo relevante cuando la carga de trabajo encaja dentro de la memoria y el rendimiento disponibles. Conviene considerar la H100 cuando el modelo cabe en 80 GB, la pila de software ya está probada y un servidor listo para usar es notablemente más barato o está disponible antes.

La H200 ocupa una posición intermedia: sus 141 GB de HBM3e y sus 4,8 TB/s de ancho de banda la convierten en una opción sólida para una inferencia limitada por la memoria que todavía no necesita Blackwell.

Un PowerEdge XE9680 con H200 puede ser más racional que la B200 si 141 GB por GPU son suficientes, no se necesita FP4, la infraestructura está estandarizada en Hopper y la diferencia de precio supera el beneficio de la generación más reciente.

La migración a Blackwell está justificada cuando elimina una limitación medible: memoria insuficiente, poco ancho de banda, un número excesivo de servidores o un tiempo de entrenamiento inaceptable.

Matriz de selección de servidores Blackwell

Escenario Plataforma racional Justificación
Asistente privado, RAG, modelos 7B–70B 1–2 RTX PRO 6000 Memoria suficiente y menor barrera de entrada
Varios servicios independientes 2–8 RTX PRO 6000 Las GPU se distribuyen entre modelos y colas
LoRA o QLoRA RTX PRO 6000 HGX normalmente no es necesario
Un modelo grande distribuido entre varias GPU B200 Comunicación rápida dentro de HGX
Inferencia de gran volumen para un LLM grande B200 HBM3e, NVLink y alta densidad
Contexto largo y KV cache de gran tamaño B300 Hasta 288 GB por GPU
Modelos de razonamiento con alta concurrencia B300 Más memoria y alto rendimiento de atención
Infraestructura Hopper existente H100 o H200 Menor riesgo de migración y posible ahorro
Se necesitan más de 80 GB, pero la B200 es excesiva H200 141 GB de HBM3e
Proyecto piloto sin una carga confirmada RTX PRO 6000 o alquiler Evitar inmovilizar el presupuesto en un sistema sobredimensionado

Antes de elegir una plataforma, el modelo debe probarse con el mismo formato, motor y modo de paralelismo que se utilizarán en producción. Una prueba con una sola solicitud corta no sustituye a una prueba de carga: se necesitan longitudes de contexto realistas, números de usuarios reales y límites de latencia aceptables.

Para la mayoría de las empresas, la RTX PRO 6000 sigue siendo el punto de entrada más flexible a Blackwell. La B200 es necesaria cuando un modelo grande depende de una comunicación rápida entre GPU. La B300 está justificada cuando el proyecto utiliza la memoria adicional para contextos largos, un KV cache amplio y alta concurrencia. Las H100 y H200 deben seguir incluidas en la comparación hasta que un cálculo del coste total demuestre la ventaja de la nueva generación.

Las especificaciones y la disponibilidad de las plataformas se comprobaron en julio de 2026. La cantidad exacta de memoria utilizable, las GPU compatibles y los requisitos de alimentación y refrigeración deben confirmarse en la documentación del servidor seleccionado.


Comentarios
(0)
Sin comentarios
Escribir un comentario
Acepto el procesamiento de mis datos personales
Servidor para IA
Nuevo
En existencia
DELL PowerEdge XE9780 16SFF
Servidor Dell PowerEdge XE9780
2× Intel Xeon 6 series (up to 86 yader na CPU) / 4096GB / 12x BP
Precio
Preguntar al gerente
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
ASUS ESC8000A-E13 SKU1 6SFF/NVMe
Servidor ASUS ESC8000A-E13 SKU1
2x AMD EPYC 9575F (64c/128t, 3.3GHz-5GHz, 400W) / 768GB
Precio
207 674 €
171 631 €
+ 36 043 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
Supermicro SYS-212GB-FNR 4NVMe
Servidor Supermicro SYS-212GB-FNR
2x Intel Xeon Platinum 8558 (48c/96t, 2.1GHz-4GHz, 330W) / 384GB / 2x BP
Precio
236 924 €
195 805 €
+ 41 119 € IVA
Incluye envío a través de la UE
Añadir a la cesta
Servidor para IA
Nuevo
En existencia
ASUS XA NB3I-E12 10NVMe
Servidor ASUS XA NB3I-E12 10NVMe
2x Intel Xeon 6 6767P (64C 336M Cache 2.40 GHz)/ 2x 1.92TB NVMe Gen5 PM9D3a/ 1x NVIDIA HGX B300 8-GPU server/ 32kh 128GB DDR5 RDIMM 6400MHz (Support up to 32 DIMM 4TB xrtov DDR5)/ 10x 3200W Titanium
Precio
890 670 €
736 091 €
+ 154 579 € IVA
Incluye envío a través de la UE
Añadir a la cesta

SIGUIENTE ARTÍCULO

Sé el primero en enterarte de las nuevas publicaciones y gana 50 €