Iniciar sesión

Configurador DELL 17G

Configurador DELL 16G

Configurador DELL 15G

Configurador DELL 14G

Configurador HPE Gen12

Configurador HPE Gen11

Configurador HPE Gen10 Plus

Configurador HPE Gen10

Solicitud de reparación bajo garantía

En caso de un problema, proporcionaremos diagnóstico y reparaciones en el sitio de instalación del servidor. De forma gratuita.

Idioma

HPE ProLiant para cargas de trabajo de IA y GPU: DL380a Gen12, DL385 Gen11 y alternativas

HPE ProLiant para LLM, RAG y cargas GPU

Para la mayoría de las soluciones de IA empresariales, el HPE ProLiant DL385 Gen11 es un punto de partida razonable: combina aceleradores modernos con procesadores AMD EPYC de alto rendimiento, gran capacidad de memoria y un subsistema de almacenamiento flexible. Elija el HPE ProLiant Compute DL380a Gen12 cuando se necesite una alta densidad de GPU desde el principio, se vayan a ejecutar varios modelos simultáneamente o haga falta capacidad adicional para la inferencia a gran escala. Para el entrenamiento completo de modelos grandes, donde es crítica la comunicación rápida entre ocho aceleradores, resulta más adecuada una plataforma especializada como HPE ProLiant Compute XD685.

HPE DL380a Gen12 and DL385 Gen11 configurations

Servidor para IA
Nuevo
En existencia
HPE DL380a Gen12 16NVMe
Servidor HPE DL380a Gen12
2x Intel Xeon 6760P (64c/128t, 2.2GHz-3.8GHz, 330W) / 1024GB
Precio
Preguntar al gerente
Añadir a la cesta
Nuevo
En existencia
HPE ProLiant DL385 Gen11 8SFF
Servidor HPE DL385 Gen11 8SFF
1xAMD EPYC 9015 (8C 64M Cache 3.60 GHz) / 16GB DDR5 RDIMM 4800MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 2.5'' SFF) / 1 × HP 800W
Precio base
3 510 €
2 901 €
+ 609 € IVA
Incluye envío a través de la UE
Configurar
Nuevo
En existencia
HPE ProLiant DL385 Gen11 8LFF
Servidor HPE DL385 Gen11 8LFF
1xAMD EPYC 9015 (8C 64M Cache 3.60 GHz) / 16GB DDR5 RDIMM 4800MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 3.5'' LFF) / 1 × HP 800W
Precio base
3 510 €
2 901 €
+ 609 € IVA
Incluye envío a través de la UE
Configurar
Nuevo
En existencia
HPE ProLiant DL385 Gen11 12LFF
Servidor HPE DL385 Gen11 12LFF
1xAMD EPYC 9015 (8C 64M Cache 3.60 GHz) / 16GB DDR5 RDIMM 4800MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 3.5'' LFF) / 1 × HP 800W
Precio base
3 510 €
2 901 €
+ 609 € IVA
Incluye envío a través de la UE
Configurar

En qué se diferencia un servidor de propósito general de una plataforma GPU especializada

Disponer de ranuras PCIe libres no convierte automáticamente un servidor en una plataforma de IA completa. En un sistema de propósito general, los aceleradores comparten recursos internos con los adaptadores de red, los controladores de almacenamiento y las unidades NVMe. Este tipo de servidor resulta práctico cuando en un mismo nodo se ejecutan un modelo pequeño, una base de datos vectorial, contenedores, máquinas virtuales y servicios de aplicaciones, pero puede no ser adecuado para cargas de IA exigentes.

Para simplificar la elección del servidor, primero debe determinarse qué clase de producto se necesita. Los sistemas HPE pueden dividirse en tres categorías principales según sus capacidades de GPU.

Servidores de propósito general compatibles con GPU

Esta categoría incluye los modelos DL380 Gen12, DL340 Gen12, DL325 Gen11 y otros en los que las GPU son una de las distintas opciones de configuración posibles.

Sus principales ventajas son:

  • una integración más sencilla en un rack y un entorno de gestión existentes;
  • se puede conservar más espacio para unidades y tarjetas de red;
  • resulta práctico empezar con una o dos GPU;
  • el servidor sigue siendo adecuado para virtualización, bases de datos y aplicaciones convencionales;
  • los requisitos de alimentación y refrigeración son inferiores a los de los sistemas de IA con mayor densidad.

La principal limitación es el número relativamente reducido de aceleradores potentes de doble ancho. La cantidad de GPU disponibles también puede depender de la cesta de unidades, los risers, la configuración de red y los procesadores seleccionados.

Servidores diseñados desde el principio para aceleradores

El DL380a Gen12 no es un DL380 estándar con un kit de cables adicional. Es una plataforma 4U cuyo chasis, canales de flujo de aire, sistema de alimentación y distribución de ranuras están diseñados para una instalación densa de GPU.

Los aceleradores se instalan según configuraciones definidas y se distribuyen entre dos sockets de procesador. Esta arquitectura es adecuada para:

  • consolidar varios servicios de IA;
  • inferencia a gran escala;
  • ajuste fino de modelos;
  • procesamiento de un gran número de flujos de vídeo;
  • permitir que varios equipos trabajen en paralelo.

La alta densidad implica mayores requisitos para el rack, la alimentación y la refrigeración.

Sistemas especializados para entrenamiento

Las plataformas como XD685 utilizan ocho aceleradores como un único complejo de computación. Las propias GPU son solo una parte del diseño: las interconexiones de alta velocidad, la conmutación especializada, la alimentación y la refrigeración son igualmente importantes.

Un gran número de tarjetas PCIe independientes no convierte un servidor en el equivalente de un sistema HGX. Si un modelo transfiere tensores constantemente entre aceleradores, el ancho de banda de la interconexión puede influir más en el tiempo de entrenamiento que el número nominal de GPU.

Comparación de plataformas HPE ProLiant para cargas de IA

Plataforma Formato y CPU Compatibilidad con GPU Cargas adecuadas Principal limitación
HPE ProLiant Compute DL380a Gen12 4U, dos procesadores Intel Xeon 6 Hasta 10 GPU de doble ancho o 16 de ancho simple en configuraciones compatibles Inferencia de alta densidad, varios modelos, ajuste fino, servicios multimodales Altos requisitos de alimentación, refrigeración y topología
HPE ProLiant DL385 Gen11 2U, dos procesadores AMD EPYC 9004/9005 Hasta 4 GPU de doble ancho u 8 de ancho simple RAG, inferencia, visión artificial, cargas mixtas Margen limitado para ampliar las GPU en el futuro
HPE ProLiant Compute DL380 Gen12 2U, dos procesadores Intel Xeon 6 Varias GPU; el máximo depende de la configuración Infraestructura de propósito general con la IA como una de las cargas Las ranuras se comparten con la red, el almacenamiento y los controladores
HPE ProLiant Compute DL340 Gen12 2U, un procesador Intel Xeon 6 Hasta 4 GPU de doble ancho o 6 de ancho simple en el chasis GPU Inferencia, visión artificial, sistema económico de un solo socket Menor margen de CPU y memoria
HPE ProLiant DL325 Gen11 1U, un procesador AMD EPYC 9004/9005 Hasta 2 GPU de doble ancho o 4 de ancho simple Nodos de IA pequeños, VDI, inferencia en el edge Diseño denso y expansión limitada
HPE ProLiant Compute XD685 5U con refrigeración líquida o 6U con refrigeración por aire 8 aceleradores NVIDIA o AMD Entrenamiento de modelos grandes, ajuste fino completo, computación de alto rendimiento Coste y requisitos de infraestructura del centro de datos

Los máximos indicados no están disponibles en todas las configuraciones. El número exacto de aceleradores depende del modelo de GPU, su potencia, el formato, los risers seleccionados, el sistema de refrigeración y otras tarjetas de expansión.

HPE ProLiant Compute DL380a Gen12: cuando se necesita una alta densidad de GPU

HPE ProLiant Compute DL380a Gen12

Fuente de la imagen: Servermall

El DL380a Gen12 ocupa 4U y utiliza dos procesadores Intel Xeon 6. La plataforma admite PCIe 5.0 y está diseñada para configuraciones con 2, 4, 8 o 10 aceleradores de doble ancho, así como con 8 o 16 aceleradores de ancho simple. Las GPU se instalan por parejas y se distribuyen uniformemente entre los sockets de procesador.

El máximo de diez tarjetas de doble ancho no es importante por sí solo. Permite:

  • asignar modelos individuales a aceleradores dedicados;
  • aumentar el número de solicitudes LLM simultáneas;
  • alojar diferentes versiones de un modelo para varios departamentos;
  • ejecutar en paralelo el ajuste fino y la inferencia en producción;
  • separar la visión artificial, el reconocimiento de voz y la generación de texto;
  • realizar varios experimentos sin reasignar continuamente el hardware.

Qué cargas son adecuadas para el DL380a Gen12

La plataforma ofrece un rendimiento especialmente bueno cuando las GPU pueden utilizarse de forma independiente. Por ejemplo, cuatro aceleradores pueden atender el modelo de lenguaje principal, dos tarjetas pueden asignarse a un modelo de embeddings, otras dos a visión artificial y las restantes a pruebas.

El DL380a también es muy adecuado para la inferencia por lotes, donde el rendimiento agregado importa más que la latencia mínima de una sola solicitud. En este modo, el servidor procesa simultáneamente grandes grupos de tareas y los distribuye entre los aceleradores.

Otro escenario incluye varios equipos o clientes internos. La alta densidad permite asignar GPU propias a cada grupo sin desplegar un servidor físico independiente para cada proyecto.

Por qué diez GPU no siempre son mejores que ocho

Si un modelo grande se distribuye entre todos los aceleradores, la velocidad de comunicación entre ellos es importante. PCIe conecta las GPU con los procesadores, la memoria y otros dispositivos, pero no siempre ofrece el mismo ancho de banda entre aceleradores que NVLink y NVSwitch en plataformas especializadas.

El rendimiento final depende de:

  • la ubicación de las GPU respecto a los sockets de procesador;
  • la capacidad de memoria de vídeo de cada tarjeta;
  • la posibilidad de comunicación directa entre aceleradores;
  • la compatibilidad de la plataforma de software con la topología elegida;
  • la velocidad de transferencia de datos desde la memoria del sistema y el almacenamiento NVMe;
  • el ancho de banda de red cuando se combinan varios nodos.

Diez tarjetas PCIe pueden ser muy eficaces para varios modelos independientes. Para el entrenamiento síncrono de un único modelo grande, suele ser preferible un sistema de ocho aceleradores con una interconexión rápida.

Limitaciones de una configuración densa

Un nodo de alta densidad concentra el consumo eléctrico y el calor en un solo chasis. El diseño debe tener en cuenta:

  • el consumo combinado de las GPU, las CPU, la memoria y los adaptadores de red;
  • el número y tipo de conexiones a la PDU;
  • la redundancia de las fuentes de alimentación;
  • la potencia permitida por rack;
  • la temperatura del aire de entrada;
  • la disponibilidad de refrigeración líquida directa;
  • el coste del tiempo de inactividad de un nodo que aloja muchos servicios.

A veces, dos servidores con menor densidad son más prácticos que un sistema completamente equipado: son más fáciles de refrigerar, mantener y dotar de redundancia.

HPE ProLiant DL385 Gen11: una plataforma AMD equilibrada

HPE ProLiant DL385 Gen11

Fuente de la imagen: HPE

El DL385 Gen11 es un servidor 2U de dos sockets basado en procesadores AMD EPYC 9004 y 9005. Admite hasta cuatro GPU de doble ancho u ocho de ancho simple, PCIe 5.0 y hasta 6 TB de memoria DDR5.

Esto hace que el DL385 resulte útil no solo como nodo GPU, sino también como servidor que ejecuta la búsqueda, la preparación de datos, el almacenamiento y la lógica de aplicaciones junto al modelo.

La plataforma es adecuada para:

  • RAG con una base de datos vectorial local;
  • inferencia de un modelo grande o varios modelos medianos;
  • ajuste fino LoRA y QLoRA;
  • aprendizaje automático convencional;
  • procesamiento de imágenes y flujos de vídeo;
  • estaciones de trabajo virtuales con GPU;
  • un entorno de contenedores con servicios mixtos.

Por qué los procesadores siguen siendo importantes

Incluso cuando el modelo principal se ejecuta en las GPU, los procesadores se encargan de una parte considerable del pipeline:

  • limpiar y transformar los datos de entrada;
  • tokenizar el texto;
  • buscar y filtrar documentos;
  • descomprimir conjuntos de datos;
  • decodificar imágenes, audio y vídeo;
  • gestionar las conexiones de red;
  • ejecutar la base de datos vectorial, los contenedores y las máquinas virtuales.

Por este motivo, servidores AMD EPYC no deben compararse únicamente por el número de núcleos. También son importantes la frecuencia de reloj, el ancho de banda de la memoria, la ocupación de los canales, las líneas PCIe disponibles y la distribución de los dispositivos entre sockets.

Dónde terminan las ventajas de la versatilidad

Cuatro GPU potentes de doble ancho son suficientes para muchos proyectos empresariales, pero pueden no bastar para un modelo grande que no pueda cuantizarse o dividirse de forma eficiente.

La instalación de aceleradores también afecta a los demás componentes:

  • algunas ranuras de expansión dejan de estar disponibles;
  • el número de unidades puede depender del kit de GPU;
  • los límites térmicos reducen la lista de CPU y GPU permitidas;
  • pasar de dos a cuatro tarjetas puede requerir otros risers, ventiladores y fuentes de alimentación.

Si ya en la fase de diseño se prevé crecer hasta ocho o diez GPU potentes en un nodo, el DL380a ofrece una vía de escalado más directa.

Intel Xeon o AMD EPYC para un servidor de IA

La elección entre Intel y AMD no puede separarse de la plataforma de servidor concreta. El DL380a Gen12 se basa en Intel Xeon 6 y una alta densidad de aceleradores. El DL385 Gen11 utiliza AMD EPYC y se centra en el equilibrio entre CPU, memoria, GPU y almacenamiento.

Qué parámetros deben tenerse en cuenta

El número de núcleos es importante para la preparación paralela de datos, la virtualización y la atención de muchos procesos. Para las etapas secuenciales, algunas operaciones de tokenización y la lógica de red, puede ser más importante el rendimiento por núcleo.

En un sistema de IA también importan:

  • el ancho de banda de la memoria;
  • el número de canales ocupados;
  • el número de líneas PCIe;
  • la topología de conexión de las GPU;
  • el consumo eléctrico de los procesadores;
  • el coste de las licencias calculadas por núcleo o socket.

NUMA y ubicación de los dispositivos

En un sistema de dos sockets, cada GPU está conectada físicamente a un procesador determinado. Si una aplicación accede a la memoria conectada al otro socket o envía datos a un dispositivo del lado opuesto, la transferencia debe realizar un salto adicional a través del enlace entre procesadores.

La arquitectura NUMA debe tenerse en cuenta al:

  • fijar procesos a núcleos;
  • asignar memoria del sistema;
  • asignar GPU a contenedores;
  • instalar tarjetas de red y unidades NVMe;
  • configurar máquinas virtuales con passthrough directo de dispositivos.

Al elegir servidores Intel Xeon para IA, el modelo de CPU no es el único aspecto que debe considerarse. También importa cómo influyen los procesadores en las configuraciones de GPU permitidas, la refrigeración y la potencia total del sistema.

En la inferencia limitada casi por completo por la GPU, las diferencias entre los aceleradores y su topología suelen importar más que la marca del procesador. En RAG, la preparación de datos y el procesamiento multimodal, la CPU puede influir de forma notable en la latencia total del servicio.

Qué servidor se necesita para distintas cargas de IA

Escenario Principal cuello de botella Requisitos de GPU Servidor adecuado Qué suele subestimarse
Inferencia LLM Memoria de vídeo, caché KV, concurrencia de solicitudes Desde una GPU hasta varias tarjetas con suficiente VRAM DL385 para una escala moderada, DL380a para alta densidad La longitud del contexto y el número de sesiones simultáneas
RAG Equilibrio entre GPU, CPU, RAM, NVMe y red Normalmente, entre 1 y 4 GPU DL385, DL380 o DL325; DL380a para varios modelos La búsqueda y la preparación del contexto
LoRA y QLoRA VRAM, lectura del conjunto de datos y comunicación entre GPU A menudo, entre 1 y 4 GPU potentes DL385 o DL380a La escritura intensiva de puntos de control
Entrenamiento completo Capacidad de VRAM e interconexión entre GPU 8 aceleradores estrechamente interconectados o varios nodos XD685 y otros sistemas especializados La red y el sistema de archivos
Aprendizaje automático convencional CPU, RAM y lectura de datos A veces basta con una GPU DL380, DL385 o DL325 de propósito general No todos los algoritmos escalan a varias GPU
Visión artificial Decodificación, número de flujos y VRAM Depende de la resolución y del modelo DL340, DL385 o DL380a El tráfico entrante y la decodificación de vídeo
Modelos multimodales VRAM, procesamiento de datos y almacenamiento de objetos Varias GPU con cargas elevadas DL385 o DL380a; XD685 para entrenamiento La carga sobre la CPU, la RAM y el almacenamiento NVMe

Inferencia LLM

Inferencia LLM en HPE ProLiant

Para ejecutar un modelo de lenguaje, primero debe determinarse si sus pesos caben en la memoria de vídeo con el formato elegido. Sin embargo, esto por sí solo no es suficiente. La caché KV, es decir, los datos que el modelo conserva del contexto ya procesado, utiliza VRAM adicional.

El consumo de memoria aumenta con:

  • la longitud del contexto;
  • el número de usuarios simultáneos;
  • el tamaño del lote;
  • el número de secuencias paralelas;
  • la precisión de los cálculos.

Un modelo puede caber holgadamente en una GPU durante una prueba con una sola solicitud, pero agotar la memoria disponible bajo carga real. Por tanto, el servidor debe elegirse según la concurrencia y la latencia objetivo, no solo por el número de parámetros.

El DL385 es adecuado cuando bastan entre una y cuatro tarjetas potentes. El DL380a se adapta mejor al alojamiento de varios modelos, a una alta concurrencia o a la asignación de GPU independientes a distintos servicios.

RAG

En la generación aumentada por recuperación, la GPU solo se ocupa de una parte del pipeline. Antes de llamar al modelo de lenguaje, el sistema debe recuperar documentos, filtrar los resultados, componer el contexto y enviarlo a la etapa de generación.

La latencia depende de:

  • la velocidad de la base de datos vectorial;
  • el tamaño del índice en la RAM;
  • el rendimiento de la CPU;
  • el rendimiento de NVMe;
  • la red entre los componentes;
  • el modelo de embeddings;
  • la longitud del contexto formado.

Si la base de datos vectorial y el modelo se ejecutan en el mismo servidor, el DL385 resulta atractivo por su gran capacidad de memoria y su potente subsistema de CPU. Si un nodo atiende varios modelos generativos y a muchos usuarios, el DL380a, más denso, puede resultar más rentable.

Ajuste fino LoRA y QLoRA

Estos métodos modifican solo un subconjunto limitado de parámetros y requieren menos memoria que el ajuste fino completo. Para muchos modelos empresariales bastan entre una y cuatro GPU, por lo que el DL385 Gen11 puede cubrir la necesidad sin pasar a una plataforma especializada de ocho aceleradores.

El DL380a tiene sentido cuando:

  • varios equipos entrenan modelos simultáneamente;
  • los hiperparámetros deben probarse en paralelo;
  • se espera que aumente el tamaño de los modelos;
  • algunas GPU deben permanecer disponibles para la inferencia.

El dimensionamiento del almacenamiento debe incluir el conjunto de datos original, las versiones preparadas, los puntos de control, los registros de los experimentos y los archivos temporales.

Entrenamiento completo de modelos grandes

Durante el entrenamiento completo, los pesos, los gradientes y los estados del optimizador se sincronizan en cada paso. Si los datos se transfieren continuamente a través de una topología PCIe convencional, cada acelerador adicional puede aportar una mejora de rendimiento progresivamente menor.

Para este tipo de carga son importantes:

  • NVLink o NVSwitch dentro del nodo;
  • una red de 200/400 Gb/s entre nodos;
  • acceso remoto directo a memoria;
  • un sistema de archivos paralelo;
  • un pipeline de datos estable que evite tiempos de inactividad de las GPU;
  • la refrigeración de todo el rack.

Una plataforma especializada como XD685 no debe considerarse simplemente un DL380a más caro. Pertenece a otra clase, diseñada para ocho aceleradores estrechamente interconectados y grandes cargas de entrenamiento, por lo que puede ser la opción óptima en lugar de los servidores convencionales.

Visión artificial y modelos multimodales

El dimensionamiento de la analítica de vídeo debe tener en cuenta algo más que la velocidad de la red neuronal. Antes de la inferencia, los flujos se reciben por la red, se decodifican, se escalan y se transforman. La CPU o los bloques de decodificación por hardware pueden convertirse en un cuello de botella antes que los núcleos de cálculo de la GPU.

Los modelos multimodales también requieren:

  • cargar imágenes, audio y vídeo;
  • almacenamiento temporal de archivos;
  • conversión de formatos;
  • funcionamiento de varios codificadores;
  • un contexto más amplio;
  • un mayor consumo de RAM y VRAM.

El DL340 es adecuado para un nodo compacto de visión artificial con un solo socket. El DL385 ofrece un equilibrio entre procesamiento y almacenamiento. El DL380a es apropiado cuando deben consolidarse en un único servidor muchos flujos, modelos o servicios independientes.

Cómo elegir las GPU

Capacidad de memoria de vídeo

El máximo rendimiento de cálculo no sirve de nada si el modelo no cabe en la VRAM.

La capacidad necesaria depende de:

  • el número de parámetros;
  • el formato de los pesos;
  • la longitud del contexto;
  • el tamaño de la caché KV;
  • el procesamiento por lotes;
  • el método de ajuste fino;
  • la necesidad de almacenar gradientes y el estado del optimizador.

La cuantización reduce el consumo de memoria, pero puede afectar a la precisión, la velocidad de determinadas operaciones y los requisitos del software. El cálculo debe validarse con el modelo elegido, el motor de inferencia y un perfil real de solicitudes.

Aceleradores de ancho simple y doble

Las tarjetas de ancho simple permiten instalar más dispositivos independientes. Resultan prácticas para varios modelos pequeños, inferencia, VDI y flujos de vídeo.

Las GPU de doble ancho suelen tener una mayor potencia de diseño térmico, más capacidad de memoria y mayor rendimiento, pero ocupan más espacio y requieren una refrigeración más potente.

La comparación no debe plantearse como «16 frente a 10», sino que debe considerar las tarjetas compatibles concretas, su VRAM, potencia y método de conexión.

PCIe, NVLink y NVSwitch

PCIe conecta el acelerador con el procesador, la memoria, la red y el almacenamiento. NVLink proporciona enlaces más rápidos entre GPU compatibles. NVSwitch conecta varios aceleradores mediante una infraestructura de conmutación especializada.

PCIe 5.0 aumenta el ancho de banda del bus, pero no convierte tarjetas independientes en un módulo HGX unificado. Esto puede no ser crítico para la inferencia independiente. En el entrenamiento y la división de un modelo entre muchas GPU, la diferencia se vuelve significativa.

La compatibilidad depende de toda la configuración

No se puede instalar una GPU en un sistema ProLiant únicamente porque la tarjeta quepa físicamente en una ranura.

La compatibilidad depende de:

  • la revisión del chasis y de la placa del sistema;
  • los risers;
  • los cables de alimentación;
  • las fuentes de alimentación;
  • el kit de ventiladores;
  • la potencia de diseño térmico de la CPU y la GPU;
  • las versiones de BIOS e iLO;
  • los controladores y el sistema operativo.

Tampoco pueden mezclarse arbitrariamente distintos modelos de GPU en un mismo sistema DL380a Gen12. Los aceleradores permitidos y las restricciones deben comprobarse en las QuickSpecs vigentes.

Qué más limita el rendimiento de un servidor de IA

Limitaciones de rendimiento de un servidor de IA HPE ProLiant

Memoria del sistema

La RAM se utiliza para cargar modelos, preparar datos, almacenar documentos en caché, ejecutar la base de datos vectorial y mantener búferes de entrada y salida.

Cuando parte de los pesos o de la caché KV se descarga de la VRAM, aumentan las exigencias sobre la memoria del sistema y PCIe, y la latencia puede empeorar de forma notable.

La capacidad en gigabytes no es el único aspecto que debe considerarse; también importan:

  • el número de canales ocupados;
  • la frecuencia de los módulos;
  • la simetría entre sockets;
  • la proximidad de la memoria respecto a las GPU;
  • el margen para los contenedores y el sistema operativo.

NVMe

En un nodo de IA, resulta útil separar las funciones del almacenamiento:

  • matriz de arranque;
  • almacenamiento de modelos;
  • conjuntos de datos de trabajo;
  • índice de la base de datos vectorial;
  • espacio temporal;
  • puntos de control del entrenamiento.

El rendimiento secuencial es importante al cargar archivos grandes, mientras que la latencia y las operaciones de entrada/salida por segundo importan al trabajar con muchos objetos pequeños.

En el entrenamiento también debe considerarse la resistencia a la escritura, ya que los puntos de control y los datos intermedios generan escrituras intensivas. Las unidades locales no deben ser el único lugar donde se almacenen los modelos y los resultados.

PCIe y topología

El número de ranuras físicas no equivale al número de conexiones a velocidad completa. Las GPU, las unidades NVMe, las tarjetas de red y los controladores comparten los recursos PCIe.

Una distribución deficiente puede provocar que:

  • los datos atraviesen el otro socket de procesador;
  • una tarjeta de red quede topológicamente alejada de la GPU a la que presta servicio;
  • varios dispositivos compartan ancho de banda;
  • un contenedor reciba memoria del nodo NUMA incorrecto;
  • los aceleradores permanezcan inactivos mientras esperan datos.

Red

Para un nodo independiente y un sistema RAG pequeño, suelen bastar 10 o 25 Gb/s. Una red de 100 Gb/s resulta útil cuando los modelos y los datos se almacenan por separado, varios servidores gestionan conjuntamente la inferencia o es necesario cargar rápidamente grandes conjuntos de datos.

El entrenamiento distribuido suele utilizar redes de 200/400 Gb/s, RoCE o InfiniBand.

Ethernet sigue siendo el transporte más universal. RoCE añade acceso remoto directo a memoria sobre una infraestructura Ethernet compatible, pero requiere una configuración correcta de la red. InfiniBand ofrece baja latencia, aunque aumenta el coste y la complejidad operativa del sistema.

Requisitos de alimentación, refrigeración y rack

Un servidor GPU no puede elegirse al margen del centro de datos. La potencia nominal de las fuentes de alimentación no refleja el consumo real: deben sumarse las necesidades de los aceleradores, procesadores, memoria, unidades, tarjetas de red y ventiladores, y después tener en cuenta la redundancia.

En configuraciones densas, compruebe:

  • la capacidad y el tipo de PDU;
  • el número de conexiones disponibles;
  • el esquema de alimentación redundante;
  • la potencia permitida por rack;
  • la emisión de calor de los servidores vecinos;
  • la temperatura del aire de entrada;
  • la dirección del flujo de aire;
  • la disponibilidad de refrigeración líquida;
  • la carga permitida sobre el rack y el suelo técnico.

Un servidor GPU potente no es adecuado para una sala de servidores convencional junto a una oficina solo porque el chasis quepa físicamente en el rack. Las temperaturas elevadas y una evacuación de calor insuficiente pueden provocar una reducción de frecuencias o impedir el uso de la configuración máxima.

Alternativas al DL380a Gen12 y al DL385 Gen11

HPE ProLiant Compute DL380 Gen12

Este servidor de propósito general con dos sockets e Intel Xeon 6 es adecuado cuando la computación con GPU es solo una de las cargas. Ofrece más flexibilidad para unidades, adaptadores de red y aplicaciones convencionales, pero tiene una menor densidad de aceleradores que el DL380a.

HPE ProLiant Compute DL340 Gen12

El DL340 Gen12 es un sistema 2U con un procesador Intel Xeon 6. En su chasis GPU admite hasta cuatro aceleradores de doble ancho o seis de ancho simple.

Esta opción resulta atractiva cuando no se necesita una segunda CPU, pero se requieren más GPU de las que normalmente caben en un servidor compacto 1U.

HPE ProLiant DL325 Gen11 y DL325 Gen12

El DL325 Gen11 es un servidor AMD EPYC 1U de un solo socket que admite hasta dos GPU de doble ancho o cuatro de ancho simple. Es adecuado para inferencia en el edge, estaciones de trabajo virtuales, modelos pequeños y nodos distribuidos de visión artificial.

El DL325 Gen12 es un servidor de computación más reciente, pero HPE lo posiciona principalmente como una plataforma densa de propósito general con un solo socket. Si la carga requiere varias GPU, la configuración Gen12 concreta debe comprobarse con especial atención en las QuickSpecs vigentes.

HPE ProLiant DL380a Gen11

La generación anterior admite hasta cuatro aceleradores de doble ancho u ocho de ancho simple. En el mercado secundario puede resultar rentable para inferencia y ajuste fino si es compatible con las GPU necesarias.

Compare el coste de una configuración completa, no el precio de un chasis vacío, e incluya:

  • kits de GPU;
  • risers;
  • cables de alimentación;
  • ventiladores de alto rendimiento;
  • fuentes de alimentación;
  • licencias y controladores;
  • firmware actualizado.

HPE ProLiant Compute XD685

El XD685 está diseñado para ocho aceleradores NVIDIA o AMD y está disponible con refrigeración líquida directa o refrigeración por aire.

El paso a este tipo de plataforma está justificado cuando la carga requiere:

  • ocho GPU estrechamente interconectadas;
  • una infraestructura de alta velocidad dentro del nodo;
  • una red de 200/400 Gb/s entre servidores;
  • refrigeración especializada;
  • almacenamiento paralelo;
  • un entorno de software para entrenamiento distribuido.

El DL380a puede ser más flexible para varios modelos independientes. Para una única carga de gran tamaño, el XD685 se ajusta mejor a la arquitectura necesaria.

Ejemplos de configuraciones por tipo de carga

Sistema RAG empresarial pequeño

Normalmente bastan una o dos GPU con una capacidad de VRAM adecuada, abundante RAM, almacenamiento NVMe rápido y una red de 25–100 Gb/s.

El DL385 resulta práctico cuando la base de datos vectorial y el modelo se encuentran en el mismo nodo. El DL325 Gen11 o un DL380 de propósito general son adecuados para un sistema más compacto.

Varios LLM para distintos departamentos

Si los modelos funcionan de forma independiente, resulta más útil asignarlos a GPU separadas que combinar todos los aceleradores en un único dominio de computación.

El DL380a puede alojar más servicios en un solo chasis, pero requiere límites de recursos y un plan alternativo en caso de fallo del nodo.

Ajuste fino LoRA o QLoRA

Entre dos y cuatro GPU, almacenamiento NVMe local rápido y suficiente RAM suelen cubrir las necesidades empresariales de ajuste fino.

El DL385 es adecuado para una escala moderada. El DL380a es preferible para experimentos paralelos y un crecimiento previsto.

Entrenamiento de un modelo grande

Ocho aceleradores interconectados, una red de alta velocidad, un sistema de archivos paralelo y refrigeración especializada apuntan a la clase XD685.

La configuración máxima del DL380a no elimina las limitaciones de comunicación entre tarjetas PCIe independientes.

Preguntas frecuentes

¿Se puede instalar cualquier GPU de servidor en un ProLiant?

No. Se requiere una tarjeta oficialmente compatible, risers adecuados, alimentación, ventiladores, firmware y una configuración de chasis apropiada. Una GPU no compatible puede funcionar en teoría, pero no puede garantizarse un funcionamiento estable si la tarjeta no figura en la lista de compatibilidad de hardware.

¿Es adecuado el DL380a Gen12 para entrenar modelos?

Sí, especialmente para ajuste fino y experimentos paralelos. Para el entrenamiento completo de un modelo grande en ocho GPU, una plataforma HGX especializada puede ser más eficiente gracias a la comunicación más rápida entre aceleradores.

¿Un mayor número de GPU siempre implica más velocidad?

No. El rendimiento puede estar limitado por la capacidad de VRAM, la topología, la comunicación entre GPU, la CPU, la RAM, el almacenamiento NVMe, la red y el software.

¿Se necesitan dos procesadores?

No siempre. Una segunda CPU resulta útil con muchos aceleradores, una preparación intensiva de datos y la necesidad de líneas PCIe adicionales. Para una o dos GPU, un sistema de un solo socket puede ser más barato y sencillo.

¿Qué es más importante para RAG: la GPU o el almacenamiento NVMe?

Los componentes cumplen funciones diferentes. La GPU realiza la generación y, a menudo, los cálculos de embeddings, mientras que el almacenamiento NVMe, la RAM y la CPU se ocupan de la recuperación, el índice, los documentos y la preparación del contexto. La velocidad del sistema viene determinada por la etapa más lenta.

¿Qué plataforma debe elegir?

  • HPE ProLiant Compute DL380a Gen12 — para una alta densidad de GPU, varios servicios de IA, inferencia a gran escala y un amplio margen de expansión.
  • HPE ProLiant DL385 Gen11 — para entre una y cuatro GPU potentes, RAG y cargas mixtas en las que importan la CPU, la memoria del sistema y el almacenamiento NVMe.
  • DL380 Gen12, DL340 Gen12 y DL325 Gen11 — cuando basta con un número pequeño o moderado de aceleradores y se necesita un sistema más versátil o compacto.
  • HPE ProLiant Compute XD685 — para el entrenamiento completo y el ajuste fino de modelos grandes sensibles a la velocidad de comunicación entre ocho GPU.

La elección final no comienza por el nombre del servidor, sino por los cálculos de memoria de vídeo, solicitudes simultáneas, topología de los aceleradores, volumen de datos y capacidades del centro de datos. Solo entonces puede determinarse si la carga requiere un ProLiant de propósito general, un DL380a de alta densidad o una plataforma especializada con ocho aceleradores.


Comentarios
(0)
Sin comentarios
Escribir un comentario
Acepto el procesamiento de mis datos personales
Nuevo
En existencia
HPE ProLiant DL380 Gen11 8SFF
Servidor HPE DL380 Gen11 8SFF
1xIntel Xeon Bronze 3408U (8C 22.5M Cache 1.80 GHz) / 16GB DDR5 RDIMM 4800MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 2.5'' SFF) / 1 × HP 800W
Precio base
3 390 €
2 802 €
+ 588 € IVA
Incluye envío a través de la UE
Configurar
Nuevo
En existencia
HPE ProLiant DL360 Gen12 8SFF
Servidor HPE DL360 Gen12 8SFF
1xIntel Xeon 6505P (12C 48M Cache 2.20 GHz) / 16GB DDR5 RDIMM 5200MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 2.5'' SFF) / 1 × HPE 800W
Precio base
3 796 €
3 137 €
+ 659 € IVA
Incluye envío a través de la UE
Configurar
Nuevo
En existencia
HPE ProLiant DL320 Gen12 8SFF
Servidor HPE DL320 Gen12 8SFF
1xIntel Xeon 6505P (12C 48M Cache 2.20 GHz) / 16GB DDR5 RDIMM 5200MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 2.5'' SFF) / 1 × HPE 1000W
Precio base
3 683 €
3 044 €
+ 639 € IVA
Incluye envío a través de la UE
Configurar
Nuevo
En existencia
HPE ProLiant DL385 Gen11 12LFF
Servidor HPE DL385 Gen11 12LFF
1xAMD EPYC 9015 (8C 64M Cache 3.60 GHz) / 16GB DDR5 RDIMM 4800MHz / RAID HPE MR216i-o / noHDD (up to Array HDD 3.5'' LFF) / 1 × HP 800W
Precio base
3 510 €
2 901 €
+ 609 € IVA
Incluye envío a través de la UE
Configurar

SIGUIENTE ARTÍCULO

Sé el primero en enterarte de las nuevas publicaciones y gana 50 €