Key Takeaways
- Densidad de GPU: los cuatro proveedores ofrecen una plataforma insignia de 8 GPU SXM5 (Dell XE9680, HPE Cray XD670, Supermicro SYS-821GE-TNHR); Lenovo y HPE también venden plataformas PCIe de menor densidad y menor costo.
- Rango de precio: un servidor 8x H100/H200 SXM5 cuesta aproximadamente entre 200.000 y 400.000+ dólares según la memoria de GPU (80GB H100 vs. 141GB H200) y el nivel de soporte.
- La refrigeración es la verdadera limitación. Dos o tres servidores de 8 GPU SXM5 ya superan el límite práctico de refrigeración por aire de 20-40kW por rack — por encima de esa densidad, la refrigeración líquida deja de ser opcional.
- La red importa para entrenamiento, menos para inferencia. Los clústeres de entrenamiento multi-nodo necesitan InfiniBand NDR o red Ethernet RoCE v2; la inferencia de un solo nodo no.
- Elija la GPU según la carga de trabajo, no solo el presupuesto. La L40S (48GB, PCIe, refrigerada por aire) sirve para inferencia; la H100/H200 (80-141GB, SXM5, NVLink) sirve para entrenamiento y servicio de gran volumen.
- Los compradores que solo necesitan una o dos GPU de capacidad de inferencia no deberían comprar un servidor en rack — una estación de trabajo es el nivel adecuado para esa escala.
Los compradores de servidores GPU empresariales deben elegir el proveedor según la carga de trabajo — Dell PowerEdge XE9680, HPE Cray XD670 y Supermicro SYS-821GE-TNHR compiten directamente en plataformas de entrenamiento 8x H100/H200 SXM5 de 200.000-400.000+ dólares, mientras que HPE ProLiant DL380a Gen11 y Lenovo ThinkSystem SR675 V3 con GPU PCIe L40S cubren presupuestos de inferencia pura por aproximadamente un tercio a la mitad del precio.
Comprar un servidor de IA para una empresa no es lo mismo que armar una PC gaming potente. Estas máquinas cuestan como una casa, necesitan un plan de refrigeración y electricidad antes de que lleguen, y vienen con un contrato de soporte de varios años. Esta guía compara a las cuatro empresas que realmente venden estos servidores de IA en rack —Dell, Lenovo, HPE y Supermicro— para que un comprador elija el tamaño y proveedor correctos para el trabajo real (ejecutar modelos de IA para empleados vs. entrenar modelos nuevos desde cero), no solo la ficha técnica más grande.
Datos rápidos
- Dell PowerEdge XE9680: 6U, hasta 8x H100/H200 SXM5, doble Intel Xeon Platinum, hasta 4TB de DDR5.
- Lenovo ThinkSystem SR675 V3: 3U, hasta 8 GPU (mezcla H100/H200/L40S), doble AMD EPYC 9004/9005, hasta 6TB de DDR5, refrigeración líquida Neptune opcional.
- HPE Cray XD670: 5U, hasta 8x H100/H200 SXM5, doble Intel Xeon de 4.ª generación, opciones de red InfiniBand NDR / Slingshot 11 / Ethernet.
- HPE ProLiant DL380a Gen11: 2U, hasta 4 GPU de doble ancho u 8 de ancho simple (L40S/H100 PCIe), doble Intel Xeon con hasta 64 núcleos.
- Supermicro SYS-821GE-TNHR: 8U, hasta 8x H100/H200 SXM5, doble Intel Xeon de 4.ª/5.ª generación, hasta 8TB de DDR5.
- VRAM de GPU: H100 = 80GB HBM3; H200 = 141GB HBM3e; L40S = 48GB GDDR6.
- Consumo del rack: un solo nodo 8x H100/H200 SXM5 consume aproximadamente 10-12kW a plena carga — dos de ellos ya superan el límite práctico de refrigeración por aire para un rack.
¿Qué servidor GPU comprar según su caso de uso?
El proveedor adecuado depende de la carga de trabajo y la preparación del centro de datos, no de la preferencia de marca. Los clústeres de entrenamiento, los despliegues de inferencia pura y los centros de datos con refrigeración líquida apuntan cada uno a una plataforma distinta.
- Mejor para entrenamiento multi-nodo a gran escala: Dell PowerEdge XE9680 — la red de ventas empresariales e integradores de sistemas más amplia para construir un clúster multi-rack conectado por InfiniBand.
- Mejor para un centro de datos listo para refrigeración líquida: Lenovo ThinkSystem SR675 V3 — la refrigeración líquida directa al chip Neptune reduce de forma notable el costo de refrigeración con uso sostenido de GPU, con opción de CPU AMD EPYC.
- Mejor para inferencia pura o una primera compra más pequeña: HPE ProLiant DL380a Gen11 — 2U, refrigerado por aire, GPU PCIe, aproximadamente un tercio a la mitad del costo de una máquina de entrenamiento 8x SXM5.
- Mejor para flexibilidad de configuración y competitividad de precio: Supermicro SYS-821GE-TNHR — las opciones de configuración a medida más amplias vía el canal de integradores, a menudo la vía más competitiva en precio hacia una configuración 8x H100/H200 SXM5.
- Evite los servidores en rack por completo si: su necesidad real es 1-2 GPU de capacidad de inferencia para un equipo pequeño — una estación de trabajo LLM local cuesta una fracción del precio y no necesita plan de refrigeración de centro de datos.
¿Cómo se comparan los cuatro proveedores en especificaciones y precio?
Dell, Lenovo, HPE y Supermicro tienen cada uno al menos una plataforma de 8 GPU SXM5, pero difieren notablemente en factor de forma, opciones de refrigeración y canal de venta.
| Proveedor / Modelo | Factor de forma | GPU máx. | Opciones de GPU | Refrigeración | Rango de precio |
|---|---|---|---|---|---|
| Dell PowerEdge XE9680 | 6U | 8 (SXM5, NVLink) | H100 80GB / H200 141GB | Aire estándar, líquida opcional | ~200-375K $ (8x GPU) |
| Lenovo SR675 V3 | 3U | 8 (PCIe o SXM) | H100 / H200 / L40S | Aire, o líquida Neptune | Muy variable según config. |
| HPE Cray XD670 | 5U | 8 (SXM5, NVLink) | H100 80GB / H200 141GB | Aire estándar | Solo bajo cotización |
| HPE ProLiant DL380a Gen11 | 2U | 4 doble / 8 simple ancho | L40S / H100 PCIe | Solo aire | Menor — solo cotización |
| Supermicro SYS-821GE-TNHR | 8U | 8 (SXM5, NVLink) | H100 80GB / H200 141GB | Aire estándar | ~200-320K $ (8x GPU) |
¿Qué ofrece el Dell PowerEdge XE9680?
El Dell PowerEdge XE9680 es un servidor en rack de 6U con 8 GPU NVIDIA HGX H100 o H200 SXM5 conectadas por NVLink, construido específicamente para entrenamiento e inferencia de modelos grandes. Combina las GPU con dos procesadores Intel Xeon Scalable de 4.ª o 5.ª generación (hasta 56 núcleos cada uno), hasta 32 ranuras DIMM DDR5 (4TB máx., 4800 MT/s) y 10 ranuras PCIe Gen5 x16 para red y expansión de almacenamiento.
Viene con refrigeración por aire de serie; Dell ofrece opciones de refrigeración líquida para centros de datos por encima de aproximadamente 20-30kW por rack, donde el aire deja de ser práctico.
El precio no se publica — las cotizaciones de revendedores e integradores para una unidad 8x H100/H200 totalmente configurada han rondado entre 200.000 y 375.000 dólares, según el nivel de memoria de GPU, RAM, almacenamiento y nivel de soporte. Solicite una cotización formal en Dell.com antes de presupuestar.
¿Qué ofrece el Lenovo ThinkSystem SR675 V3?
El Lenovo ThinkSystem SR675 V3 es un servidor en rack de 3U compatible con hasta 8 GPU de doble o simple ancho —incluidas NVIDIA H100, H200 y L40S— junto con dos procesadores AMD EPYC 9004/9005 de 5.ª generación y hasta 6TB de memoria DDR5-4800 en 24 ranuras DIMM.
Su característica distintiva es Lenovo Neptune, un sistema de refrigeración directa al chip e híbrida líquido-aire disponible como opción de configuración — relevante para compradores cuya instalación ya usa circuitos de refrigeración líquida o planea añadirlos, ya que reduce notablemente el costo de refrigeración con cargas GPU de alta utilización sostenida frente al aire solo.
El SR675 V3 también admite configuraciones de GPU mixtas (compilaciones H200 de 4 GPU con NVLink, o L40S para despliegues orientados a inferencia), lo que lo convierte en la plataforma más flexible en configuración de esta comparativa para compradores que quieren una sola familia de chasis para entrenamiento e inferencia. Configuración en Lenovo.com.
¿Qué ofrecen el HPE Cray XD670 y el ProLiant DL380a Gen11?
HPE vende dos niveles distintos de servidores GPU: el Cray XD670 para entrenamiento a gran escala, y el ProLiant DL380a Gen11 para inferencia y despliegues más pequeños.
El Cray XD670 es un chasis de 5U con 8 GPU NVIDIA H100 o H200 SXM5 y dos procesadores Intel Xeon de 4.ª generación. Su característica distintiva es la elección de red: 8 ranuras PCIe Gen5 de media altura compatibles con HPE Slingshot 11, InfiniBand NDR o Ethernet estándar — relevante para compradores ya estandarizados en Slingshot por un parque HPE Cray existente.
El ProLiant DL380a Gen11 es un servidor de 2U compatible con 4 GPU de doble ancho u 8 de ancho simple (L40S o H100 PCIe), hasta 3TB de DDR5 y PCIe 5.0 — la opción refrigerada por aire y de menor densidad para cargas de inferencia o una primera compra de GPU que no justifica una plataforma de 8 GPU SXM5. Ambos en HPE.com.
¿Qué ofrece el Supermicro SYS-821GE-TNHR?
El Supermicro SYS-821GE-TNHR es un servidor en rack de 8U compatible con hasta 8 GPU NVIDIA HGX H100 (80GB) o HGX H200 (141GB), dos procesadores Intel Xeon Scalable de 4.ª o 5.ª generación y hasta 8TB de memoria DDR5-5600 en 32 ranuras DIMM — la mayor capacidad máxima de RAM de las cuatro plataformas comparadas aquí.
Supermicro vende principalmente a través de un canal de integradores y revendedores en lugar de equipos de venta empresarial directa, lo que suele traducirse en más flexibilidad de configuración a medida (bahías de disco, tarjetas de red, redundancia de fuente de alimentación) y, según listados actuales de revendedores, un precio inicial competitivo para una configuración 8x H100 — las cotizaciones de configuración base han rondado entre 200.000 y 320.000 dólares, con configuraciones completas más altas.
El almacenamiento es un punto fuerte: hasta 19 bahías 2,5" NVMe/SATA/SAS de intercambio en caliente más 2 ranuras M.2 — útil para compradores que ejecutan grandes conjuntos de datos locales junto a inferencia o ajuste fino. Vea la configuración base en Supermicro.com.
¿H100, H200 o L40S — cuál comprar?
La H200 gana en memoria y ancho de banda, la H100 es la opción SXM5 más disponible y a menudo más barata, y la L40S es la opción PCIe refrigerada por aire para inferencia pura. Las tres son GPU de centro de datos NVIDIA vigentes en septiembre de 2026; ninguna está próxima a descontinuarse, así que la elección es de ajuste a la carga de trabajo, no de riesgo de obsolescencia.
- Elija H200 si: atiende cargas de contexto grande o entrena modelos más grandes donde 80GB por GPU forzaría un fragmentado entre GPU que preferiría evitar.
- Elija H100 si: necesita la mayor disponibilidad de proveedores y revendedores para un clúster de entrenamiento multi-nodo NVLink/InfiniBand y 80GB por GPU son suficientes para su modelo.
- Elija L40S si: la carga de trabajo es solo inferencia, el centro de datos solo tiene refrigeración por aire y 48GB por GPU cubren su modelo más grande en el nivel de cuantización previsto.
| GPU | VRAM | Ancho de banda de memoria | Mejor para |
|---|---|---|---|
| NVIDIA H100 SXM5 | 80GB HBM3 | 3,35 TB/s | Entrenamiento multi-nodo, mayor disponibilidad |
| NVIDIA H200 SXM | 141GB HBM3e | 4,8 TB/s | Servicio de contexto grande, entrenamiento por lotes mayores |
| NVIDIA L40S | 48GB GDDR6 | 864 GB/s | Inferencia PCIe refrigerada por aire, presupuesto menor |
¿Cuánta energía y refrigeración necesita un rack denso en GPU?
Un solo servidor de 8 GPU H100/H200 SXM5 consume aproximadamente 10-12kW a plena carga — solo las 8 GPU de 700W suman 5,6kW, antes de CPU, memoria y ventiladores. Dos o tres de esos servidores en un mismo rack ya superan el límite práctico de la refrigeración por aire.
Las cifras del sector sitúan el límite práctico de la refrigeración por aire en aproximadamente 20-40kW por rack; por encima se necesita refrigeración líquida (directa al chip o inmersión), que puede soportar 100-200kW+ por rack. Como referencia, el sistema de rack GB200 NVL72 de NVIDIA consume en total aproximadamente 120-130kW — un dato sobre hacia dónde va la densidad de racks de IA, no una especificación de ningún servidor comparado aquí.
Implicación práctica para compradores: si va a instalar más de uno o dos servidores de 8 GPU SXM5 por rack, planifique refrigeración líquida directa al chip (Lenovo Neptune, o un circuito líquido a nivel de instalación) en lugar de asumir que la refrigeración por aire estándar del centro de datos será suficiente.
¿Necesita InfiniBand o Ethernet estándar?
Los despliegues de inferencia de un solo nodo no necesitan InfiniBand — Ethernet estándar de 100/200GbE es suficiente. Los clústeres de entrenamiento o ajuste fino multi-nodo, donde las GPU de varios servidores deben sincronizar gradientes constantemente, sí necesitan una red dedicada de alto ancho de banda y baja latencia.
Las dos opciones para esa red son InfiniBand NDR (400Gb/s por enlace, la opción HPC tradicional, una NIC por GPU en plataformas insignia) y RoCE v2 (RDMA sobre Ethernet convergido — por ejemplo NVIDIA Spectrum-X— que ofrece un rendimiento similar sobre una red Ethernet estándar que su equipo de red quizá ya opera).
- Use InfiniBand NDR si: está construyendo un clúster de entrenamiento multi-nodo dedicado y quiere la red RDMA más madura y ampliamente desplegada a esa escala.
- Use RoCE v2 (Ethernet) si: su equipo ya opera una red Ethernet convergida y quiere evitar mantener una red InfiniBand separada y las habilidades que requiere.
- Evite ambas si: ejecuta inferencia de un solo nodo — la red estándar es suficiente y el costo de red adicional no se justifica.
¿Cómo dimensionar la compra de un servidor GPU según su carga de trabajo?
Dimensione la compra según la carga de trabajo, no según la configuración más grande disponible. Los despliegues de inferencia pura y los de entrenamiento/ajuste fino tienen requisitos fundamentalmente distintos de GPU, memoria y red.
- 1Clasificar primero la carga de trabajo
Why it matters: La inferencia pura (servir un modelo fijo a usuarios) necesita mucha menos memoria de GPU y ninguna red multi-nodo en comparación con entrenamiento o ajuste fino, que debe mantener gradientes y estado del optimizador además de los pesos del modelo. - 2Estimar la necesidad de memoria de GPU a partir del tamaño del modelo y la cuantización
Why it matters: Un modelo de 70B parámetros en FP16 necesita aproximadamente 140GB de VRAM antes de overhead — eso por sí solo descarta una L40S de una sola GPU (48GB) y apunta hacia fragmentado multi-GPU H100/H200 o un modelo más pequeño/cuantizado. - 3Decidir entre un solo nodo o multi-nodo
Why it matters: Si la VRAM combinada de un servidor de 8 GPU cubre el modelo y el objetivo de concurrencia, omita InfiniBand/RoCE por completo y ahorre el costo de red; si no, presupueste una red dedicada desde el principio. - 4Ajustar la refrigeración a la densidad del rack antes de pedir
Why it matters: Confirme con el equipo de instalaciones si el rack objetivo puede soportar refrigeración líquida antes de comprometerse a más de uno o dos servidores de 8 GPU SXM5 por rack — adaptar la refrigeración después de la entrega es mucho más caro que planificarlo de antemano. - 5Obtener una cotización formal y confirmar el plazo de entrega
Why it matters: Ninguno de estos proveedores publica precios de lista para configuraciones de 8 GPU, y los plazos de entrega de servidores densos en GPU han variado de varias semanas a algunos meses según la asignación de GPU — presupueste el cronograma, no solo el precio.
¿Qué nivel de garantía y soporte elegir?
Los cuatro proveedores ofrecen soporte empresarial por niveles más allá de la garantía básica de hardware, pero los nombres de nivel, tiempos de respuesta y servicios incluidos difieren — confirme las condiciones actuales directamente con el proveedor antes de comprar, ya que los programas cambian.
- Dell vende sus niveles ProSupport (incluidas opciones de respuesta más rápida y misión crítica) junto con el XE9680 — pregunte específicamente por soporte calificado para servidores GPU, no el nivel PowerEdge estándar.
- Lenovo vende niveles Premier Support para la línea ThinkSystem, con opciones de respuesta en sitio y monitoreo proactivo.
- HPE vende soporte a través de Pointnext Complete Care y ofrece HPE GreenLake como alternativa de pago por uso a la compra de capital para compradores que quieren evitar el costo inicial de seis cifras.
- Supermicro — las condiciones de soporte varían más según el revendedor/integrador que en los otros tres proveedores, ya que gran parte de su volumen pasa por ese canal en vez de ventas empresariales directas — obtenga las condiciones de soporte por escrito de su revendedor específico, no solo de la página de garantía base de Supermicro.
- Para cualquier proveedor: pregunte concretamente qué ocurre ante un fallo de GPU (SLA de reemplazo, si hay que enviar todo el nodo o solo la bandeja de GPU) — es el modo de fallo más probable en un servidor denso en GPU.
¿Qué errores cometen los compradores empresariales?
- Comprar capacidad de 8 GPU SXM5 para una carga de trabajo solo de inferencia. Si solo sirve un modelo fijo a usuarios, una plataforma PCIe de 2U como el ProLiant DL380a Gen11 lo cubre a una fracción del precio y la complejidad.
- Pedir antes de confirmar la capacidad de refrigeración del rack. Un segundo o tercer servidor de 8 GPU SXM5 en el mismo rack puede superar el límite práctico de la refrigeración por aire — confírmelo con instalaciones antes de que llegue el hardware, no después.
- Omitir el presupuesto de red para un clúster "tal vez escalemos después". Añadir InfiniBand o RoCE después a una flota de un solo nodo ya desplegada es más disruptivo que presupuestarlo en la compra original.
- Tratar el precio de etiqueta como el costo total. Contratos de soporte, red, actualización de refrigeración y de infraestructura de energía suelen añadir 15-30% adicional sobre la partida de hardware del servidor.
- Asumir que la H200 siempre es la mejora correcta sobre la H100. Si su modelo y tamaño de lote caben cómodamente en 80GB por GPU, la memoria y el costo extra de la H200 no aportan nada — verifique la necesidad real de VRAM antes de pagar la prima.
Preguntas frecuentes
¿Cuántas GPU H100 o H200 necesito para inferencia empresarial vs. entrenamiento?
Los despliegues de inferencia pura que sirven un modelo fijo a un número moderado de usuarios concurrentes suelen caber en 1-4 GPU y no necesitan una plataforma de 8 GPU SXM5 en absoluto. El entrenamiento o ajuste fino de modelos grandes (70B+ parámetros) normalmente necesita la configuración completa de 8 GPU con NVLink para mantener el modelo, gradientes y estado del optimizador entre GPU. Dimensione la compra según la carga de trabajo, no por defecto "comprar la plataforma más grande".
¿Cuál es el costo total real de un servidor rack de 8 GPU H100?
Las cotizaciones de revendedores e integradores para una unidad 8x H100 totalmente configurada han rondado entre 200.000 y 375.000 dólares solo por el hardware, antes de contratos de soporte, red y cualquier actualización de refrigeración — esos suelen añadir otro 15-30% adicional. Ninguno de los cuatro proveedores publica precios de lista; solicite una cotización formal antes de presupuestar.
¿Necesito refrigeración líquida para un rack denso en GPU?
Si va a instalar más de uno o dos servidores de 8 GPU H100/H200 SXM5 por rack, sí — cada uno consume aproximadamente 10-12kW a plena carga, y el límite práctico de la refrigeración por aire ronda los 20-40kW por rack. Por debajo de esa densidad, la refrigeración por aire estándar aún puede funcionar; confírmelo con instalaciones antes de pedir.
¿Debo elegir InfiniBand o Ethernet (RoCE) para la red?
Para inferencia de un solo nodo, ninguno — Ethernet estándar es suficiente. Para clústeres de entrenamiento multi-nodo, InfiniBand NDR es la red RDMA de alto ancho de banda más madura y ampliamente desplegada; RoCE v2 sobre Ethernet es la alternativa si su equipo de red quiere evitar mantener una red InfiniBand separada.
Dell vs. Lenovo vs. HPE vs. Supermicro — ¿qué proveedor tiene el mejor soporte empresarial?
Dell, Lenovo y HPE venden soporte empresarial por niveles (ProSupport, Premier Support y Pointnext Complete Care respectivamente) a través de equipos de cuenta directos. Supermicro vende principalmente vía integradores y revendedores, así que las condiciones de soporte varían más según el revendedor que un nivel único de Supermicro — obtenga las condiciones por escrito del revendedor específico antes de comprar.
H100 vs. H200 vs. L40S — ¿qué GPU comprar?
Elija H200 (141GB HBM3e) para servicio de contexto grande o entrenamiento donde 80GB por GPU forzarían un fragmentado entre GPU que preferiría evitar. Elija H100 (80GB HBM3) para la mayor disponibilidad de proveedores y revendedores en un clúster de entrenamiento multi-nodo donde 80GB sean suficientes. Elija L40S (48GB GDDR6, PCIe, refrigerada por aire) para inferencia pura con presupuesto menor.
¿Puedo mezclar modelos de GPU en el mismo rack o servidor?
Dentro de un mismo servidor, no — una plataforma de 8 GPU SXM5 está construida y conectada por NVLink alrededor de un solo modelo de GPU (todas H100 o todas H200), no una mezcla. Dentro de un rack, sí — puede tener un servidor configurado con H100/H200 para entrenamiento junto a otro configurado con L40S para inferencia, siempre que la refrigeración y el consumo de cada servidor se contabilicen por separado.
¿Qué nivel de garantía y soporte deberían elegir los compradores empresariales?
Como mínimo, confirme el SLA de reemplazo del proveedor específicamente para fallo de GPU (no solo fallo general de hardware) — el fallo de GPU es el modo de falla más probable en un servidor denso en GPU, y la logística de reemplazo (enviar una bandeja de GPU vs. todo el nodo) varía según proveedor y nivel. Ajuste el nivel de tiempo de respuesta a cuánto tiempo de inactividad puede tolerar realmente la carga de trabajo.
¿Es más barato el hardware on-premises que el alquiler de GPU en la nube a escala empresarial?
Depende de la utilización, no solo del precio de etiqueta — el hardware on-premises tiene un costo inicial alto pero un costo por hora bajo una vez en funcionamiento, mientras que el alquiler en la nube no tiene costo inicial pero una tarifa por hora mucho más alta. El punto de equilibrio suele estar en una utilización sostenida y casi constante; las cargas ocasionales o intermitentes suelen costar menos en alquiler. Vea nuestra guía de alquiler de GPU en la nube para una comparación de costos detallada.
¿Cuánto tarda la entrega de una configuración 8x H100 o H200?
Los plazos de entrega de servidores densos en GPU han variado de varias semanas a algunos meses según la asignación de GPU y la demanda actual — no es un artículo en stock para la mayoría de proveedores en configuración de 8 GPU. Confirme el plazo como parte de la cotización formal y presupueste el cronograma del proyecto en consecuencia, no solo el precio.
Fuentes
- Página de producto Dell PowerEdge XE9680 -- dell.com/en-us/shop/ipovw/poweredge-xe9680
- Guía de producto Lenovo ThinkSystem SR675 V3 -- lenovopress.lenovo.com/lp1611-thinksystem-sr675-v3-server
- HPE Cray XD670 QuickSpecs -- hpe.com/us/en/hpe-cray-xd670.html
- Ficha técnica HPE ProLiant DL380a Gen11 -- hpe.com/us/en/compute/hpe-proliant-compute/dl380a-gen11.html
- Ficha técnica Supermicro SYS-821GE-TNHR -- supermicro.com/en/products/system/datasheet/SYS-821GE-TNHR
- Especificaciones NVIDIA H100/H200 Tensor Core GPU -- nvidia.com