Key Takeaways
- Densidade de GPU: Dell XE9680, HPE Cray XD670 e Supermicro SYS-821GE-TNHR têm cada um uma plataforma principal de 8 GPUs SXM5; o módulo SXM5 da Lenovo tem limite de 4 GPUs, com as configurações de 8 GPUs disponíveis como PCIe. HPE e Lenovo também vendem plataformas PCIe de menor densidade e custo mais baixo para inferência.
- Faixa de preço: um servidor 8x H100/H200 SXM5 custa cerca de US$ 200.000-400.000+ dependendo da memória da GPU (80GB H100 vs. 141GB H200) e do nível de suporte.
- A refrigeração é a real limitação. Dois ou três servidores de 8 GPUs SXM5 já ultrapassam o teto prático de ~20-40kW por rack da refrigeração a ar — acima dessa densidade, refrigeração líquida deixa de ser opcional.
- Rede importa mais para treinamento, menos para inferência. Clusters de treinamento multi-nó precisam de InfiniBand NDR ou rede Ethernet RoCE v2; inferência de nó único não.
- Escolha a GPU pela carga de trabalho, não só pelo orçamento. A L40S (48GB, PCIe, refrigerada a ar) serve para inferência; a H100/H200 (80-141GB, SXM5, NVLink) serve para treinamento e atendimento de alto volume.
- Compradores que precisam de apenas uma ou duas GPUs de capacidade de inferência não deveriam comprar um servidor em rack — uma workstation é o porte certo para essa escala.
Compradores de servidores GPU corporativos devem escolher o fornecedor pela carga de trabalho — Dell PowerEdge XE9680, HPE Cray XD670 e Supermicro SYS-821GE-TNHR competem diretamente nas plataformas de treinamento 8x H100/H200 SXM5 na faixa de US$ 200.000-400.000+, enquanto HPE ProLiant DL380a Gen11 e Lenovo ThinkSystem SR675 V3 com GPUs PCIe L40S atendem orçamentos de inferência pura por cerca de um terço a metade do preço.
Comprar um servidor de IA para uma empresa não é como montar um PC gamer turbinado. Essas máquinas custam o preço de uma casa, precisam de um plano de refrigeração e energia elétrica antes mesmo de chegar, e vêm com um contrato de suporte de vários anos. Este guia compara as quatro empresas que realmente vendem esses servidores de IA em rack — Dell, Lenovo, HPE e Supermicro — para que o comprador escolha o tamanho e o fornecedor certos para a necessidade real (rodar modelos de IA para funcionários vs. treinar modelos novos do zero), não apenas a ficha técnica maior.
Fatos rápidos
- Dell PowerEdge XE9680: 6U, até 8x H100/H200 SXM5, dois Intel Xeon Platinum, até 4TB de DDR5.
- Lenovo ThinkSystem SR675 V3: 3U, até 4x H100/H200 SXM5 (módulo NVLink) ou até 8x GPUs PCIe (H100/L40S), dois AMD EPYC 9004/9005, até 6TB de DDR5, refrigeração líquida Neptune opcional.
- HPE Cray XD670: 5U, até 8x H100/H200 SXM5, dois Intel Xeon de 4ª geração, opções de rede InfiniBand NDR / Slingshot 11 / Ethernet.
- HPE ProLiant DL380a Gen11: 2U, até 4 GPUs de largura dupla ou 8 de largura simples (L40S/H100 PCIe), dois Intel Xeon com até 64 núcleos.
- Supermicro SYS-821GE-TNHR: 8U, até 8x H100/H200 SXM5, dois Intel Xeon de 4ª/5ª geração, até 8TB de DDR5.
- VRAM de GPU: H100 = 80GB HBM3; H200 = 141GB HBM3e; L40S = 48GB GDDR6.
- Consumo do rack: um único nó 8x H100/H200 SXM5 consome cerca de 10-12kW em carga máxima — dois deles já ultrapassam o teto prático de refrigeração a ar de um rack.
Solicitar cotação para um servidor de IA corporativo
O preço de servidores GPU corporativos é definido por cotação e muda conforme a disponibilidade de GPU, memória, armazenamento, suporte e região — não se comprometa com o primeiro fornecedor contatado. Comece comparando as configurações dos quatro fornecedores abaixo.
Fornecedor | Melhor para | Ação |
|---|---|---|
| Dell | Clusters de treinamento e inferência multi-nó em larga escala | Configurar o Dell PowerEdge XE9680 → |
| Lenovo | Implantações com refrigeração líquida ou flexíveis em configuração | Configurar o Lenovo ThinkSystem SR675 V3 → |
| HPE | Treinamento corporativo (Cray XD670) ou implantações de inferência menores (ProLiant DL380a) | Explorar servidores GPU da HPE → |
| Supermicro | Flexibilidade de configuração e competitividade de preço | Encontrar um parceiro autorizado Supermicro → |
Qual servidor GPU comprar para o seu caso de uso?
O fornecedor certo depende da carga de trabalho e da prontidão do data center, não de preferência de marca. Clusters de treinamento, implantações de inferência pura e data centers prontos para líquido apontam cada um para uma plataforma diferente.
- 🏆 **Melhor opção geral: Dell PowerEdge XE9680.** Ideal para treinamento de IA corporativo e inferência em larga escala. Até 8x H100/H200 SXM5, formato 6U, cerca de US$ 200.000-375.000 por uma unidade de 8 GPUs totalmente configurada. Principal motivo para escolher: a maior rede de vendas corporativas e integradores de sistemas para montar um cluster multi-rack conectado por InfiniBand.
- 💧 **Melhor para refrigeração líquida: Lenovo ThinkSystem SR675 V3.** A refrigeração líquida direta ao chip Neptune reduz de forma relevante o custo de refrigeração em uso sustentado de GPU, com opção de CPU AMD EPYC. O módulo SXM5 tem limite de 4x H100/H200 com NVLink — para 8x SXM5 em um único servidor, considere Dell, HPE Cray XD670 ou Supermicro; as configurações de 8 GPUs do SR675 V3 são PCIe.
- Melhor para inferência pura ou uma primeira compra menor: HPE ProLiant DL380a Gen11 — 2U, refrigerado a ar, GPUs PCIe, cerca de um terço a metade do custo de uma máquina de treinamento 8x SXM5.
- Melhor para flexibilidade de configuração e preço: Supermicro SYS-821GE-TNHR — as opções de configuração sob medida mais amplas via canal de integradores, muitas vezes o caminho mais competitivo em preço para uma configuração 8x H100/H200 SXM5.
- Melhor GPU para cargas de trabalho com alta demanda de memória: NVIDIA H200 (141GB HBM3e) — veja H100 vs. H200 vs. L40S abaixo.
- Melhor opção de inferência de menor custo: NVIDIA L40S (48GB GDDR6, PCIe, refrigerada a ar).
- Evite servidores em rack completamente se: sua necessidade real é 1-2 GPUs de capacidade de inferência para uma equipe pequena — uma workstation para LLM local custa uma fração do preço e não exige plano de refrigeração de data center.
Como os quatro fornecedores se comparam em especificações e preço?
Dell, HPE e Supermicro oferecem cada um uma plataforma de 8 GPUs SXM5; o módulo SXM5 da Lenovo tem limite de 4 GPUs, com configurações de 8 GPUs disponíveis apenas como PCIe. Também divergem bastante em fator de forma, opções de refrigeração e canal de venda.
Fornecedor / Modelo | Fator de forma | GPUs máx. | HGX/SXM5 | PCIe | Refrigeração líquida |
|---|---|---|---|---|---|
| Dell PowerEdge XE9680 | 6U | 8 | 8x H100/H200 | — | Opcional |
| Lenovo SR675 V3 | 3U | 8 | 4x H100/H200 (módulo NVLink) | Até 8x (H100/L40S) | Neptune (opcional) |
| HPE Cray XD670 | 5U | 8 | 8x H100/H200 | — | Opcional (DLC) |
| HPE ProLiant DL380a Gen11 | 2U | 8 | — | 4 dupla / 8 simples largura | Só ar |
| Supermicro SYS-821GE-TNHR | 8U | 8 | 8x H100/H200 | — | Depende da configuração |
O que o Dell PowerEdge XE9680 oferece?
O Dell PowerEdge XE9680 é um servidor em rack de 6U com 8 GPUs NVIDIA HGX H100 ou H200 SXM5 conectadas via NVLink, construído especificamente para treinamento e inferência de modelos grandes. Ele combina as GPUs com dois processadores Intel Xeon Scalable de 4ª ou 5ª geração (até 56 núcleos cada), até 32 slots DIMM DDR5 (4TB máx., 4800 MT/s) e 10 slots PCIe Gen5 x16 para rede e expansão de armazenamento.
Sai de fábrica com refrigeração a ar; a Dell oferece opções de refrigeração líquida para data centers acima de aproximadamente 20-30kW por rack, faixa em que o ar deixa de ser prático.
O preço não é publicado — cotações de revendedores e integradores para uma unidade 8x H100/H200 totalmente configurada giraram em torno de US$ 200.000-375.000, dependendo do nível de memória da GPU, RAM, armazenamento e nível de suporte. Peça uma cotação formal em Dell.com antes de orçar.
O que o Lenovo ThinkSystem SR675 V3 oferece?
O Lenovo ThinkSystem SR675 V3 é um servidor em rack de 3U disponível em duas configurações de GPU distintas: um módulo NVIDIA HGX H100/H200 de 4 GPUs SXM5 com NVLink e refrigeração líquida híbrida Lenovo Neptune, ou até 8 GPUs PCIe de largura dupla (H100 ou L40S) com refrigeração a ar padrão. Cada opção se combina com dois processadores AMD EPYC 9004/9005 de 5ª geração e até 6TB de memória DDR5-4800 em 24 slots DIMM.
Esse é o ponto factual que precisa ser entendido corretamente ao comparar fornecedores: o número de "8 GPUs" do SR675 V3 e seu número de SXM5/NVLink não são a mesma configuração. Dell, HPE Cray XD670 e Supermicro oferecem os três 8x H100/H200 SXM5 em um único domínio NVLink; o módulo SXM5 da Lenovo tem limite de 4 GPUs. Se você precisa de 8 GPUs conectadas por NVLink em um único servidor, a Lenovo não é essa opção — suas configurações de 8 GPUs são PCIe.
O diferencial é o Lenovo Neptune, um sistema de refrigeração direta ao chip e híbrida líquido-ar disponível como opção de configuração no módulo SXM5 — relevante para compradores cuja instalação já opera circuitos de refrigeração líquida ou planeja adicionar um, já que reduz de forma relevante o custo de refrigeração em cargas de GPU com alta utilização sustentada em comparação com o ar sozinho.
Esse design de duas vias torna o SR675 V3 a plataforma mais flexível em configuração desta comparação para quem quer uma única família de chassi cobrindo tanto um nível de treinamento com refrigeração líquida quanto um nível de inferência refrigerado a ar. Configure em Lenovo.com.
O que o HPE Cray XD670 e o ProLiant DL380a Gen11 oferecem?
A HPE vende dois níveis distintos de servidores GPU: o Cray XD670 para treinamento em larga escala, e o ProLiant DL380a Gen11 para inferência e implantações menores.
O Cray XD670 é um chassi 5U com 8x GPUs NVIDIA H100 ou H200 SXM5 e dois processadores Intel Xeon de 4ª geração. Seu diferencial é a escolha de rede: 8 slots PCIe Gen5 de meia altura com suporte a HPE Slingshot 11, InfiniBand NDR ou Ethernet padrão — relevante para compradores já padronizados em Slingshot por um parque HPE Cray existente.
O ProLiant DL380a Gen11 é um servidor 2U que suporta 4 GPUs de largura dupla ou 8 de largura simples (L40S ou H100 PCIe), até 3TB de DDR5 e PCIe 5.0 — a opção refrigerada a ar e de menor densidade para cargas de inferência ou uma primeira compra de GPU que não justifica uma plataforma de 8 GPUs SXM5. Ambos em HPE.com.
O que o Supermicro SYS-821GE-TNHR oferece?
O Supermicro SYS-821GE-TNHR é um servidor em rack de 8U que suporta até 8 GPUs NVIDIA HGX H100 (80GB) ou HGX H200 (141GB), dois processadores Intel Xeon Scalable de 4ª ou 5ª geração e até 8TB de memória DDR5-5600 em 32 slots DIMM — a maior capacidade máxima de RAM entre as quatro plataformas comparadas aqui.
A Supermicro vende principalmente via canal de integradores e revendedores em vez de times de vendas corporativas diretas, o que geralmente significa mais flexibilidade de configuração sob medida (baias de disco, placas de rede, redundância de fonte) e, segundo listagens atuais de revendedores, um preço inicial competitivo para uma configuração 8x H100 — cotações de configuração básica giraram em torno de US$ 200.000-320.000, com configurações completas custando mais.
Armazenamento é um ponto forte: até 19 baias hot-swap de 2,5" NVMe/SATA/SAS mais 2 slots M.2 — útil para quem roda grandes conjuntos de dados locais junto com inferência ou fine-tuning. Veja a configuração base em Supermicro.com.
H100, H200 ou L40S — qual GPU comprar?
A H200 vence em memória e largura de banda, a H100 é a opção SXM5 mais disponível e muitas vezes mais barata, e a L40S é a escolha PCIe refrigerada a ar para inferência pura. As três são GPUs de data center NVIDIA atuais em setembro de 2026; nenhuma está prestes a ser descontinuada, então a escolha é sobre adequação à carga de trabalho, não risco de obsolescência.
- Escolha H200 se: você atende cargas de contexto grande ou treina modelos maiores nos quais 80GB por GPU forçariam um sharding entre GPUs que você preferiria evitar.
- Escolha H100 se: você precisa da maior disponibilidade entre fornecedores e revendedores para um cluster de treinamento multi-nó NVLink/InfiniBand e 80GB por GPU são suficientes para o tamanho do seu modelo.
- Escolha L40S se: a carga de trabalho é só inferência, o data center só tem refrigeração a ar, e 48GB por GPU cobrem o maior modelo no nível de quantização planejado.
GPU | VRAM | Largura de banda de memória | Melhor para |
|---|---|---|---|
| NVIDIA H100 SXM5 | 80GB HBM3 | 3,35 TB/s | Treinamento multi-nó, maior disponibilidade |
| NVIDIA H200 SXM | 141GB HBM3e | 4,8 TB/s | Serviço de contexto grande, treinamento com lotes maiores |
| NVIDIA L40S | 48GB GDDR6 | 864 GB/s | Inferência PCIe refrigerada a ar, orçamento menor |
Quanto custa de verdade um servidor GPU corporativo?
A linha de hardware do servidor 8x H100/H200 é só parte do orçamento. Suporte, rede, infraestrutura elétrica do rack, refrigeração, armazenamento e instalação normalmente são cotados separadamente e costumam adicionar 15-30% a mais sobre o servidor em si — dimensione o custo total da implantação, não só a cotação do servidor.
- Estas são faixas indicativas de cotações de revendedores/integradores, não uma ferramenta de preços em tempo real — nenhum dos quatro fornecedores publica preço de tabela para configurações de 8 GPUs. Peça cotações aos fornecedores acima para um número que possa entrar no orçamento.
Componente | Custo estimado |
|---|---|
| Servidor 8x H100/H200 SXM5 (hardware) | US$ 200.000-400.000+ |
| Contrato de suporte corporativo (3-5 anos) | Soma ao total — só cotação |
| Rede (InfiniBand NDR ou RoCE v2, se multi-nó) | Soma ao total — só cotação |
| Upgrade da infraestrutura elétrica do rack (se necessário) | Soma ao total — depende do local |
| Refrigeração (adaptação para líquida, acima da densidade a ar) | Soma ao total — depende do local |
| Armazenamento (NVMe para datasets/checkpoints) | Soma ao total — só cotação |
| Instalação e integração | Soma ao total — só cotação |
| Total típico totalmente implantado | Preço do hardware + 15-30% |
Quanta energia e refrigeração um rack denso em GPU precisa?
Um único servidor de 8 GPUs H100/H200 SXM5 consome cerca de 10-12kW em carga máxima — só as 8 GPUs de 700W já somam 5,6kW, antes de CPUs, memória e ventoinhas. Dois ou três desses servidores no mesmo rack já ultrapassam o teto prático da refrigeração a ar.
Números do setor colocam o limite prático da refrigeração a ar em cerca de 20-40kW por rack; acima disso, refrigeração líquida (direta ao chip ou imersão) é necessária e pode suportar 100-200kW+ por rack. Para referência, o sistema em escala de rack GB200 NVL72 da NVIDIA consome no total cerca de 120-130kW — um dado sobre para onde a densidade de racks de IA está indo, não uma especificação de nenhum servidor comparado aqui.
Implicação prática para compradores: se você vai instalar mais de um ou dois servidores de 8 GPUs SXM5 por rack, planeje refrigeração líquida direta ao chip (Lenovo Neptune, ou um circuito líquido em nível de instalação) em vez de presumir que a refrigeração a ar padrão do data center vai dar conta.
Você precisa de InfiniBand ou Ethernet padrão?
Implantações de inferência de nó único não precisam de InfiniBand — Ethernet padrão de 100/200GbE é suficiente. Clusters de treinamento ou fine-tuning multi-nó, em que GPUs de vários servidores precisam sincronizar gradientes constantemente, precisam sim de uma rede dedicada de alta largura de banda e baixa latência.
As duas opções para essa rede são InfiniBand NDR (400Gb/s por link, a escolha HPC tradicional, uma NIC por GPU em plataformas principais) e RoCE v2 (RDMA sobre Ethernet convergido — por exemplo NVIDIA Spectrum-X — que entrega throughput semelhante sobre uma rede Ethernet padrão que seu time de rede talvez já opere).
- Use InfiniBand NDR se: você está montando um cluster de treinamento multi-nó dedicado e quer a rede RDMA mais madura e amplamente implantada nessa escala.
- Use RoCE v2 (Ethernet) se: seu time já opera uma rede Ethernet convergida e quer evitar manter uma rede InfiniBand separada e o conjunto de habilidades que ela exige.
- Evite as duas se: você roda inferência de nó único — rede padrão é suficiente e o custo extra da rede dedicada não se justifica.
Comprar um servidor de IA ou alugar GPU na nuvem?
Comprar vence com utilização alta e sustentada; alugar vence para cargas de trabalho variáveis ou irregulares. O ponto de virada é a utilização, não o tamanho da empresa — uma empresa bem financiada com uso irregular ainda pode sair melhor alugando.
- Esta tabela é uma leitura rápida, não o modelo completo — veja Alugar GPU na nuvem vs comprar on-prem para IA corporativa para a análise completa de TCO capex vs opex antes de decidir.
Fator | Comprar um servidor | Alugar GPU na nuvem |
|---|---|---|
| Custo inicial | Muito alto (seis dígitos) | Baixo / nenhum |
| Custo de longo prazo com alta utilização | Potencialmente menor | Potencialmente maior |
| Utilização necessária para compensar | Precisa ser alta e sustentada | Flexível — pagamento por hora |
| Controle da infraestrutura | Máximo | Menor |
| Soberania de dados | Controle total | Depende do fornecedor/região |
| Velocidade de implantação | Semanas a meses (prazo de entrega) | Minutos a horas |
| Melhor para | Utilização alta e previsível | Cargas variáveis ou de curto prazo |
Como dimensionar a compra de um servidor GPU pela sua carga de trabalho?
Dimensione a compra pela carga de trabalho, não pela maior configuração disponível. Implantações de inferência pura e de treinamento/fine-tuning têm requisitos fundamentalmente diferentes de GPU, memória e rede.
- 1Classificar a carga de trabalho primeiro
Why it matters: Inferência pura (servir um modelo fixo a usuários) precisa de bem menos memória de GPU e nenhuma rede multi-nó em comparação com treinamento ou fine-tuning, que precisa manter gradientes e estado do otimizador além dos pesos do modelo. - 2Estimar a necessidade de memória de GPU a partir do tamanho do modelo e quantização
Why it matters: Um modelo de 70B parâmetros em FP16 precisa de cerca de 140GB de VRAM antes de overhead — isso sozinho já descarta uma L40S de GPU única (48GB) e aponta para sharding multi-GPU H100/H200 ou um modelo menor/quantizado. - 3Decidir entre nó único e multi-nó
Why it matters: Se a VRAM combinada de um servidor de 8 GPUs cobre o modelo e a meta de concorrência, pule InfiniBand/RoCE inteiramente e economize o custo da rede; se não, orce uma rede dedicada desde o início. - 4Ajustar a refrigeração à densidade do rack antes de encomendar
Why it matters: Confirme com o time de facilities se o rack alvo suporta refrigeração líquida antes de se comprometer com mais de um ou dois servidores de 8 GPUs SXM5 por rack — adaptar a refrigeração depois da entrega é bem mais caro do que planejar com antecedência. - 5Obter cotação formal e confirmar o prazo de entrega
Why it matters: Nenhum desses fornecedores publica preço de tabela para configurações de 8 GPUs, e os prazos de entrega de servidores densos em GPU variaram de várias semanas a alguns meses dependendo da alocação de GPU — orce o cronograma, não só o preço.
Qual nível de garantia e suporte escolher?
Os quatro fornecedores oferecem suporte corporativo em níveis além da garantia básica de hardware, mas os nomes dos níveis, tempos de resposta e serviços incluídos diferem — confirme as condições atuais diretamente com o fornecedor antes da compra, já que os programas mudam.
- Dell vende seus níveis ProSupport (incluindo opções de resposta mais rápida, missão crítica) junto com o XE9680 — pergunte especificamente por suporte qualificado para servidor GPU, não o nível PowerEdge padrão.
- Lenovo vende níveis Premier Support para a linha ThinkSystem, com opções de resposta no local e monitoramento proativo.
- HPE vende suporte via Pointnext Complete Care e oferece HPE GreenLake como alternativa por consumo (pague pelo uso) à compra de capital para quem quer evitar o custo inicial de seis dígitos.
- Supermicro — as condições de suporte variam mais conforme o revendedor/integrador do que nos outros três fornecedores, já que boa parte do volume passa por esse canal em vez de vendas corporativas diretas — obtenha as condições de suporte por escrito do revendedor específico, não só da página de garantia básica da Supermicro.
- Para qualquer fornecedor: pergunte especificamente o que acontece em caso de falha de GPU (SLA de substituição, se é preciso enviar o nó inteiro ou só a bandeja de GPU) — esse é o modo de falha mais provável em um servidor denso em GPU.
Checklist de compra de servidor GPU corporativo
Defina estes pontos antes de solicitar uma cotação — um fornecedor ou revendedor vai perguntar a maior parte disso de qualquer forma, e tê-los prontos encurta o ciclo de cotação.
- Modelo de GPU (H100 / H200 / L40S)
- Número de GPUs necessárias
- Requisito de VRAM para seu(s) modelo(s)
- Tamanho do modelo e nível de quantização
- Inferência vs. treinamento vs. fine-tuning
- Utilização esperada (sustentada vs. irregular)
- Nó único vs. multi-nó
- Velocidade de rede necessária (100/200/400/800GbE)
- InfiniBand vs. RoCE v2
- Disponibilidade de energia no rack do local
- Capacidade de refrigeração a ar vs. líquida
- Requisitos de armazenamento (tamanho do dataset, frequência de checkpoints)
- Plano de backup e recuperação de desastres
- SLA de substituição de GPU
- Disponibilidade de suporte no local
- Período de garantia
- Prazo de entrega
- Escopo de instalação e integração
- Pilha de software (orquestração, framework de serving)
- Custo total de propriedade, não só o preço do hardware
Que erros os compradores corporativos cometem?
- Comprar capacidade de 8 GPUs SXM5 para uma carga de trabalho só de inferência. Se você só serve um modelo fixo a usuários, uma plataforma PCIe 2U como o ProLiant DL380a Gen11 cobre isso por uma fração do preço e da complexidade.
- Encomendar antes de confirmar a capacidade de refrigeração do rack. Um segundo ou terceiro servidor de 8 GPUs SXM5 no mesmo rack pode ultrapassar o teto prático da refrigeração a ar — confirme com facilities antes da chegada do hardware, não depois.
- Pular o orçamento de rede para um cluster "talvez a gente escale depois". Adicionar InfiniBand ou RoCE depois em uma frota de nó único já implantada é mais disruptivo do que orçar isso na compra original.
- Tratar o preço de etiqueta como o custo total. Contratos de suporte, rede, atualização de refrigeração e infraestrutura de energia costumam adicionar 15-30% acima da linha de hardware do servidor.
- Presumir que a H200 é sempre o upgrade certo em relação à H100. Se o seu modelo e tamanho de lote cabem confortavelmente em 80GB por GPU, a memória e o custo extra da H200 não trazem vantagem — verifique a necessidade real de VRAM antes de pagar o adicional.
Perguntas frequentes
Quantas GPUs H100 ou H200 eu preciso para inferência corporativa vs. treinamento?
Implantações de inferência pura que servem um modelo fixo a um número moderado de usuários simultâneos muitas vezes cabem em 1-4 GPUs e nem precisam de uma plataforma de 8 GPUs SXM5. Treinamento ou fine-tuning de modelos grandes (70B+ parâmetros) geralmente precisa da configuração completa de 8 GPUs com NVLink para manter modelo, gradientes e estado do otimizador entre as GPUs. Dimensione a compra pela carga de trabalho, não pelo padrão de "comprar a maior plataforma".
Qual é o custo total real de um servidor rack 8-GPU H100?
Cotações de revendedores e integradores para uma unidade 8x H100 totalmente configurada giraram em torno de US$ 200.000-375.000 só pelo hardware, antes de contratos de suporte, rede e qualquer upgrade de refrigeração — esses costumam adicionar outros 15-30%. Nenhum dos quatro fornecedores publica preço de tabela; peça uma cotação formal antes de orçar.
Eu preciso de refrigeração líquida para um rack denso em GPU?
Se você vai instalar mais de um ou dois servidores de 8 GPUs H100/H200 SXM5 por rack, sim — cada um consome cerca de 10-12kW em carga máxima, e o teto prático da refrigeração a ar fica em torno de 20-40kW por rack. Abaixo dessa densidade, a refrigeração a ar padrão ainda pode funcionar; confirme com facilities antes de encomendar.
Devo escolher InfiniBand ou Ethernet (RoCE) para a rede?
Para inferência de nó único, nenhum dos dois — Ethernet padrão é suficiente. Para clusters de treinamento multi-nó, InfiniBand NDR é a rede RDMA de alta largura de banda mais madura e amplamente implantada; RoCE v2 sobre Ethernet é a alternativa se seu time de rede quiser evitar manter uma rede InfiniBand separada.
Dell vs. Lenovo vs. HPE vs. Supermicro — qual fornecedor tem o melhor suporte corporativo?
Dell, Lenovo e HPE vendem suporte corporativo em níveis (ProSupport, Premier Support e Pointnext Complete Care, respectivamente) via times de conta diretos. A Supermicro vende principalmente via integradores e revendedores, então as condições de suporte variam mais conforme o revendedor do que um único nível Supermicro — obtenha as condições por escrito do revendedor específico antes da compra.
H100 vs. H200 vs. L40S — qual GPU comprar?
Escolha H200 (141GB HBM3e) para serviço de contexto grande ou treinamento em que 80GB por GPU forçariam um sharding entre GPUs que você preferiria evitar. Escolha H100 (80GB HBM3) pela maior disponibilidade entre fornecedores e revendedores em um cluster de treinamento multi-nó quando 80GB são suficientes. Escolha L40S (48GB GDDR6, PCIe, refrigerada a ar) para inferência pura com orçamento menor.
Posso misturar modelos de GPU no mesmo rack ou servidor?
Dentro de um único servidor, não — uma plataforma de 8 GPUs SXM5 é construída e conectada por NVLink em torno de um único modelo de GPU (todas H100 ou todas H200), não uma mistura. Dentro de um rack, sim — você pode rodar um servidor configurado com H100/H200 para treinamento ao lado de outro configurado com L40S para inferência, desde que a refrigeração e o consumo de cada servidor sejam contabilizados separadamente.
Que nível de garantia e suporte os compradores corporativos deveriam escolher?
No mínimo, confirme o SLA de substituição do fornecedor especificamente para falha de GPU (não só falha geral de hardware) — falha de GPU é o modo de falha mais provável em um servidor denso em GPU, e a logística de substituição (enviar uma bandeja de GPU vs. o nó inteiro) varia por fornecedor e nível. Ajuste o nível de tempo de resposta a quanto tempo de inatividade a carga de trabalho realmente tolera.
Hardware on-premises é mais barato que aluguel de GPU em nuvem em escala corporativa?
Depende da utilização, não só do preço de etiqueta — hardware on-premises tem custo inicial alto mas custo por hora baixo depois de rodando, enquanto aluguel em nuvem não tem custo inicial mas uma tarifa por hora bem mais alta. O ponto de equilíbrio costuma ser utilização sustentada e quase constante; cargas ocasionais ou intermitentes geralmente custam menos alugando. Veja nosso guia de aluguel de GPU em nuvem para uma comparação de custo detalhada.
Quanto tempo leva a entrega de uma configuração 8x H100 ou H200?
Os prazos de entrega de servidores densos em GPU variaram de várias semanas a alguns meses dependendo da alocação de GPU e da demanda atual — não é um item de estoque para a maioria dos fornecedores em configuração de 8 GPUs. Confirme o prazo como parte da cotação formal e orce o cronograma do projeto de acordo, não só o preço.
Qual é o melhor servidor GPU corporativo em 2026?
Não existe um único melhor servidor — depende da carga de trabalho. O Dell PowerEdge XE9680 tem a rede de suporte corporativo mais ampla para treinamento ou inferência em larga escala. O Lenovo ThinkSystem SR675 V3 é a melhor opção se seu data center já está pronto para refrigeração líquida. O HPE ProLiant DL380a Gen11 é a melhor opção para uma primeira compra menor, só de inferência. O Supermicro SYS-821GE-TNHR costuma ser o caminho mais competitivo em preço para uma configuração 8x H100/H200 via canal de integradores.
Quantas GPUs um modelo de 70 bilhões de parâmetros precisa?
Um modelo de 70B parâmetros em FP16 precisa de cerca de 140GB de VRAM antes de overhead — isso sozinho já descarta uma única GPU e tipicamente exige pelo menos 2x H100 (80GB cada) ou 1-2x H200 (141GB cada) com sharding, dependendo do comprimento de contexto e do tamanho do lote. Quantizar para 8 bits ou 4 bits reduz o requisito de forma aproximadamente proporcional, com algum custo de precisão.
Um servidor GPU corporativo pode rodar LLMs locais?
Sim — são as mesmas GPUs (H100, H200, L40S) usadas em workstations e configurações multi-GPU para LLM local, só que em um formato montado em rack, com suporte corporativo, multiusuário. A diferença está na escala e no modelo de implantação, não na capacidade de IA subjacente.
É preciso InfiniBand para inferência de IA, ou só para treinamento?
Só para treinamento ou fine-tuning multi-nó, em que GPUs de vários servidores precisam sincronizar gradientes constantemente. A inferência de nó único — mesmo em um servidor de 8 GPUs — não precisa de InfiniBand; Ethernet padrão de 100/200GbE é suficiente.
Fontes
- Página do produto Dell PowerEdge XE9680 -- dell.com/en-us/shop/ipovw/poweredge-xe9680
- Guia de produto Lenovo ThinkSystem SR675 V3 -- lenovopress.lenovo.com/lp1611-thinksystem-sr675-v3-server
- HPE Cray XD670 QuickSpecs -- hpe.com/us/en/hpe-cray-xd670.html
- Ficha técnica HPE ProLiant DL380a Gen11 -- hpe.com/us/en/compute/hpe-proliant-compute/dl380a-gen11.html
- Ficha técnica Supermicro SYS-821GE-TNHR -- supermicro.com/en/products/system/datasheet/SYS-821GE-TNHR
- Localizador de parceiros autorizados Supermicro -- supermicro.com/en/wheretobuy
- Especificações NVIDIA H100/H200 Tensor Core GPU -- nvidia.com