Skip to main content
PromptQuorum

Quanto custa uma GPU na nuvem por hora em 2026?

Quanto custa uma GPU na nuvem por hora em 2026?

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Resposta rápida

RTX 4090: $0,15–0,44/h. A100 80 GB: $1,10–2,00/h. H100: $2,50–4,00/h. Mais barata para inferência: Vast.ai spot.

  • Vast.ai spot RTX 4090 é a mais barata a ~$0,15/h, mas pode ser interrompida no meio do trabalho.
  • RunPod Secure Cloud cobra ~$0,44/h por RTX 4090 com disponibilidade garantida.
  • H100 80 GB na Lambda Labs: ~$2,49/h — use apenas para modelos de 70B+ ou jobs batch de grande escala.
Hardware-SpecificIntermediário

Pontos principais

  • RTX 4090 24 GB é a opção viável mais barata — $0,30–0,80/h em marketplaces, ideal para inferência de 13B–30B
  • A100 80 GB a $0,90–1,90/h é o cavalo de batalha para inferência de 70B e a maioria dos jobs de treinamento
  • H100 80 GB a $2,20–4,00/h é a opção mais rápida, mas vale a pena apenas para treinamento em larga escala ou serving em produção
  • Todas as faixas são aproximações de maio de 2026 — verifique os painéis dos provedores em tempo real antes de reservar

Melhor opção: ajuste a placa à carga de trabalho

A GPU na nuvem mais barata viável é aquela que cabe no seu modelo com a menor margem de VRAM. Alugar uma H100 a $4/h para executar um modelo de 13B desperdiça mais de 60 GB de VRAM pelo qual você está pagando.

Para inferência de 7B–13B: uma RTX 4090 24 GB em um marketplace (Vast.ai, RunPod community pool) a $0,30–0,80/h. Os 24 GB de VRAM são suficientes e os marketplaces de placas de consumidor são mais baratos do que nuvens gerenciadas.

Para inferência de 70B ou fine-tuning de escala média: uma A100 80 GB a $0,90–1,90/h. Os 80 GB de VRAM acomodam um modelo de 70B em Q4 com espaço para contexto. Para treinamento de modelos frontier ou serving em produção com objetivos rígidos de latência: uma H100 80 GB a $2,20–4,00/h — vale apenas quando o desempenho sustentado é o gargalo.

Ver tarifas atuais de GPU no RunPodlink de produto · divulgadoVer tarifas atuais de GPU no Vast.ailink de produto · divulgadoVer tarifas atuais de GPU na Lambda Labslink de produto · divulgado

Tarifas horárias de GPU na nuvem por placa

As faixas abaixo são cifras aproximadas de maio de 2026 entre os principais provedores (RunPod, Vast.ai, Lambda Labs e outros). O extremo inferior corresponde tipicamente a preços interrompíveis ou de marketplace; o extremo superior é nuvem gerenciada sob demanda.

GPUVRAMTarifa horária (aprox.)Ideal para
RTX 409024 GB$0,30–0,80/hInferência 7B–30B, fine-tuning leve
A100 80 GB80 GB$0,90–1,90/hInferência 70B, maioria dos fine-tunings
H100 80 GB80 GB$2,20–4,00/hTreinamento em larga escala, serving crítico em latência

Leituras relacionadas

Respostas rápidas sobre preços de GPU na nuvem

Quando é mais barato alugar uma GPU na nuvem do que comprá-la?
Alugar vence em cargas de trabalho curtas e esporádicas — algumas horas por semana. Comprar vence com uso diário sustentado. Uma RTX 4090 usada a ~$2.500 se amortiza em aproximadamente 3.000–8.000 horas de aluguel na nuvem a $0,30–0,80/h.
Por que a mesma GPU custa tão diferente por provedor?
Nuvens gerenciadas (Lambda, AWS, GCP) incluem suporte, SLA e hardware dedicado — são mais caras. Marketplaces (Vast.ai) são de hosts individuais, que podem ser interrompíveis. Região e demanda também deslocam os preços.
As tarifas incluem armazenamento e largura de banda?
Geralmente não. O armazenamento persistente custa tipicamente $0,05–0,20/GB-mês. A largura de banda de saída pode adicionar centavos por GB. Para pesos de modelos grandes ou datasets, inclua-os no custo total.
Como encontro a GPU mais barata para minha carga de trabalho agora?
Compare pelo menos dois provedores antes de reservar — RunPod (gerenciado) e Vast.ai (marketplace) cobrem ambos os extremos do espectro. Filtre pela VRAM necessária e depois ordene por preço.