Melhor SSD para carregamento rápido de modelos em 2026?

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.
Resposta rápida
Um NVMe PCIe Gen4 de 2 TB, como o Samsung 990 Pro, carrega um modelo 7B em cerca de um segundo graças à sua velocidade de leitura sequencial nominal de ~7.450 MB/s. O WD Black SN850X 2 TB tem desempenho quase idêntico — compre o que estiver mais barato em um varejista confiável, já que os preços de SSD oscilaram bastante em 2026.
- ▸Um NVMe Gen4 de 2 TB carrega um modelo 7B em cerca de um segundo e um modelo 14B em poucos segundos — 7 a 10x mais rápido que um SSD SATA.
- ▸A velocidade do SSD só muda o tempo de carregamento e troca de modelo. Ela não muda os tokens por segundo depois que o modelo está rodando — isso é uma questão de GPU/VRAM.
- ▸Coloque a pasta de modelos do Ollama ou LM Studio na NVMe, não na unidade do sistema operacional, para aproveitar todo o ganho.
Pontos principais
- ✓Melhor opção: Samsung 990 Pro 2 TB (PCIe Gen4 NVMe). Melhor alternativa: WD Black SN850X 2 TB — compre o que estiver mais barato em um vendedor confiável
- ✓O fato mais importante desta página: um SSD mais rápido acelera o carregamento e a troca de modelos, não a geração de texto — tokens por segundo dependem da GPU e da largura de banda de memória, não do armazenamento
- ✓2 TB é o mínimo prático quando se mantém mais de dois ou três modelos quantizados em disco
- ✓Não compre uma unidade PCIe Gen5 só para carregamento de LLM — o ganho real sobre o Gen4 é menor do que os números da ficha técnica sugerem, a menos que já esteja com preço igual ao de uma unidade Gen4
Melhor opção: Samsung 990 Pro 2 TB (PCIe Gen4 NVMe)
O Samsung 990 Pro 2 TB é o melhor SSD para carregamento rápido de modelos LLM: sua velocidade de leitura sequencial nominal de ~7.450 MB/s carrega um modelo 14B Q4 (~9 GB) na RAM em poucos segundos, contra 15+ segundos em um SSD SATA e mais de um minuto em um HD. Se o Samsung estiver significativamente mais caro na hora de comprar, opte pelo WD Black SN850X 2 TB — ambos são unidades PCIe Gen4 com desempenho prático quase idêntico para essa finalidade.
PCIe Gen4 NVMe é o ponto ideal para a maioria das configurações. Se a sua placa-mãe tem um slot PCIe 5.0 M.2 (Intel série 700, AMD X670E/B650E ou mais recente) e uma unidade Gen5 como o Samsung 9100 Pro está com preço igual ou menor que uma unidade Gen4 — o que aconteceu repetidamente em 2026 dada a volatilidade dos preços de SSD —, é uma boa compra. Não troque de placa-mãe só para ter Gen5 no carregamento de LLM: o ganho real de tempo sobre o Gen4 é menor do que os números de leitura sequencial sugerem.
Compre 2 TB ou mais. Alguns modelos quantizados (7B, 8B, 13B, 14B em múltiplas quantizações) preenchem 1 TB rapidamente. 2 TB deixam espaço para o SO, frameworks e uma dúzia de modelos sem precisar apagar e baixar de novo o tempo todo. Para uma biblioteca de modelos maior, veja nosso guia de NAS e armazenamento abaixo, com opções de 4 TB+ e armazenamento em rede.
Velocidade do SSD vs. velocidade de inferência: o que muda de verdade
Depois que um modelo é carregado na RAM ou VRAM, o SSD praticamente não tem mais relação com os tokens por segundo. Um SSD mais rápido acelera três coisas: iniciar um modelo pela primeira vez, trocar entre modelos e copiar ou baixar arquivos de modelo.
Ele não acelera a geração de texto, a inferência da GPU nem os tokens por segundo — isso depende da GPU, da VRAM e da largura de banda de memória. Comprar um SSD mais rápido esperando uma geração mais rápida é o erro mais comum sobre esse assunto. Se o que você busca é mais tokens por segundo, a compra certa é uma GPU, não armazenamento.
Tipos de SSD comparados para carregamento de modelos LLM
A velocidade de leitura sequencial é a única característica que importa para o carregamento de modelos. A tabela abaixo mostra quanto tempo cada tipo de unidade leva, aproximadamente, para carregar um modelo 14B Q4 (~9 GB) do disco para a RAM — calculado a partir da leitura sequencial nominal de cada unidade, não medido em laboratório. O tempo real varia com o overhead do sistema, mas a ordem se mantém.
| Tipo de unidade | Leitura sequencial | Tempo de carga modelo 9 GB | Veredicto |
|---|---|---|---|
| PCIe Gen5 NVMe (ex. Samsung 9100 Pro) | ~13.000-14.700 MB/s | ~1-2 s | Bom se a placa-mãe suporta Gen5 e o preço está próximo do Gen4 |
| PCIe Gen4 NVMe (ex. Samsung 990 Pro) | ~7.000 MB/s | ~2-4 s | Melhor opção para a maioria das configurações |
| PCIe Gen3 NVMe | ~3.500 MB/s | ~3-7 s | Aceitável |
| SSD SATA | ~550 MB/s | ~15-25 s | Nitidamente lento — atualize se possível |
| HDD (7200 RPM) | ~150 MB/s | ~60-90 s | Evitar para LLMs |
Leitura relacionada
- ▸Melhor GPU por menos de $600 para LLMs locais — combine um SSD rápido com a GPU certa
- ▸Melhor mini PC para LLM local — muitos mini PCs incluem SSDs mais lentos
- ▸Quanta RAM um modelo 7B precisa? — a RAM importa mais do que o SSD para a velocidade de inferência
- ▸Melhor NAS e armazenamento para modelos de IA locais — para 4 TB+ e vários modelos
Respostas rápidas sobre SSDs para LLMs locais
Um SSD mais rápido acelera a inferência?▾
Vale a pena o PCIe Gen5 em relação ao Gen4 para LLMs?▾
Por que os preços de SSD mudam tanto em 2026?▾
Quanta capacidade de SSD preciso para LLMs locais?▾
A unidade do sistema operacional precisa ser o mesmo SSD?▾
Quer a análise completa?
Ler o guia completo →Prompt Bites relacionados