Conclusiones clave
- La RTX 4090 sigue siendo la mejor GPU de consumo individual para IA local en 2026: 24 GB VRAM, ~1 TB/s de ancho de banda — su precio de segunda mano incluso ha bajado ligeramente desde la primavera
- Un kit DDR5 de 64 GB que costaba ~145 € en mayo de 2026 cuesta ahora ~835 € — la escasez de memoria de 2026 pesa más que el cambio de precio de la GPU
- Los modelos 70B Q4 necesitan más de 40 GB VRAM — requieren dual RTX 3090 o CPU offloading
- El precio de calle del Ryzen 9 9950X (Zen 5, 16 núcleos) ha bajado a ~455 €, desde ~420 € en mayo — el único componente que se abarató
- NVMe PCIe Gen 4/5 carga un modelo de 7B en menos de 2 segundos, pero un SSD Gen 5 de 4 TB cuesta ahora ~745 €, antes ~200 €
- Los Niveles 1 y 2 comparten el socket AM5 — actualiza GPU/RAM sin cambiar la placa base; el Nivel 3 requiere TRX50
¿Qué workstation deberías construir?
Elige tu build según el modelo más grande que realmente necesitas ejecutar: 7B–14B → Económico. 14B–32B → Recomendado. 70B → Profesional. Precios de sistema completo, verificados al 25 de agosto de 2026.
| Económico | Recomendado | Profesional | |
|---|---|---|---|
| Precio | ~2.500 € | ~4.950 € | ~8.200 € |
| GPU | RTX 3090 24GB (usada) | RTX 4090 24GB | 2× RTX 3090 (48GB) |
| CPU | Ryzen 7 7700X | Ryzen 9 9950X | Threadripper 7960X |
| RAM | 64GB DDR5 | 64GB DDR5-6000 | 256GB DDR5 ECC |
| Modelo máximo | 32B Q4 en GPU | 30B Q4 GPU / 70B offload | 70B Q4 a velocidad GPU |
| Ideal para | Presupuesto ajustado, 7B–14B | La mayoría de usuarios, 14B–32B | Cargas 70B, multiusuario |
Cada total abajo supera los precios citados en otros lugares en 2026 — es la escasez de DDR5/NAND (ver aviso tras las tablas de niveles), no un error. Los precios de GPU, en cambio, están estables o en ligera baja.
Elección del editor: Workstation Recomendada RTX 4090
La mejor workstation de IA local en general para 2026 — el punto de equilibrio entre VRAM, margen de actualización y precio para la gama más amplia de modelos.
- 24 GB VRAM — ejecuta cualquier modelo hasta 32B Q4 completamente en GPU
- 64 GB DDR5-6000 — suficiente para 70B vía CPU offload a 10–15 tok/s
- Qwen3 32B Q4 completamente en GPU a 28–38 tok/s; 70B con offloading
- ~4.950 € en sistema completo, verificado al 25 de agosto de 2026
- Sáltatelo si: solo ejecutas modelos 7B–14B — el build Económico ahorra ~2.450 € y cumple igual de bien
La VRAM determina tu build
¿No sabes qué nivel necesitas? Parte del modelo más grande que realmente planeas usar, no el que podrías usar algún día.
| Tamaño de modelo | VRAM recomendada | Mejor build |
|---|---|---|
| 7B | 8–12 GB | Económico (RTX 3090 con margen de sobra) |
| 14B | 16–24 GB | Económico o Recomendado |
| 32B Q4 | ~20–24 GB | Recomendado (RTX 4090) |
| 70B Q4 | ~40 GB+ | Profesional (dual RTX 3090) o offload en Recomendado |
| 70B Q8 | ~70 GB+ | Solo multi-GPU — ver nuestra guía de GPU |
¿Solo buscas una GPU (no un build completo)? Consulta nuestra guía de compra de GPU.
Nivel 1: ~2.500 € workstation de IA económica
El build económico utiliza una RTX 3090 usada (24 GB VRAM) como núcleo. Ejecuta Llama 3.1 8B Q8 a 45–60 tok/s, Qwen3 14B Q8 a 20–28 tok/s y Qwen3 32B Q4 a 12–18 tok/s completamente en GPU. Elige este build si: tu presupuesto está por debajo de 3.000 €, usas sobre todo modelos 7B–32B, y no te importa comprar una GPU usada. Sáltatelo si: el 70B es tu carga principal — el offloading a CPU en este nivel corre a 5–8 tok/s, funcional pero lento.
- Modelos compatibles a velocidad GPU completa: 7B (cualquier cuantización), 13B (Q4/Q8), 14B (Q4/Q8), 30B (Q4)
- Soporte para 70B: requiere CPU offloading — ~5–8 tok/s, funcional pero no ideal
- Consumo eléctrico: ~450 W en pico (GPU 350 W + CPU 65 W + resto)
| Componente | Modelo | Precio (ago 2026) |
|---|---|---|
| GPU | NVIDIA RTX 3090 (usada, 24 GB) | ~790 € |
| CPU | AMD Ryzen 7 7700X | ~200 € |
| Placa base | MSI MAG X670E Tomahawk WiFi | ~175 € |
| RAM | 64 GB DDR5-5600 (2×32 GB) | ~790 € (mayo: ~110 €) |
| Almacenamiento | 2 TB PCIe Gen 4 NVMe | ~325 € (mayo: ~90 €) |
| Fuente de poder | 850 W certificada 80+ Gold | ~100 € |
| Gabinete | Torre media ATX, 3+ ranuras para ventiladores | ~75 € |
| Disipador CPU | AIO 240mm o torre | ~65 € |
| Total | ~2.520 € |
💡Tip: Usada vs. nueva: las RTX 3090 usadas (~650–950 € en eBay.es) ahorran 30–50% frente al poco stock nuevo que queda, a costa de una garantía incierta. Elige un vendedor con devoluciones y revisa señales de desgaste por minería (ruido de ventilador, olor a quemado bajo carga).
Nivel 2: ~4.950 € workstation de IA recomendada
El build recomendado se centra en la RTX 4090 (24 GB, ~1 TB/s de ancho de banda de memoria) combinada con el AMD Ryzen 9 9950X (Zen 5, 16 núcleos). La 4090 es un 30–40% más rápida que la 3090 por GB de VRAM. Elige este build si: quieres la mejor workstation mono-GPU, usas modelos 14B–32B regularmente, y ocasionalmente haces offload de un 70B. Sáltatelo si: el 70B es tu carga diaria principal — mejor Profesional para velocidad de GPU en 70B.
- Velocidad 7B Q4: ~105–125 tok/s en Ollama
- Velocidad 14B Q8: ~48–60 tok/s
- Velocidad 30B Q4: ~28–38 tok/s
- 70B Q4 (CPU offloading): ~10–15 tok/s con 64 GB RAM
- Consumo eléctrico: ~550 W en pico
| Componente | Modelo | Precio (ago 2026) |
|---|---|---|
| GPU | NVIDIA GeForce RTX 4090 24 GB | ~2.050 € |
| CPU | AMD Ryzen 9 9950X (16C/32T, Zen 5) | ~455 € (mayo: ~420 €) |
| Placa base | ASUS ProArt X870E-Creator WiFi | ~485 € |
| RAM | 64 GB DDR5-6000 CL30 (2×32 GB) | ~835 € (mayo: ~145 €) |
| Almacenamiento | 4 TB PCIe Gen 5 NVMe | ~745 € (mayo: ~200 €) |
| Fuente de poder | 1000 W certificada 80+ Platinum | ~165 € |
| Gabinete | Torre completa ATX con buen flujo de aire | ~130 € |
| Disipador CPU | AIO 360mm | ~100 € |
| Total | ~4.965 € |
Nivel 3: ~8.200 € workstation profesional 70B
El build profesional está orientado a la inferencia de modelos 70B a velocidad de GPU (25–40 tok/s) usando dos RTX 3090 para un total de 48 GB VRAM. El Ryzen Threadripper 7960X (24 núcleos) acelera el CPU offloading. Con 256 GB DDR5 ECC, incluso los modelos 140B cuantizados se cargan completamente en RAM. Elige este build si: el 70B es tu carga principal, necesitas 48 GB+ de VRAM de GPU, o das soporte a varios usuarios simultáneos. Sáltatelo si: nunca has usado un modelo mayor de 32B — este nivel es entonces un sobrecoste importante.
- Velocidad 70B Q4: 25–40 tok/s (ambas RTX 3090 activas mediante paralelismo de tensores)
- CPU offloading con 256 GB RAM: ejecuta modelos de 140B+ a 4–6 tok/s
- Consumo eléctrico: ~900 W en pico
| Componente | Modelo | Precio (ago 2026) |
|---|---|---|
| GPU ×2 | 2× NVIDIA RTX 3090 24 GB (usadas) | ~1.580 € |
| CPU | AMD Ryzen Threadripper 7960X (24C) | ~1.300 € (volátil — se ha visto entre 950–2.300 €) |
| Placa base | ASUS Pro WS TRX50-SAGE WiFi | ~745 € |
| RAM | 256 GB DDR5-5200 ECC (8×32 GB) | ~2.600 € (mayo: ~650 € — verifica antes de comprar) |
| Almacenamiento | 8 TB PCIe Gen 4 NVMe (2×4 TB) | ~1.300 € (mayo: ~360 €) |
| Fuente de poder | 1600 W Platinum modular | ~325 € |
| Gabinete | Torre completa HEDT ATX | ~205 € |
| Disipador CPU | AIO 360mm + ventiladores adicionales | ~140 € |
| Total | ~8.195 € |
⚠️Warning: La escasez de DDR5 de 2026 golpeó con más fuerza a la RAM de servidor ECC/RDIMM — los kits DDR5 ECC de 256 GB son escasos y con precio volátil. Consigue un presupuesto en tiempo real de RAM listada en la QVL de tu placa antes de pedir.
Hardware que no compraríamos para este uso
- Una GPU de 8 GB si el objetivo son modelos de 32B — chocarás con el límite de VRAM de inmediato
- Una CPU cara con una GPU insuficiente — la GPU y su VRAM deciden la velocidad de inferencia mucho más que el reloj de la CPU
- Un SSD SATA para una workstation de IA nueva — carga de modelos 5 veces más lenta que NVMe Gen 4 por una diferencia de 20–40 €
- Una fuente de poder insuficiente — el nivel Profesional alcanza picos cercanos a 900 W
- 32 GB de RAM para offloading serio de 70B en CPU — el propio modelo necesita ~40 GB solo para residir en memoria
¿Construir una workstation o alquilar GPU en la nube?
Workstation local vs. alquiler de GPU en la nube
Usa un LLM local si:
- •Usas modelos locales 2+ horas/día
- •La privacidad o la residencia de datos importan para tu caso de uso
- •Quieres un coste fijo y predecible a largo plazo
- •Ya te has decidido por un nivel de arriba
Usa un modelo en la nube si:
- •Usas modelos locales menos de 1 hora/día
- •Tu uso es ocasional o puntual (pruebas, lotes)
- •No quieres ocuparte del mantenimiento del hardware
- •Quieres probar un modelo 70B+ antes de invertir en hardware
Decisión rápida:
- →Uso diario intensivo → construye la workstation (ver tablas de niveles arriba)
- →Uso ocasional/de evaluación → alquila GPU en la nube
- →¿No estás seguro? Ver la tabla de amortización más abajo
- →Comparar proveedores de GPU en la nube →
Stack de software para cualquier build
Una vez ensamblado el hardware, poner en marcha Ollama toma menos de 10 minutos:
- 1Instala Ubuntu 22.04 LTS o Windows 11 (Ubuntu es preferible por la estabilidad de CUDA)
- 2Instala los drivers de NVIDIA 550+ desde nvidia.com o con
ubuntu-drivers autoinstall - 3Instala Ollama:
curl -fsSL https://ollama.com/install.sh | sh - 4Descarga un modelo:
ollama pull qwen2.5:14b-instruct-q8_0 - 5Ejecuta como servidor de red:
OLLAMA_HOST=0.0.0.0 ollama serve - 6Instala Open WebUI para interfaz en el navegador:
docker run -d -p 3000:8080 --gpus all ghcr.io/open-webui/open-webui:cuda - 7Usa Tailscale para acceso remoto seguro desde cualquier dispositivo
Comparación de rendimiento en los tres builds
El rendimiento del hardware es el mismo que en mediciones anteriores de 2026 — solo cambiaron los precios.
| Modelo + cuantización | Económico (~2.500 €) | Recomendado (~4.950 €) | Profesional (~8.200 €) |
|---|---|---|---|
| Llama 3.1 8B Q4 | 55–70 tok/s | 105–125 tok/s | 120–140 tok/s |
| Qwen3 14B Q8 | 20–28 tok/s | 48–60 tok/s | 55–70 tok/s |
| Qwen3 32B Q4 | 12–18 tok/s | 28–38 tok/s | 40–55 tok/s |
| Llama 3.3 70B Q4 | 5–8 tok/s (CPU) | 10–15 tok/s (CPU) | 25–40 tok/s (GPU) |
| Mixtral 8x22B Q4 | 15–22 tok/s | 32–45 tok/s | 45–60 tok/s |
Coste total de propiedad: workstation vs. GPU en la nube
El coste de hardware del build Recomendado subió ~29% desde mayo de 2026 (RAM y almacenamiento, no la GPU) — la amortización frente al alquiler en la nube cambió en consecuencia.
| Uso | Coste nube/año (A40 a 0,44 $/h) | Coste eléctrico workstation/año | Amortización vs. nube |
|---|---|---|---|
| 2 h/día | ~295 € | ~88 € (@0,30 €/kWh) | ~19 años — gana la nube |
| 4 h/día | ~590 € | ~176 € | ~12 años |
| 8 h/día | ~1.180 € | ~352 € | ~6 años |
A los precios de hardware inflados de 2026, la workstation solo gana claramente el cálculo de coste puro a partir de ~6 h/día de uso. La privacidad y la independencia de la disponibilidad en la nube son razones aparte para ir local.
¿Es mejor construir una workstation o alquilar GPU en la nube para ejecutar modelos de 70B?
Para uso regular (6+ horas al día), construye la workstation. Una A40 de 48 GB en RunPod cuesta $0.44/h — a 4 horas al día, eso es ~590 € al año. A los precios de hardware de 2026, el build Recomendado de ~4.950 € se amortiza en unos 12 años a ese ritmo, o menos de 6 años a 8 h/día. Para uso ocasional (menos de 2 horas al día), la nube es más económica.
¿Por qué este build cuesta tanto más que otras guías de 2026?
La RAM y el almacenamiento NVMe, no la GPU. Una escasez de DDR5/NAND en 2026 subió los kits DDR5 de 64 GB de ~145 € en mayo a ~835 € en agosto, y los SSD NVMe de 4 TB de ~200 € a ~700–800 €. Los precios de GPU se mantuvieron estables o bajaron ligeramente en el mismo periodo.
¿Debería comprar una RTX 3090 usada o nueva?
Usada es la opción estándar en 2026 — la producción terminó en 2022, así que "nueva" es solo stock antiguo a precio superior. Las tarjetas usadas cuestan 650–950 €; revisa ruido excesivo de ventilador u olor a quemado bajo carga, y prefiere un vendedor que acepte devoluciones.
¿Necesito NVLink para ejecutar Ollama en dos GPU?
No. Ollama usa paralelismo de tensores CUDA a través de PCIe — no se necesita NVLink. La configuración con dual RTX 3090 funciona perfectamente sin NVLink.
¿Por qué una dual RTX 3090 en lugar de una RTX 4090 para el build profesional?
La VRAM es el factor decisivo. Dos RTX 3090 de 24 GB cada una = 48 GB en total, suficiente para Llama 3.3 70B Q4 (~40 GB). Una sola RTX 4090 tiene solo 24 GB — el modelo 70B Q4 no cabe sin CPU offloading.
Mejoras que vale la pena pagar si esperas crecer
Tres mejoras valen la pena si crees que superarás tu nivel en un año:
- RAM: 64 GB → 128 GB — útil para modelos 70B con offload de CPU en el nivel Recomendado
- Almacenamiento: 2 TB → 4 TB — útil si mantienes más de 3–4 modelos grandes instalados a la vez
- Refrigeración: AIO 240mm → 360mm — importa más en los niveles Recomendado y Profesional
¿Qué workstation deberías comprar?
¿Sigues sin decidirte? Empieza con el build Recomendado RTX 4090 — ofrece el mejor equilibrio de rendimiento, VRAM, consumo y capacidad de actualización para la mayoría de usuarios.
💰 Menos de 3.000 € — Build Económico
~2.500 € · RTX 3090 24GB
Ejecuta cualquier modelo hasta 32B Q4 completamente en GPU.
⭐ Mejor opción general — Build Recomendado
~4.950 € · RTX 4090 24GB
El mejor equilibrio entre rendimiento, VRAM y precio para la mayoría de usuarios.
🚀 70B / profesional — Build Profesional
~8.200 € · Dual RTX 3090 (48GB)
Inferencia 70B a velocidad de GPU (25–40 tok/s). Solo para uso diario de 70B.
Lectura relacionada
- Mejor GPU para LLMs locales 2026 -- guía de compra de GPU para cada nivel de workstation
- Mejor app de IA local para PC de gama baja -- opciones de software si aún no estás listo para una workstation completa
- Mejor Mac para IA local 2026 -- alternativa Apple Silicon a una workstation GPU
- Los mejores portátiles para ejecutar LLMs locales: guía de compra 2026 -- opciones portátiles antes de comprometerte con un build de workstation
- Despliegue Local de Qwen: Guía Completa de Producción 2026 -- despliegue en producción una vez construida tu workstation
