Forma más barata y práctica de ejecutar un modelo 70B en local en 2026

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.
Respuesta rápida
Una configuración dual RTX 3090 de segunda mano (~48 GB de VRAM combinada) es la forma más barata y práctica de ejecutar un modelo 70B Q4 a una velocidad utilizable. Un Mac Apple Silicon con 64 GB+ de memoria unificada es la alternativa de un solo equipo más sencilla — sin necesidad de configuración multi-GPU. Consulta los precios actuales en lugar de una cifra fija — los precios de GPU de segunda mano varían mucho.
- ▸Lo más barato y práctico: 2× RTX 3090 24 GB de segunda mano (~48 GB de VRAM combinada) — descarga Q4 completa, requiere saber montar un PC
- ▸Lo más sencillo: Mac Apple Silicon 64 GB+ — el modelo entero cabe en la memoria unificada, sin configuración multi-GPU
- ▸Lo más barato en absoluto: 64–128 GB de RAM, solo CPU — funciona, pero dolorosamente lento a 1–3 tok/s
- ▸Mejor rendimiento: un sistema multi-GPU de alta VRAM para cargas de trabajo 70B serias y sostenidas
- ▸Novedad de agosto de 2026: el Mac mini M5 Pro (64 GB, desde 1.699 $) es el equipo Apple Silicon nuevo más barato capaz de ejecutar un 70B — el Mac mini M6 base (32 GB máx.) no puede
Puntos clave
- ✓Un 70B en Q4 necesita unos 40–48 GB de memoria — una sola GPU de 24 GB no puede contener el modelo completo
- ✓Lo más barato y práctico: 2× RTX 3090 24 GB de segunda mano, descarga Q4 completa — consulta los precios de segunda mano actuales
- ✓Lo más sencillo: Mac Apple Silicon 64 GB+ — no requiere configuración multi-GPU
- ✓Lo más barato en absoluto: 64–128 GB de RAM, solo CPU — utilizable pero lento (1–3 tok/s)
- ✓¿Uso ocasional? Alquilar una GPU en la nube suele ser más barato que comprar hardware
- ✓Actualización de agosto de 2026: el nuevo Mac mini M5 Pro (64 GB, desde 1.699 $) ya puede ejecutar un 70B — el Mac mini M6 base (32 GB máx.) sigue sin poder
Lo más barato y práctico: 2× RTX 3090 de segunda mano
Dos tarjetas RTX 3090 de segunda mano (24 GB de VRAM cada una) suman unos 48 GB de VRAM utilizable con el tensor-parallel de llama.cpp — suficiente para descargar por completo un modelo 70B Q4_K_M sin recurrir a la CPU. Necesitas una placa base con dos ranuras PCIe x16 y una fuente de 1000 W+.
El precio de las RTX 3090 de segunda mano varía enormemente según el estado, la refrigeración y el vendedor — consulta los anuncios actuales en lugar de fiarte de una cifra fija. Compra a un vendedor con fotos claras de la tarjeta y, si es posible, con información sobre si se usó para minería o gaming.
Cómprala si: te gusta montar PCs y quieres la mejor velocidad de inferencia por euro. Evítala si: quieres un equipo sencillo, silencioso, en una sola caja — mira la opción Mac más abajo.
Comparativa de hardware para 70B
Todas las opciones de abajo caben un modelo 70B Q4_K_M (~42 GB) con calidad utilizable. Consulta los precios actuales de cada opción antes de decidir — los precios de GPU de segunda mano y RAM cambian a menudo.
| Configuración | Velocidad | Complejidad | Ideal para |
|---|---|---|---|
| CPU + 64–128 GB RAM | 🐌 1–3 tok/s | ⭐ Baja | Hardware más barato, pruebas |
| 2× RTX 3090 de 2ª mano | 🏆 20–35 tok/s | ⚠️ Alta | Mejor relación calidad-precio |
| Mac Apple Silicon 64 GB+ | ⭐⭐⭐ 12–18 tok/s | 🟢 Baja | Simplicidad, un solo equipo |
| Mac mini M5 Pro 64 GB (nuevo) | 🆕 Sin benchmarks aún | 🟢 Baja | Sistema completo nuevo más barato |
| RTX 4090 sola + offload | ⭐⭐ 8–12 tok/s | ⚠️ Media | Ya tienes una 4090 |
| Mac Apple Silicon 128 GB | 🚀 25–35 tok/s | 🟢 Baja | Modelos más grandes, calidad total |
Lo más sencillo: Mac Apple Silicon 64 GB+
Si no quieres montar un PC con dos GPU, Apple Silicon es mucho más sencillo: el modelo vive directamente en la memoria unificada, así que no hay que repartirlo entre RAM del sistema y VRAM, ni configurar drivers multi-GPU. 64 GB de memoria unificada es el objetivo para ejecutar un 70B Q4 con comodidad sin descargar capas a disco.
La actualización de hardware de Apple del 25 de agosto de 2026 también renovó el Mac mini, además del Mac Studio. El Mac mini base con chip M6 parte de 899 $, pero tiene un tope de 32 GB de memoria unificada — insuficiente para un modelo 70B en Q4, así que no sirve para este uso. El Mac mini con chip M5 Pro parte de 1.699 $ con hasta 64 GB de memoria unificada, lo que sí alcanza el umbral necesario — el equipo Apple Silicon nuevo más barato capaz de ejecutar un 70B. Ambos salen a la venta el 22 de septiembre de 2026; consulta el precio actual antes de comprar, ya que los precios del hardware nuevo pueden variar.
Apple actualizó la línea Mac Studio a M5 Max/M5 Ultra en el mismo anuncio de agosto de 2026, desde 2.499 $, configurable hasta 128 GB de memoria unificada — consulta el precio actual de una configuración de 64 GB en lugar de fiarte de una cifra antigua. Un MacBook Pro con 64 GB+ de memoria unificada es el equivalente portátil, con un sobreprecio respecto al de sobremesa.
Si partes de cero — sin un PC existente al que añadir GPU —, el Mac mini M5 Pro de 1.699 $ suele salir más barato en total que montar una máquina dual RTX 3090 desde cero una vez que cuentas placa base, fuente de alimentación y caja, no solo las dos GPU. Si ya tienes un PC capaz, añadir dos RTX 3090 de segunda mano probablemente siga siendo la opción más barata y rápida.
Cómpralo si: valoras la simplicidad, el bajo consumo y el funcionamiento silencioso por encima de la velocidad bruta. Evítalo si: quieres el máximo de tokens por segundo por euro — ahí gana la configuración dual 3090.
Lo más barato en absoluto: CPU + 64–128 GB RAM
Técnicamente, no necesitas GPU en absoluto — un modelo 70B Q4_K_M puede ejecutarse por completo en RAM del sistema. Espera alrededor de 1–3 tokens por segundo, utilizable para tareas por lotes o pruebas, pero frustrante para un chat interactivo.
No compres una máquina solo-CPU de 128 GB específicamente para chat 70B interactivo, salvo que el coste puro te importe de verdad más que la velocidad — las opciones dual-3090 o Mac de arriba cuestan más pero son muchísimo más usables en el día a día.
Una alternativa: alquilar en vez de comprar
Si solo necesitas un modelo 70B de forma ocasional, no compres hardware en absoluto. Alquilar una GPU en la nube suele ser muchísimo más barato para uso ocasional que una compra de hardware de 1.500–3.000 $ — la A40 de 48 GB en Community Cloud de RunPod (la GPU más pequeña que cabe un 70B Q4 por completo) cuesta alrededor de 0,44 $/hora en el momento de esta comprobación, y existen APIs de inferencia alojadas para Llama 3.3 70B con tarifa por token, sin hardware alguno.
Merece la pena decirlo claramente en vez de pasarlo por alto, porque una página que solo recomienda comprar da la impresión de querer vender hardware a todo el mundo — para uso ocasional o irregular, alquilar es la respuesta honesta.
Cuantización para un 70B
Para un modelo 70B, Q4_K_M es el equilibrio estándar entre tamaño y calidad. Los porcentajes de calidad de abajo son aproximados — la pérdida de calidad real depende del modelo concreto y de cómo se evalúe, no de una constante universal.
| Cuantización | Tamaño | Calidad vs FP16 |
|---|---|---|
| Q4_K_M | ~42 GB | ~96 % (mejor equilibrio) |
| Q3_K_M | ~32 GB | ~90 % |
| Q2_K | ~25 GB | ~82 %, pérdida notable |
| FP16 (completo) | ~140 GB | 100 % — poco realista en hardware de consumo |
No compres una sola GPU de 24 GB esperando la velocidad completa de un 70B
- ▸Una sola tarjeta de 24 GB (RTX 3090 o 4090) no puede contener un modelo 70B Q4 completo — puede ejecutar uno con offload a CPU, pero la velocidad cae a unos 8–12 tok/s.
- ▸GPU de 24 GB sola → offload parcial, más lenta
- ▸48 GB de VRAM combinada (2× 24 GB) → descarga 70B Q4 completa
- ▸64 GB+ de memoria unificada (Mac) → cómodo, sin necesidad de offload
- ▸Mac mini M6 base (32 GB máx.) → tampoco puede ejecutar un 70B completo, misma categoría que una sola GPU de 24 GB
Guías relacionadas
- ▸¿Cuánta VRAM necesita un modelo 70B? — how much VRAM for a 70B model
- ▸Chuleta de VRAM para DeepSeek R1 Distill — DeepSeek R1 distill VRAM cheatsheet
- ▸Mejor DeepSeek Distill para tu GPU — best DeepSeek distill for your GPU
- ▸Coste de GPU en la nube por hora 2026 — cloud GPU cost per hour
Quick Answers
¿Puedo ejecutar un modelo 70B en una sola GPU de consumo?▾
¿Cuánta RAM necesito para un modelo 70B solo con CPU?▾
¿Es suficiente la calidad de Q4 para un modelo 70B?▾
¿Cuál es la forma más barata de ejecutar un modelo 70B sin comprar hardware?▾
¿Puede el nuevo Mac mini ejecutar un modelo 70B?▾
¿Quieres el desglose completo?
Leer la guía completa →