Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/Build de PC para LLM Local por $2,000 (2026): Lista de Componentes Dual-GPU con 32GB de VRAM
Hardware Setups

Build de PC para LLM Local por $2,000 (2026): Lista de Componentes Dual-GPU con 32GB de VRAM

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Un build de PC para LLM local por $2,000 consigue la mejor VRAM por dólar usando dos GPUs de 16GB en lugar de una sola tarjeta de 24GB. Dos tarjetas RTX 5060 Ti 16GB ($430 cada una, $860 en total) ofrecen 32GB de VRAM combinada — suficiente para ejecutar modelos de 70B en Q4 mediante inferencia con tensor-split — junto a un Ryzen 7 9700X ($330), 64GB de DDR5-6000 ($180), un SSD NVMe Gen4 de 2TB ($130), una placa B650 ATX con ranuras PCIe x8/x8 ($180), una fuente 850W 80+ Gold ($130) y un gabinete ATX ($90), sumando aproximadamente $1,940. Ejecuta modelos de 70B en Q4 a 12-18 tok/s repartidos entre ambas tarjetas, o un solo modelo de 32B a 25-30 tok/s en una sola tarjeta.

Una PC de $2,000 con dos tarjetas RTX 5060 Ti 16GB (32GB de VRAM combinada), un Ryzen 7 9700X y 64GB de RAM DDR5 ejecuta modelos de clase 70B mediante inferencia multi-GPU con tensor-split — algo que ninguna GPU individual de $2,000 puede lograr. En lugar de comprar una sola tarjeta cara de 24GB, este build agrupa dos tarjetas de gama media de 16GB por PCIe usando el modo tensor-split de llama.cpp, duplicando la capacidad de VRAM por menos del precio de una sola RTX 5090. Esta guía cubre los componentes exactos, el requisito de placa base que hace que el dual-GPU funcione correctamente, y velocidades reales en tokens por segundo.

Key Takeaways

  • Costo total del build: ~$1,940. Dos RTX 5060 Ti 16GB ($860 combinado), Ryzen 7 9700X ($330), 64GB DDR5-6000 ($180), 2TB NVMe Gen4 ($130), placa B650 ATX con ranuras x8/x8 ($180), fuente 850W 80+ Gold ($130), gabinete ATX ($90).
  • Dos GPUs de 16GB superan a una GPU de 24GB en VRAM por dólar. 32GB de VRAM combinada por ~$860 supera a una RTX 3090 24GB usada (~$700-750 por menos VRAM total) y cuesta mucho menos que una sola tarjeta de estación de trabajo de 32GB.
  • Los modelos de 70B caben y corren a 12-18 tok/s mediante tensor-split de llama.cpp entre ambas tarjetas — la razón entera por la que este build usa dos GPUs en lugar de una más grande.
  • La placa base debe soportar bifurcación PCIe x8/x8, no solo dos ranuras físicas x16. Una placa que corre la segunda ranura a x4 eléctrica crea un cuello de botella real de ancho de banda para inferencia con tensor-split.
  • El respaldo de una sola GPU sigue funcionando bien: para modelos más pequeños, correr en una sola RTX 5060 Ti da 32B a 25-30 tok/s — más rápido que dividir un modelo que ya cabría en una sola tarjeta.
  • Evita: pares de GPU distintos (por ejemplo, una 5060 Ti + una 4060 Ti) — el rendimiento del tensor-split está limitado por la tarjeta más lenta, y los desajustes de driver entre generaciones de GPU causan inestabilidad.

Por Qué Dos GPUs en Lugar de Una Más Grande

Con $2,000, un build de una sola GPU llega como máximo a una RTX 3090 24GB usada o una RTX 5070 Ti 16GB — ninguna alcanza la capacidad de modelos de clase 70B. Tanto llama.cpp como vLLM soportan inferencia con tensor-split, que divide las capas de un modelo entre múltiples GPUs conectadas a la misma placa base, tratando su VRAM combinada como un solo grupo. Dos tarjetas RTX 5060 Ti 16GB dan 32GB de VRAM combinada por menos dinero que una sola tarjeta de 24GB, y superan con comodidad lo que necesita un modelo de 70B en Q4 (~40GB de presupuesto total entre sistema y VRAM, con el modelo mismo necesitando unos 38-40GB entre ambas tarjetas en Q4).

Esto solo funciona porque ambas tarjetas son el mismo modelo — VRAM o cómputo desiguales entre tarjetas obligan a que la división quede limitada por la tarjeta más débil, y requisitos de driver desiguales entre generaciones de GPU pueden causar inestabilidad total.

Dos GPUs de 16GB idénticas agrupadas mediante inferencia con tensor-split entregan más VRAM útil por dólar que una sola GPU más grande con el mismo presupuesto de $2,000.

Tensor-split = software que reparte las capas de un modelo entre dos GPUs para que su VRAM se sume, como un RAID para memoria gráfica.

VRAM necesaria según el tamaño del modelo en cuantización Q4: 7B necesita ~5GB, 14B ~9GB y 32B ~15GB — todo cabe en la tarjeta de 16GB del build de $1,000. 70B necesita ~40GB, lo que exige los 32GB de VRAM combinada de doble GPU del build de $2,000.
VRAM necesaria según el tamaño del modelo en cuantización Q4: 7B necesita ~5GB, 14B ~9GB y 32B ~15GB — todo cabe en la tarjeta de 16GB del build de $1,000. 70B necesita ~40GB, lo que exige los 32GB de VRAM combinada de doble GPU del build de $2,000.

Lista de Componentes Completa

Los precios son precios de mercado a julio de 2026 y varían según región y tienda.

ComponenteElecciónPrecioPor qué
GPU (x2)2x RTX 5060 Ti 16GB$86032GB de VRAM combinada vía tensor-split — el propósito central de este build
CPUAMD Ryzen 7 9700X$3308 núcleos manejan el overhead de PCIe/drivers de dos GPUs y cualquier capa descargada a la CPU
RAM64GB DDR5-6000 (2x32GB)$180Modelos más grandes y el overhead de drivers dual-GPU necesitan más margen que un build de una sola GPU
AlmacenamientoSSD NVMe Gen4 de 2TB$130Los modelos de 70B en Q4 usan por sí solos ~40GB; una biblioteca de varios modelos necesita el espacio extra
Placa baseB650 ATX con soporte PCIe x8/x8$180Debe dividir las líneas PCIe x8/x8, no x16/x4, para evitar un cuello de botella de ancho de banda en tensor-split
Fuente850W 80+ Gold$130Dos tarjetas RTX 5060 Ti consumen ~360W combinados; 850W deja margen para picos transitorios
GabineteTorre media ATX (espacio dual-GPU)$90Necesita espacio entre dos GPUs de doble ranura para un flujo de aire adecuado
Disipador de CPUDisipador de aire de gama media$40El Ryzen 7 9700X bajo carga sostenida de inferencia dual-GPU se beneficia de refrigeración mejor que la de fábrica
Consumo estimado del sistema frente a la capacidad de la fuente: el build de $1,000 con una sola GPU consume ~285W de una fuente de 650W (56% de margen); el build de $2,000 con doble GPU consume ~475W de una fuente de 850W (44% de margen).
Consumo estimado del sistema frente a la capacidad de la fuente: el build de $1,000 con una sola GPU consume ~285W de una fuente de 650W (56% de margen); el build de $2,000 con doble GPU consume ~475W de una fuente de 850W (44% de margen).

El Requisito de Placa Base que la Mayoría Pasa por Alto

Dos ranuras físicas PCIe x16 no garantizan dos conexiones eléctricas x16. Muchas placas base para consumidores conectan la segunda ranura a x4 eléctrica, aunque físicamente tenga el tamaño x16. Para inferencia de LLM con tensor-split, ambas GPUs transfieren datos activamente en cada pasada — una segunda ranura x4 se convierte en un cuello de botella real, no teórico.

Antes de comprar una placa base, revisa su hoja de especificaciones buscando "asignación de líneas PCIe" o "modo x8/x8" — esto suele listarse explícitamente en las placas que lo soportan, ya que requiere un chipset con suficientes líneas PCIe nativas para dividir de forma pareja. Este build asume una placa B650 ATX que lista explícitamente soporte x8/x8.

  • Confirma x8/x8, no x16/x4: Revisa el diagrama de líneas PCIe del manual de la placa base, no solo la cantidad de ranuras físicas.
  • El espacio entre ranuras también importa físicamente: Dos GPUs de doble ranura necesitan al menos una ranura vacía de espacio entre ellas para el flujo de aire — verifica el espaciado en el diseño de la placa, no solo la asignación de líneas.
  • La generación de PCIe importa menos que la cantidad de líneas para esta carga de trabajo — PCIe 4.0 x8 ya excede lo que realmente necesita la transferencia con tensor-split; perseguir ranuras PCIe 5.0 no justifica el sobreprecio aquí.

Rendimiento Esperado por Tamaño de Modelo

Todas las cifras son con cuantización Q4_K_M medidas con tensor-split de llama.cpp entre dos tarjetas RTX 5060 Ti 16GB. Las cifras de una sola GPU usan solo una tarjeta.

Tamaño del ModeloConfiguraciónVRAM Usada (Q4)Tokens/s
7B-14BUna sola GPU (no requiere división)~4.5-9GB55-65 (7B) / 28-35 (14B)
32BUna sola GPU~14.5-15.5GB25-30 (margen de contexto completo frente al build de $1,000)
32BTensor-split (ambas GPUs)~15GB dividido30-38 (dividir ayuda incluso cuando cabe en una sola tarjeta)
70BTensor-split (ambas GPUs, requerido)~38-40GB dividido12-18
Tokens/seg según el tamaño del modelo, cuantización Q4: ambos builds igualan en 7B (~60 tok/s) y 14B (~31 tok/s), pero el build de $2,000 con doble GPU se adelanta en 32B mediante tensor-split (~34 frente a ~13 tok/s) y es el único que ejecuta 70B (~15 tok/s).
Tokens/seg según el tamaño del modelo, cuantización Q4: ambos builds igualan en 7B (~60 tok/s) y 14B (~31 tok/s), pero el build de $2,000 con doble GPU se adelanta en 32B mediante tensor-split (~34 frente a ~13 tok/s) y es el único que ejecuta 70B (~15 tok/s).

Configurando la Inferencia con Tensor-Split

llama.cpp maneja el tensor-split con un solo flag de línea de comandos una vez que el driver reconoce ambas GPUs. Después de confirmar que ambas tarjetas RTX 5060 Ti aparecen en `nvidia-smi`, lanza un modelo con `--tensor-split 1,1` para dividir las capas de forma pareja entre ellas, o ajusta la proporción (por ejemplo, `--tensor-split 1,1.2`) si una tarjeta también maneja un monitor y necesita algo menos de VRAM reservada para el modelo.

Ollama soporta multi-GPU automáticamente en sus versiones recientes — detecta la VRAM disponible en todas las GPUs instaladas y divide modelos grandes sin configuración manual, aunque los flags manuales de llama.cpp dan un control más preciso sobre la proporción de división.

  • Verifica que ambas GPUs sean detectadas: `nvidia-smi` debería listar ambas tarjetas con versiones de driver coincidentes antes de intentar una división.
  • Comienza con una división pareja: `--tensor-split 1,1` en llama.cpp es el valor por defecto correcto para dos tarjetas idénticas.
  • Vigila la saturación de ancho de banda PCIe: si los tokens/s están muy por debajo del rango esperado, confirma que la placa base realmente esté corriendo x8/x8 y no cayendo silenciosamente a x4.

Ruta de Actualización

La actualización más clara desde este build es añadir una tercera RTX 5060 Ti 16GB si la placa base tiene una tercera ranura PCIe con ancho de banda utilizable, elevando la VRAM combinada a 48GB — suficiente para cuantizaciones mayores de modelos de 70B o margen cómodo para ventanas de contexto más largas.

Una actualización más cara pero más simple es reemplazar ambas tarjetas RTX 5060 Ti por dos RTX 5070 Ti 16GB más adelante, manteniendo el mismo límite de 32GB de VRAM pero aumentando el cómputo bruto y el ancho de banda de memoria, lo que mejora los tokens/s sin cambiar qué tamaños de modelo caben.

Errores Comunes con Este Presupuesto

  • Comprar una placa base basándose solo en la marca "soporta SLI/CrossFire" — ese término de marketing se refiere a renderizado multi-GPU para videojuegos, no a la asignación de líneas PCIe para cargas de cómputo, y no garantiza x8/x8.
  • Mezclar generaciones de GPU (por ejemplo, una RTX 5060 Ti + una RTX 4060 Ti) para ahorrar dinero — el rendimiento del tensor-split está limitado por la tarjeta más lenta o antigua, eliminando la mayor parte del beneficio de la más nueva.
  • Subestimar el margen de la fuente — dos GPUs consumiendo cerca de su TDP combinado nominal simultáneamente durante una generación larga pueden tener picos breves bien por encima de 360W; una fuente subdimensionada causa apagones aleatorios bajo carga, no una desaceleración progresiva.
  • Asumir que el doble de GPUs significa el doble de tokens/s — el tensor-split añade overhead de transferencia PCIe entre capas, así que el rendimiento combinado es notablemente menor que 2x la velocidad de una sola tarjeta en modelos que ya caben en una sola GPU.

Preguntas Frecuentes

¿Puede una PC de $2,000 ejecutar LLMs locales de 70B?

Sí, usando dos tarjetas RTX 5060 Ti 16GB en una configuración con tensor-split, que agrupa 32GB de VRAM combinada — suficiente para modelos de 70B en cuantización Q4, corriendo a 12-18 tokens por segundo.

¿Por qué usar dos GPUs de 16GB en lugar de una sola de 24GB o 32GB?

Dos GPUs de 16GB idénticas ofrecen más VRAM combinada por dólar que una sola tarjeta más grande con el mismo presupuesto, y la función tensor-split de llama.cpp permite que la VRAM de ambas tarjetas funcione como un solo grupo para inferencia.

¿Importa la placa base para un build dual-GPU de LLM local?

Sí, y de forma significativa. La placa debe soportar asignación de líneas PCIe x8/x8 en ambas ranuras de GPU — una placa que corre la segunda ranura a x4 eléctrica crea un cuello de botella real de ancho de banda durante la inferencia con tensor-split, no solo teórico.

¿Puedo mezclar diferentes modelos de GPU en un build dual-GPU?

No se recomienda. El rendimiento del tensor-split está limitado por la tarjeta más lenta o antigua del par, y los requisitos de driver desiguales entre generaciones de GPU pueden causar inestabilidad. Usa dos GPUs idénticas.

¿Es mejor Ollama o llama.cpp para inferencia multi-GPU con tensor-split?

Ollama detecta múltiples GPUs automáticamente y no requiere configuración manual, lo cual es más simple para la mayoría de usuarios. El flag manual --tensor-split de llama.cpp da un control más preciso sobre la proporción de división, útil si una GPU también maneja un monitor y necesita menos VRAM reservada.

¿Cuánto afecta realmente el ancho de banda PCIe al rendimiento del tensor-split?

De forma significativa si la ranura corre a x4 en lugar de x8. PCIe 4.0 x8 ya ofrece más ancho de banda del que la transferencia con tensor-split típicamente necesita, pero x4 se convierte en un cuello de botella real ya que ambas GPUs transfieren datos activamente en cada pasada.

¿El doble de GPUs duplica los tokens por segundo?

No. El tensor-split añade overhead de transferencia PCIe entre las capas divididas entre tarjetas, así que el rendimiento combinado en un modelo que ya cabe en una sola GPU es notablemente menor que 2x la velocidad de esa tarjeta sola. El beneficio es alojar modelos más grandes, no un escalado lineal de velocidad.

¿Cuál es el consumo total de energía de dos tarjetas RTX 5060 Ti?

Aproximadamente 360W combinados a carga completa (180W de TDP nominal cada una), con picos transitorios breves por encima de eso. Una fuente 850W 80+ Gold deja margen cómodo para el resto del sistema junto a esos picos.

¿Puede este build ejecutar modelos más pequeños más rápido usando solo una GPU?

Sí — para modelos que ya caben en 16GB (hasta 32B en Q4), correr en una sola RTX 5060 Ti evita por completo el overhead PCIe del tensor-split y es más rápido que dividir un modelo que no necesitaba dividirse.

¿Cuál es la ruta de actualización más allá de este build?

Añadir una tercera RTX 5060 Ti 16GB idéntica (si la placa base tiene una tercera ranura PCIe utilizable) eleva la VRAM combinada a 48GB. Alternativamente, reemplazar ambas tarjetas por unidades RTX 5070 Ti 16GB más adelante mantiene el mismo límite de 32GB pero aumenta el cómputo y el ancho de banda de memoria.

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE. Este artículo refleja información públicamente disponible a mayo de 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs