Key Takeaways
- Costo total del build: ~$1,010. RTX 5060 Ti 16GB ($430), Ryzen 5 7600 ($180), 32GB DDR5-6000 ($90), 1TB NVMe Gen4 ($70), placa B650 mATX ($130), fuente 650W 80+ Gold ($75), gabinete mATX ($65).
- 16GB de VRAM es el objetivo, no la velocidad bruta de la GPU. La RTX 5060 Ti 16GB supera a tarjetas más rápidas con 8-12GB de VRAM para trabajo con LLMs, porque el tamaño del modelo, no la cantidad de shaders, decide qué es lo que cabe.
- Modelos de 7B: 55-65 tok/s en Q4. Modelos de 14B: 28-35 tok/s. Los modelos de 32B caben en Q4 con 1-2GB de margen para contexto, corriendo a 12-15 tok/s.
- Los modelos de 70B no caben. Un modelo de 70B en Q4 necesita ~40GB de VRAM; este build llega hasta 32B como máximo. Consulta el build dual-GPU de $2,000 para inferencia de clase 70B.
- 32GB de RAM de sistema, no 16GB. La carga del modelo, el overhead del sistema operativo y cualquier capa descargada a la CPU necesitan margen adicional más allá de la GPU; 16GB provoca swapping en modelos de 14B o más.
- Evita: las GPUs de 8GB (RTX 5060, RTX 4060 Ti 8GB) — se limitan a 7B y no pueden crecer hacia 13B-14B sin reemplazar toda la tarjeta.
Qué Compra Realmente Este Presupuesto
La velocidad de inferencia de un LLM local está limitada primero por la capacidad de VRAM, en segundo lugar por el ancho de banda de memoria, y en un lejano tercer lugar por el cómputo (núcleos CUDA). Un modelo que no cabe en la VRAM no carga o se derrama hacia la RAM del sistema, reduciendo el rendimiento de 5 a 10 veces. Con $1,000, la única asignación correcta es sobrecargar la GPU y recortar todo lo demás — por eso la CPU aquí es un componente de gama media de $180, no un modelo tope de gama de $350.
Este build asume inferencia de un solo modelo (un modelo cargado a la vez a través de Ollama, LM Studio o llama.cpp), no servicio concurrente para múltiples usuarios. Para atender varias solicitudes simultáneas, los requisitos de VRAM aumentan aún más y un presupuesto de $1,000 deja de ser realista.
Un build de PC para LLM local de $1,000 debería destinar casi la mitad de su presupuesto a la capacidad de VRAM de la GPU, no a la velocidad de la CPU, ya que la VRAM decide qué modelos pueden ejecutarse siquiera.
VRAM = la memoria propia de la GPU donde vive el modelo; si el modelo no cabe, todo se vuelve de 5 a 10 veces más lento o directamente no carga.
Lista de Componentes Completa
Los precios son precios de mercado a julio de 2026 y varían según región y tienda.
| Componente | Elección | Precio | Por qué |
|---|---|---|---|
| GPU | RTX 5060 Ti 16GB | $430 | 16GB de VRAM es el propósito central del build — cabe 14B con comodidad, 32B en Q4 |
| CPU | AMD Ryzen 5 7600 | $180 | 6 núcleos son suficientes para inferencia de un solo modelo; la CPU no es el cuello de botella |
| RAM | 32GB DDR5-6000 (2x16GB) | $90 | Margen para el sistema operativo, carga de modelos y cualquier capa descargada a la CPU |
| Almacenamiento | SSD NVMe Gen4 de 1TB | $70 | Tiempos de carga rápidos; una biblioteca de 5 modelos usa ~40-60GB en Q4 |
| Placa base | B650 mATX | $130 | Ranura PCIe 4.0 x16, soporte DDR5, sin funciones innecesarias |
| Fuente | 650W 80+ Gold | $75 | La RTX 5060 Ti consume 180W; 650W deja margen para picos transitorios |
| Gabinete | Torre media mATX | $65 | Flujo de aire para carga de inferencia sostenida; cabe cualquier largo de tarjeta 5060 Ti |
| Disipador de CPU | Disipador incluido de fábrica | $0 | El Ryzen 5 7600 no necesita refrigeración adicional para esta carga de trabajo |
Por Qué la RTX 5060 Ti 16GB Frente a GPUs Más Baratas
Las variantes de 8GB y 12GB de GPUs con precio similar son un falso ahorro para trabajo con LLMs locales. La RTX 5060 Ti viene en versiones de 8GB y 16GB con una diferencia de precio de unos $100 — la tarjeta de 16GB es la única que vale la pena comprar para inferencia de LLMs, porque la versión de 8GB no puede alojar con comodidad nada más allá de un modelo de 7B en Q4 con un largo de contexto usable.
El margen de VRAM también importa para el largo de contexto: un modelo de 7B por sí solo necesita unos 4-4.5GB en Q4, pero un contexto de 16K tokens añade otro 1-2GB de caché KV. En una tarjeta de 8GB eso deja casi nada; en la de 16GB hay espacio tanto para el modelo como para una ventana de contexto larga.
- RTX 5060 Ti 8GB ($330): Solo cabe 7B en Q4, y por poco — las ventanas de contexto largas desbordan la VRAM. No recomendada.
- RTX 4060 Ti 16GB (generación anterior, ~$450 usada): Misma VRAM que la 5060 Ti a precio similar o mayor con menor cómputo — no hay razón para preferirla nueva.
- RTX 5060 Ti 16GB ($430, este build): Mejor VRAM por dólar en el segmento de 16GB a julio de 2026.
- RTX 3090 24GB usada (~$650-750): Más VRAM (permite modelos de 30B bajos con más comodidad) pero eleva el costo total del build por encima de $1,300 y consume significativamente más energía.
Rendimiento Esperado por Tamaño de Modelo
Todas las cifras son con cuantización Q4_K_M, medidas con llama.cpp/Ollama en la RTX 5060 Ti 16GB. La velocidad real varía según el largo del prompt, el método de cuantización y el motor de inferencia.
| Tamaño del Modelo | VRAM Usada (Q4) | Tokens/s | ¿Cabe Bien? |
|---|---|---|---|
| 7B-8B | ~4.5-5GB | 55-65 | Sí — margen completo de contexto |
| 13B-14B | ~8-9GB | 28-35 | Sí — 8GB+ de margen para contexto |
| 20B (MoE, ~4B activos) | ~12GB | 35-45 | Sí |
| 32B | ~14.5-15.5GB | 12-15 | Ajustado — solo contexto corto (4K-8K) |
| 70B | ~40GB | N/D | No cabe — consulta el build dual-GPU de $2,000 |
Notas de Ensamblaje
- Espacio para la GPU: Confirma el largo de la tarjeta RTX 5060 Ti (varía entre 210-270mm según el fabricante) frente al espacio máximo para GPU del gabinete mATX antes de comprar.
- Velocidad de la RAM en BIOS: Los kits DDR5-6000 suelen venir corriendo a JEDEC 4800 por defecto — activa EXPO/XMP en la BIOS para obtener la velocidad nominal de 6000, lo cual afecta la generación de tokens del lado de la CPU si alguna capa se descarga.
- Orden de instalación de drivers: Instala el driver más reciente de NVIDIA y el toolkit de CUDA antes de instalar Ollama o LM Studio, no después — ambos detectan automáticamente la capacidad de la GPU al momento de instalarse.
- Cableado de la fuente: La RTX 5060 Ti usa un solo conector de alimentación PCIe de 8 pines (o 12VHPWR en algunos modelos) — verifica que el kit de cables modulares de tu fuente incluya el conector correcto antes de armar el equipo.
Ruta de Actualización
Este build está diseñado para que la GPU sea el único componente que valga la pena reemplazar más adelante. La placa B650 soporta una segunda ranura PCIe (típicamente x4 eléctrica) para añadir una segunda GPU en el futuro, aunque la inferencia multi-GPU con tensor-split necesita al menos x8/x8 para evitar un cuello de botella de ancho de banda PCIe — consulta el build de $2,000 para una placa elegida con eso en mente.
Una actualización directa desde este build es cambiar la RTX 5060 Ti 16GB por una RTX 3090 24GB usada cuando el presupuesto lo permita, lo cual habilita inferencia cómoda de 32B y descarga ligera de 70B. El Ryzen 5 7600, los 32GB de RAM y la fuente de 650W tienen suficiente margen para soportar ese cambio sin modificaciones adicionales.
Errores Comunes con Este Presupuesto
- Comprar la RTX 5060 Ti de 8GB para ahorrar $100 — el límite de VRAM que esto crea no se puede solucionar con software y obliga a reemplazar la GPU más adelante, costando más en total.
- Gastar de más en la CPU (por ejemplo, un Ryzen 7 en lugar de un Ryzen 5) mientras se usa una GPU de 8GB o 12GB — la elección de CPU casi no afecta los tokens/s una vez que un modelo cabe en la VRAM.
- Saltarse la configuración del perfil EXPO/XMP de RAM en la BIOS, dejando los kits DDR5-6000 corriendo a 4800 — una pérdida de rendimiento gratuita que no cuesta nada arreglar.
- Subdimensionar la fuente para ahorrar $20-30 — el consumo de la GPU tiene picos breves bien por encima de su TDP nominal bajo carga sostenida, y una unidad de 550W deja muy poco margen.
Preguntas Frecuentes
¿Puede una PC de $1,000 ejecutar bien LLMs locales?
Sí, con comodidad para modelos de 7B a 14B y con modelos de 32B en una cuantización Q4 ajustada. Una RTX 5060 Ti 16GB, el componente central de este build, es el factor decisivo — la capacidad de VRAM importa mucho más que el presupuesto bruto por encima de la GPU.
¿Por qué este build gasta tanto en la GPU en relación con la CPU?
La velocidad de inferencia de un LLM local depende casi por completo de la capacidad de VRAM de la GPU y el ancho de banda de memoria. Una CPU más rápida no aumenta los tokens/s una vez que un modelo está cargado en la VRAM, así que una CPU de gama media y una GPU fuerte superan a una CPU fuerte con una GPU débil para esta carga de trabajo específica.
¿Son 16GB de VRAM suficientes para LLMs locales en 2026?
16GB alojan con comodidad todos los modelos de 7B a 14B en Q4 con espacio para contexto largo, y permiten modelos de 32B en Q4 con una ventana de contexto corta. No alcanzan para modelos de clase 70B, que necesitan cerca de 40GB en Q4.
¿Puedo usar una GPU de 8GB en su lugar para ahorrar dinero?
Puedes, pero te limita a modelos de 7B con un margen de contexto mínimo — un límite duro que no puedes elevar sin reemplazar la tarjeta. Los $100 que ahorras con una RTX 5060 Ti de 8GB no valen la pena si pierdes acceso a modelos de 13B-14B.
¿Cuánta RAM necesito en realidad junto a una GPU con 16GB de VRAM?
32GB de RAM de sistema. Esto cubre el overhead del sistema operativo, el cacheo del archivo del modelo durante la carga, y cualquier capa descargada a la CPU para modelos que exceden ligeramente la capacidad de VRAM.
¿Este build ejecutará bien modelos de 32B?
Sí caben modelos de 32B en cuantización Q4 con aproximadamente 12-15 tokens por segundo, pero el largo de contexto se limita a unos 4K-8K tokens ya que queda poco margen de VRAM después de cargar el modelo.
¿Qué software debería usar con este build?
Ollama o LM Studio son los puntos de partida más simples — ambos detectan automáticamente la RTX 5060 Ti y manejan la cuantización Q4 de forma automática. llama.cpp directamente da más control sobre el formato de cuantización y los ajustes de contexto.
¿Se puede actualizar este build para ejecutar modelos de 70B más adelante?
No con una sola GPU — 70B en Q4 necesita ~40GB de VRAM. La ruta de actualización más clara es cambiar a una RTX 3090 24GB usada (aún no del todo suficiente para 70B completo) o añadir una segunda GPU para agrupar VRAM, lo cual cubre directamente el build dual-GPU de $2,000.
¿Importa el chipset de la placa base (B650 vs B850) para la inferencia de LLM local?
No para un build de una sola GPU. B650 ofrece una ranura PCIe 4.0 x16, que es lo que necesita la GPU; las diferencias de chipset entre B650 y placas más nuevas importan más para la asignación de líneas PCIe multi-GPU que para inferencia de LLM de una sola GPU.
¿Es una GPU usada mejor valor que una RTX 5060 Ti 16GB nueva con este presupuesto?
Una RTX 3060 12GB usada puede ser más barata pero tiene menos VRAM y menor ancho de banda de memoria, alojando menos tamaños de modelo. Una RTX 3090 24GB usada es una mejora real en VRAM pero eleva el costo total por encima de $1,300 incluyendo el resto del build — pertenece a un nivel de presupuesto mayor, no a este.