Skip to main content
PromptQuorum
Home/Local LLMs/Mejores mini PCs para LLMs locales 2026: Mac Mini M6, M5 Pro y Framework Desktop comparados
Hardware Setups

Mejores mini PCs para LLMs locales 2026: Mac Mini M6, M5 Pro y Framework Desktop comparados

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Los mini PCs con silicon moderno ejecutan modelos de 7B a 70B en un factor de forma compacto. La actualización del Mac mini de Apple de agosto de 2026 añadió el chip M6 (desde $899, tope de 32 GB) y el chip M5 Pro (desde $1,699, tope de 64 GB) — solo la configuración M5 Pro es apta para modelos de clase 70B. El Framework Desktop (AMD Ryzen AI Max 395+, 128 GB unificado) alcanzó el 70B a 20+ tok/s frente a la generación anterior de Apple Silicon.

Los mini PCs con silicon moderno ejecutan modelos de 7B a 70B en un factor de forma compacto. Apple actualizó el Mac mini el 25 de agosto de 2026: la configuración M6 parte de $899 con un tope de 32 GB de memoria unificada, mientras que la configuración M5 Pro parte de $1,699 y escala hasta 64 GB — solo la M5 Pro tiene suficiente margen de memoria para modelos de clase 70B. El Framework Desktop (AMD Ryzen AI Max 395+, 128 GB unificado) alcanzó el 70B a 20+ tok/s frente a la generación anterior de Apple Silicon. Los builds Mini-ITX tradicionales con RTX 5060 Ti (16 GB) o RTX 5070 (12 GB) cubren 7B–13B por $900–1,400. Los mini PCs eliminan el desorden del escritorio sin sacrificar el rendimiento de los LLMs locales. Los precios pueden variar según tu país.

Slide Deck: Mejores mini PCs para LLMs locales 2026: Mac Mini M6, M5 Pro y Framework Desktop comparados

La presentación a continuación cubre: cómo elegir el mejor mini PC para inferencia LLM local en 2026, la actualización del Mac mini de agosto de 2026 (M6: 32GB máx., M5 Pro: 64GB máx.), benchmarks del Framework Desktop 128 GB frente a la generación anterior de Mac mini (70B a 20–25 tok/s), compatibilidad de GPU Mini-ITX (RTX 5060 Ti como opción óptima) y comparación de valor de plataformas. Descarga el PDF como tarjeta de referencia de hardware mini PC para LLMs.

Browse the slides below or download as PDF for offline reference. Download Reference Card (PDF)

Mejores mini PCs para LLMs locales 2026: Mac Mini M6, M5 Pro y Framework Desktop comparados

Key Takeaways

  • Mac mini M6 (32 GB máx.): $899. Nuevo Mac mini de entrada de Apple (ago. 2026) — silencioso y compacto, pero no apto para modelos 70B.
  • Mac mini M5 Pro (64 GB máx.): $1,699. Única configuración nueva del Mac mini con memoria suficiente para modelos de clase 70B. Disponible desde el 22 de septiembre de 2026 — aún sin benchmarks independientes.
  • Framework Desktop (128 GB): $1,999. El mini PC 70B más rápido a 20+ tok/s. Diseñado específicamente para LLMs locales.
  • ASUS PN51 + RTX 5060 Ti: $900. Mejor valor x86 tradicional. 7B a 25 tok/s, 13B a 15 tok/s.
  • Intel NUC 13 + eGPU: $1,300. Calidad de construcción premium, el eGPU Thunderbolt pierde 15–25% de ancho de banda.
  • Mini-ITX personalizado (Lian Li A4): $1,000–1,400. El más flexible, el más difícil de armar.
  • Evitar: Mini PCs solo con GPU integrada (1–2 tok/s en 7B), cases ATX completos (no encajan), RTX 4090 (demasiado grande para cualquier case SFF).

Los mini PCs con silicio moderno ejecutan modelos de 7B a 70B en un formato compacto; solo las configuraciones con más memoria, como el Mac mini M5 Pro (64 GB) o el Framework Desktop (128 GB unificados), tienen suficiente margen para modelos de clase 70B -- los builds Mini-ITX económicos con GPU dedicada cubren 7B-13B por menos de $1,400.

Un mini PC es un buen término medio entre un portátil y una torre de escritorio completa para IA local: lo bastante pequeño para estar junto a un monitor, pero lo bastante potente para modelos reales con la configuración adecuada. Lo clave a comprobar es la memoria -- un mini PC con solo 32 GB de memoria unificada llega hasta modelos de tamaño medio, mientras que uno con 64 GB o más puede manejar un modelo de 70B.

¿Qué hace a un mini PC adecuado para LLMs locales?

Un mini PC viable necesita un slot PCIe x16, fuente SFX de 450W+, refrigeración activa y SSD de 1TB+. La mayoría de los mini PCs de consumo carecen de un slot para GPU discreta — siempre verifica antes de comprar.

  • Slot PCIe x16 (longitud completa): Para instalar una GPU discreta. Algunos mini PCs usan docks USB-C externos — la pérdida de ancho de banda del eGPU es del 15–25% frente al PCIe interno.
  • Presupuesto de energía: Mínimo fuente SFX de 450W. RTX 5060 Ti (165W) + CPU (65W) + placa (50W) = 280W de carga, picos a 420W+.
  • Refrigeración: Se requieren ventiladores de case activos. La refrigeración pasiva funciona para 3B en reposo; la inferencia sostenida de 7B necesita flujo de aire forzado.
  • Almacenamiento: SSD de 1TB mínimo. Un modelo 7B en Q4_K_M usa ~4 GB en disco; una biblioteca de 5 modelos ocupa 25 GB.

Mac Mini: opciones M6, M5 Pro y generación anterior

Apple actualizó el Mac mini el 25 de agosto de 2026 con el chip M6 (desde $899, tope de 32 GB de memoria unificada) y el chip M5 Pro (desde $1,699, tope de 64 GB) — ambos disponibles desde el 22 de septiembre de 2026 y ahora la línea actual de Apple. Solo la configuración M5 Pro llega a 64 GB; el M6 base tiene un tope de 32 GB, insuficiente para modelos de clase 70B. Los chips salientes M4 (desde $599) y M4 Pro (hasta 64 GB, hasta $2,299) son ahora la generación anterior. Apple afirma que el M6 es aproximadamente un 40% más rápido en CPU y hasta 4 veces más rápido en cargas de IA que el M4 saliente — una afirmación de marketing de Apple, no una medición independiente, ya que los nuevos chips todavía no se han lanzado.

  • Línea actual (ago. 2026): M6 desde $899 (32 GB máx.) y M5 Pro desde $1,699 (64 GB máx.), disponibles desde el 22 de septiembre de 2026. Para modelos de clase 70B se necesita la configuración M5 Pro — el M6 tiene un tope de 32 GB y no es apto.
  • Generación anterior: M4 (desde $599) y M4 Pro (hasta 64 GB, hasta $2,299) — la cifra de 10–15 tok/s en 70B de la tabla anterior corresponde a esta generación ya superada.
  • Ventajas: Silencioso (sin ruido de ventilador en inferencia), formato compacto, macOS + Linux vía Asahi, aceleración GPU Metal de Ollama funciona de inmediato.
  • Desventajas: La RAM no se puede actualizar en ninguno de los dos chips. Todavía no existen benchmarks independientes de tok/s en 70B para el M6 ni el M5 Pro — ambos se lanzan el 22 de septiembre de 2026. La afirmación de Apple de ~40% más CPU y hasta 4x más IA en el M6 es una cifra de marketing de Apple, no una medición de terceros.
  • Comando: `ollama run llama3.3:70b-instruct-q4_K_M` — funciona de forma nativa en Apple Silicon vía Metal.
  • **Para una comparación enfocada en M5 Pro y M5 Max (Mac Studio, MacBook Pro), consulta nuestra guía de LLMs locales con Apple Silicon M5 →.**
Configuración Mac miniTope de memoria7B Q4 tok/s70B Q4 tok/sPrecio
M4 (16 GB) — generación anterior16 GB40–50No cabe$599
M4 Pro (64 GB) — generación anterior64 GB60–8010–15$2,299
M6 — nuevo (ago. 2026)32 GBSin benchmark aúnNo cabeDesde $899
M5 Pro — nuevo (ago. 2026)64 GBSin benchmark aúnSin benchmark aúnDesde $1,699
Generaciones del Mac mini comparadas: el nuevo M6 (desde $899) tiene un tope de 32 GB de memoria unificada y no es apto para modelos 70B; el nuevo M5 Pro (desde $1,699) escala hasta 64 GB. El M4 Pro saliente (64 GB, $2,299) alcanzaba 10–15 tok/s en 70B.
Generaciones del Mac mini comparadas: el nuevo M6 (desde $899) tiene un tope de 32 GB de memoria unificada y no es apto para modelos 70B; el nuevo M5 Pro (desde $1,699) escala hasta 64 GB. El M4 Pro saliente (64 GB, $2,299) alcanzaba 10–15 tok/s en 70B.

Framework Desktop: AMD Ryzen AI Max 395+

El Framework Desktop con AMD Ryzen AI Max 395+ y 128 GB de memoria unificada LPDDR5X ejecuta Llama 3.3 70B a 20+ tok/s por $1,999 — lanzado a finales de 2025 y diseñado específicamente para cargas de trabajo de LLMs locales. El Framework Desktop utiliza la APU Strix Halo con 128 GB de memoria unificada accesible tanto para la CPU como para la GPU integrada Radeon 8060S. Comercializado explícitamente para IA local — una primera vez en hardware PC convencional.

  • CPU: AMD Ryzen AI Max 395+ (16 núcleos Zen 5)
  • GPU: Radeon 8060S (40 CU RDNA 3.5)
  • Memoria: 128 GB LPDDR5X unificada (sin VRAM separada)
  • Factor de forma: estilo Mini-ITX de 4,5 L
  • Energía: 120W sostenido, 200W en pico
  • Ventajas: El 70B a 20+ tok/s superó al Mac mini M4 Pro saliente (10–15 tok/s) a un precio similar — todavía no hay benchmarks independientes para el nuevo Mac mini M5 Pro. Totalmente actualizable (placa base, almacenamiento). Diseño Linux-first. Firmware de código abierto.
  • Desventajas: Se requiere configurar ROCm para Ollama (no tan llave en mano como Metal en Mac). Ruido de ventilador de 40–50 dB bajo carga sostenida. Lanzado a finales de 2025 — la madurez de los drivers sigue mejorando.
Modelotok/s
Llama 3.1 8B Q445–60
Llama 3.3 70B Q420–25
DeepSeek-R1 70B Q418–22
Qwen3 72B Q422–26
Framework Desktop vs Mac mini M4 Pro (generación anterior): Framework ejecuta Llama 3.3 70B a 20–25 tok/s con 128 GB de memoria unificada por $1,999; el M4 Pro saliente entregaba 10–15 tok/s con 64 GB por $2,299. Todavía no existe un benchmark independiente para el nuevo Mac mini M5 Pro (64 GB máx., desde $1,699).
Framework Desktop vs Mac mini M4 Pro (generación anterior): Framework ejecuta Llama 3.3 70B a 20–25 tok/s con 128 GB de memoria unificada por $1,999; el M4 Pro saliente entregaba 10–15 tok/s con 64 GB por $2,299. Todavía no existe un benchmark independiente para el nuevo Mac mini M5 Pro (64 GB máx., desde $1,699).

¿Qué plataforma de mini PC ofrece el mejor valor?

El ASUS PN51 con Ryzen 5 y RTX 5060 Ti ofrece el mejor valor x86 tradicional a $900 — rendimiento LLM idéntico al de una torre completa a la mitad del precio.

  • Intel NUC 13 Pro (Core i7): CPU compacta y actualizable de 65W. GPU vía dock eGPU Thunderbolt 3. $600 base + $450 RTX 5060 Ti + $250 dock = $1,300. Mejor calidad de construcción.
  • ASUS PN51 o PN52 (barebone Mini-ITX): Agregar Ryzen 5 ($150) + 32 GB RAM ($80) + SSD 1TB ($70) + RTX 5060 Ti ($450) = $900. Mejor valor.
  • Giada F350 o Zotac ZBOX Sphere (pre-ensamblado): Solo GPU integrada. Adecuado para 3B–7B a velocidades de CPU. No recomendado para inferencia con GPU discreta.
  • Build Mini-ITX personalizado (Lian Li A4, Dan A4-H2O): El más flexible, el más difícil de armar. $1,000–1,400 según la GPU elegida.
Comparación de valor de plataformas mini PC: el ASUS PN51 con RTX 5060 Ti ofrece el mejor valor a ~$900; el Intel NUC 13 con dock eGPU Thunderbolt cuesta ~$1,300 por calidad de construcción premium.
Comparación de valor de plataformas mini PC: el ASUS PN51 con RTX 5060 Ti ofrece el mejor valor a ~$900; el Intel NUC 13 con dock eGPU Thunderbolt cuesta ~$1,300 por calidad de construcción premium.

¿Qué GPU cabe en un case de mini PC?

La RTX 5060 Ti de 16 GB se convirtió en la opción ideal para Mini-ITX a finales de 2025 — cabe en todos los cases a 217mm, ejecuta 13B en Q4 con margen de VRAM, por menos de $500. La RTX 5070 funciona en la mayoría de los cases pero mide — algunas variantes superan los 220mm.

GPUVRAMModelo máximoCabe en Mini-ITXPrecio (2026)
RTX 5060 Ti16 GB13B Q4Sí (217mm)$450–500
RTX 507012 GB13B Q4Verificar variante (225mm)$550–650
RTX 4060 Ti8 GB7B Q4Sí (216mm)$280–320
RTX 407012 GB13B Q4Verificar variante (límite 220mm)$400–500
RTX A400016 GB13B (cómodo)Verificar variante$250–350 usado
Tabla de compatibilidad de GPU para cases Mini-ITX: RTX 5060 Ti 16 GB cabe en todos los cases a 217mm por $450–500; RTX 5070 y RTX 4070 requieren medir la variante.
Tabla de compatibilidad de GPU para cases Mini-ITX: RTX 5060 Ti 16 GB cabe en todos los cases a 217mm por $450–500; RTX 5070 y RTX 4070 requieren medir la variante.

¿Cómo gestionar la refrigeración en un case de mini PC compacto?

Espera 60–70°C en la GPU y 50–60 dB de ruido de ventilador con carga completa de inferencia LLM. El undervolting reduce las temperaturas 5–10°C sin pérdida de velocidad medible.

  • Temperaturas: GPU 60–70°C, CPU 55–65°C bajo inferencia sostenida. No es peligroso pero los ventiladores se aceleran.
  • Ruido: RTX 5060 Ti a plena carga = 50–60 dB (nivel de aspiradora). Aceptable en oficina, molesto en espacios silenciosos.
  • Undervolting: Reducir el voltaje del núcleo 50mV vía MSI Afterburner (Windows) o CoreCtrl (Linux). Reduce temperaturas 5–10°C, pérdida de velocidad del 0–2%.
  • Operación silenciosa: Reemplaza los ventiladores de la GPU con variantes Noctua o BeQuiet! ($50–80). Reduce el ruido 10–15 dB.
Guía de refrigeración para mini PC: 4 pasos — monitorear temperaturas GPU con GPU-Z/HWiNFO64, undervolting con MSI Afterburner (–50 mV ahorra 5–10°C), reemplazar ventiladores con Noctua/BeQuiet! ($50–80), optimizar el flujo de aire del case.
Guía de refrigeración para mini PC: 4 pasos — monitorear temperaturas GPU con GPU-Z/HWiNFO64, undervolting con MSI Afterburner (–50 mV ahorra 5–10°C), reemplazar ventiladores con Noctua/BeQuiet! ($50–80), optimizar el flujo de aire del case.

¿Cuáles son los límites de los mini PCs para LLMs locales?

Los builds Mini-ITX tradicionales tienen un máximo de 13B (12–16 GB de VRAM). Las opciones Apple Silicon y AMD Ryzen AI Max eliminan esta restricción con memoria unificada de hasta 128 GB.

  • VRAM máxima Mini-ITX tradicional: 8–16 GB (solo una GPU discreta). No cabe una RTX 4090 (doble slot, 280mm+ de largo).
  • Tamaño máximo de modelo (tradicional): 13B cómodamente. El 70B requiere descarga en CPU y una penalización de velocidad de 3–5×.
  • Ruta de actualización: Limitada. El cambio de GPU puede requerir modificación del case. La RAM generalmente es actualizable.
  • Multi-GPU: Imposible en Mini-ITX. No hay espacio para una segunda tarjeta discreta.
  • Longevidad: Los cases de mini PC están diseñados para cargas de trabajo de oficina, no para inferencia 24/7. Limpia los filtros de polvo anualmente.
  • El hardware del mini PC limita el tamaño del modelo, pero el tamaño del modelo no es el único límite. Incluso los modelos más grandes tienen limitaciones fundamentales — alucinaciones, fallos de razonamiento y brechas de conocimiento. Consulta lo que los LLMs no pueden hacer para el panorama completo.

Contexto regional: residencia de datos con mini PCs

Los mini PCs que ejecutan LLMs locales mantienen todos los datos en las instalaciones — ningún dato sale del dispositivo, cumpliendo por defecto con los requisitos de residencia de datos del GDPR, la APPI y la DSL de China.

  • UE / GDPR: La inferencia local elimina los acuerdos de procesamiento de datos (Artículo 28 del GDPR). Los datos profesionales sensibles (legales, médicos, financieros) permanecen dentro de la UE sin la carga contractual de las SCC.
  • Japón / APPI: La Ley de Protección de Información Personal (APPI) requiere consentimiento explícito para la transferencia transfronteriza de datos. La inferencia local elimina completamente este requisito.
  • China / Ley de Seguridad de Datos: La Ley de Seguridad de Datos de 2021 restringe el envío de ciertas categorías de datos al exterior. Un mini PC que ejecuta Qwen3 localmente cumple estos requisitos sin enrutamiento en la nube.

Errores comunes con mini PCs para inferencia LLM local

El error más común es comprar un mini PC de consumo con GPU integrada — las GPUs integradas son 10× más lentas que las tarjetas discretas para inferencia LLM.

  • Comprar un mini PC pre-ensamblado con GPU integrada para inferencia 7B. Las GPUs integradas producen 1–2 tok/s frente a 25 tok/s de la RTX 5060 Ti.
  • Elegir un dock eGPU TB3 esperando la velocidad completa de una GPU discreta. El eGPU pierde 15–25% de ancho de banda PCIe — espera 12 tok/s en lugar de 15 en 7B.
  • Asumir que cualquier case de mini PC admite una fuente ATX de tamaño completo. El Mini-ITX requiere fuentes en formato SFX o TFX.
  • Saltarse el dimensionamiento de RAM — con solo 8 GB de RAM libre, la carga del modelo 7B provoca thrashing de swap y ralentizaciones de 5–10×.
  • No medir la longitud de la GPU antes de pedirla — las variantes de RTX 5070 van de 210mm a 242mm; verifica el límite de slot de tu case específico.

Preguntas frecuentes: mini PCs para LLMs locales

¿Puedo ejecutar modelos 13B sin problemas en un mini PC?

Sí, con cuantización Q4 con RTX 5060 Ti (16 GB) o RTX 4070 (12 GB). La RTX 4060 Ti (8 GB) es demasiado ajustada para 13B cómodo — el margen de VRAM cae por debajo de 1 GB.

¿Es útil el Intel NUC con una RTX 5060 Ti externa en dock para LLMs locales?

Sí. El eGPU TB3 pierde 15–20% de ancho de banda, así que espera 12 tok/s en lugar de 15 en 7B. Sigue siendo funcional y excelente para espacios pequeños donde una torre completa es poco práctica.

¿Qué tan ruidoso es un mini PC ejecutando LLMs?

La RTX 5060 Ti a plena carga alcanza 50–60 dB. El undervolting o reemplazar los ventiladores de la GPU con variantes Noctua reduce el ruido a 40–45 dB — aceptable para la mayoría de las oficinas.

¿Puedo instalar una RTX 4090 en un mini PC?

No. La RTX 4090 es de doble slot y mide 280mm+. Los cases SFF personalizados (Lian Li A4, Dan A4-H2O) tienen un máximo de 220mm de longitud de GPU.

¿Es mejor un mini PC que una laptop para LLMs locales?

Para uso estacionario, sí. El mini PC ofrece mejor gestión térmica (60–70°C sostenido) y ancho de banda PCIe completo. La laptop limita a ~10 tok/s bajo carga sostenida. El mini PC gana para uso en escritorio.

¿Cuál es el costo total de un mini PC para inferencia 7B?

Build ASUS PN51: $900. Intel NUC 13 + dock eGPU RTX 5060 Ti: $1,300. Ambos ejecutan 7B a 20–25 tok/s; el PN51 ofrece mejor valor. Los precios pueden variar según tu país.

¿Necesita un mini PC una solución de refrigeración dedicada para LLMs?

Sí para inferencia sostenida. Los ventiladores de case Mini-ITX estándar (1×80mm) son insuficientes para la RTX 5060 Ti a plena carga. Agrega un ventilador lateral de 92mm o reemplaza los ventiladores de la GPU con variantes Noctua ($50–80).

¿Qué CPU de mini PC es mejor para inferencia LLM local?

La CPU es secundaria frente a la GPU para la generación de tokens. Ryzen 7 7700X o Intel Core i7-14700K son suficientes. Prioriza el presupuesto de VRAM de la GPU sobre la velocidad de la CPU para inferencia de 7B–13B.

¿Puede el nuevo Mac mini (M6 o M5 Pro) ejecutar Llama 3.3 70B?

Solo la configuración M5 Pro (desde $1,699, tope de 64 GB de memoria unificada) tiene suficiente margen de memoria para modelos de clase 70B — todavía no existen benchmarks independientes de tok/s, ya que se lanza el 22 de septiembre de 2026. El M6 base (desde $899) tiene un tope de 32 GB de memoria unificada y no es apto para modelos 70B. Como referencia, el M4 Pro saliente (64 GB, $2,299) alcanzaba 10–15 tok/s en 70B.

¿El nuevo Mac mini M6 admite 64 GB de memoria unificada como el antiguo M4 Pro?

No — el Mac mini M6 base tiene un tope de 32 GB de memoria unificada, por debajo del máximo de 64 GB del M4 Pro. Para obtener 64 GB de memoria unificada en la nueva línea de Mac mini, necesitas la configuración M5 Pro (desde $1,699), no el M6 (desde $899). Es un cambio importante respecto a la generación anterior, donde 64 GB estaban disponibles en el M4 Pro de gama media.

¿Es el Framework Desktop mejor que el nuevo Mac mini para LLMs locales?

El Framework Desktop ($1,999, 128 GB de memoria unificada) sigue teniendo más margen de memoria que cualquier chip del nuevo Mac mini — el M5 Pro tiene un tope de 64 GB y el M6 de 32 GB. Frente al M4 Pro saliente, el Framework Desktop alcanzó 20+ tok/s en 70B, superando los 10–15 tok/s del Mac mini; todavía no existe un benchmark independiente para el nuevo chip M5 Pro. En facilidad de configuración, el Mac mini sigue ganando — Ollama funciona con Metal de forma inmediata, mientras que Framework requiere configurar ROCm.

¿Qué configuración de Mac mini es la mejor para LLMs locales: M6 o M5 Pro?

Para modelos de clase 70B, solo el M5 Pro (desde $1,699, hasta 64 GB de memoria unificada) tiene margen suficiente — el M6 (desde $899) tiene un tope de 32 GB y no es apto para modelos 70B, ni siquiera con cuantización Q4. Si solo necesitas modelos de 7B–13B, el M6 base es suficiente. El M4 Pro saliente (hasta 64 GB, hasta $2,299) se está descontinuando pero alcanzaba 10–15 tok/s en 70B si encuentras una unidad con descuento.

¿Cuál es una buena alternativa al Mac mini para LLMs locales?

El Framework Desktop ($1,999, 128 GB de memoria unificada) tiene más margen de memoria que cualquier configuración nueva del Mac mini (M6: 32 GB, M5 Pro: 64 GB) y, frente al M4 Pro saliente, superó al Mac mini en velocidad bruta en 70B (20+ tok/s frente a 10–15 tok/s), a costa de un ventilador más ruidoso y un paso de configuración de ROCm. Para flexibilidad x86 en lugar de memoria unificada, un build de ASUS PN51 + RTX 5060 Ti ($900) cubre modelos de 7B–13B a menor costo inicial.

¿Cuál es el mejor mini PC económico para LLMs locales en 2026?

Un barebone ASUS PN51 o PN52 con Ryzen 5, 32 GB de RAM, SSD de 1TB y RTX 5060 Ti de 16 GB cuesta en total unos $900 — el build de mini PC más económico que aún alcanza 7B a 25 tok/s y 13B a 15 tok/s con GPU dedicada. Los mini PCs prefabricados con gráficos integrados cuestan menos, pero caen a 1–2 tok/s en 7B, así que no son una opción real de presupuesto para inferencia de LLM local.

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs