Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/LiteLLM en 2026: una sola puerta de enlace para más de 100 API de LLM
Overview & Reference

LiteLLM en 2026: una sola puerta de enlace para más de 100 API de LLM

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

LiteLLM (github.com/BerriAI/litellm) es una puerta de enlace de código abierto que permite a tu código llamar a más de 100 API de proveedores de LLM mediante una única interfaz compatible con OpenAI, en lugar de escribir código de integración distinto por proveedor. Se distribuye como un SDK de Python (pip install litellm) para uso directo dentro de una aplicación, y como un servidor proxy autoalojado con un panel de administración de claves virtuales para equipos que quieren enrutamiento centralizado, seguimiento de costes y limitación de tasa entre varias aplicaciones y usuarios. El repositorio principal tiene licencia MIT según su propio archivo LICENSE, con una excepción de licencia enterprise aparte que se aplica únicamente al subdirectorio enterprise/ — verificado directamente contra el archivo LICENSE del repositorio para esta reseña. Al momento de esta reseña, GitHub muestra aproximadamente 58.663 estrellas y 11.415 forks.

LiteLLM (github.com/BerriAI/litellm, documentación en docs.litellm.ai) es una puerta de enlace de LLM de código abierto que ofrece a tu código una única interfaz compatible con OpenAI para llamar a más de 100 API de proveedores distintos — OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Ollama y muchos más — en lugar de escribir código de integración por separado para cada uno. Se distribuye de dos formas: un SDK de Python importable (pip install litellm) y un servidor proxy autoalojado con panel de administración, desplegable vía Docker, Helm, AWS ECS Fargate o Google Cloud Run. Esta reseña cubre qué hace realmente LiteLLM, cómo instalar y operar ambos modos, su licencia (que no es simplemente "MIT" para todo el repositorio) y su posición frente a vLLM, LocalAI y servicios de enrutamiento alojados como OpenRouter.

LiteLLM en 2026: una sola puerta de enlace para más de 100 API de LLM

Conclusiones clave

  • Código abierto en GitHub (BerriAI/litellm); aproximadamente 58.663 estrellas y 11.415 forks al momento de esta reseña
  • El repositorio principal tiene licencia MIT según su propio archivo LICENSE; una licencia aparte se aplica únicamente al subdirectorio enterprise/, verificado directamente contra el archivo LICENSE para esta reseña
  • Dos productos: el SDK de Python litellm (pip install litellm) para llamar a proveedores directamente desde el código, y el LiteLLM Proxy Server (`pip install 'litellm[proxy]'`, o Docker) como puerta de enlace autoalojada con panel de administración
  • Unifica más de 100 API de proveedores (OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure OpenAI, Ollama y más) tras un único formato de solicitud/respuesta, según el propio README del proyecto
  • Funciones documentadas en el README y en el sitio de documentación: balanceo de carga, enrutamiento, respaldo/conmutación, presupuestos por clave y por usuario, limitación de tasa, caché de solicitudes y registro de gasto
  • No requiere GPU — LiteLLM reenvía solicitudes en lugar de ejecutar pesos del modelo; el despliegue en producción del proxy necesita PostgreSQL (claves, datos de gasto) y Redis (limitación de tasa entre instancias), no una GPU
  • Desplegable vía Docker (docker.litellm.ai/berriai/litellm), charts de Helm, un módulo Terraform oficial para AWS ECS Fargate, un módulo Terraform oficial para Google Cloud Run, o botones de despliegue con un clic en Render/Railway
  • Existe un nivel comercial Enterprise aparte en litellm.ai/enterprise, que cubre SSO, solicitudes de funciones prioritarias y soporte dedicado — el SDK y el proxy de código abierto siguen siendo completamente utilizables sin él

📍 En una frase

LiteLLM es una puerta de enlace de código abierto que permite a las aplicaciones llamar a más de 100 API de proveedores de LLM mediante una única interfaz compatible con OpenAI, disponible como SDK de Python o como servidor proxy autoalojado con enrutamiento, respaldo, seguimiento de costes y limitación de tasa.

💬 En términos simples

Si tu app necesita hablar con OpenAI hoy y con Anthropic o un modelo local de Ollama mañana, normalmente tendrías que reescribir el código de integración para cada uno. LiteLLM se coloca en medio y traduce la API de cada proveedor al mismo formato estilo OpenAI, así que tu código solo tiene que aprender un formato, y la versión proxy añade además un panel para ver quién gasta qué.

📌Nota: Esta reseña es el complemento en profundidad de la ficha de LiteLLM en el Directorio de Software LLM Local — consulta esa página para ver cómo se compara LiteLLM de un vistazo con docenas de otras herramientas de IA local.

¿Qué es LiteLLM?

LiteLLM es una puerta de enlace que traduce un único formato de solicitud compatible con OpenAI en llamadas a más de 100 API de proveedores de LLM distintos. Su propio README de GitHub lo describe como "la puerta de enlace de IA más rápida y ligera", construida con un núcleo en Rust y un SDK de Python encima — un cambio respecto a la implementación puramente en Python de los primeros años del proyecto. En lugar de escribir código cliente separado para la API de OpenAI, la de Anthropic y un servidor Ollama local, una aplicación llama a LiteLLM una vez, y LiteLLM reenvía la solicitud al proveedor configurado para ese nombre de modelo.

  • Función principal: aceptar una solicitud en el formato chat/completions de OpenAI (o en el formato nativo del proveedor de destino), reenviarla al proveedor configurado y devolver una respuesta normalizada
  • Dos modos de acceso: el SDK de Python litellm, importado directamente en el código de una aplicación, y el LiteLLM Proxy Server, un servicio independiente que otras aplicaciones llaman por HTTP
  • Desarrollador: BerriAI, la organización detrás del repositorio github.com/BerriAI/litellm
  • No es un motor de ejecución de modelos: LiteLLM no carga pesos de modelos ni realiza inferencia por sí mismo — enruta solicitudes a proveedores que sí lo hacen, incluyendo API en la nube y servidores locales como Ollama o vLLM
  • Funciones de nivel producción según la documentación: claves de API virtuales, presupuestos de gasto por clave y por usuario, limitación de tasa, balanceo de carga entre varios despliegues del mismo modelo, y conmutación automática cuando un proveedor falla

¿Qué puedes hacer con LiteLLM?

El conjunto de funciones de LiteLLM abarca enrutamiento de solicitudes, control de costes y fiabilidad — las partes de operar una aplicación basada en LLM que se complican a medida que se añaden más proveedores y más usuarios, según la documentación de LiteLLM.

  • Superficie de API unificada — enviar una solicitud en formato OpenAI; LiteLLM la traduce al formato nativo que requiera el proveedor del modelo de destino y normaliza la respuesta de vuelta
  • Enrutamiento y balanceo de carga — repartir el tráfico entre varios despliegues del mismo modelo (por ejemplo, varias regiones de Azure OpenAI) para evitar un único punto de fallo o un límite de tasa
  • Lógica de respaldo y reintento — reintentar automáticamente una solicitud fallida contra otro proveedor o despliegue de modelo en lugar de mostrar el error al usuario final
  • Seguimiento de costes y presupuestos — registrar el gasto por clave de API, por usuario o por equipo, y fijar límites de presupuesto estrictos que bloquean nuevas solicitudes al superarse
  • Limitación de tasa — limitar solicitudes por minuto/tokens por clave o usuario, aplicado de forma consistente entre varias instancias del proxy mediante Redis
  • Barreras de protección y registro — puntos de integración para moderación de contenido e integraciones de observabilidad, más registro estructurado de solicitudes/respuestas para auditorías
  • Panel de administración — una interfaz web (servida en /ui del proxy) para gestionar claves virtuales, ver el gasto y configurar modelos sin editar el archivo de configuración directamente
  • También funciona con runtimes locales — la misma capa de enrutamiento que llama a OpenAI o Anthropic puede apuntar igualmente a un endpoint local de Ollama o vLLM, permitiendo que una puerta de enlace mezcle modelos en la nube y locales

Ejemplos de uso: dos formas de usar LiteLLM

Estos son flujos de trabajo concretos construidos a partir de las rutas de instalación documentadas de LiteLLM anteriores — no casos de uso hipotéticos.

Instalar LiteLLM: SDK, proxy y Docker

LiteLLM es un framework y una puerta de enlace autoalojada, no una app descargable para el usuario final — no hay un instalador que "obtener" de una tienda de apps. A continuación están los comandos reales de instalación e inicio rápido, según la propia documentación de LiteLLM y su guía rápida de Docker; comprueba siempre la documentación directamente antes de desplegar, ya que los indicadores exactos y las etiquetas de imagen pueden cambiar entre versiones.

SDK de Python

Comando:
pip install litellm (o uv add litellm)

Proxy Server (pip)

Comando:
`pip install 'litellm[proxy]' y luego litellm --model gpt-4o`

Proxy Server (Docker)

Comando:
docker run -v $(pwd)/config.yaml:/app/config.yaml -e OPENAI_API_KEY=<clave> -e LITELLM_MASTER_KEY=sk-1234 -p 4000:4000 docker.litellm.ai/berriai/litellm:latest --config /app/config.yaml

Helm (Kubernetes)

Comando:
helm install litellm oci://ghcr.io/berriai/litellm-helm -f values.yaml

AWS ECS Fargate

Comando:
Módulo Terraform oficial BerriAI/litellm/aws (provisiona VPC, Aurora PostgreSQL, ElastiCache Redis, ALB, ECS)

Google Cloud Run

Comando:
Módulo Terraform oficial BerriAI/litellm/google (provisiona Cloud SQL, Memorystore Redis, GCS, balanceador de carga HTTPS)

El proxy usa por defecto el puerto 4000, con el panel de administración en http://localhost:4000/ui (inicio de sesión por defecto: usuario admin, contraseña igual a tu LITELLM_MASTER_KEY). Un config.yaml mínimo necesita un array model_list que asigne un model_name a litellm_params (la cadena real del modelo del proveedor más su clave de API) — consulta el inicio rápido del proxy para un ejemplo completo. Render y Railway también ofrecen botones de despliegue con un clic para el proxy, según la documentación de despliegue de LiteLLM.

Precios de LiteLLM: ¿es realmente gratis?

El SDK de código abierto y el Proxy Server son gratuitos — solo pagas las llamadas a la API del proveedor subyacente que enrutas a través de LiteLLM, más tus propios costes de alojamiento. LiteLLM en sí no cobra por solicitud ni por token en la vía de código abierto. Existe un nivel de pago aparte, LiteLLM Enterprise, en litellm.ai/enterprise, que cubre SSO, solicitudes de funciones prioritarias y soporte dedicado, según el propio sitio del proyecto — esta reseña no encontró precios de Enterprise publicados y recomienda contactar directamente con LiteLLM para una cotización.

  • SDK de código abierto y Proxy Server: sin cuota de licencia, repositorio principal con licencia MIT (ver la nota de licencia abajo)
  • Sigues pagando al proveedor al que enrutas — LiteLLM no reduce los precios de las API de OpenAI, Anthropic o Bedrock, solo los unifica y registra
  • Autoalojar el proxy tiene su propio coste de infraestructura: un servidor o proveedor de contenedores, más PostgreSQL y Redis para uso en producción
  • LiteLLM Enterprise añade SSO, soporte prioritario y otras funciones empresariales sobre el mismo núcleo de código abierto, según litellm.ai/enterprise — los precios no están publicados y requieren contactar con la empresa

LiteLLM frente a vLLM y LocalAI

LiteLLM, vLLM y LocalAI resuelven problemas distintos que es fácil confundir porque los tres exponen una API compatible con OpenAI. LiteLLM enruta solicitudes a modelos que se ejecutan en otro lugar; vLLM y LocalAI ejecutan ellos mismos los pesos del modelo.

Aspecto
LiteLLM
vLLM
LocalAI
Qué haceEnruta solicitudes a proveedoresEjecuta modelos él mismoEjecuta modelos él mismo
Ejecuta pesos del modeloNo
LicenciaMIT (+ excepción enterprise)Apache-2.0MIT
GPU necesariaNo (solo enrutador)Sí, para servicio en tiempo realDepende del modelo
Ideal paraEnrutamiento multiproveedor y seguimiento de gastoServicio autoalojado de alto rendimientoAPI única autoalojada compatible con OpenAI

Estas herramientas se suelen usar juntas en lugar de como sustitutas entre sí: LiteLLM puede colocarse delante de un despliegue de vLLM o LocalAI como capa de enrutamiento y seguimiento de costes, mientras que vLLM o LocalAI realiza la inferencia real del modelo. Consulta los artículos dedicados vLLM explicado y LocalAI explicado para más detalles sobre esos dos.

¿Para quién es LiteLLM?

Que LiteLLM encaje depende de si tu aplicación ya llama, o planea llamar, a más de un proveedor de LLM — una app de un solo proveedor obtiene menos beneficio de una capa de enrutamiento.

LiteLLM frente a otras puertas de enlace y frameworks

Al momento de esta reseña, LiteLLM es la primera herramienta de la categoría enrutador/puerta de enlace con su propia reseña dedicada en el Directorio de Software LLM Local de PromptQuorum — todavía no existe una segunda herramienta del mismo segmento (enrutador/puerta de enlace) para una comparación directa. Las comparaciones útiles más cercanas provienen en cambio de herramientas afines en la misma sección "Run & Serve" del directorio, más una alternativa alojada ampliamente conocida fuera del directorio.

  • vLLM — un motor de inferencia autoalojado que realmente sirve los pesos del modelo (requiere GPU); habitualmente combinado con LiteLLM en lugar de competir con él, con LiteLLM como capa de enrutamiento delante de uno o varios despliegues de vLLM.
  • LocalAI — un servidor de API autoalojado y compatible con OpenAI para ejecutar modelos abiertos localmente; resuelve un problema distinto al de LiteLLM (servir vs. enrutar) pero expone una API de formato OpenAI similar, fuente habitual de confusión entre ambos.
  • LangChain — un framework de aplicación para construir apps basadas en LLM (cadenas, agentes, memoria); puede llamar a LiteLLM (o directamente a cualquier proveedor) como su capa de acceso a modelos, en lugar de sustituir lo que hace LiteLLM.
  • OpenRouter (externo, no está en el directorio de PromptQuorum) — un servicio de enrutamiento alojado y gestionado que cubre un caso de uso multiproveedor similar al proxy de LiteLLM, pero como servicio de terceros al que llamas en lugar de infraestructura que autoalojas; merece la pena comparar directamente si buscas enrutamiento sin operación propia en vez de gestionar tu propio proxy.

Errores comunes al evaluar LiteLLM

La mayor parte de la confusión sobre LiteLLM viene de confundirlo con un motor de servicio de modelos, o de simplificar en exceso su licencia.

Preguntas frecuentes

¿Qué es LiteLLM?

LiteLLM (github.com/BerriAI/litellm) es una puerta de enlace de código abierto que permite a las aplicaciones llamar a más de 100 API de proveedores de LLM mediante una única interfaz compatible con OpenAI, disponible como SDK de Python o como servidor proxy autoalojado con enrutamiento, seguimiento de costes y limitación de tasa.

¿Es gratis LiteLLM?

El SDK de código abierto y el Proxy Server son gratuitos — solo pagas las llamadas a la API del proveedor subyacente y tu propio alojamiento. Un nivel de pago aparte, LiteLLM Enterprise, añade SSO y soporte dedicado; sus precios no están publicados y requieren contactar directamente con LiteLLM.

¿Qué licencia usa LiteLLM?

El repositorio principal tiene licencia MIT, según su propio archivo LICENSE. Una licencia aparte se aplica únicamente al subdirectorio enterprise/, definida en enterprise/LICENSE — verificado directamente contra el archivo LICENSE del repositorio para esta reseña.

¿Necesita LiteLLM una GPU?

No. LiteLLM es un enrutador de solicitudes, no un motor de inferencia de modelos — reenvía llamadas a proveedores (API en la nube o runtimes locales como Ollama) en lugar de ejecutar él mismo los pesos del modelo, por lo que funciona bien en hardware solo con CPU.

¿Cómo instalo LiteLLM?

Para el SDK de Python: pip install litellm. Para el proxy autoalojado: `pip install 'litellm[proxy]' y luego litellm --model gpt-4o, o ejecuta la imagen Docker docker.litellm.ai/berriai/litellm:latest con un config.yaml` montado. Consulta la tabla de instalación anterior para las opciones de Helm, AWS ECS Fargate y Google Cloud Run.

¿El proxy de LiteLLM requiere una base de datos?

Para uso en producción, sí — PostgreSQL persiste las claves virtuales y los datos de gasto, y Redis mantiene la limitación de tasa consistente entre varias instancias del proxy, según la propia documentación de despliegue de LiteLLM. Una prueba local rápida puede ejecutarse sin ninguna de las dos, pero pierde esas funciones.

¿Puede LiteLLM enrutar a un modelo alojado localmente?

Sí. La misma model_list del config.yaml que apunta a OpenAI o Anthropic puede apuntar igualmente a un endpoint local de Ollama o vLLM, permitiendo que una puerta de enlace mezcle modelos en la nube y locales.

¿Cómo se compara LiteLLM con OpenRouter?

Ambos unifican varios proveedores de LLM tras una interfaz. LiteLLM es infraestructura autoalojada que operas tú mismo (proxy o SDK de código abierto); OpenRouter es un servicio de enrutamiento alojado por un tercero al que llamas en lugar de operar el tuyo propio. La elección depende de si quieres cero operación propia (OpenRouter) o control total sin recargo por solicitud de un proveedor de enrutamiento (LiteLLM autoalojado).

¿Quién desarrolla LiteLLM?

BerriAI, la organización detrás del repositorio github.com/BerriAI/litellm, que muestra aproximadamente 58.663 estrellas y 11.415 forks al momento de esta reseña.

Fuentes

← Volver a LLM locales avanzados