Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Reseña de openai-edge-tts: un servidor TTS gratuito compatible con OpenAI
Voice, Speech & Multimodal

Reseña de openai-edge-tts: un servidor TTS gratuito compatible con OpenAI

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

openai-edge-tts es un servidor API gratuito, de código abierto y autoalojado que expone un endpoint /v1/audio/speech con el mismo formato que la API de texto a voz de OpenAI, pero no sintetiza voz de forma local. Cada solicitud se reenvía a través de la librería edge-tts hacia las voces gratuitas en línea "Leer en voz alta" de Microsoft Edge por internet, así que el texto que le envías sale de tu equipo y llega al servicio de Microsoft, aunque el propio proceso del servidor se ejecute en hardware que tú controlas.

openai-edge-tts (github.com/travisvn/openai-edge-tts) es un servidor API gratuito, de código abierto y autoalojado, creado por el desarrollador travisvn, que expone un endpoint /v1/audio/speech con el mismo formato que la API de texto a voz de OpenAI. No ejecuta un modelo de voz local: reenvía cada solicitud a través de la librería Python edge-tts hacia las voces gratuitas en línea "Leer en voz alta" de Microsoft Edge, y luego devuelve el audio en una respuesta compatible con OpenAI. Esta reseña cubre exactamente hacia dónde reenvía las solicitudes, cómo instalarlo y para quién es adecuado.

Conclusiones clave

  • openai-edge-tts (github.com/travisvn/openai-edge-tts) es un servidor API gratuito, de código abierto y autoalojado — no un modelo de voz local
  • Creado por el desarrollador travisvn; el repositorio se creó el 9 de octubre de 2024
  • Con licencia GPL-3.0, confirmada en el campo de licencia del repositorio de GitHub
  • Expone /v1/audio/speech, con el mismo formato de solicitud/respuesta que la API de texto a voz de OpenAI, así que el código cliente existente para OpenAI-TTS puede apuntar a él solo cambiando la URL base
  • La síntesis se reenvía a las voces gratuitas en línea "Leer en voz alta" de Microsoft Edge mediante la librería Python edge-tts — no se ejecuta ningún modelo de voz local en tu hardware
  • Más de 2.100 estrellas y 316 forks en GitHub al momento de esta reseña

📍 En una frase

openai-edge-tts es un servidor API gratuito y de código abierto (GPL-3.0) creado por travisvn que expone un endpoint /v1/audio/speech compatible con OpenAI, pero en lugar de ejecutar un modelo de voz local, reenvía cada solicitud a las voces gratuitas en línea de Microsoft Edge mediante la librería edge-tts.

💬 En términos simples

Es un servidor pequeño que ejecutas tú mismo (normalmente en Docker) que hace que las herramientas de texto a voz creadas para la API de OpenAI funcionen contra una fuente de voz gratuita — pero el "habla" real ocurre en los servidores de Microsoft, no en tu equipo. Si la privacidad frente a Microsoft te importa para tu texto, esta herramienta no la ofrece; si el problema que resuelves es el costo de la API TTS de OpenAI/Azure/ElevenLabs, sí lo hace.

📌Nota: Esta reseña se basa en el propio repositorio de GitHub, el README y las notas de versión de openai-edge-tts. No afirma que PromptQuorum haya realizado benchmarks prácticos de latencia o calidad frente a las voces subyacentes de Microsoft Edge.

¿Qué es openai-edge-tts?

openai-edge-tts es un servidor API autoalojado que imita la API de texto a voz de OpenAI, de modo que las herramientas creadas para llamar a OpenAI, Azure AI Speech o ElevenLabs puedan apuntar a él en su lugar, sin una factura por solicitud. Lo logra envolviendo la librería edge-tts, que a su vez se comunica por internet con el servicio de voz "Leer en voz alta" gratuito y basado en navegador de Microsoft Edge.

  • Tipo de producto: un servidor API autoalojado (Docker o Python), no una app de usuario final descargable ni un modelo de voz local
  • Creador: travisvn, un desarrollador independiente; el repositorio de GitHub está en github.com/travisvn/openai-edge-tts
  • Repositorio creado el 9 de octubre de 2024, según los metadatos del repositorio de GitHub
  • Licencia: GPL-3.0, confirmada mediante los metadatos de licencia del repositorio de GitHub; el README también indica que los despliegues empresariales/comerciales deben contactar directamente al autor
  • Localidad: híbrida, no local — el proceso del servidor es autoalojado, pero la síntesis de texto a voz en sí se reenvía al servicio de voz en línea de Microsoft Edge, no se calcula en tu propio hardware
  • Escala: más de 2.100 estrellas y 316 forks en GitHub al momento de esta reseña

Historia del proyecto y versiones clave

El repositorio de GitHub se creó el 9 de octubre de 2024, y su hito de lanzamiento público más importante es la v2.0.0, publicada el 28 de diciembre de 2024, que añadió filtrado de markdown, compatibilidad beta con los endpoints de ElevenLabs/Azure AI Speech y una configuración simplificada.

  1. 1
    9 de octubre de 2024: se crea el repositorio
    Why it matters: Marca el inicio del proyecto, según los metadatos del repositorio de GitHub.
  2. 2
    v2.0.0 — 28 de diciembre de 2024: filtrado de markdown, soporte de API ampliado, configuración simplificada
    Why it matters: Añadió filtrado opcional de markdown en el texto de salida, compatibilidad beta directa con los endpoints de ElevenLabs y Azure AI Speech (junto al endpoint existente en formato OpenAI), y volvió opcional el prefijo de ruta `/v1`, según las notas de versión oficiales de GitHub.

¿Qué hace realmente openai-edge-tts?

openai-edge-tts recibe una solicitud de texto a voz en el formato de la API de OpenAI, asigna la voz y los ajustes solicitados a una voz equivalente de Microsoft Edge, obtiene el audio sintetizado del servicio en línea de Microsoft mediante la librería edge-tts, y lo devuelve en el formato que el cliente espera.

  • Endpoint compatible con OpenAI: /v1/audio/speech (el prefijo /v1 es opcional desde la v2.0.0), con el mismo formato de solicitud/respuesta TTS de OpenAI, de modo que el código cliente existente solo necesita cambiar la URL base
  • Asignación de voces: los nombres de voz de OpenAI (alloy, echo, fable, onyx, nova, shimmer) se asignan por defecto a voces específicas de edge-tts; el README también documenta la selección directa de cualquier voz de edge-tts, evitando la asignación por nombre de OpenAI
  • Capas de compatibilidad beta: endpoints directos que imitan las API de ElevenLabs y Azure AI Speech, además del endpoint principal en formato OpenAI, introducidos en la v2.0.0
  • Formatos de audio: salida en mp3, opus, aac, flac, wav y pcm, según el README
  • Streaming: streaming por eventos enviados por el servidor (SSE) con fragmentos de audio codificados en base64, para clientes que prefieren audio incremental en vez de esperar un archivo completo
  • Control de velocidad: velocidad de reproducción ajustable de 0,25x a 4,0x
  • Filtrado opcional de markdown: elimina por defecto la sintaxis markdown del texto de entrada antes de sintetizarlo, ya que el texto de origen (por ejemplo, la respuesta de un LLM) suele contener markdown que no debería leerse literalmente; se puede desactivar mediante una variable de entorno REMOVE_FILTER
  • Configuración: un archivo .env define la clave de API, el puerto (5050 por defecto), la voz predeterminada, la velocidad predeterminada y el idioma predeterminado

Ejemplos de uso: dos formas de usar openai-edge-tts

Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas del proyecto descritas arriba.

Plataforma, precio y licencia

Plataforma

Lo que indica openai-edge-tts:
Un servidor API autoalojado (Docker o Python) — sin GUI, sin app de usuario final descargable; funciona en cualquier host que pueda ejecutar Docker o Python.

Costo

Lo que indica openai-edge-tts:
Gratis y de código abierto para uso personal. El README indica que los despliegues empresariales/comerciales deben contactar directamente al autor (travisvn).

Licencia

Lo que indica openai-edge-tts:
GPL-3.0, confirmada mediante los metadatos de licencia del repositorio de GitHub.

Método de instalación

Lo que indica openai-edge-tts:
Docker (docker run o docker-compose) es la vía principal documentada; también se documenta una vía con entorno virtual de Python + pip para ejecutarlo sin Docker.

Verifica la licencia actual y los términos de uso comercial directamente en el repositorio de GitHub antes de desplegarlo a escala organizacional, ya que la nota de contacto empresarial del README es una intención declarada, no un texto de licencia comercial publicado por separado que esta reseña pudiera verificar de forma independiente.

openai-edge-tts vs. Piper TTS

openai-edge-tts y Piper TTS resuelven el mismo problema de "endpoint TTS gratuito compatible con OpenAI" de formas opuestas: uno reenvía a un servicio de voz gratuito en la nube, el otro ejecuta un modelo TTS neuronal real por completo en tu propio hardware. Se comparan porque ambos aparecen en las mismas búsquedas de "cómo añado TTS gratuito a mi stack de IA autoalojado".

Aspecto
openai-edge-tts
Piper TTS
Dónde ocurre la síntesisEn el servicio de voz de Microsoft Edge, por redTotalmente en tu propia CPU, sin llamadas de red
LocalidadHíbrida — servidor autoalojado, síntesis dependiente de la nubeTotalmente local — funciona sin conexión tras descargar el modelo
Calidad/estilo de vozVoces en línea de calidad comercial de Microsoft Edge, muchos idiomasModelos de voz neuronal más pequeños, calidad variable por voz, descarga por voz
Riesgo de dependenciaDepende de que Microsoft siga ofreciendo este servicio gratuitoDepende solo de que el archivo de modelo descargado siga funcionando
LicenciaGPL-3.0MIT

Si enviar texto a Microsoft es aceptable para tu caso de uso y quieres una amplia gama de voces pulidas sin costo de cómputo local, openai-edge-tts es el camino más simple. Si la síntesis debe permanecer por completo en hardware que controlas, Piper TTS (u otro motor genuinamente local) es la opción correcta, no esta herramienta.

¿Quién debería usar openai-edge-tts?

openai-edge-tts es adecuado para desarrolladores que quieren eliminar el costo por solicitud de una API TTS comercial sin renunciar a una integración con forma de OpenAI, y que están dispuestos a que el texto se envíe al servicio de voz de Microsoft Edge.

Para qué no sirve openai-edge-tts

openai-edge-tts no es adecuado si necesitas una síntesis de voz genuinamente local, sin conexión o sensible a la privacidad.

  • No funciona sin conexión — cada solicitud de síntesis requiere una conexión a internet funcional para alcanzar el servicio de voz de Microsoft Edge; no funcionará en una máquina aislada de la red
  • No es privado como lo es un modelo local — el texto enviado para sintetizar llega a los servidores de Microsoft, así que esta herramienta no mantiene el texto sintetizado confinado a tu propio hardware
  • No está respaldado por una API oficial y documentada de Microsoft — depende del mismo mecanismo gratuito de voz "Leer en voz alta" que usa el navegador Edge, que Microsoft podría cambiar o restringir sin previo aviso; el propio README no documenta un límite de tasa formal ni una garantía de términos de servicio para esta dependencia
  • No es una herramienta de clonación de voz — solo ofrece las voces preestablecidas existentes de Microsoft Edge, sin soporte para entrenar o clonar una voz personalizada a partir de tu propio audio
  • No tiene licencia comercial por defecto — el README pide a los despliegues empresariales/comerciales que contacten directamente al autor en lugar de asumir que los términos GPL-3.0 por sí solos cubren ese caso de uso

Errores comunes al evaluar openai-edge-tts

La mayor parte de la confusión sobre openai-edge-tts viene de asumir que se comporta como un modelo local por ser autoalojado, o de pasar por alto el estado beta de sus modos de endpoint que no son de OpenAI.

Competidores y alternativas

openai-edge-tts se compara más a menudo con motores de texto a voz genuinamente locales y sin conexión que también exponen un endpoint compatible con OpenAI — su principal diferencia es intercambiar la privacidad total sin conexión por la selección de voces más amplia y pulida de Microsoft Edge a costo de cómputo local cero.

Herramienta
Conocida por
Enlace
Piper TTSMotor TTS neuronal rápido, totalmente local y solo con CPU del proyecto RhasspyReseña de Piper TTS
Coqui TTSKit de herramientas TTS local de código abierto con clonación de voz y muchos idiomasReseña de Coqui TTS
XTTS-v2Modelo TTS local de clonación de voz sin muestras previas de CoquiReseña de XTTS-v2
BarkModelo TTS local basado en transformers con generación de audio expresivo/no verbalReseña de Bark

Esta lista refleja herramientas que se comparan comúnmente con openai-edge-tts en el espacio TTS local/autoalojado, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.

Preguntas frecuentes

¿Qué es openai-edge-tts?

openai-edge-tts (github.com/travisvn/openai-edge-tts) es un servidor API gratuito, de código abierto (GPL-3.0) y autoalojado que expone un endpoint /v1/audio/speech con el mismo formato que la API de texto a voz de OpenAI, respaldado por las voces gratuitas en línea de Microsoft Edge en lugar de un modelo de voz local.

¿openai-edge-tts es local o usa la nube?

Es híbrido, no totalmente local. El servidor en sí es autoalojado, pero cada solicitud de texto a voz se reenvía por internet al servicio de voz gratuito en línea "Leer en voz alta" de Microsoft Edge mediante la librería edge-tts.

¿openai-edge-tts es gratuito?

Sí, para uso personal. Es gratuito y de código abierto bajo GPL-3.0. El README indica que los despliegues empresariales/comerciales deben contactar directamente al autor, travisvn.

¿openai-edge-tts protege mi privacidad?

No de la forma en que lo hace un modelo local. Como la síntesis se reenvía al servicio de voz de Microsoft Edge, el texto que envías no se mantiene confinado a tu propio hardware — no lo uses para texto que no quieras que un servicio en la nube de terceros procese.

¿Cómo instalo openai-edge-tts?

El inicio rápido documentado es Docker: docker run -d -p 5050:5050 -e API_KEY=tu_clave_de_api -e PORT=5050 travisvn/openai-edge-tts:latest. El README de GitHub también documenta una configuración con docker-compose y una instalación directa con Python/pip.

¿Qué voces admite openai-edge-tts?

Asigna por defecto los seis nombres de voz estándar de OpenAI (alloy, echo, fable, onyx, nova, shimmer) a voces equivalentes de Microsoft Edge, y también permite seleccionar directamente cualquier voz de edge-tts, cubriendo muchos idiomas.

¿openai-edge-tts puede reemplazar a ElevenLabs o Azure AI Speech, no solo a OpenAI?

El proyecto añadió endpoints de compatibilidad directa beta para ElevenLabs y Azure AI Speech en la v2.0.0 (diciembre de 2024), junto a su endpoint principal en formato OpenAI. Verifica el comportamiento actual contra tu cliente específico antes de depender de esto en producción.

¿Quién creó openai-edge-tts?

Un desarrollador independiente conocido como travisvn creó y mantiene openai-edge-tts. El repositorio de GitHub se creó el 9 de octubre de 2024.

¿openai-edge-tts admite clonación de voz?

No. Solo ofrece las voces preestablecidas existentes de Microsoft Edge; no tiene ninguna función para entrenar o clonar una voz personalizada a partir de tus propias muestras de audio.

¿PromptQuorum ha probado de forma independiente las afirmaciones de openai-edge-tts?

Esta reseña se basa en el propio repositorio de GitHub, el README y las notas de versión del proyecto, y no en benchmarks prácticos de latencia o calidad de audio realizados por PromptQuorum.

Fuentes

← Volver a LLM locales avanzados