Conclusiones clave
- openai-edge-tts (github.com/travisvn/openai-edge-tts) es un servidor API gratuito, de código abierto y autoalojado — no un modelo de voz local
- Creado por el desarrollador travisvn; el repositorio se creó el 9 de octubre de 2024
- Con licencia GPL-3.0, confirmada en el campo de licencia del repositorio de GitHub
- Expone
/v1/audio/speech, con el mismo formato de solicitud/respuesta que la API de texto a voz de OpenAI, así que el código cliente existente para OpenAI-TTS puede apuntar a él solo cambiando la URL base - La síntesis se reenvía a las voces gratuitas en línea "Leer en voz alta" de Microsoft Edge mediante la librería Python
edge-tts— no se ejecuta ningún modelo de voz local en tu hardware - Más de 2.100 estrellas y 316 forks en GitHub al momento de esta reseña
📍 En una frase
openai-edge-tts es un servidor API gratuito y de código abierto (GPL-3.0) creado por travisvn que expone un endpoint /v1/audio/speech compatible con OpenAI, pero en lugar de ejecutar un modelo de voz local, reenvía cada solicitud a las voces gratuitas en línea de Microsoft Edge mediante la librería edge-tts.
💬 En términos simples
Es un servidor pequeño que ejecutas tú mismo (normalmente en Docker) que hace que las herramientas de texto a voz creadas para la API de OpenAI funcionen contra una fuente de voz gratuita — pero el "habla" real ocurre en los servidores de Microsoft, no en tu equipo. Si la privacidad frente a Microsoft te importa para tu texto, esta herramienta no la ofrece; si el problema que resuelves es el costo de la API TTS de OpenAI/Azure/ElevenLabs, sí lo hace.
📌Nota: Esta reseña se basa en el propio repositorio de GitHub, el README y las notas de versión de openai-edge-tts. No afirma que PromptQuorum haya realizado benchmarks prácticos de latencia o calidad frente a las voces subyacentes de Microsoft Edge.
¿Qué es openai-edge-tts?
openai-edge-tts es un servidor API autoalojado que imita la API de texto a voz de OpenAI, de modo que las herramientas creadas para llamar a OpenAI, Azure AI Speech o ElevenLabs puedan apuntar a él en su lugar, sin una factura por solicitud. Lo logra envolviendo la librería edge-tts, que a su vez se comunica por internet con el servicio de voz "Leer en voz alta" gratuito y basado en navegador de Microsoft Edge.
- Tipo de producto: un servidor API autoalojado (Docker o Python), no una app de usuario final descargable ni un modelo de voz local
- Creador: travisvn, un desarrollador independiente; el repositorio de GitHub está en github.com/travisvn/openai-edge-tts
- Repositorio creado el 9 de octubre de 2024, según los metadatos del repositorio de GitHub
- Licencia: GPL-3.0, confirmada mediante los metadatos de licencia del repositorio de GitHub; el README también indica que los despliegues empresariales/comerciales deben contactar directamente al autor
- Localidad: híbrida, no local — el proceso del servidor es autoalojado, pero la síntesis de texto a voz en sí se reenvía al servicio de voz en línea de Microsoft Edge, no se calcula en tu propio hardware
- Escala: más de 2.100 estrellas y 316 forks en GitHub al momento de esta reseña
Historia del proyecto y versiones clave
El repositorio de GitHub se creó el 9 de octubre de 2024, y su hito de lanzamiento público más importante es la v2.0.0, publicada el 28 de diciembre de 2024, que añadió filtrado de markdown, compatibilidad beta con los endpoints de ElevenLabs/Azure AI Speech y una configuración simplificada.
- 19 de octubre de 2024: se crea el repositorio
Why it matters: Marca el inicio del proyecto, según los metadatos del repositorio de GitHub. - 2v2.0.0 — 28 de diciembre de 2024: filtrado de markdown, soporte de API ampliado, configuración simplificada
Why it matters: Añadió filtrado opcional de markdown en el texto de salida, compatibilidad beta directa con los endpoints de ElevenLabs y Azure AI Speech (junto al endpoint existente en formato OpenAI), y volvió opcional el prefijo de ruta `/v1`, según las notas de versión oficiales de GitHub.
¿Qué hace realmente openai-edge-tts?
openai-edge-tts recibe una solicitud de texto a voz en el formato de la API de OpenAI, asigna la voz y los ajustes solicitados a una voz equivalente de Microsoft Edge, obtiene el audio sintetizado del servicio en línea de Microsoft mediante la librería edge-tts, y lo devuelve en el formato que el cliente espera.
- Endpoint compatible con OpenAI:
/v1/audio/speech(el prefijo/v1es opcional desde la v2.0.0), con el mismo formato de solicitud/respuesta TTS de OpenAI, de modo que el código cliente existente solo necesita cambiar la URL base - Asignación de voces: los nombres de voz de OpenAI (alloy, echo, fable, onyx, nova, shimmer) se asignan por defecto a voces específicas de edge-tts; el README también documenta la selección directa de cualquier voz de edge-tts, evitando la asignación por nombre de OpenAI
- Capas de compatibilidad beta: endpoints directos que imitan las API de ElevenLabs y Azure AI Speech, además del endpoint principal en formato OpenAI, introducidos en la v2.0.0
- Formatos de audio: salida en mp3, opus, aac, flac, wav y pcm, según el README
- Streaming: streaming por eventos enviados por el servidor (SSE) con fragmentos de audio codificados en base64, para clientes que prefieren audio incremental en vez de esperar un archivo completo
- Control de velocidad: velocidad de reproducción ajustable de 0,25x a 4,0x
- Filtrado opcional de markdown: elimina por defecto la sintaxis markdown del texto de entrada antes de sintetizarlo, ya que el texto de origen (por ejemplo, la respuesta de un LLM) suele contener markdown que no debería leerse literalmente; se puede desactivar mediante una variable de entorno
REMOVE_FILTER - Configuración: un archivo
.envdefine la clave de API, el puerto (5050 por defecto), la voz predeterminada, la velocidad predeterminada y el idioma predeterminado
Ejemplos de uso: dos formas de usar openai-edge-tts
Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas del proyecto descritas arriba.
Instalar openai-edge-tts
openai-edge-tts se instala gratis vía Docker (recomendado) o directamente con Python, y su código fuente está en GitHub.
Fuente | Enlace |
|---|---|
| Imagen Docker (Docker Hub) | travisvn/openai-edge-tts |
| Repositorio GitHub (código fuente, GPL-3.0) | github.com/travisvn/openai-edge-tts |
| Muestras de voz / sitio del proyecto | tts.travisvn.com |
Inicio rápido con Docker: docker run -d -p 5050:5050 -e API_KEY=tu_clave_de_api -e PORT=5050 travisvn/openai-edge-tts:latest. El README también documenta una configuración con docker-compose con soporte opcional de FFmpeg y una vía directa de instalación con Python/pip — verifica los comandos actuales en GitHub antes de ejecutarlos, ya que las instrucciones de instalación pueden cambiar entre versiones.
Plataforma, precio y licencia
Plataforma
- Lo que indica openai-edge-tts:
- Un servidor API autoalojado (Docker o Python) — sin GUI, sin app de usuario final descargable; funciona en cualquier host que pueda ejecutar Docker o Python.
Costo
- Lo que indica openai-edge-tts:
- Gratis y de código abierto para uso personal. El README indica que los despliegues empresariales/comerciales deben contactar directamente al autor (travisvn).
Licencia
- Lo que indica openai-edge-tts:
- GPL-3.0, confirmada mediante los metadatos de licencia del repositorio de GitHub.
Método de instalación
- Lo que indica openai-edge-tts:
- Docker (
docker runo docker-compose) es la vía principal documentada; también se documenta una vía con entorno virtual de Python + pip para ejecutarlo sin Docker.
Verifica la licencia actual y los términos de uso comercial directamente en el repositorio de GitHub antes de desplegarlo a escala organizacional, ya que la nota de contacto empresarial del README es una intención declarada, no un texto de licencia comercial publicado por separado que esta reseña pudiera verificar de forma independiente.
openai-edge-tts vs. Piper TTS
openai-edge-tts y Piper TTS resuelven el mismo problema de "endpoint TTS gratuito compatible con OpenAI" de formas opuestas: uno reenvía a un servicio de voz gratuito en la nube, el otro ejecuta un modelo TTS neuronal real por completo en tu propio hardware. Se comparan porque ambos aparecen en las mismas búsquedas de "cómo añado TTS gratuito a mi stack de IA autoalojado".
Aspecto | openai-edge-tts | Piper TTS |
|---|---|---|
| Dónde ocurre la síntesis | En el servicio de voz de Microsoft Edge, por red | Totalmente en tu propia CPU, sin llamadas de red |
| Localidad | Híbrida — servidor autoalojado, síntesis dependiente de la nube | Totalmente local — funciona sin conexión tras descargar el modelo |
| Calidad/estilo de voz | Voces en línea de calidad comercial de Microsoft Edge, muchos idiomas | Modelos de voz neuronal más pequeños, calidad variable por voz, descarga por voz |
| Riesgo de dependencia | Depende de que Microsoft siga ofreciendo este servicio gratuito | Depende solo de que el archivo de modelo descargado siga funcionando |
| Licencia | GPL-3.0 | MIT |
Si enviar texto a Microsoft es aceptable para tu caso de uso y quieres una amplia gama de voces pulidas sin costo de cómputo local, openai-edge-tts es el camino más simple. Si la síntesis debe permanecer por completo en hardware que controlas, Piper TTS (u otro motor genuinamente local) es la opción correcta, no esta herramienta.
¿Quién debería usar openai-edge-tts?
openai-edge-tts es adecuado para desarrolladores que quieren eliminar el costo por solicitud de una API TTS comercial sin renunciar a una integración con forma de OpenAI, y que están dispuestos a que el texto se envíe al servicio de voz de Microsoft Edge.
Para qué no sirve openai-edge-tts
openai-edge-tts no es adecuado si necesitas una síntesis de voz genuinamente local, sin conexión o sensible a la privacidad.
- No funciona sin conexión — cada solicitud de síntesis requiere una conexión a internet funcional para alcanzar el servicio de voz de Microsoft Edge; no funcionará en una máquina aislada de la red
- No es privado como lo es un modelo local — el texto enviado para sintetizar llega a los servidores de Microsoft, así que esta herramienta no mantiene el texto sintetizado confinado a tu propio hardware
- No está respaldado por una API oficial y documentada de Microsoft — depende del mismo mecanismo gratuito de voz "Leer en voz alta" que usa el navegador Edge, que Microsoft podría cambiar o restringir sin previo aviso; el propio README no documenta un límite de tasa formal ni una garantía de términos de servicio para esta dependencia
- No es una herramienta de clonación de voz — solo ofrece las voces preestablecidas existentes de Microsoft Edge, sin soporte para entrenar o clonar una voz personalizada a partir de tu propio audio
- No tiene licencia comercial por defecto — el README pide a los despliegues empresariales/comerciales que contacten directamente al autor en lugar de asumir que los términos GPL-3.0 por sí solos cubren ese caso de uso
Errores comunes al evaluar openai-edge-tts
La mayor parte de la confusión sobre openai-edge-tts viene de asumir que se comporta como un modelo local por ser autoalojado, o de pasar por alto el estado beta de sus modos de endpoint que no son de OpenAI.
Competidores y alternativas
openai-edge-tts se compara más a menudo con motores de texto a voz genuinamente locales y sin conexión que también exponen un endpoint compatible con OpenAI — su principal diferencia es intercambiar la privacidad total sin conexión por la selección de voces más amplia y pulida de Microsoft Edge a costo de cómputo local cero.
Herramienta | Conocida por | Enlace |
|---|---|---|
| Piper TTS | Motor TTS neuronal rápido, totalmente local y solo con CPU del proyecto Rhasspy | Reseña de Piper TTS |
| Coqui TTS | Kit de herramientas TTS local de código abierto con clonación de voz y muchos idiomas | Reseña de Coqui TTS |
| XTTS-v2 | Modelo TTS local de clonación de voz sin muestras previas de Coqui | Reseña de XTTS-v2 |
| Bark | Modelo TTS local basado en transformers con generación de audio expresivo/no verbal | Reseña de Bark |
Esta lista refleja herramientas que se comparan comúnmente con openai-edge-tts en el espacio TTS local/autoalojado, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.
Preguntas frecuentes
¿Qué es openai-edge-tts?
openai-edge-tts (github.com/travisvn/openai-edge-tts) es un servidor API gratuito, de código abierto (GPL-3.0) y autoalojado que expone un endpoint /v1/audio/speech con el mismo formato que la API de texto a voz de OpenAI, respaldado por las voces gratuitas en línea de Microsoft Edge en lugar de un modelo de voz local.
¿openai-edge-tts es local o usa la nube?
Es híbrido, no totalmente local. El servidor en sí es autoalojado, pero cada solicitud de texto a voz se reenvía por internet al servicio de voz gratuito en línea "Leer en voz alta" de Microsoft Edge mediante la librería edge-tts.
¿openai-edge-tts es gratuito?
Sí, para uso personal. Es gratuito y de código abierto bajo GPL-3.0. El README indica que los despliegues empresariales/comerciales deben contactar directamente al autor, travisvn.
¿openai-edge-tts protege mi privacidad?
No de la forma en que lo hace un modelo local. Como la síntesis se reenvía al servicio de voz de Microsoft Edge, el texto que envías no se mantiene confinado a tu propio hardware — no lo uses para texto que no quieras que un servicio en la nube de terceros procese.
¿Cómo instalo openai-edge-tts?
El inicio rápido documentado es Docker: docker run -d -p 5050:5050 -e API_KEY=tu_clave_de_api -e PORT=5050 travisvn/openai-edge-tts:latest. El README de GitHub también documenta una configuración con docker-compose y una instalación directa con Python/pip.
¿Qué voces admite openai-edge-tts?
Asigna por defecto los seis nombres de voz estándar de OpenAI (alloy, echo, fable, onyx, nova, shimmer) a voces equivalentes de Microsoft Edge, y también permite seleccionar directamente cualquier voz de edge-tts, cubriendo muchos idiomas.
¿openai-edge-tts puede reemplazar a ElevenLabs o Azure AI Speech, no solo a OpenAI?
El proyecto añadió endpoints de compatibilidad directa beta para ElevenLabs y Azure AI Speech en la v2.0.0 (diciembre de 2024), junto a su endpoint principal en formato OpenAI. Verifica el comportamiento actual contra tu cliente específico antes de depender de esto en producción.
¿Quién creó openai-edge-tts?
Un desarrollador independiente conocido como travisvn creó y mantiene openai-edge-tts. El repositorio de GitHub se creó el 9 de octubre de 2024.
¿openai-edge-tts admite clonación de voz?
No. Solo ofrece las voces preestablecidas existentes de Microsoft Edge; no tiene ninguna función para entrenar o clonar una voz personalizada a partir de tus propias muestras de audio.
¿PromptQuorum ha probado de forma independiente las afirmaciones de openai-edge-tts?
Esta reseña se basa en el propio repositorio de GitHub, el README y las notas de versión del proyecto, y no en benchmarks prácticos de latencia o calidad de audio realizados por PromptQuorum.