Principais conclusões
- Kokoro-82M: Apache-2.0, 82M parâmetros, roda via o framework MLX da Apple através do projeto comunitário mlx-audio — o caminho real de aceleração no Apple Silicon.
- Piper: GPL-3.0-or-later, somente-CPU por design via ONNX Runtime — mesmo perfil de desempenho em Macs Intel e Apple Silicon.
- XTTS v2: licença CPML não comercial, clonagem de voz a partir de ~6 segundos de áudio, mas o suporte Metal (MPS) é uma issue acompanhada e sem solução no GitHub — roda somente com CPU no Mac.
- Bark: licença MIT, suporte Apple Silicon MPS experimental atrás de uma variável de ambiente, sem commits em seu repositório público desde abril de 2024.
- Macs Intel não conseguem usar o caminho Kokoro acelerado por MLX de forma alguma — o MLX exige Apple Silicon.
📍 Em uma frase
Para texto para voz local no Apple Silicon, o Kokoro-82M é o único dos quatro principais mecanismos locais com um caminho real de GPU Metal (via o projeto comunitário mlx-audio sobre o framework MLX da Apple); o Piper é a opção somente-CPU mais simples, com comportamento idêntico em Macs Intel; o XTTS v2 oferece clonagem de voz, mas seu suporte MPS no Apple Silicon é uma issue documentada e quebrada no GitHub; e o suporte MPS do Bark é explicitamente experimental.
💬 Em termos simples
Nem todo programa gratuito de texto para voz que roda em um Mac realmente usa o chip gráfico do Mac — alguns simplesmente rodam no processador comum, o que funciona bem mas é mais lento do que poderia ser. O Kokoro é o que foi construído para aproveitar o design de chip da própria Apple através de um projeto chamado MLX; os outros ou pulam a GPU por design (Piper) ou tentam usá-la mas esbarram em problemas sem solução (XTTS v2, Bark).
📌Nota: Este guia compara os quatro mecanismos de TTS local que a PromptQuorum revisou de forma independente (Piper, Kokoro, XTTS v2, Bark). Cada um tem sua própria análise dedicada, referenciada ao longo do artigo, com comandos de instalação, detalhes de licenciamento e limitações completas.
Qual mecanismo de TTS local você deveria realmente instalar?
O mecanismo certo depende de você precisar de aceleração por GPU, clonagem de voz, ou a maior compatibilidade possível com Macs — nenhum mecanismo vence nos três aspectos. O Kokoro é o único aqui com um caminho real de GPU no Apple Silicon; o Piper é o mais portátil; o XTTS v2 é o único que clona vozes.
- 🏆 Melhor opção geral para Apple Silicon: Kokoro-82M via mlx-audio — o único mecanismo aqui com um caminho real de GPU Metal, pequeno o suficiente (82M parâmetros) para rodar confortavelmente em qualquer Mac Apple Silicon.
- Melhor opção para simplicidade e compatibilidade com Intel: Piper — somente-CPU por design, então instalação e desempenho são idênticos, seja em um chip série M ou em um Mac Intel mais antigo.
- Melhor opção se você precisa de clonagem de voz: XTTS v2 — clona uma voz a partir de ~6 segundos de áudio de referência, mas roda somente com CPU em qualquer Mac e é licenciado apenas para uso não comercial.
- Melhor opção para áudio expressivo não verbal: Bark — risadas, suspiros e música simples a partir de texto, com suporte de GPU Apple Silicon experimental (parcial), embora seu repositório esteja inativo desde abril de 2024.
Quem deveria usar qual mecanismo?
Combine o mecanismo com seu Mac e sua real necessidade, não com aquele que tem mais estrelas no GitHub. A aceleração por GPU só importa se você gera áudio suficiente, com frequência suficiente, para que a síntese somente-CPU pareça lenta.
- 🧭 Mac Apple Silicon, quer a opção local mais rápida: Kokoro via mlx-audio — o único mecanismo aqui escrito para usar Metal através do MLX.
- 🧭 Qualquer Mac, incluindo um modelo Intel mais antigo: Piper — somente-CPU por design, então não há nada específico do Apple Silicon para configurar ou resolver.
- 🧭 Precisa clonar uma voz específica a partir de uma gravação curta: XTTS v2 — aceite que ele rodará somente com CPU em um Mac, e que sua licença é não comercial.
- 🧭 Quer risadas, suspiros ou som ambiente, não apenas fala: Bark — mas reserve tempo extra de instalação para seu caminho experimental no Apple Silicon, e confirme antes o status de manutenção atual.
- ❌ Evite o Bark se você precisa de manutenção ativa ou desempenho garantido — seu repositório público não mostra commits desde abril de 2024, independentemente da questão do Apple Silicon.
- ❌ Evite o XTTS v2 se você está construindo um produto comercial — sua licença Coqui Public Model License (CPML) é não comercial, e a Coqui AI, a empresa que o lançou, encerrou seus serviços pagos em dezembro de 2023.
Como Piper, Kokoro, XTTS v2 e Bark se comparam na adequação ao Apple Silicon?
O Kokoro é o único mecanismo desta comparação com um caminho real, construído especificamente, para a GPU do Apple Silicon; os demais são somente-CPU por design ou por causa de um bug sem solução. A tabela abaixo pontua cada mecanismo nos quatro fatores que realmente definem a adequação a um Mac: se usa aceleração Apple Silicon, quanta memória exige, quanto atrito tem a instalação no macOS, e a qualidade de voz.
Mecanismo | Aceleração Apple Silicon | Uso de RAM | Instalação macOS | Qualidade de voz |
|---|---|---|---|---|
| Kokoro-82M | Sim — Metal via MLX (mlx-audio) | Baixo (82M param., há variantes quantiz.) | pip install + mlx-audio, só Apple Silicon | Natural, próxima de modelos cloud maiores |
| Piper | Nenhuma (design) — CPU, ONNX Runtime | Muito baixo (~50–100MB por voz) | pip install piper-tts, sem config de GPU | Clara, prosódia um pouco robótica |
| XTTS v2 | Nenhuma — MPS trava (issue GH #3649) | Moderado a alto (modelo de clonagem completo) | pip install coqui-tts, só CPU no Mac | Alta, clona uma voz específica |
| Bark | Experimental — SUNO_ENABLE_MPS=True | Alto (flag small-models para reduzir) | pip install do GitHub, sem pacote PyPI | Expressiva, não determinística |
As avaliações de qualidade de voz são descrições qualitativas baseadas na arquitetura documentada de cada mecanismo e nas análises dedicadas da PromptQuorum (referenciadas em cada linha), não um teste de audição às cegas conduzido pela PromptQuorum — nenhuma pontuação MOS (Mean Opinion Score) numérica ou número de benchmark é afirmado aqui.
Quais mecanismos realmente usam a GPU em um Mac?
Apenas o Kokoro tem um caminho real, construído especificamente, para a GPU Metal do Apple Silicon; o Piper evita a GPU por completo, por design, e tanto o XTTS v2 quanto o Bark têm suporte de GPU sem solução ou parcial no Mac. Este é o maior fator individual que separa esses mecanismos no Apple Silicon, e é fácil assumir que "roda em um Mac" significa "usa a GPU do Mac" — geralmente não é o caso.
- O Kokoro-82M roda através do framework MLX da própria Apple, via o projeto comunitário mlx-audio, que exige Apple Silicon e Python 3.10–3.12. O MLX é o framework de machine learning de código aberto da Apple, construído do zero para Metal na arquitetura de memória unificada do Apple Silicon — o mesmo framework coberto pelo guia de LLM local para Apple Silicon e pela comparação MLX vs. Ollama vs. llama.cpp para modelos de linguagem. Os pesos oficiais do Kokoro-82M, publicados pela hexgrad no Hugging Face, são nativamente um modelo PyTorch; o caminho MLX é um port da comunidade, não um lançamento oficial da Apple ou da hexgrad, e o mlx-audio também oferece variantes quantizadas (bf16, 8-bit, 4-bit) para menor uso de memória.
- O Piper nunca toca na GPU em nenhuma plataforma, Apple Silicon incluído — isso é design, não limitação. O Piper converte texto em fonemas com espeak-ng, depois sintetiza áudio com um modelo exportado para o ONNX Runtime para inferência rápida na CPU. Essa escolha de design é exatamente o motivo pelo qual o Piper roda em tempo real até em uma Raspberry Pi — veja a análise do Piper TTS da PromptQuorum para a arquitetura completa e os passos de instalação.
- O suporte Apple Silicon Metal (MPS) do XTTS v2 atualmente não funciona. Uma issue acompanhada no repositório coqui-ai/TTS no GitHub, intitulada "Unable to use xtts_v2 with mps device on Apple Silicon", documenta que tentar rodar o XTTS v2 no dispositivo MPS trava em vez de completar. O próprio projeto da Coqui não lista o suporte de GPU do Apple Silicon como oficialmente suportado. Na prática, isso significa que o XTTS v2 roda somente com CPU em um Mac, através do mesmo toolkit Coqui TTS (licenciado sob MPL-2.0) que o executa em outras plataformas.
- O Bark tem suporte Apple Silicon MPS experimental, protegido por uma variável de ambiente. Definir
SUNO_ENABLE_MPS=Trueativa a aceleração Metal, segundo discussões no repositório suno-ai/bark no GitHub, mas alguns operadores do PyTorch dos quais o Bark depende não estavam implementados para MPS no momento, causando fallback parcial para CPU nessas etapas. O Bark também suporta uma flagSUNO_USE_SMALL_MODELS=Trueespecificamente para reduzir a pressão de memória em Macs com menos memória unificada.
Como instalar o Kokoro com aceleração MLX em um Mac?
Este passo a passo instala o projeto comunitário mlx-audio para rodar o Kokoro-82M através do framework MLX da Apple, seguindo a configuração documentada no repositório mlx-audio no GitHub.
- 1Confirme que você está em um Apple Silicon com uma versão de Python compatível.
Why it matters: O mlx-audio exige um Mac Apple Silicon (chip série M) e Python 3.10–3.12; o MLX não roda em Macs Intel de forma alguma, então esse caminho é exclusivo do Apple Silicon. - 2Instale o mlx-audio.
Why it matters: Execute `pip install mlx-audio` em um ambiente virtual Python. Isso traz o próprio MLX (versão 0.31 ou posterior) junto com o pipeline de áudio. - 3Execute uma primeira síntese pela linha de comando.
Why it matters: O pacote traz um ponto de entrada de CLI que baixa os pesos do Kokoro-82M no primeiro uso e sintetiza um arquivo WAV a partir de uma string de texto — verifique o README atual do projeto para o comando exato, já que as flags da CLI podem mudar entre versões. - 4Escolha uma voz e, opcionalmente, uma variante de modelo quantizada.
Why it matters: O Kokoro-82M vem com 54 presets de voz em vários idiomas. O mlx-audio também oferece variantes quantizadas bf16, 8-bit e 4-bit — precisão menor troca um pouco de qualidade por uma pegada de memória menor, útil em um Mac com menos memória unificada. - 5Integre em sua própria aplicação Python.
Why it matters: Para qualquer uso além da síntese pontual via CLI, chame a API Python do mlx-audio diretamente em vez de invocar a CLI repetidamente, evitando o custo de recarregar o modelo a cada chamada.
O que muda em um Mac Intel?
Em um Mac Intel, o caminho Kokoro acelerado por MLX fica totalmente indisponível — o MLX exige Apple Silicon e não roda em hardware Intel de forma alguma. Todos os outros mecanismos cobertos aqui continuam funcionando em Intel, porque nenhum depende do Neural Engine da Apple ou de aceleração de GPU específica do Apple Silicon para funcionar; eles simplesmente rodam na CPU.
- O Piper não é afetado pela distinção Intel/Apple Silicon. Ele é somente-CPU por design em toda plataforma, então um Mac Intel tem desempenho comparável a um Mac Apple Silicon especificamente para o Piper, deixando de lado a geração do hardware.
- O Kokoro ainda roda em um Mac Intel através de seus pesos PyTorch oficiais, apenas sem o caminho de aceleração MLX. Você perde o caminho Metal específico do Apple Silicon via mlx-audio, mas o modelo em si (82M parâmetros) é pequeno o suficiente para rodar de forma aceitável na CPU.
- O XTTS v2 e o Bark rodam de forma idêntica em Macs Intel e Apple Silicon, já que ambos atualmente rodam somente com CPU em qualquer Mac de qualquer forma — o XTTS v2 porque o suporte MPS está quebrado, e o Bark porque o suporte MPS é experimental e parcial. Nenhum dos dois perde capacidade significativa ao migrar de Apple Silicon para Intel, já que nenhum tem um caminho acelerado maduro no Apple Silicon para começar.
Quando você não deveria usar nenhum desses mecanismos?
Nenhum dos quatro mecanismos desta comparação é a escolha certa para todo caso de uso de TTS em Mac — cada um tem situações em que outra ferramenta, ou uma API na nuvem, se encaixa melhor.
- ❌ Precisa de uma licença comercial garantida com vozes clonadas. A licença CPML do XTTS v2 é não comercial, sem um caminho ativo confirmado para uma licença comercial desde que a Coqui AI encerrou seus serviços pagos em dezembro de 2023 — veja a comparação com ElevenLabs da PromptQuorum para uma alternativa comercial gerenciada na nuvem.
- ❌ Precisa de manutenção ativa garantida. O repositório público do Bark no GitHub não mostra commits desde 5 de abril de 2024; se correções e atualizações contínuas importam para seu projeto, o Piper (mantido ativamente pela Open Home Foundation) ou o Kokoro (um ecossistema comunitário ativamente usado em torno do mlx-audio) são apostas mais seguras.
- ❌ Precisa de suporte de GPU de nível produção no Apple Silicon hoje, sem depender de um projeto comunitário. O caminho MLX do Kokoro passa por um projeto comunitário, não um lançamento oficial da Apple ou da hexgrad — trate-o como bom, mas não garantido por um fornecedor.
- ❌ Precisa de voz interativa em tempo real em memória Apple Silicon muito limitada (configurações básicas de 8GB) enquanto também roda um LLM local grande ao mesmo tempo. Empilhar um processo grande de XTTS v2 ou Bark junto a um LLM em um Mac com memória restrita pode ficar apertado; as pegadas pequenas do Piper e do Kokoro deixam mais margem.
Perguntas frequentes
Qual é o melhor mecanismo de TTS local para Macs Apple Silicon?
O Kokoro-82M, executado através do projeto comunitário mlx-audio, é a melhor escolha se você quer especificamente aceleração de GPU (Metal) no Apple Silicon via o framework MLX da própria Apple. Se você quer a instalação mais simples que funciona igual em qualquer Mac, o Piper é a melhor escolha, já que é somente-CPU por design em toda plataforma.
O Piper usa a GPU em um Mac?
Não. O Piper é somente-CPU por design em toda plataforma, incluindo Apple Silicon e Macs Intel. Ele converte texto em fonemas com espeak-ng e sintetiza áudio através do ONNX Runtime, por isso roda em tempo real até em uma Raspberry Pi sem nenhuma GPU.
O Kokoro-82M pode rodar no Apple Silicon com aceleração por GPU?
Sim, através do projeto comunitário mlx-audio, que executa o Kokoro-82M via o framework MLX da própria Apple — construído especificamente para Metal na arquitetura de memória unificada do Apple Silicon. Os pesos oficiais do Kokoro-82M da hexgrad são um modelo PyTorch; o caminho MLX é um port da comunidade, não um lançamento oficial, e exige um Mac Apple Silicon (Macs Intel não conseguem usá-lo) e Python 3.10–3.12.
O XTTS v2 funciona no Apple Silicon?
Ele roda, mas somente com CPU. O suporte ao dispositivo Metal (MPS) do XTTS v2 é uma issue documentada e sem solução, acompanhada no repositório coqui-ai/TTS no GitHub (issue #3649), onde tentar usar o dispositivo MPS trava em vez de completar. O projeto da Coqui não suporta oficialmente a aceleração de GPU do Apple Silicon para o XTTS v2, então espere desempenho somente-CPU em qualquer Mac.
O Bark é acelerado no Apple Silicon?
Parcialmente, e de forma experimental. Definir a variável de ambiente SUNO_ENABLE_MPS=True ativa a aceleração de GPU Metal para o Bark, mas alguns operadores do PyTorch dos quais ele depende não foram implementados para MPS, então algumas etapas de processamento ainda recaem na CPU. Os próprios mantenedores do Bark descrevem esse suporte como experimental, não pronto para produção.
Posso usar algum desses mecanismos em um Mac Intel?
Piper, XTTS v2 e Bark rodam todos em Macs Intel, já que nenhum deles exige aceleração específica do Apple Silicon para funcionar — eles rodam somente com CPU, seja por design (Piper) ou porque seus caminhos de aceleração de GPU estão de qualquer forma sem solução ou são parciais (XTTS v2, Bark). O caminho acelerado por MLX do Kokoro exige especificamente Apple Silicon e não roda em um Mac Intel de forma alguma, embora os pesos PyTorch oficiais do Kokoro ainda rodem em Intel sem aceleração MLX.
Qual desses mecanismos consegue clonar uma voz específica?
Apenas o XTTS v2, entre os quatro cobertos aqui, clona uma voz a partir de um clipe de áudio de referência curto (a partir de apenas 6 segundos, segundo sua ficha oficial de modelo). Piper, Kokoro e Bark usam vozes pré-treinadas ou predefinidas, em vez de clonar uma voz arbitrária na hora. Veja a análise dedicada do XTTS v2 da PromptQuorum para detalhes completos de clonagem e licenciamento.
Algum desses mecanismos de TTS local exige uma licença paga para uso em Mac Apple Silicon?
Nenhum mecanismo coberto aqui cobra especificamente pelo uso em macOS ou Apple Silicon. Piper (GPL-3.0-or-later), Kokoro (Apache-2.0) e Bark (MIT) são todos softwares gratuitos e de código aberto, independentemente da plataforma. O XTTS v2 é gratuito para uso, mas sob uma licença não comercial (CPML) — essa restrição se aplica igualmente no Apple Silicon, Intel, Windows ou Linux, e não tem relação com qual Mac você usa.
Veredito
Especificamente no Apple Silicon, o Kokoro-82M se destaca porque é o único desses quatro mecanismos com um caminho real, construído especificamente, para a GPU Metal do Mac, através do projeto comunitário mlx-audio construído sobre o framework MLX da própria Apple — e é pequeno o suficiente (82 milhões de parâmetros, licenciado sob Apache-2.0) para que valha a pena configurar essa aceleração. O Piper continua sendo a escolha padrão certa quando simplicidade e consistência entre diferentes hardwares importam mais do que velocidade bruta: ele é somente-CPU em todo lugar, então não há nada específico do Apple Silicon para configurar, resolver, ou temer que regrida em um Mac Intel. O XTTS v2 vale a perda de desempenho somente-CPU apenas se você precisa especificamente de clonagem de voz e pode conviver com sua licença não comercial; o Bark merece consideração apenas por seus sons distintos não verbais, com a ressalva de que tanto sua aceleração no Apple Silicon quanto seu status geral de manutenção permanecem incertos. Na dúvida, comece com o Piper para a instalação mais simples, migre para o Kokoro via mlx-audio assim que confirmar que quer a aceleração Metal, e recorra ao XTTS v2 apenas quando a clonagem de voz for um requisito rígido.
Fontes
- Kokoro-82M no Hugging Face — a ficha oficial do modelo: parâmetros, licença e arquitetura.
- mlx-audio no GitHub — o projeto comunitário que executa o Kokoro-82M via o framework MLX da Apple no Apple Silicon.
- Issue #3649 do coqui-ai/TTS no GitHub — "Unable to use xtts_v2 with mps device on Apple Silicon", que documenta a travada não resolvida do MPS.
- Repositório suno-ai/bark no GitHub — issues e pull requests que documentam o suporte experimental Apple Silicon MPS via SUNO_ENABLE_MPS.
- Framework MLX da Apple — o framework oficial de machine learning de código aberto da Apple, com aceleração nativa de GPU Metal para Apple Silicon.
- Análise do Piper TTS — a análise dedicada da PromptQuorum, incluindo comandos de instalação e histórico de licenciamento.
- Análise do XTTS v2, Análise do Coqui TTS e Análise do Bark TTS — as análises dedicadas da PromptQuorum dos demais mecanismos cobertos aqui.
