Principais conclusões
- Kokoro-82M: 82 milhões de parâmetros, licença Apache 2.0, arquitetura derivada do StyleTTS2, lançado pela hexgrad (huggingface.co/hexgrad/Kokoro-82M).
- 54 vozes integradas em 8 idiomas (inglês, espanhol, francês, hindi, italiano, japonês, português, chinês) — sem clonagem de voz oficial em tempo real a partir de uma amostra de referência.
- Roda em CPU ou GPU modesta; não precisa de conexão com a internet depois que o modelo e os pacotes de voz são baixados.
- ElevenLabs: plataforma em nuvem paga, do plano gratuito (10.000 créditos/mês, sem licença comercial) até o Business (US$ 990/mês, 6.000.000 créditos) — verifique planos e custos de créditos atuais na página de preços do ElevenLabs antes de decidir.
- O ElevenLabs oferece clonagem de voz zero-shot a partir de um clipe de referência curto a partir dos planos pagos; o Kokoro não inclui esse recurso de fábrica.
- Não há relação de afiliação entre a PromptQuorum e Kokoro/hexgrad; quaisquer links do ElevenLabs neste artigo são divulgados conforme o aviso de afiliação no topo da página.
📍 Em uma frase
O Kokoro é um modelo TTS local gratuito de pesos abertos com 82 milhões de parâmetros (Apache 2.0, da hexgrad) que roda localmente com 54 vozes fixas; o ElevenLabs é uma plataforma em nuvem paga com um catálogo de vozes maior e clonagem de voz.
💬 Em termos simples
O Kokoro é um software que você baixa e executa gratuitamente no seu próprio computador, com uma lista fixa de vozes para escolher. O ElevenLabs é um serviço por assinatura que você usa por navegador ou API e que também consegue copiar a voz de uma pessoa específica a partir de uma gravação curta.
📌Nota: Os fatos foram verificados com base na ficha do modelo Kokoro-82M no Hugging Face e na página pública de preços do ElevenLabs na data de publicação deste artigo. Ambos podem mudar — verifique os termos atuais antes de se comprometer com qualquer uma das opções.
O Kokoro é um modelo de texto para voz de pesos abertos lançado pelo desenvolvedor pseudônimo hexgrad. Com 82 milhões de parâmetros, ele é pequeno em comparação com a maioria dos sistemas TTS modernos, mas análises independentes e benchmarks da comunidade no Hugging Face o descrevem como superior ao seu número de parâmetros em qualidade de áudio percebida — porém a PromptQuorum não realizou seus próprios testes cegos de audição, então trate comparações de qualidade como direcionais, não medidas. A arquitetura deriva do StyleTTS 2, combinada com um vocoder no estilo ISTFTNet em um design somente de decodificador, o que explica em parte por que ele consegue rodar confortavelmente em CPU ou GPU intermediária em vez de exigir um grande acelerador.
O ElevenLabs é uma plataforma de voz hospedada. Seus planos combinam texto para voz com outros recursos de voz e mídia; os créditos são compartilhados entre produtos. O plano gratuito lista 10.000 créditos por mês, enquanto os planos pagos adicionam acesso a licença comercial, clonagem de voz profissional e instantânea, e cotas mais altas. Consulte a página de preços do ElevenLabs ao vivo antes de confiar em qualquer número específico, porque planos e custos de créditos mudam.
A decisão real não é "qual voz soa melhor?" É: você quer um modelo gratuito que você baixa uma vez e opera sozinho com um conjunto fixo de vozes, ou um serviço pago que oferece clonagem e uma biblioteca de vozes maior em troca de uma assinatura e do envio do seu texto para um servidor de terceiros?
Nosso veredito
🏆 Melhor TTS gratuito/offline: Kokoro — um modelo de 82M de parâmetros licenciado sob Apache 2.0 que você mesmo opera, sem custo por caractere. 💰 Melhor para clonagem de voz: ElevenLabs — clonagem zero-shot a partir de um clipe de referência curto nos planos pagos. ⚡ Melhor para uma voz polida hoje, sem instalação: ElevenLabs. 🖥️ Melhor para hardware somente CPU ou GPU modesta: Kokoro. 🔒 Melhor para manter texto e áudio fora de servidores de terceiros: Kokoro (uma vez baixado e executado totalmente offline). 🌍 Melhor para cobertura máxima de idiomas: ElevenLabs — verifique a documentação atual para o número exato; o Kokoro cobre 8 idiomas no nível do modelo.
Para desenvolvedores e entusiastas com orçamento limitado que não precisam de clonagem de voz, comece com o Kokoro. Para criadores e empresas que precisam de uma voz clonada, suporte mais amplo a idiomas, ou resultados hoje sem instalar nada, comece com o plano gratuito do ElevenLabs.
Escolha sua abordagem de TTS
Use um LLM local se:
- •Você quer geração gratuita e ilimitada sem cobrança por caractere.
- •O pipeline precisa funcionar totalmente offline depois de configurado — quiosques, dispositivos embarcados, sistemas isolados.
- •Você está satisfeito escolhendo entre um conjunto fixo de 54 vozes em vez de clonar uma específica.
Use um modelo em nuvem se:
- •Você precisa clonar uma voz específica a partir de uma amostra de referência curta.
- •Você quer a maior cobertura de idiomas e sotaques sem verificar você mesmo as listas de idiomas no nível do modelo.
- •Você precisa de uma voz hoje e não quer instalar nada nem gerenciar um modelo.
Decisão rápida:
- →Para clonagem de voz ou máximo acabamento com zero configuração: o ElevenLabs vence.
- →Para geração gratuita, offline e de vozes fixas: o Kokoro vence.
- →Para geração de alto volume em que o preço da nuvem por uso se acumula: o Kokoro costuma ser mais barato depois de configurado.
Resumo geral
Situação | Melhor opção | Motivo |
|---|---|---|
| Você precisa de uma narração natural hoje, sem instalação | ElevenLabs | Sem download de modelo, sem configuração local. Geração em navegador ou via API em minutos. |
| Você precisa clonar a voz de uma pessoa específica a partir de uma amostra | ElevenLabs | O Kokoro não clona vozes; o ElevenLabs sim, em planos pagos, com requisitos de consentimento. |
| Você quer TTS gratuito e sem medição para um projeto paralelo ou app | Kokoro | Licenciado sob Apache 2.0, sem assinatura, sem créditos por caractere após baixado e em execução. |
| Você está construindo um recurso de voz offline ou embarcado | Kokoro | Roda em CPU ou GPU modesta sem conexão com a internet após a configuração. |
| Você precisa de dezenas de idiomas/sotaques sem verificar a cobertura você mesmo | ElevenLabs | Lista suporte a idiomas mais amplo em seu site; o Kokoro está documentado para 8 idiomas no nível do modelo. |
| Você gera um alto volume de áudio todo mês | O Kokoro pode ser mais barato | Sem custo por caractere após o hardware estar em uso; os créditos por uso do ElevenLabs escalam com o volume. |
| Você quer ajustar, auto-hospedar ou auditar totalmente o modelo | Kokoro | Os pesos Apache 2.0 podem ser baixados e inspecionados; o ElevenLabs é uma plataforma fechada e hospedada. |
O que é o Kokoro e em que ele é diferente do ElevenLabs?
O Kokoro é um pequeno modelo de texto para voz de pesos abertos — não uma empresa, suíte de produtos ou plataforma hospedada. É um único conjunto de pesos de modelo (atualmente distribuído como Kokoro-82M) que você baixa do Hugging Face e executa com um script de inferência, um wrapper da comunidade, ou uma versão quantizada em GGUF/ONNX. Não há conta, painel ou assinatura — o "produto" inteiro é o arquivo do modelo mais o código que o executa.
- Parâmetros: 82 milhões — pequeno o suficiente para rodar confortavelmente em CPU ou GPU intermediária, diferente de sistemas TTS que precisam de aceleradores dedicados.
- Licença: Apache 2.0 — permissiva, permite uso comercial, modificação e redistribuição sem os requisitos de copyleft de uma licença como a GPL.
- Arquitetura: derivada do StyleTTS 2, combinada com um vocoder no estilo ISTFTNet em um design somente de decodificador — sem processo de difusão, sem uma pilha de codificador pesada.
- Vozes: 54 pacotes de voz integrados enviados com o modelo, abrangendo 8 idiomas (inglês, espanhol, francês, hindi, italiano, japonês, português, chinês) no nível do modelo.
- Clonagem de voz: não é um recurso oficial integrado. Existem projetos comunitários de terceiros que adicionam clonagem zero-shot em cima do Kokoro, mas são complementos separados e não oficiais — não é algo que a hexgrad ou o modelo base ofereça ou suporte.
- Distribuição: a ficha do modelo e os pesos estão no Hugging Face em hexgrad/Kokoro-82M; versões quantizadas e ONNX da comunidade também estão disponíveis para implantações mais leves.
Publicidade
Pelo que você paga com o ElevenLabs
Precisa de uma voz clonada ou polida hoje, sem instalação local? Comece com o plano gratuito do ElevenLabs — 10.000 créditos mensais, sem necessidade de cartão. Testar o ElevenLabs gratuitamente →
O ElevenLabs elimina várias tarefas que ficam com você ao rodar o Kokoro por conta própria:
Nenhum modelo ou runtime para gerenciar
- O que muda na prática:
- Você não baixa pesos, não instala uma pilha de inferência nem resolve dependências de áudio
Clonagem de voz
- O que muda na prática:
- Você pode clonar uma voz a partir de um clipe de referência curto nos planos pagos — um recurso que o Kokoro não oferece
Biblioteca de vozes maior e selecionada
- O que muda na prática:
- Você escolhe entre um catálogo maior que as 54 vozes predefinidas fixas do Kokoro
Suporte a idiomas documentado mais amplo
- O que muda na prática:
- Verifique a documentação atual do ElevenLabs para o número exato; provavelmente mais amplo que os 8 idiomas do Kokoro no nível do modelo
Escalonamento hospedado
- O que muda na prática:
- O fornecedor opera a infraestrutura em vez de você gerenciar GPU, servidor, atualizações e monitoramento
Recursos de produção
- O que muda na prática:
- Os planos pagos podem incluir acesso a licença comercial e ferramentas adicionais; verifique os termos do plano aplicáveis à sua conta
•Key Point: O ElevenLabs atualmente lista: Free (US$ 0, 10.000 créditos/mês, sem licença comercial), Starter (US$ 6/mês, 30.000 créditos, licença comercial e clonagem de voz instantânea incluídas), Creator (US$ 22/mês, 121.000 créditos, clonagem de voz profissional), Pro (US$ 99/mês, 600.000 créditos, áudio de maior qualidade a 192 kbps), Scale (US$ 299/mês, 1.800.000 créditos), e Business (US$ 990/mês, 6.000.000 créditos). Os planos Enterprise usam preços personalizados. A cobrança anual reduz o preço mensal efetivo. O uso de texto para voz consome créditos compartilhados, e o custo exato em créditos depende do modelo e do fluxo de trabalho selecionados — confirme os números atuais na página de preços do ElevenLabs ao vivo antes de decidir.
•Key Point: Em 7 de maio de 2026, o ElevenLabs reduziu seus preços de API de autoatendimento — Text to Speech em até 55%, Speech to Text em até 45%, e ElevenAgents em até 20% — e introduziu créditos pré-pagos por uso para desenvolvedores que não querem uma assinatura mensal. Fonte: ElevenLabs — We've lowered API & Agents pricing and introduced PAYG.
O que rodar o Kokoro sozinho realmente custa
Quer TTS local gratuito e ilimitado sem exigência de clonagem? O Kokoro é um dos modelos TTS pequenos de pesos abertos mais acessíveis para colocar em funcionamento. Explorar o Kokoro-82M no Hugging Face →
Os pesos do modelo Kokoro custam US$ 0 sob a licença Apache 2.0, mas "gratuito" é apenas um item na lista quando você realmente o implanta:
Hardware
- O que significa:
- Uma máquina somente CPU funciona para cargas mais leves; uma GPU modesta acelera a geração e requisições simultâneas
Instalação
- O que significa:
- Você instala um ambiente Python, o código de inferência ou um wrapper, e baixa o modelo e os pacotes de voz
Seleção de voz
- O que significa:
- Você fica limitado às 54 vozes integradas — não é possível clonar sua própria voz ou a de um cliente sem um complemento de terceiros
Sem API hospedada oficial
- O que significa:
- Não existe um endpoint oficial operado pela hexgrad; você faz auto-hospedagem ou usa um fornecedor terceiro rodando os mesmos pesos abertos
Operações
- O que significa:
- Atualizações, segurança, armazenamento, registros, monitoramento e escalonamento são de sua responsabilidade
Confiabilidade
- O que significa:
- Você assume os modos de falha: conflitos de dependências, problemas de driver e latência sob carga simultânea
•Key Point: O Kokoro troca uma assinatura por tempo de configuração inicial e responsabilidade contínua. É uma boa troca para desenvolvedores que querem geração gratuita, ilimitada e com capacidade offline e não precisam de clonagem de voz. É uma má troca se você precisa de uma voz clonada ou quer publicar resultados hoje sem nenhuma configuração.
Kokoro vs ElevenLabs: lado a lado
Dimensão | Kokoro | ElevenLabs |
|---|---|---|
| Tipo de produto | Modelo local de pesos abertos (82M de parâmetros) | Plataforma em nuvem gerenciada |
| Custo | Gratuito (Apache 2.0); você fornece o hardware | Plano gratuito, depois planos pagos de US$ 6 a US$ 990+/mês |
| Configuração | Instalar um ambiente Python, baixar pesos e vozes | Criar uma conta e gerar — sem instalação |
| Requisito de internet | Nenhum após o download do modelo/vozes | O uso normal requer conectividade com o serviço |
| Computação | CPU ou GPU modesta — leve para sua qualidade de saída | Operado pelo fornecedor |
| Catálogo de vozes | 54 vozes fixas integradas | Biblioteca de vozes hospedada, maior e selecionada, além de ferramentas de design de voz |
| Clonagem de voz | Não é um recurso oficial integrado (existem complementos comunitários não oficiais) | Clonagem zero-shot/instantânea a partir de uma amostra curta nos planos pagos |
| Cobertura de idiomas | 8 idiomas documentados no nível do modelo | Cobertura documentada mais ampla — verificar documentação atual para o número exato |
| Controle de privacidade | Texto e áudio podem permanecer inteiramente no seu dispositivo depois de configurado | Regido pelos termos do fornecedor, configurações de conta e práticas de dados atuais |
| Uso comercial | A Apache 2.0 permite uso comercial do modelo em si | Verifique seu plano — o acesso a licença comercial está vinculado aos níveis pagos |
| Licença | Apache 2.0 (permissiva) | Serviço proprietário; uso regido pelos termos de serviço |
| Melhor uso | Desenvolvedores e entusiastas que querem TTS gratuito, offline e de vozes fixas | Criadores e empresas que precisam de clonagem, acabamento e velocidade sem configuração |
A reputação do Kokoro em qualidade por parâmetro, relatada de forma independente, vem de benchmarks da comunidade e discussões no Hugging Face, não de um teste cego realizado pela PromptQuorum — trate como direcional. A simultaneidade e latência de ambas as ferramentas variam conforme o hardware e o nível da conta; teste com sua própria carga de trabalho antes de se comprometer.
Que hardware você realmente precisa para o Kokoro?
Planejando comprar hardware para IA de voz local ou trabalho com LLM? Veja nosso guia das melhores GPUs para IA local para recomendações de compra em todos os orçamentos.
O baixo número de parâmetros do Kokoro (82 milhões) é o principal motivo pelo qual ele roda em hardware modesto em comparação com modelos maiores de TTS e clonagem de voz.
Notebook somente CPU
- Kokoro:
- Funcional para uso leve, não em tempo real
Mac Mini / Apple Silicon
- Kokoro:
- Bom
PC com 16GB de RAM, sem GPU dedicada
- Kokoro:
- Bom para throughput moderado
GPU NVIDIA de 8GB
- Kokoro:
- Margem confortável, geração mais rápida
GPU NVIDIA de 12GB+
- Kokoro:
- Mais que suficiente; útil principalmente para simultaneidade
Raspberry Pi / placa embarcada de baixo consumo
- Kokoro:
- Possível para cargas leves, mas não é o alvo principal do Kokoro — teste antes de decidir
Estas são diretrizes direcionais, não benchmarks — o throughput real depende do runtime de inferência específico (PyTorch, ONNX, GGUF), do batching e da carga simultânea. Teste com seus próprios scripts antes de comprar hardware.
Qual fluxo de trabalho é mais barato?
A resposta depende do volume, se você já possui hardware adequado, e se precisa de clonagem de voz.
Cenário | Kokoro | ElevenLabs | Resposta prática |
|---|---|---|---|
| Uma narração ocasional esta semana | O tempo de configuração pode superar o valor da economia | O plano gratuito ou um plano pago pequeno cobre em minutos | O ElevenLabs geralmente é mais rápido para chegar a um resultado finalizado |
| Um projeto hobby ou ferramenta interna sem necessidade de clonagem | Sem custo por caractere depois de configurado; ideal se você já tem uma máquina | O plano gratuito funciona até 10.000 créditos/mês | O Kokoro costuma ser mais barato para uso gratuito sustentado |
| Você precisa de uma voz específica clonada | Não é um recurso oficial — você precisaria de um complemento não oficial de terceiros | Integrado nos planos pagos, com requisitos de consentimento | O ElevenLabs é o caminho direto e suportado |
| Geração de alto volume (milhares de requisições/mês) | Hardware e operações podem ser mais baratos que créditos medidos em escala | As cobranças de uso podem crescer substancialmente com o volume | Calcule com seu volume real de requisições e custo de hardware |
| Implantação offline ou isolada | Excelente encaixe assim que modelo e vozes forem instalados localmente | Requer conectividade para uso normal | O Kokoro vence (requisito offline) |
Privacidade, clonagem e consentimento
Rodar o Kokoro localmente pode manter seu texto e o áudio gerado no seu próprio dispositivo, mas isso não cria conformidade legal automática para como você usa a saída. Suas responsabilidades ainda podem incluir base legal, minimização de dados, retenção e direitos do usuário, dependendo do seu caso de uso e jurisdição.
A clonagem de voz levanta um conjunto separado e mais sério de preocupações — que se aplica especificamente ao recurso de clonagem do ElevenLabs, já que o Kokoro não oferece clonagem alguma:
- Nunca clone, imite ou implante a voz de uma pessoa real sem sua permissão clara e informada. Clonar uma voz sem consentimento pode expor você a responsabilidade legal (direito de imagem, fraude, difamação e outras reivindicações dependendo da jurisdição) e causa dano real à pessoa cuja voz é usada.
- Verifique os requisitos de consentimento e verificação da plataforma. Os termos do ElevenLabs regem o que os fluxos de clonagem exigem e o que você tem permissão para fazer com uma voz clonada — revise os termos atuais antes de clonar qualquer voz, incluindo a sua própria, para uso comercial.
- Divulgue áudio sintético ou clonado quando relevante. Políticas de plataforma, regulamentações de publicidade e expectativas do público cada vez mais exigem divulgação quando o áudio é gerado por IA ou é uma clonagem de voz, particularmente em conteúdo comercial ou voltado ao público.
- O conjunto fixo de vozes do Kokoro evita totalmente essa categoria de risco — como não tem clonagem integrada, não há questão de consentimento a gerenciar para as vozes que ele traz. Isso muda se você adicionar uma camada de clonagem de terceiros não oficial por cima, que passa a carregar as mesmas obrigações de consentimento de qualquer outra ferramenta de clonagem.
•Warning: Este artigo é orientação técnica, não aconselhamento jurídico. Consulte um profissional qualificado sobre questões de consentimento, direito de imagem e conformidade na sua jurisdição antes de implantar qualquer fluxo de trabalho de clonagem de voz.
Escolha o Kokoro se
Escolha o modelo local gratuito se a maioria destas afirmações descreve você:
- Você quer texto para voz gratuito e ilimitado sem assinatura ou cobrança por caractere.
- O pipeline precisa rodar totalmente offline depois de configurado — dispositivos embarcados, quiosques, sistemas isolados.
- Você está confortável escolhendo entre um conjunto fixo de 54 vozes predefinidas em vez de clonar uma específica.
- Você quer instalar, inspecionar, ajustar ou redistribuir o modelo sob uma licença permissiva.
- Você é desenvolvedor e está confortável configurando um ambiente Python e um pipeline de inferência.
- Você gera altos volumes de áudio nos quais o preço medido em nuvem se acumularia.
•Key Point: Os pesos do Kokoro-82M podem ser baixados gratuitamente do Hugging Face sob Apache 2.0. Sem conta, sem assinatura, sem créditos.
Não escolha o Kokoro se
Um modelo local de vozes fixas é a escolha errada se algum destes descreve seu projeto:
- Você precisa clonar a voz de uma pessoa específica a partir de uma amostra — o Kokoro não tem um recurso oficial para isso.
- Você precisa de um idioma fora dos 8 idiomas do Kokoro no nível do modelo.
- Você quer resultados hoje sem instalar ou configurar nada.
- Você não tem hardware para rodar o modelo e não quer alugar uma instância na nuvem.
- Você precisa de uma API hospedada oficial com suporte e SLAs — o Kokoro não tem um endpoint hospedado oficial.
Escolha o ElevenLabs se
Escolha a plataforma em nuvem paga se a maioria destas afirmações descreve você:
- Você precisa clonar uma voz específica a partir de uma amostra de referência, com consentimento adequado.
- Você precisa de uma voz polida e profissional esta semana, não depois de um projeto de configuração.
- Você publica vídeos, anúncios, podcasts, cursos ou trabalho para clientes regularmente e valoriza iteração rápida.
- Você precisa de cobertura de idiomas ou sotaques mais ampla que os 8 idiomas do Kokoro no nível do modelo.
- Você não quer instalar dependências, gerenciar um modelo ou manter infraestrutura local.
- Você está confortável em usar uma plataforma de terceiros após revisar seus termos e práticas de dados atuais.
•Key Point: Comece gratuitamente com 10.000 créditos mensais. Sem necessidade de cartão de crédito. Teste com seu próprio script hoje.
Não escolha o ElevenLabs se
Se este é o seu caso, comece com o Kokoro-82M no Hugging Face → em vez disso — gratuito, Apache 2.0, e roda em CPU ou GPU modesta.
Uma plataforma em nuvem paga é a escolha errada se algum destes descreve seu projeto:
- Você precisa de operação totalmente offline, sem conexão com a internet.
- Seu texto e áudio não podem sair da sua própria infraestrutura.
- Você precisa de geração ilimitada sem nenhum custo por caractere ou crédito.
- Você está rodando um sistema isolado ou embarcado sem acesso à rede.
- Você quer controle total sobre e visibilidade dos pesos do modelo em si.
Perguntas frequentes
O Kokoro é melhor que o ElevenLabs?
Para geração gratuita, offline e de vozes fixas: o Kokoro vence em custo e controle. Para clonagem de voz, cobertura de idiomas mais ampla, ou resultados sem nenhuma configuração local: o ElevenLabs vence. Eles resolvem problemas diferentes — o Kokoro é um modelo que você opera sozinho, o ElevenLabs é um serviço hospedado.
O Kokoro consegue clonar vozes como o ElevenLabs?
Não, não oficialmente. O Kokoro vem com 54 vozes predefinidas fixas e não tem um recurso de clonagem de voz zero-shot integrado. Existem projetos comunitários de terceiros não oficiais que adicionam clonagem em cima do Kokoro, mas são complementos separados, não algo que o modelo base ou a hexgrad suportem diretamente.
O Kokoro é gratuito para uso comercial?
O Kokoro-82M é lançado sob a licença Apache 2.0, que permite uso comercial, modificação e redistribuição do modelo em si. Sempre verifique a licença atual na ficha do modelo antes de uma implantação comercial, já que os termos podem ser atualizados.
Quantos parâmetros o Kokoro tem?
O Kokoro-82M tem 82 milhões de parâmetros — pequeno em comparação com a maioria dos sistemas TTS modernos, o que explica por que ele consegue rodar em CPU ou GPU modesta em vez de exigir um acelerador dedicado.
Quais idiomas o Kokoro suporta?
O Kokoro está documentado no nível do modelo para suportar 8 idiomas: inglês, espanhol, francês, hindi, italiano, japonês, português e chinês. Verifique a ficha do modelo atual para a divisão exata de pacotes de voz por idioma.
O Kokoro precisa de GPU?
Não. O Kokoro pode rodar em hardware somente CPU para cargas mais leves; uma GPU modesta acelera a geração e ajuda com requisições simultâneas, mas não é estritamente necessária dado o tamanho pequeno de 82 milhões de parâmetros do modelo.
Quanto custa o ElevenLabs?
O ElevenLabs lista um plano Free (US$ 0, 10.000 créditos/mês, sem licença comercial) até planos pagos que vão de Starter (US$ 6/mês) a Business (US$ 990/mês, 6.000.000 créditos), além de preços Enterprise personalizados. Confirme os números atuais na página de preços do ElevenLabs, já que planos e custos de créditos mudam.
Posso rodar o Kokoro totalmente offline?
Sim, depois de baixar os pesos do modelo e os pacotes de voz, o Kokoro pode gerar fala sem conexão com a internet. O ElevenLabs, como serviço em nuvem, requer conectividade para uso normal.
O ElevenLabs oferece um plano gratuito?
Sim. O plano Free do ElevenLabs atualmente lista 10.000 créditos por mês, mas não inclui licença comercial — você precisaria de um plano pago como o Starter para usar o áudio gerado comercialmente. Verifique os termos atuais antes de publicar conteúdo monetizado.
O Kokoro é de código aberto?
Os pesos do modelo Kokoro-82M são lançados sob a licença Apache 2.0 e hospedados no Hugging Face, o que torna os pesos e o código de inferência típico abertamente disponíveis. Sempre verifique o repositório específico que você usa para seus termos de licença exatos.
Qual é mais barato em alto volume, Kokoro ou ElevenLabs?
Depende do seu uso real e dos custos de hardware. O Kokoro não tem cobrança por caractere depois de configurado, então hardware e configuração podem ser mais baratos que os créditos medidos do ElevenLabs em volume suficiente. O preço baseado em uso do ElevenLabs pode crescer substancialmente com o volume. Calcule usando sua contagem real de requisições, não uma hipotética.
Posso clonar minha própria voz gratuitamente com um modelo local?
Não diretamente com o Kokoro, já que ele não oferece clonagem de voz. Outros modelos abertos locais com capacidade de clonagem existem, mas normalmente exigem mais configuração e hardware mais potente que o Kokoro. Sempre obtenha consentimento claro antes de clonar qualquer voz, incluindo a sua própria, para uso comercial, e revise a licença e os requisitos de consentimento da ferramenta específica.
Veredito
Se você precisa de uma voz clonada, ampla cobertura de idiomas, ou um resultado polido hoje sem configuração, comece com o ElevenLabs. O plano gratuito (10.000 créditos/mês, sem necessidade de cartão) elimina o risco de tempo de configuração desperdiçado, e os planos pagos desbloqueiam licenciamento comercial e clonagem.
Se você quer texto para voz gratuito, ilimitado e com capacidade offline e não precisa de clonagem de voz, o Kokoro é a escolha estratégica. Um modelo de 82 milhões de parâmetros licenciado sob Apache 2.0 que roda em CPU ou GPU modesta, com 54 vozes integradas, com custo zero por caractere.
A decisão real não é "qual soa melhor?" É se você prefere alugar uma plataforma de voz hospedada com clonagem e cobertura mais ampla, ou baixar e rodar sozinho um modelo pequeno, gratuito e de vozes fixas. Para desenvolvedores com uma exigência específica offline ou de alto volume, a configuração do Kokoro vale a pena. Para todos os demais, especialmente quem precisa de clonagem, o plano gratuito do ElevenLabs é o ponto de partida mais rápido.
