Principais conclusões
- Criado por Guillaume Klein em março de 2023; hoje mantido sob SYSTRAN no GitHub.
- Licença MIT — uso, modificação e redistribuição gratuitos, incluindo uso comercial.
- Transcrição aproximadamente 4 vezes mais rápida que o pacote openai-whisper original, no mesmo hardware.
- Compatível com GPUs NVIDIA CUDA (float16/int8) e CPU (int8) como tipos de computação.
- Filtro VAD (detecção de atividade de voz) Silero integrado que ignora automaticamente segmentos silenciosos.
- Última versão estável: v1.2.1, publicada em 31 de outubro de 2025.
📍 Em uma frase
O faster-whisper é uma reimplementação Python gratuita, com licença MIT, do modelo de reconhecimento de voz Whisper da OpenAI, criada por Guillaume Klein e mantida sob SYSTRAN, que usa o motor de inferência CTranslate2 para transcrever aproximadamente 4 vezes mais rápido que a implementação original, com menos memória.
💬 Em termos simples
É uma biblioteca Python que você instala com pip install para transformar áudio em texto na sua própria máquina, usando os mesmos modelos Whisper que a OpenAI treinou, mas executados por um motor mais rápido e eficiente em memória — sem chamadas a uma API na nuvem, e já com detecção automática de silêncio embutida.
📌Nota: Esta análise foca no faster-whisper como ferramenta independente: história, instalação, código Python real, licenciamento e limites honestos. Para um comparativo direto com o whisper.cpp em Apple Silicon e GPUs NVIDIA, veja o comparativo whisper.cpp vs faster-whisper.
História: quem criou o faster-whisper e por quê
A OpenAI lançou seu modelo de reconhecimento de voz Whisper em setembro de 2022, como um modelo de pesos abertos distribuído como pacote Python (openai-whisper) construído sobre o PyTorch, simples de executar, mas não otimizado de fábrica para velocidade de inferência ou eficiência de memória.
Guillaume Klein criou o faster-whisper em março de 2023, publicando-o no repositório SYSTRAN/faster-whisper. Klein construiu o faster-whisper sobre o CTranslate2, um motor de inferência em C++ e Python para modelos Transformer, originalmente desenvolvido dentro do projeto de tradução automática OpenNMT, no qual a SYSTRAN — uma empresa com longa trajetória em tradução automática — investe há muito tempo. O CTranslate2 oferece kernels CUDA personalizados, quantização INT8/FP16 e operações fundidas que a inferência genérica do PyTorch não aplica por padrão.
A motivação foi eficiência de inferência, não um novo modelo. O faster-whisper não treina nem modifica a arquitetura do modelo Whisper — ele carrega os mesmos pesos treinados pela OpenAI, convertidos para o formato de modelo do CTranslate2, e os executa por um caminho de execução muito mais otimizado. O resultado relatado pelo projeto é uma transcrição até aproximadamente 4 vezes mais rápida que a implementação original do openai-whisper no mesmo hardware, com menor uso de memória graças à quantização int8, e sem perda de precisão mensurável para configurações equivalentes.
O projeto cresceu até se tornar o wrapper de Whisper baseado em CTranslate2 mais usado. Ele adicionou um filtro VAD Silero integrado para detectar e ignorar automaticamente segmentos de áudio silenciosos, carimbos de tempo por palavra, e suporte a inferência em lote, mantendo o foco em ser uma biblioteca rápida e fácil de integrar, em vez de uma aplicação completa. Continua sendo mantido sob a organização SYSTRAN no GitHub, com versões que acompanham novas versões do CTranslate2 e atualizações dos modelos Whisper.
Quem criou o faster-whisper?
Guillaume Klein criou o faster-whisper em março de 2023, construindo-o sobre o motor de inferência CTranslate2. O projeto hoje é mantido sob SYSTRAN no GitHub.
O que o faster-whisper realmente faz
O faster-whisper recebe um arquivo de áudio como entrada e produz uma transcrição em texto através da classe Python WhisperModel, usando uma versão de um modelo Whisper convertida pelo CTranslate2 para executar a inferência bem mais rápido que a implementação original baseada em PyTorch.
- Transcrição em lote rápida. Carregar um
WhisperModeluma vez e chamar.transcribe()em um arquivo de áudio para obter um gerador de segmentos com carimbo de tempo e informações de detecção de idioma. - Detecção de atividade de voz (VAD) integrada. Definir
vad_filter=Trueexecuta um modelo VAD Silero antes da transcrição para remover automaticamente trechos silenciosos, reduzindo processamento desperdiçado e texto alucinado sobre silêncio. - Múltiplos tipos de computação. Escolher
float16ouint8_float16na GPU, ouint8na CPU, trocando um pouco de precisão por menor uso de memória e maior velocidade. - Carimbos de tempo por palavra. Passar
word_timestamps=Trueretorna informações de tempo por palavra, além dos carimbos de tempo por segmento. - Inferência em lote. A classe
BatchedInferencePipelineprocessa vários segmentos de áudio em paralelo em lotes para maior throughput em arquivos mais longos. - Transcrição e tradução multilíngues. Como os modelos Whisper subjacentes, o faster-whisper pode transcrever no idioma de origem ou traduzir diretamente para o inglês via o parâmetro
task="translate".
Instalar e executar o faster-whisper: passo a passo
Este guia instala o faster-whisper via pip e executa uma primeira transcrição, usando a sintaxe documentada no próprio README do projeto.
- 1Instalar o faster-whisper.
Why it matters: Execute `pip install faster-whisper` em um ambiente Python (recomenda-se Python 3.9+). Isso instala a biblioteca junto com sua dependência do CTranslate2; nenhuma instalação separada do toolkit CUDA é necessária para uso em CPU. - 2(Apenas GPU) Confirmar que CUDA e cuDNN estão disponíveis.
Why it matters: Para aceleração por GPU, você precisa de um driver NVIDIA funcional e uma configuração CUDA. O faster-whisper depende do suporte de GPU do CTranslate2 — se `device="cuda"` falhar, verifique primeiro se o `nvidia-smi` reconhece sua GPU corretamente antes de investigar do lado do Python. - 3Carregar um modelo.
Why it matters: Em Python, execute `from faster_whisper import WhisperModel` e depois `model = WhisperModel("large-v3", device="cuda", compute_type="float16")`. Troque `"large-v3"` por `"tiny"`, `"base"`, `"small"` ou `"medium"` para um modelo menor e mais rápido, ou use `device="cpu"` com `compute_type="int8"` se não tiver GPU. - 4Transcrever um arquivo de áudio.
Why it matters: Execute `segments, info = model.transcribe("audio.mp3", beam_size=5)`. Isso retorna um gerador de segmentos (não uma lista) — você precisa iterar sobre ele para a transcrição realmente ser executada. - 5Imprimir a transcrição.
Why it matters: Percorra os segmentos: `for segment in segments: print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))`. Cada segmento traz um horário de início, de fim e o texto transcrito para aquele trecho. - 6(Opcional) Ativar a filtragem VAD.
Why it matters: Passe `vad_filter=True` para `.transcribe()` para pular automaticamente trechos silenciosos de áudio usando o modelo VAD Silero embutido, o que reduz processamento desperdiçado em gravações longas com pausas. - 7(Opcional) Obter carimbos de tempo por palavra.
Why it matters: Passe `word_timestamps=True` para `.transcribe()` para obter o tempo por palavra além do tempo por segmento, útil para criar legendas ou destacar palavras conforme são faladas.
Exemplos de uso reais
Além do guia básico de instalação acima, estes são padrões comuns de uso extraídos da própria documentação do projeto.
- BatchedInferencePipeline envolve um
WhisperModelpara processar vários trechos de áudio em paralelo, melhorando o throughput em arquivos longos:from faster_whisper import BatchedInferencePipeline; batched_model = BatchedInferencePipeline(model=model). - Compatibilidade com distil-large-v3. O faster-whisper suporta nativamente variantes destiladas do Whisper como distil-large-v3 — carregue-o da mesma forma que um nome de modelo padrão para trocar um pouco de precisão por uma inferência aproximadamente 6 vezes mais rápida.
from faster_whisper import WhisperModel
# GPU com float16 (mais rápido, requer CUDA + cuDNN)
model = WhisperModel("large-v3", device="cuda", compute_type="float16")
# CPU com int8 (não requer GPU, mais lento)
# model = WhisperModel("base", device="cpu", compute_type="int8")
segments, info = model.transcribe("audio.mp3", beam_size=5, vad_filter=True)
print(f"Detected language '{info.language}' with probability {info.language_probability:.2f}")
for segment in segments:
print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))
# Traduzir diretamente áudio não inglês para texto em inglês
segments, info = model.transcribe("french-audio.mp3", task="translate")
# Carimbos de tempo por palavra para legendas
segments, info = model.transcribe("audio.mp3", word_timestamps=True)
for segment in segments:
for word in segment.words:
print("[%.2fs -> %.2fs] %s" % (word.start, word.end, word.word))Licença e custo
O faster-whisper é licenciado sob a licença MIT — o arquivo de licença no repositório oficial permite uso, modificação e redistribuição gratuitos, inclusive em produtos fechados e comerciais, sem royalties e sem exigência de atribuição além de manter o aviso de licença.
Não existe plano pago, assinatura ou taxa de licença para o faster-whisper em si. Os únicos custos reais são o hardware em que você o executa (ou uma instância de GPU alugada na nuvem) e, se você construir um produto sobre ele, seu próprio tempo de desenvolvimento. Não há medição de uso, chave de API nem dependência de fornecedor.
O CTranslate2, motor de inferência do qual o faster-whisper depende, também é licenciado sob MIT, e os pesos do modelo Whisper subjacente também são publicados separadamente pela OpenAI sob licença MIT — assim, toda a pilha (ambiente de execução, motor de inferência e pesos do modelo) tem licenças permissivas para uso comercial.
O faster-whisper é gratuito para uso comercial?
Sim. O faster-whisper é licenciado sob MIT, sua dependência CTranslate2 é licenciada sob MIT, e os pesos do modelo Whisper que ele usa também são publicados pela OpenAI sob licença MIT. Os três permitem uso, modificação e redistribuição comercial sem custo.
Para que o faster-whisper não serve
O faster-whisper é uma biblioteca Python de transcrição rápida, não um produto completo de IA conversacional nem uma ferramenta de implantação sem Python. É a ferramenta errada nas seguintes situações:
- Implantação sem Python ou em binário multiplataforma. O faster-whisper é uma biblioteca Python com uma dependência nativa do CTranslate2 — não foi projetado para ser um binário único e sem dependências como o whisper.cpp. Se você precisa mirar em um Raspberry Pi, um app iOS ou uma página WebAssembly sem ambiente Python, o whisper.cpp é a melhor opção.
- Aceleração por GPU no Apple Silicon. O backend CTranslate2 do faster-whisper suporta CPU e NVIDIA CUDA, mas não tem nenhum caminho de aceleração por GPU Apple Metal — em um Mac, o faster-whisper recorre à inferência apenas em CPU. O benchmark da PromptQuorum constatou que o whisper.cpp com aceleração Metal é bem mais rápido que o faster-whisper apenas em CPU no Apple Silicon.
- Diarização de falantes ("quem disse o quê"). O faster-whisper transcreve o que foi dito, mas não separa nem rotula nativamente diferentes falantes em uma gravação com várias pessoas. Para diarização, combine suas transcrições com uma ferramenta dedicada, ou use o WhisperX, que adiciona diarização sobre as transcrições do Whisper.
- Configuração zero para usuários não técnicos. O faster-whisper é uma biblioteca Python voltada para desenvolvedores que constroem pipelines, não uma aplicação de usuário final com interface gráfica. Quem quiser um app de transcrição de clicar-e-usar deve procurar uma aplicação construída sobre o faster-whisper ou o whisper.cpp, ou um serviço de transcrição hospedado.
Alternativas ao faster-whisper
whisper.cpp
- Melhor para:
- Implantação sem Python, multiplataforma — Apple Silicon, dispositivos embarcados, móvel
- Licença:
- MIT
WhisperX
- Melhor para:
- Quando você precisa de carimbos de tempo por palavra e diarização construídos sobre Whisper/faster-whisper
- Licença:
- BSD-2-Clause
insanely-fast-whisper
- Melhor para:
- Throughput máximo de GPU via Hugging Face Transformers e Flash Attention, em GPUs muito recentes
- Licença:
- Apache-2.0
API OpenAI Whisper
- Melhor para:
- Equipes que preferem uma API gerenciada na nuvem à autohospedagem, em troca de tarifas por uso
- Licença:
- Proprietária (API paga)
Perguntas frequentes
O que é o faster-whisper?
O faster-whisper é uma reimplementação Python gratuita, com licença MIT, do modelo de reconhecimento de voz Whisper da OpenAI, criada por Guillaume Klein e mantida sob SYSTRAN, que usa o motor de inferência CTranslate2 para transcrever bem mais rápido que a implementação original.
O faster-whisper é gratuito?
Sim. O faster-whisper é licenciado sob MIT, sem plano pago, assinatura ou taxa de uso. Sua dependência CTranslate2 e os pesos do modelo Whisper subjacente também são licenciados sob MIT.
Preciso de uma GPU para rodar o faster-whisper?
Não. O faster-whisper suporta inferência em CPU via quantização int8, embora rode mais rápido em uma GPU NVIDIA com CUDA usando os tipos de computação float16 ou int8_float16. Ele não tem nenhum caminho de aceleração por GPU Apple Metal, então em um Mac roda apenas em CPU.
Quanto mais rápido é o faster-whisper que o OpenAI Whisper original?
O projeto relata até aproximadamente 4 vezes mais rápido em transcrição que o pacote openai-whisper original no mesmo hardware, com menor uso de memória graças à quantização int8, e sem perda de precisão notável para configurações equivalentes.
Qual é a diferença entre faster-whisper e whisper.cpp?
O faster-whisper é uma biblioteca Python baseada em CTranslate2, otimizada principalmente para throughput de GPU NVIDIA em pipelines Python. O whisper.cpp é uma implementação pura em C/C++ sem dependência de Python, construída para portabilidade entre CPU, Apple Metal, CUDA e dispositivos embarcados. Veja o comparativo detalhado da PromptQuorum para números específicos por plataforma.
O faster-whisper suporta detecção de atividade de voz?
Sim. Passar vad_filter=True para .transcribe() executa um modelo VAD Silero embutido que detecta e ignora automaticamente segmentos de áudio silenciosos antes da transcrição.
O faster-whisper pode produzir carimbos de tempo por palavra?
Sim. Passar word_timestamps=True para .transcribe() retorna horários de início e fim por palavra, além dos carimbos de tempo por segmento padrão, útil para geração de legendas.
O faster-whisper traduz áudio para inglês?
Sim. Passar task="translate" para .transcribe() transcreve fala não inglesa e a traduz diretamente para texto em inglês, usando a capacidade de tradução embutida nos modelos Whisper multilíngues.
Quem mantém o faster-whisper hoje?
O projeto foi criado por Guillaume Klein em março de 2023 e hoje é mantido sob a organização SYSTRAN no GitHub. Sua última versão estável é a v1.2.1, publicada em 31 de outubro de 2025.
Veredito
O faster-whisper consegue seu objetivo central: tornar o modelo Whisper da OpenAI sensivelmente mais rápido e mais leve em memória para desenvolvedores Python, sem mudar o que o modelo produz. Seu backend CTranslate2 oferece aproximadamente 4 vezes o throughput da implementação original, seu filtro VAD Silero embutido é uma comodidade prática real para áudio do mundo real com silêncios, e sua licença MIT torna seguro construir produtos comerciais sobre ele. É gratuito, bem mantido, e produz a mesma qualidade de transcrição que o Whisper original para um dado tamanho de modelo. Onde ele não é a escolha mais forte é em implantação sem Python ou acelerada por GPU no Apple Silicon — ali o suporte Metal e o binário sem dependências do whisper.cpp vencem, como documenta o comparativo direto da PromptQuorum. Para quem constrói um pipeline Python para reconhecimento de voz em GPU NVIDIA ou CPU e quer velocidade sem sair do ecossistema Python, o faster-whisper é um ponto de partida bem verificado e sem custo.
Fontes
- faster-whisper no GitHub — repositório oficial: README, instruções de instalação, licença e histórico de versões.
- Releases do faster-whisper — histórico de versões, incluindo a v1.2.1 (31 de outubro de 2025).
- LICENÇA do faster-whisper — texto da licença MIT.
- CTranslate2 no GitHub — o motor de inferência sobre o qual o faster-whisper é construído.
- Anúncio do OpenAI Whisper — publicação original do modelo Whisper em 2022.
