Principais conclusões
- O FunClip (github.com/modelscope/FunClip) é uma ferramenta de corte de vídeo gratuita, de código aberto e auto-hospedada — não um serviço web hospedado
- Desenvolvido pela ModelScope, a plataforma de modelos abertos da Alibaba, como parte do trabalho do laboratório de voz TONGYI
- Licenciado sob MIT para o código-fonte, confirmado pelo arquivo LICENSE do repositório no GitHub; os pesos do modelo FunASR subjacente têm licença separada sob Apache 2.0
- Voz em texto via modelo Paraformer-Large do FunASR, com reconhecimento de locutor CAM++ e personalização de palavras-chave SeACo-Paraformer
- Seleção de clipes assistida por IA: descreva o trecho que você quer e um LLM identifica os timestamps correspondentes
- Interfaces: uma interface web Gradio local (padrão em
localhost:7860) e um script de linha de comando,videoclipper.py - Suporte a idiomas: mandarim por padrão, um modo em inglês via flag
-l en, e suporte multilíngue (mais detecção de emoções) através do modelo SenseVoice - Última versão no momento desta análise: v2.2.1
- Mais de 6.300 estrelas no GitHub no momento desta análise
📍 Em uma frase
O FunClip é uma ferramenta de corte de vídeo gratuita, de código aberto (MIT) e auto-hospedada da ModelScope, com mais de 6.300 estrelas no GitHub, que transcreve vídeos com modelos de reconhecimento de voz FunASR e usa um LLM para encontrar e cortar os trechos que você quer, com geração automática de legendas e reconhecimento de locutor.
💬 Em termos simples
O FunClip assiste a um vídeo longo por você, anota tudo o que é falado (transcrição) e, quando você descreve o momento que quer, um modelo de IA encontra esse momento e corta o clipe automaticamente, já com as legendas embutidas ou anexadas. Ele roda no seu próprio computador ou servidor por meio de uma página web local ou da linha de comando — é gratuito, mas você precisa instalá-lo você mesmo, e as partes de IA exigem hardware suficiente para rodar modelos de voz e de linguagem.
📌Nota: Esta análise se baseia no próprio repositório GitHub e README do FunClip. Ela não afirma que a PromptQuorum realizou benchmarks práticos de precisão de transcrição do FunClip, e apresenta o papel da ModelScope/Alibaba como desenvolvedora de forma factual, sem enquadramento geopolítico.
O que é o FunClip?
O FunClip é uma ferramenta auto-hospedada e de código aberto que automatiza o corte de vídeo combinando a transcrição de voz em texto com a seleção de momentos assistida por IA, em vez de exigir que você revise manualmente o material bruto. Ele é desenvolvido pela ModelScope, a plataforma de modelos abertos da Alibaba, e se baseia nos próprios modelos de reconhecimento de voz FunASR dessa equipe.
- Tipo de produto: uma ferramenta web/CLI auto-hospedada — instala-se via git clone e Python, não é um app de desktop baixável nem um produto SaaS hospedado
- Desenvolvedora: ModelScope (a plataforma de modelos abertos da Alibaba), especificamente o trabalho do seu laboratório de voz TONGYI
- Licença: MIT para o próprio código-fonte do FunClip, confirmado pelo arquivo LICENSE do repositório no GitHub; os pesos do modelo FunASR subjacente dos quais ele depende têm licença separada sob Apache 2.0
- Dependência principal: FunASR, o próprio kit de reconhecimento de voz de código aberto da ModelScope, que o FunClip usa para transcrição em vez de construir seu próprio modelo ASR do zero
- Escala: mais de 6.300 estrelas no GitHub no momento desta análise
- Última versão: v2.2.1, que o changelog do próprio projeto descreve como preservando as cores de legenda selecionadas por meio de um renderizador baseado em Pillow
O que o FunClip realmente faz?
O FunClip pega um arquivo de vídeo, transcreve a fala contida nele e depois deixa você (ou um LLM, com base na sua descrição) selecionar momentos específicos para cortar em clipes independentes já com legendas geradas.
- Transcrição automática: o modelo Paraformer-Large do FunASR transcreve a fala do vídeo com previsão de timestamp integrada, de modo que cada trecho falado é mapeado para um ponto exato do vídeo
- Reconhecimento de locutor: a identificação de locutor CAM++ permite cortar trechos por um locutor específico, útil para entrevistas, painéis ou gravações com várias pessoas
- Personalização de palavras-chave: a integração com o SeACo-Paraformer permite especificar nomes de entidades ou termos específicos com antecedência para melhorar a precisão de reconhecimento dessas palavras
- Seleção de clipes assistida por IA: em vez de revisar manualmente a transcrição completa, você pode descrever o momento que quer e um LLM identifica os timestamps correspondentes a serem cortados
- Geração automática de legendas: o FunClip gera legendas SRT tanto para o vídeo completo quanto para cada trecho cortado individualmente
- Renderização de legendas: a versão 2.2.1 adicionou um renderizador baseado em Pillow que preserva as cores de legenda selecionadas no vídeo de saída
- Saída multi-segmento: o FunClip pode gerar vários clipes a partir de um único vídeo de origem em uma única passagem, sem exigir uma execução separada por clipe
Exemplos de uso: duas formas de usar o FunClip
Estes são fluxos de trabalho construídos a partir dos próprios recursos documentados do FunClip — não são casos de uso hipotéticos.
Plataforma, preços e licenciamento
Plataforma
- O que o FunClip declara:
- Aplicação Python auto-hospedada; uma interface web Gradio local mais um script de linha de comando. Multiplataforma em princípio, embora o suporte específico a sistemas operacionais não seja detalhado na documentação.
Custo
- O que o FunClip declara:
- Gratuito e de código aberto. Sem plano pago ou serviço hospedado; você o executa no seu próprio hardware.
Licenciamento
- O que o FunClip declara:
- MIT para o código-fonte, confirmado pelo arquivo LICENSE do repositório no GitHub; os pesos do modelo FunASR têm licença separada sob Apache 2.0.
Método de instalação
- O que o FunClip declara:
- Segundo o próprio README do projeto, clone o repositório no GitHub e instale as dependências de
requirements.txtdentro de um ambiente virtual Python 3.12+. Arquivos de release versionados (por exemplo, FunClip-2.2.1.tar.gz/.zip) também estão disponíveis com checksums SHA256.
Verifique a versão do Python recomendada atualmente e a lista de dependências diretamente no repositório GitHub antes de instalar, já que os requisitos podem mudar entre versões.
Instalar o FunClip
O FunClip se instala gratuitamente via git clone e pip, e seu código-fonte e arquivos de release versionados estão no GitHub.
Source | Link |
|---|---|
| Repositório GitHub (código-fonte, MIT) | github.com/modelscope/FunClip |
| Arquivos de release versionados (com checksums SHA256) | github.com/modelscope/FunClip/releases |
| FunASR (kit de reconhecimento de voz subjacente) | github.com/modelscope/FunASR |
| Plataforma ModelScope | modelscope.cn |
O FunClip exige um ambiente Python 3.12+ e hardware local suficiente para rodar os modelos de reconhecimento de voz do FunASR além do LLM escolhido — não há instalador gráfico nem plano gratuito hospedado para fazer login.
FunClip vs. Whisper.cpp
O FunClip e o whisper.cpp rodam voz em texto localmente, mas resolvem problemas diferentes. O Whisper.cpp é um mecanismo de transcrição C/C++ enxuto e com poucas dependências, que você incorpora a outros projetos; o FunClip é uma camada de aplicação completa sobre a transcrição do FunASR, adicionando seleção de clipes assistida por IA, reconhecimento de locutor e exportação de vídeo com legendas embutidas.
Aspecto | FunClip | Whisper.cpp |
|---|---|---|
| Objetivo principal | App de corte de vídeo ponta a ponta construído sobre transcrição | Um mecanismo de transcrição, incorporável a outras ferramentas |
| Modelo de voz | FunASR Paraformer-Large / SenseVoice | Pesos do OpenAI Whisper (portado para C/C++) |
| Saída | Clipes de vídeo cortados com legendas geradas | Somente texto de transcrição/legenda |
| Interface | Interface web Gradio local + script CLI | Linha de comando e bindings de biblioteca |
| Dependência de execução | Python 3.12+, FunASR, um LLM | Não requer ambiente de execução Python |
| Desenvolvedora | ModelScope (Alibaba) | Georgi Gerganov / ggml-org |
Se seu objetivo é obter clipes de vídeo prontos com legendas e edição manual mínima, o pipeline integrado de seleção e exportação de clipes do FunClip já entrega mais de fábrica. Se você só precisa de texto de transcrição bruto ou legendas para alimentar seu próprio pipeline, sem Python nem uma camada completa de edição de vídeo, veja a análise do whisper.cpp. Verifique o conjunto de recursos atual de cada projeto no respectivo repositório antes de escolher.
Para quem o FunClip é indicado?
O FunClip é indicado para quem precisa transformar gravações longas em clipes curtos regularmente e quer automatizar esse processo com transcrição mais um LLM, em vez de revisar manualmente.
Para que o FunClip não é bom
O FunClip não é uma boa escolha se você quer um serviço hospedado sem instalação ou um editor de vídeo de uso geral além da seleção de clipes e legendas.
- Não é um produto hospedado — não há plano de nuvem gerenciado; você instala e executa por conta própria via git clone e um ambiente Python
- Não é um editor de vídeo geral — foca especificamente na seleção de clipes guiada por transcrição e na geração de legendas, não em edição de linha do tempo, correção de cor ou efeitos
- Não é configuração zero — fazer a seleção de clipes assistida por IA funcionar exige configurar você mesmo um LLM, além da instalação de Python/FunASR
- Não há garantia de suporte a nível de sistema operacional listado — a própria documentação do projeto não lista sistemas operacionais específicos suportados além de descrevê-lo como um app Python/Gradio, então verifique a compatibilidade com seu próprio ambiente antes de confiar nele
- Não foi testado de forma independente pela PromptQuorum quanto à precisão de transcrição — esta análise se baseia no próprio repositório GitHub e README do FunClip, não em testes práticos de precisão
Erros comuns ao avaliar o FunClip
A maior parte da confusão sobre o FunClip vem de esperar um editor de vídeo completo, não perceber a flag de modo de idioma ou supor que ele não precisa de configuração adicional de LLM.
Concorrentes e alternativas
O FunClip é mais frequentemente comparado a outras ferramentas locais e auto-hospedadas de voz em texto, como whisper.cpp, faster-whisper e MacWhisper — seu principal diferencial é ir além da transcrição bruta até a seleção de clipes assistida por IA completa e a exportação de vídeo com legendas embutidas.
Tool | Best known for | Link |
|---|---|---|
| whisper.cpp | Porte C/C++ gratuito e com licença MIT do OpenAI Whisper para transcrição no dispositivo | Análise do Whisper.cpp |
| faster-whisper | Reimplementação do Whisper baseada em CTranslate2 otimizada para velocidade em GPU/CPU | Análise do Faster-Whisper |
| MacWhisper | App de transcrição nativo para macOS, bem polido, construído sobre modelos Whisper | Análise do MacWhisper |
Esta lista reflete ferramentas comumente comparadas ao FunClip no lado da transcrição, não um ranking independente da PromptQuorum — verifique o conjunto de recursos atual de cada ferramenta antes de escolher. Nenhuma dessas três adiciona a camada de seleção de clipes assistida por IA e exportação de vídeo do FunClip; são mecanismos/apps de transcrição, não ferramentas de corte. Veja também a comparação FunClip vs. Whisper.cpp acima.
Perguntas frequentes
O que é o FunClip?
O FunClip (github.com/modelscope/FunClip) é uma ferramenta de corte de vídeo gratuita, de código aberto e auto-hospedada da ModelScope, que transcreve vídeos com modelos de reconhecimento de voz FunASR e usa um LLM para encontrar e cortar os trechos que você quer.
O FunClip é gratuito?
Sim, o FunClip é gratuito e de código aberto (código-fonte com licença MIT; os pesos do modelo FunASR têm licença separada sob Apache 2.0). Não há plano pago nem serviço hospedado — você o executa no seu próprio hardware.
Como instalo o FunClip?
Segundo o próprio README do projeto, clone o repositório no GitHub e instale as dependências de requirements.txt dentro de um ambiente virtual Python 3.12+. Arquivos de release versionados com checksums SHA256 também estão disponíveis na página de releases.
O FunClip suporta inglês?
Sim, o FunClip transcreve em mandarim por padrão, mas documenta um modo em inglês via flag -l en, além de suporte multilíngue via modelo SenseVoice.
O FunClip funciona pela linha de comando?
Sim, além da interface web Gradio local (padrão em localhost:7860), o FunClip oferece um script de linha de comando, videoclipper.py, para reconhecimento e corte direto de vídeo.
O FunClip gera legendas automaticamente?
Sim, o FunClip gera automaticamente legendas SRT tanto para o vídeo completo quanto para cada trecho cortado individualmente, usando a transcrição do FunASR com timestamps integrados.
Quem desenvolve o FunClip?
A ModelScope, a plataforma de modelos abertos da Alibaba, desenvolve o FunClip como parte do trabalho do seu laboratório de voz TONGYI. O repositório canônico no GitHub é modelscope/FunClip.
O FunClip precisa de um LLM para funcionar?
Os recursos principais de transcrição e exportação manual de clipes funcionam sem um LLM. O recurso de seleção de clipes assistida por IA, em que você descreve um momento e a ferramenta o encontra, exige configurar um LLM separadamente.
O FunClip consegue identificar locutores diferentes em uma gravação?
Sim, o FunClip inclui reconhecimento de locutor CAM++, permitindo cortar trechos por um locutor específico — útil para entrevistas, painéis ou gravações com várias pessoas.
A PromptQuorum testou de forma independente a precisão de transcrição do FunClip?
Esta análise se baseia no próprio repositório GitHub e README do FunClip, em vez de em benchmarks práticos de precisão de transcrição feitos pela PromptQuorum.