Points clés
- FunClip (github.com/modelscope/FunClip) est un outil de découpage vidéo gratuit, open source et auto-hébergé — pas un service web hébergé
- Développé par ModelScope, la plateforme de modèles ouverts d'Alibaba, dans le cadre des travaux de son laboratoire vocal TONGYI
- Sous licence MIT pour le code source, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sous-jacent sont sous licence Apache 2.0 séparément
- Parole-texte via le modèle Paraformer-Large de FunASR, avec reconnaissance des locuteurs CAM++ et personnalisation de mots-clés SeACo-Paraformer
- Sélection de clips assistée par IA : décrivez le segment souhaité et un LLM identifie les horodatages correspondants
- Interfaces : une interface web Gradio locale (par défaut sur
localhost:7860) et un script en ligne de commande,videoclipper.py - Prise en charge des langues : mandarin par défaut, mode anglais via l'option
-l en, et prise en charge multilingue (plus détection des émotions) via le modèle SenseVoice - Dernière version au moment de cette revue : v2.2.1
- Plus de 6 300 étoiles GitHub au moment de cette revue
📍 En une phrase
FunClip est un outil de découpage vidéo gratuit, open source (MIT) et auto-hébergé de ModelScope, avec plus de 6 300 étoiles GitHub, qui transcrit les vidéos avec les modèles de reconnaissance vocale FunASR et utilise un LLM pour trouver et découper les segments souhaités, avec génération automatique de sous-titres et reconnaissance des locuteurs.
💬 En termes simples
FunClip regarde une longue vidéo à votre place, note tout ce qui est dit (transcription), puis, lorsque vous décrivez le moment que vous cherchez, un modèle d'IA trouve ce moment et découpe automatiquement le clip, avec des sous-titres déjà incrustés ou joints. Il fonctionne sur votre propre ordinateur ou serveur via une page web locale ou la ligne de commande — c'est gratuit, mais il faut l'installer soi-même, et les composants IA nécessitent un matériel suffisant pour exécuter des modèles de parole et de langage.
📌Remarque: Cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip. Elle n'affirme pas que PromptQuorum a réalisé ses propres tests pratiques de précision de transcription de FunClip, et présente le rôle de ModelScope/Alibaba en tant que développeur de manière factuelle, sans cadrage géopolitique.
Qu'est-ce que FunClip ?
FunClip est un outil auto-hébergé et open source qui automatise le découpage vidéo en combinant la transcription parole-texte avec une sélection de moments assistée par IA, plutôt que d'exiger de parcourir manuellement les rushs. Il est développé par ModelScope, la plateforme de modèles ouverts d'Alibaba, et s'appuie sur les propres modèles de reconnaissance vocale FunASR de cette équipe.
- Type de produit : un outil web/CLI auto-hébergé — s'installe via git clone et Python, ce n'est ni une application de bureau téléchargeable ni un produit SaaS hébergé
- Développeur : ModelScope (la plateforme de modèles ouverts d'Alibaba), plus précisément les travaux de son laboratoire vocal TONGYI
- Licence : MIT pour le code source de FunClip lui-même, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sous-jacent dont il dépend sont sous licence Apache 2.0 séparément
- Dépendance principale : FunASR, le propre kit de reconnaissance vocale open source de ModelScope, que FunClip utilise pour la transcription plutôt que de développer son propre modèle ASR depuis zéro
- Ampleur : plus de 6 300 étoiles GitHub au moment de cette revue
- Dernière version : v2.2.1, que le changelog du projet décrit comme préservant les couleurs de sous-titres sélectionnées grâce à un moteur de rendu basé sur Pillow
Que fait réellement FunClip ?
FunClip prend un fichier vidéo, transcrit la parole qu'il contient, puis vous laisse (ou laisse un LLM, selon votre description) sélectionner des moments précis à découper en clips autonomes avec des sous-titres déjà générés.
- Transcription automatique : le modèle Paraformer-Large de FunASR transcrit la parole de la vidéo avec prédiction d'horodatage intégrée, de sorte que chaque segment parlé est associé à un point exact de la vidéo
- Reconnaissance des locuteurs : l'identification de locuteurs CAM++ permet de découper des segments par locuteur spécifique, utile pour les interviews, tables rondes ou enregistrements à plusieurs personnes
- Personnalisation de mots-clés : l'intégration SeACo-Paraformer permet de spécifier à l'avance des noms d'entités ou des termes précis pour améliorer la précision de reconnaissance de ces mots
- Sélection de clips assistée par IA : au lieu de parcourir manuellement l'intégralité de la transcription, vous pouvez décrire le moment souhaité et un LLM identifie les horodatages correspondants à découper
- Génération automatique de sous-titres : FunClip génère des sous-titres SRT à la fois pour la vidéo complète et pour chaque segment découpé individuellement
- Rendu des sous-titres : la version 2.2.1 a ajouté un moteur de rendu basé sur Pillow qui préserve les couleurs de sous-titres sélectionnées dans la vidéo de sortie
- Sortie multi-segments : FunClip peut générer plusieurs clips à partir d'une même vidéo source en une seule passe, sans nécessiter une exécution distincte par clip
Exemples d'utilisation : deux façons d'utiliser FunClip
Il s'agit de workflows construits à partir des fonctionnalités documentées de FunClip lui-même — pas de cas d'usage hypothétiques.
Plateforme, tarifs et licence
Plateforme
- Ce que déclare FunClip:
- Application Python auto-hébergée ; une interface web Gradio locale plus un script en ligne de commande. Multiplateforme en principe, bien que la prise en charge précise des systèmes d'exploitation ne soit pas détaillée dans la documentation.
Coût
- Ce que déclare FunClip:
- Gratuit et open source. Pas de palier payant ni de service hébergé ; vous l'exécutez sur votre propre matériel.
Licence
- Ce que déclare FunClip:
- MIT pour le code source, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sont sous licence Apache 2.0 séparément.
Méthode d'installation
- Ce que déclare FunClip:
- Clonez le dépôt GitHub et installez les dépendances depuis
requirements.txtdans un environnement virtuel Python 3.12+, selon le README propre du projet. Des archives de versions numérotées (par exemple FunClip-2.2.1.tar.gz/.zip) sont également disponibles avec des sommes de contrôle SHA256.
Vérifiez la version de Python recommandée actuelle et la liste des dépendances directement sur le dépôt GitHub avant l'installation, car les prérequis peuvent changer d'une version à l'autre.
Installer FunClip
FunClip s'installe gratuitement via git clone et pip, et son code source ainsi que ses archives de versions numérotées sont sur GitHub.
Source | Link |
|---|---|
| Dépôt GitHub (code source, MIT) | github.com/modelscope/FunClip |
| Archives de versions numérotées (avec sommes SHA256) | github.com/modelscope/FunClip/releases |
| FunASR (kit de reconnaissance vocale sous-jacent) | github.com/modelscope/FunASR |
| Plateforme ModelScope | modelscope.cn |
FunClip nécessite un environnement Python 3.12+ et suffisamment de matériel local pour exécuter les modèles de reconnaissance vocale de FunASR ainsi que le LLM choisi — il n'y a ni installateur graphique ni palier gratuit hébergé auquel se connecter.
FunClip vs. Whisper.cpp
FunClip et whisper.cpp exécutent tous deux la reconnaissance vocale localement, mais résolvent des problèmes différents. Whisper.cpp est un moteur de transcription C/C++ léger et peu dépendant, à intégrer dans d'autres projets ; FunClip est une couche applicative complète au-dessus de la transcription FunASR, ajoutant la sélection de clips assistée par IA, la reconnaissance des locuteurs et l'export vidéo avec sous-titres incrustés.
Aspect | FunClip | Whisper.cpp |
|---|---|---|
| Objectif principal | Application de découpage vidéo de bout en bout, construite sur la transcription | Un moteur de transcription, intégrable dans d'autres outils |
| Modèle vocal | FunASR Paraformer-Large / SenseVoice | Poids OpenAI Whisper (portage C/C++) |
| Sortie | Clips vidéo découpés avec sous-titres générés | Texte de transcription/sous-titres uniquement |
| Interface | Interface web Gradio locale + script CLI | Ligne de commande et liaisons de bibliothèque |
| Dépendance d'exécution | Python 3.12+, FunASR, un LLM | Aucun environnement Python requis |
| Développeur | ModelScope (Alibaba) | Georgi Gerganov / ggml-org |
Si votre objectif est d'obtenir des clips vidéo finis avec sous-titres et un minimum de montage manuel, le pipeline intégré de sélection et d'export de FunClip en fait davantage d'emblée. Si vous n'avez besoin que d'un texte de transcription brut ou de sous-titres à intégrer dans votre propre pipeline, sans Python ni couche complète de montage vidéo, consultez la revue de whisper.cpp. Vérifiez les fonctionnalités actuelles de chaque projet sur son propre dépôt avant de choisir.
Pour qui FunClip est-il fait ?
FunClip convient à ceux qui doivent régulièrement transformer de longs enregistrements en clips courts et souhaitent automatiser ce processus par la transcription et un LLM, plutôt que par un parcours manuel.
Pour quoi FunClip n'est pas adapté
FunClip ne convient pas si vous voulez un service hébergé sans installation ou un éditeur vidéo généraliste allant au-delà de la sélection de clips et des sous-titres.
- Ce n'est pas un produit hébergé — il n'existe aucun palier cloud géré ; vous l'installez et l'exécutez vous-même via git clone et un environnement Python
- Ce n'est pas un éditeur vidéo généraliste — il se concentre spécifiquement sur la sélection de clips guidée par la transcription et la génération de sous-titres, pas sur le montage sur timeline, l'étalonnage ou les effets
- Ce n'est pas configuration zéro — faire fonctionner la sélection de clips assistée par IA nécessite de configurer vous-même un LLM, en plus de l'installation Python/FunASR
- La prise en charge des systèmes d'exploitation n'est pas garantie ni détaillée — la documentation propre du projet ne liste pas de systèmes d'exploitation précis pris en charge au-delà de la décrire comme une application Python/Gradio, vérifiez donc la compatibilité avec votre propre environnement avant de vous y fier
- Non testé de manière indépendante par PromptQuorum pour la précision de transcription — cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip, pas sur des tests pratiques de précision
Erreurs courantes lors de l'évaluation de FunClip
La plupart des confusions autour de FunClip viennent du fait d'attendre un éditeur vidéo complet, de manquer l'option de mode de langue, ou de supposer qu'il ne nécessite aucune configuration LLM supplémentaire.
Concurrents et alternatives
FunClip est le plus souvent comparé à d'autres outils locaux et auto-hébergés de reconnaissance vocale comme whisper.cpp, faster-whisper et MacWhisper — son principal élément différenciateur est d'aller au-delà de la simple transcription brute vers une sélection de clips assistée par IA complète et un export vidéo avec sous-titres incrustés.
Tool | Best known for | Link |
|---|---|---|
| whisper.cpp | Portage C/C++ gratuit et sous licence MIT d'OpenAI Whisper pour la transcription sur l'appareil | Revue whisper.cpp |
| faster-whisper | Réimplémentation de Whisper basée sur CTranslate2, optimisée pour la vitesse sur GPU/CPU | Revue faster-whisper |
| MacWhisper | Application de transcription native macOS aboutie, basée sur les modèles Whisper | Revue MacWhisper |
Cette liste reflète les outils couramment comparés à FunClip côté transcription, pas un classement indépendant de PromptQuorum — vérifiez les fonctionnalités actuelles de chaque outil avant de choisir. Aucun de ces trois outils n'ajoute la couche de sélection de clips assistée par IA et d'export vidéo de FunClip ; ce sont des moteurs/applications de transcription, pas des outils de découpage. Voir aussi la comparaison FunClip vs. Whisper.cpp ci-dessus.
Questions fréquentes
Qu'est-ce que FunClip ?
FunClip (github.com/modelscope/FunClip) est un outil de découpage vidéo gratuit, open source et auto-hébergé développé par ModelScope, qui transcrit les vidéos avec les modèles de reconnaissance vocale FunASR et utilise un LLM pour trouver et découper les segments souhaités.
FunClip est-il gratuit ?
Oui, FunClip est gratuit et open source (code source sous licence MIT ; poids du modèle FunASR sous licence Apache 2.0 séparément). Il n'existe ni palier payant ni service hébergé — vous l'exécutez sur votre propre matériel.
Comment installer FunClip ?
Selon le README propre du projet, clonez le dépôt GitHub et installez les dépendances depuis requirements.txt dans un environnement virtuel Python 3.12+. Des archives de versions numérotées avec sommes de contrôle SHA256 sont également disponibles sur la page des versions.
FunClip prend-il en charge l'anglais ?
Oui, FunClip transcrit en mandarin par défaut mais documente un mode anglais via l'option -l en, ainsi qu'une prise en charge multilingue via le modèle SenseVoice.
FunClip fonctionne-t-il en ligne de commande ?
Oui, en plus de l'interface web Gradio locale (par défaut sur localhost:7860), FunClip fournit un script en ligne de commande, videoclipper.py, pour la reconnaissance et le découpage direct de vidéos.
FunClip génère-t-il automatiquement des sous-titres ?
Oui, FunClip génère automatiquement des sous-titres SRT à la fois pour la vidéo complète et pour chaque segment découpé individuellement, en utilisant la transcription de FunASR avec horodatages intégrés.
Qui développe FunClip ?
ModelScope, la plateforme de modèles ouverts d'Alibaba, développe FunClip dans le cadre des travaux de son laboratoire vocal TONGYI. Le dépôt GitHub canonique est modelscope/FunClip.
FunClip a-t-il besoin d'un LLM pour fonctionner ?
Les fonctionnalités principales de transcription et d'export manuel de clips fonctionnent sans LLM. La fonctionnalité de sélection de clips assistée par IA, où vous décrivez un moment et l'outil le trouve, nécessite de configurer un LLM séparément.
FunClip peut-il identifier différents locuteurs dans un enregistrement ?
Oui, FunClip inclut la reconnaissance des locuteurs CAM++, permettant de découper des segments par locuteur spécifique — utile pour les interviews, tables rondes ou enregistrements à plusieurs personnes.
PromptQuorum a-t-il testé indépendamment la précision de transcription de FunClip ?
Cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip, plutôt que sur des tests pratiques de précision de transcription réalisés par PromptQuorum.