Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/FunClip : le découpage vidéo par IA auto-hébergé avec FunASR
Voice, Speech & Multimodal

FunClip : le découpage vidéo par IA auto-hébergé avec FunASR

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

FunClip est un outil de découpage vidéo gratuit, open source et auto-hébergé développé par ModelScope (la plateforme de modèles ouverts d'Alibaba), qui transcrit une vidéo avec les modèles de reconnaissance vocale FunASR, puis utilise un LLM pour trouver et découper les segments souhaités, en générant automatiquement des sous-titres. Il est sous licence MIT (les poids du modèle FunASR sous-jacent sont sous licence Apache 2.0), s'exécute via une interface web Gradio locale ou en ligne de commande, et transcrit par défaut en mandarin, avec un mode anglais et une prise en charge multilingue via SenseVoice également disponibles.

FunClip (github.com/modelscope/FunClip) est un outil de découpage vidéo gratuit, open source et auto-hébergé, développé par ModelScope, la plateforme de modèles ouverts d'Alibaba. Il transcrit une vidéo à l'aide des modèles de reconnaissance vocale FunASR, puis utilise un LLM pour identifier et découper les segments souhaités, en générant automatiquement des sous-titres au passage — avec plus de 6 300 étoiles sur GitHub. Cette revue présente ce qu'il fait réellement, comment l'installer et l'exécuter, les langues prises en charge, et à qui il convient.

Points clés

  • FunClip (github.com/modelscope/FunClip) est un outil de découpage vidéo gratuit, open source et auto-hébergé — pas un service web hébergé
  • Développé par ModelScope, la plateforme de modèles ouverts d'Alibaba, dans le cadre des travaux de son laboratoire vocal TONGYI
  • Sous licence MIT pour le code source, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sous-jacent sont sous licence Apache 2.0 séparément
  • Parole-texte via le modèle Paraformer-Large de FunASR, avec reconnaissance des locuteurs CAM++ et personnalisation de mots-clés SeACo-Paraformer
  • Sélection de clips assistée par IA : décrivez le segment souhaité et un LLM identifie les horodatages correspondants
  • Interfaces : une interface web Gradio locale (par défaut sur localhost:7860) et un script en ligne de commande, videoclipper.py
  • Prise en charge des langues : mandarin par défaut, mode anglais via l'option -l en, et prise en charge multilingue (plus détection des émotions) via le modèle SenseVoice
  • Dernière version au moment de cette revue : v2.2.1
  • Plus de 6 300 étoiles GitHub au moment de cette revue

📍 En une phrase

FunClip est un outil de découpage vidéo gratuit, open source (MIT) et auto-hébergé de ModelScope, avec plus de 6 300 étoiles GitHub, qui transcrit les vidéos avec les modèles de reconnaissance vocale FunASR et utilise un LLM pour trouver et découper les segments souhaités, avec génération automatique de sous-titres et reconnaissance des locuteurs.

💬 En termes simples

FunClip regarde une longue vidéo à votre place, note tout ce qui est dit (transcription), puis, lorsque vous décrivez le moment que vous cherchez, un modèle d'IA trouve ce moment et découpe automatiquement le clip, avec des sous-titres déjà incrustés ou joints. Il fonctionne sur votre propre ordinateur ou serveur via une page web locale ou la ligne de commande — c'est gratuit, mais il faut l'installer soi-même, et les composants IA nécessitent un matériel suffisant pour exécuter des modèles de parole et de langage.

📌Remarque: Cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip. Elle n'affirme pas que PromptQuorum a réalisé ses propres tests pratiques de précision de transcription de FunClip, et présente le rôle de ModelScope/Alibaba en tant que développeur de manière factuelle, sans cadrage géopolitique.

Qu'est-ce que FunClip ?

FunClip est un outil auto-hébergé et open source qui automatise le découpage vidéo en combinant la transcription parole-texte avec une sélection de moments assistée par IA, plutôt que d'exiger de parcourir manuellement les rushs. Il est développé par ModelScope, la plateforme de modèles ouverts d'Alibaba, et s'appuie sur les propres modèles de reconnaissance vocale FunASR de cette équipe.

  • Type de produit : un outil web/CLI auto-hébergé — s'installe via git clone et Python, ce n'est ni une application de bureau téléchargeable ni un produit SaaS hébergé
  • Développeur : ModelScope (la plateforme de modèles ouverts d'Alibaba), plus précisément les travaux de son laboratoire vocal TONGYI
  • Licence : MIT pour le code source de FunClip lui-même, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sous-jacent dont il dépend sont sous licence Apache 2.0 séparément
  • Dépendance principale : FunASR, le propre kit de reconnaissance vocale open source de ModelScope, que FunClip utilise pour la transcription plutôt que de développer son propre modèle ASR depuis zéro
  • Ampleur : plus de 6 300 étoiles GitHub au moment de cette revue
  • Dernière version : v2.2.1, que le changelog du projet décrit comme préservant les couleurs de sous-titres sélectionnées grâce à un moteur de rendu basé sur Pillow

Que fait réellement FunClip ?

FunClip prend un fichier vidéo, transcrit la parole qu'il contient, puis vous laisse (ou laisse un LLM, selon votre description) sélectionner des moments précis à découper en clips autonomes avec des sous-titres déjà générés.

  • Transcription automatique : le modèle Paraformer-Large de FunASR transcrit la parole de la vidéo avec prédiction d'horodatage intégrée, de sorte que chaque segment parlé est associé à un point exact de la vidéo
  • Reconnaissance des locuteurs : l'identification de locuteurs CAM++ permet de découper des segments par locuteur spécifique, utile pour les interviews, tables rondes ou enregistrements à plusieurs personnes
  • Personnalisation de mots-clés : l'intégration SeACo-Paraformer permet de spécifier à l'avance des noms d'entités ou des termes précis pour améliorer la précision de reconnaissance de ces mots
  • Sélection de clips assistée par IA : au lieu de parcourir manuellement l'intégralité de la transcription, vous pouvez décrire le moment souhaité et un LLM identifie les horodatages correspondants à découper
  • Génération automatique de sous-titres : FunClip génère des sous-titres SRT à la fois pour la vidéo complète et pour chaque segment découpé individuellement
  • Rendu des sous-titres : la version 2.2.1 a ajouté un moteur de rendu basé sur Pillow qui préserve les couleurs de sous-titres sélectionnées dans la vidéo de sortie
  • Sortie multi-segments : FunClip peut générer plusieurs clips à partir d'une même vidéo source en une seule passe, sans nécessiter une exécution distincte par clip

Exemples d'utilisation : deux façons d'utiliser FunClip

Il s'agit de workflows construits à partir des fonctionnalités documentées de FunClip lui-même — pas de cas d'usage hypothétiques.

Plateforme, tarifs et licence

Plateforme

Ce que déclare FunClip:
Application Python auto-hébergée ; une interface web Gradio locale plus un script en ligne de commande. Multiplateforme en principe, bien que la prise en charge précise des systèmes d'exploitation ne soit pas détaillée dans la documentation.

Coût

Ce que déclare FunClip:
Gratuit et open source. Pas de palier payant ni de service hébergé ; vous l'exécutez sur votre propre matériel.

Licence

Ce que déclare FunClip:
MIT pour le code source, confirmé via le fichier LICENSE du dépôt GitHub ; les poids du modèle FunASR sont sous licence Apache 2.0 séparément.

Méthode d'installation

Ce que déclare FunClip:
Clonez le dépôt GitHub et installez les dépendances depuis requirements.txt dans un environnement virtuel Python 3.12+, selon le README propre du projet. Des archives de versions numérotées (par exemple FunClip-2.2.1.tar.gz/.zip) sont également disponibles avec des sommes de contrôle SHA256.

Vérifiez la version de Python recommandée actuelle et la liste des dépendances directement sur le dépôt GitHub avant l'installation, car les prérequis peuvent changer d'une version à l'autre.

FunClip vs. Whisper.cpp

FunClip et whisper.cpp exécutent tous deux la reconnaissance vocale localement, mais résolvent des problèmes différents. Whisper.cpp est un moteur de transcription C/C++ léger et peu dépendant, à intégrer dans d'autres projets ; FunClip est une couche applicative complète au-dessus de la transcription FunASR, ajoutant la sélection de clips assistée par IA, la reconnaissance des locuteurs et l'export vidéo avec sous-titres incrustés.

Aspect
FunClip
Whisper.cpp
Objectif principalApplication de découpage vidéo de bout en bout, construite sur la transcriptionUn moteur de transcription, intégrable dans d'autres outils
Modèle vocalFunASR Paraformer-Large / SenseVoicePoids OpenAI Whisper (portage C/C++)
SortieClips vidéo découpés avec sous-titres générésTexte de transcription/sous-titres uniquement
InterfaceInterface web Gradio locale + script CLILigne de commande et liaisons de bibliothèque
Dépendance d'exécutionPython 3.12+, FunASR, un LLMAucun environnement Python requis
DéveloppeurModelScope (Alibaba)Georgi Gerganov / ggml-org

Si votre objectif est d'obtenir des clips vidéo finis avec sous-titres et un minimum de montage manuel, le pipeline intégré de sélection et d'export de FunClip en fait davantage d'emblée. Si vous n'avez besoin que d'un texte de transcription brut ou de sous-titres à intégrer dans votre propre pipeline, sans Python ni couche complète de montage vidéo, consultez la revue de whisper.cpp. Vérifiez les fonctionnalités actuelles de chaque projet sur son propre dépôt avant de choisir.

Pour qui FunClip est-il fait ?

FunClip convient à ceux qui doivent régulièrement transformer de longs enregistrements en clips courts et souhaitent automatiser ce processus par la transcription et un LLM, plutôt que par un parcours manuel.

Pour quoi FunClip n'est pas adapté

FunClip ne convient pas si vous voulez un service hébergé sans installation ou un éditeur vidéo généraliste allant au-delà de la sélection de clips et des sous-titres.

  • Ce n'est pas un produit hébergé — il n'existe aucun palier cloud géré ; vous l'installez et l'exécutez vous-même via git clone et un environnement Python
  • Ce n'est pas un éditeur vidéo généraliste — il se concentre spécifiquement sur la sélection de clips guidée par la transcription et la génération de sous-titres, pas sur le montage sur timeline, l'étalonnage ou les effets
  • Ce n'est pas configuration zéro — faire fonctionner la sélection de clips assistée par IA nécessite de configurer vous-même un LLM, en plus de l'installation Python/FunASR
  • La prise en charge des systèmes d'exploitation n'est pas garantie ni détaillée — la documentation propre du projet ne liste pas de systèmes d'exploitation précis pris en charge au-delà de la décrire comme une application Python/Gradio, vérifiez donc la compatibilité avec votre propre environnement avant de vous y fier
  • Non testé de manière indépendante par PromptQuorum pour la précision de transcription — cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip, pas sur des tests pratiques de précision

Erreurs courantes lors de l'évaluation de FunClip

La plupart des confusions autour de FunClip viennent du fait d'attendre un éditeur vidéo complet, de manquer l'option de mode de langue, ou de supposer qu'il ne nécessite aucune configuration LLM supplémentaire.

Concurrents et alternatives

FunClip est le plus souvent comparé à d'autres outils locaux et auto-hébergés de reconnaissance vocale comme whisper.cpp, faster-whisper et MacWhisper — son principal élément différenciateur est d'aller au-delà de la simple transcription brute vers une sélection de clips assistée par IA complète et un export vidéo avec sous-titres incrustés.

Tool
Best known for
Link
whisper.cppPortage C/C++ gratuit et sous licence MIT d'OpenAI Whisper pour la transcription sur l'appareilRevue whisper.cpp
faster-whisperRéimplémentation de Whisper basée sur CTranslate2, optimisée pour la vitesse sur GPU/CPURevue faster-whisper
MacWhisperApplication de transcription native macOS aboutie, basée sur les modèles WhisperRevue MacWhisper

Cette liste reflète les outils couramment comparés à FunClip côté transcription, pas un classement indépendant de PromptQuorum — vérifiez les fonctionnalités actuelles de chaque outil avant de choisir. Aucun de ces trois outils n'ajoute la couche de sélection de clips assistée par IA et d'export vidéo de FunClip ; ce sont des moteurs/applications de transcription, pas des outils de découpage. Voir aussi la comparaison FunClip vs. Whisper.cpp ci-dessus.

Questions fréquentes

Qu'est-ce que FunClip ?

FunClip (github.com/modelscope/FunClip) est un outil de découpage vidéo gratuit, open source et auto-hébergé développé par ModelScope, qui transcrit les vidéos avec les modèles de reconnaissance vocale FunASR et utilise un LLM pour trouver et découper les segments souhaités.

FunClip est-il gratuit ?

Oui, FunClip est gratuit et open source (code source sous licence MIT ; poids du modèle FunASR sous licence Apache 2.0 séparément). Il n'existe ni palier payant ni service hébergé — vous l'exécutez sur votre propre matériel.

Comment installer FunClip ?

Selon le README propre du projet, clonez le dépôt GitHub et installez les dépendances depuis requirements.txt dans un environnement virtuel Python 3.12+. Des archives de versions numérotées avec sommes de contrôle SHA256 sont également disponibles sur la page des versions.

FunClip prend-il en charge l'anglais ?

Oui, FunClip transcrit en mandarin par défaut mais documente un mode anglais via l'option -l en, ainsi qu'une prise en charge multilingue via le modèle SenseVoice.

FunClip fonctionne-t-il en ligne de commande ?

Oui, en plus de l'interface web Gradio locale (par défaut sur localhost:7860), FunClip fournit un script en ligne de commande, videoclipper.py, pour la reconnaissance et le découpage direct de vidéos.

FunClip génère-t-il automatiquement des sous-titres ?

Oui, FunClip génère automatiquement des sous-titres SRT à la fois pour la vidéo complète et pour chaque segment découpé individuellement, en utilisant la transcription de FunASR avec horodatages intégrés.

Qui développe FunClip ?

ModelScope, la plateforme de modèles ouverts d'Alibaba, développe FunClip dans le cadre des travaux de son laboratoire vocal TONGYI. Le dépôt GitHub canonique est modelscope/FunClip.

FunClip a-t-il besoin d'un LLM pour fonctionner ?

Les fonctionnalités principales de transcription et d'export manuel de clips fonctionnent sans LLM. La fonctionnalité de sélection de clips assistée par IA, où vous décrivez un moment et l'outil le trouve, nécessite de configurer un LLM séparément.

FunClip peut-il identifier différents locuteurs dans un enregistrement ?

Oui, FunClip inclut la reconnaissance des locuteurs CAM++, permettant de découper des segments par locuteur spécifique — utile pour les interviews, tables rondes ou enregistrements à plusieurs personnes.

PromptQuorum a-t-il testé indépendamment la précision de transcription de FunClip ?

Cette revue s'appuie sur le dépôt GitHub et le README propres de FunClip, plutôt que sur des tests pratiques de précision de transcription réalisés par PromptQuorum.

Sources

← Retour aux LLM locaux avancés