Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/FunClipレビュー: FunASRによるセルフホスト型AI動画クリッピング
Voice, Speech & Multimodal

FunClipレビュー: FunASRによるセルフホスト型AI動画クリッピング

·9分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

FunClipは、Alibabaのオープンモデルプラットフォームである ModelScope が開発した、無料・オープンソース・セルフホスト型の動画クリッピングツールです。 FunASRの音声認識モデルで動画を文字起こしし、LLMを使って切り出したい区間を見つけてカットし、字幕も自動生成します。MITライセンス(基盤となるFunASRのモデル重みはApache 2.0ライセンス)で、ローカルのGradio Web UIまたはコマンドラインから実行でき、デフォルトでは標準中国語(普通話)を文字起こしします。英語モードと多言語対応のSenseVoiceも利用可能です。

FunClip(github.com/modelscope/FunClip)は、Alibabaのオープンモデルプラットフォームである ModelScope が開発した、無料・オープンソース・セルフホスト型の動画クリッピングツールです。FunASRの音声認識モデルで動画を文字起こしし、LLMを使って切り出したい区間を特定・カットし、字幕も自動生成します。GitHubスターは6,300を超えています。このレビューでは、FunClipが実際に何をするか、インストールと実行方法、対応言語、そしてどんな人に向いているかを解説します。

重要なポイント

  • FunClip(github.com/modelscope/FunClip)は無料・オープンソース・セルフホスト型の動画クリッピングツールであり、ホスト型のWebサービスではない
  • TONGYI音声研究室の取り組みの一環として、AlibabaのオープンモデルプラットフォームであるModelScopeが開発
  • ソースコードはMITライセンス(GitHubリポジトリのLICENSEファイルで確認)。基盤となるFunASRのモデル重みは別途Apache 2.0ライセンス
  • 音声からテキストへの変換はFunASRのParaformer-Largeモデルによるもので、CAM++による話者認識とSeACo-Paraformerによるホットワードのカスタマイズを備える
  • LLM支援によるクリップ選択: 欲しい区間を説明すると、LLMバックエンドが一致するタイムスタンプを特定する
  • インターフェース: ローカルGradio Web UI(デフォルトでlocalhost:7860)と、コマンドラインスクリプトvideoclipper.py
  • 言語対応: デフォルトは標準中国語、-l enフラグによる英語モード、SenseVoiceモデルによる多言語対応(感情検出も含む)
  • 本レビュー時点の最新リリース: v2.2.1
  • 本レビュー時点でGitHubスターは6,300を超える

📍 一文で説明

FunClipは、ModelScope製の無料・オープンソース(MIT)・セルフホスト型の動画クリッピングツールで、FunASRの音声認識モデルで動画を文字起こしし、LLMを使って切り出したい区間を見つけてカットします。字幕の自動生成、話者認識に対応し、GitHubスターは6,300を超えています。

💬 簡潔に説明

FunClipは、長い動画を代わりに見て、話されている内容をすべて書き起こし(文字起こし)、欲しい場面を説明すると、AIモデルがその場面を見つけて自動的にクリップを切り出します。字幕もすでに焼き込まれた状態か、あるいは添付された状態で出力されます。自分のパソコンやサーバー上で、ローカルのWebページまたはコマンドラインから動かします。無料ですが自分でインストールする必要があり、AI部分を動かすには音声モデルと言語モデルを実行できる十分なハードウェアが必要です。

📌補足: このレビューはFunClip自身のGitHubリポジトリとREADMEに基づいています。PromptQuorumがFunClipの文字起こし精度について独自のハンズオンベンチマークを実施したという主張はしておらず、ModelScope/Alibabaの開発者としての役割は地政学的な文脈付けをせず事実として記載しています。

FunClipとは?

FunClipは、手動で素材を延々と確認する代わりに、音声からテキストへの文字起こしとLLM支援による場面選択を組み合わせて動画クリッピングを自動化する、セルフホスト型のオープンソースツールです。 Alibabaのオープンモデルプラットフォームである ModelScope が開発しており、同チーム自身のFunASR音声認識モデルを基盤としています。

  • 製品タイプ: セルフホスト型のWeb/CLIツール。git cloneとPythonでインストールし、ダウンロード型のデスクトップアプリでもホスト型のSaaS製品でもない
  • 開発元: ModelScope(Alibabaのオープンモデルプラットフォーム)、具体的にはそのTONGYI音声研究室の取り組み
  • ライセンス: FunClip自体のソースコードはMIT(GitHubリポジトリのLICENSEファイルで確認)。依存する基盤のFunASRモデル重みは別途Apache 2.0ライセンス
  • 中核となる依存関係: FunASR。ModelScope自身のオープンソース音声認識ツールキットで、FunClipは独自のASRモデルをゼロから構築するのではなく、これを文字起こしに利用している
  • 規模: 本レビュー時点でGitHubスターは6,300を超える
  • 最新リリース: v2.2.1。プロジェクト自身の変更履歴によれば、Pillowベースのレンダラーにより選択した字幕の色を保持するようになった

FunClipは実際に何をする?

FunClipは動画ファイルを受け取り、その中の音声を文字起こしし、その後あなた(またはあなたの説明に基づくLLM)が特定の瞬間を選んで、すでに字幕が生成された独立クリップとして切り出せるようにします。

  • 自動文字起こし: FunASRのParaformer-Largeモデルが動画の音声を統合されたタイムスタンプ予測付きで文字起こしし、発話された各区間を動画内の正確な位置に対応付ける
  • 話者認識: CAM++による話者識別により、特定の話者ごとにセグメントを切り出せる。インタビューやパネルディスカッション、複数人の収録に有用
  • ホットワードのカスタマイズ: SeACo-Paraformerの統合により、固有名詞や特定の用語を事前に指定して、それらの語の認識精度を向上できる
  • LLM支援によるクリップ選択: 文字起こし全体を手動で確認する代わりに、欲しい瞬間を説明すると、LLMバックエンドが切り出すべきタイムスタンプを特定する
  • 字幕の自動生成: FunClipは動画全体と個々の切り出しクリップの両方について、SRT字幕を自動生成する
  • 字幕レンダリング: バージョン2.2.1で、出力動画に選択した字幕の色を保持するPillowベースのレンダラーが追加された
  • 複数セグメント出力: FunClipは1回の処理で1本の元動画から複数のクリップを生成でき、クリップごとに個別に実行する必要はない

使用例: FunClipの2つの使い方

これらはFunClip自身が文書化している機能から構成されたワークフローであり、仮定の使用例ではありません。

プラットフォーム、料金、ライセンス

プラットフォーム

FunClipの記載内容:
セルフホスト型のPythonアプリケーション。ローカルGradio Web UIとコマンドラインスクリプトを提供。原理上はクロスプラットフォームだが、具体的な対応OSはドキュメントに列挙されていない。

料金

FunClipの記載内容:
無料でオープンソース。有料プランやホスト型サービスはなく、自分のハードウェア上で実行する。

ライセンス

FunClipの記載内容:
ソースコードはMIT(GitHubリポジトリのLICENSEファイルで確認)。FunASRのモデル重みは別途Apache 2.0ライセンス。

インストール方法

FunClipの記載内容:
プロジェクト自身のREADMEによれば、GitHubリポジトリをクローンし、Python 3.12以上の仮想環境内でrequirements.txtから依存関係をインストールする。SHA256チェックサム付きのバージョン管理されたリリースアーカイブ(例: FunClip-2.2.1.tar.gz/.zip)も利用可能。

バージョンによって要件が変わることがあるため、インストール前にGitHubリポジトリで現在推奨されているPythonバージョンと依存関係リストを直接確認してください。

FunClip vs. Whisper.cpp

FunClipとwhisper.cppはどちらもローカルで音声からテキストへの変換を行いますが、解決する課題が異なります。 Whisper.cppは他のプロジェクトに組み込むための、依存関係が少ない軽量なC/C++の文字起こしエンジンです。一方FunClipは、FunASRによる文字起こしの上に構築された完全なアプリケーション層で、LLM支援によるクリップ選択、話者認識、字幕焼き込み動画エクスポートを追加しています。

項目
FunClip
Whisper.cpp
主な目的文字起こしを基盤としたエンドツーエンドの動画クリッピングアプリ他のツールに組み込み可能な文字起こしエンジン
音声モデルFunASR Paraformer-Large / SenseVoiceOpenAI Whisperの重み(C/C++移植版)
出力生成された字幕付きの切り出し動画クリップ文字起こし/字幕テキストのみ
インターフェースローカルGradio Web UI + CLIスクリプトコマンドラインとライブラリバインディング
ランタイム依存Python 3.12以上、FunASR、LLMバックエンドPythonランタイム不要
開発元ModelScope(Alibaba)Georgi Gerganov / ggml-org

手作業での編集を最小限にして字幕付きの完成された動画クリップを得たいなら、FunClipの内蔵クリップ選択・エクスポートパイプラインの方が、最初から多くをこなしてくれます。Pythonやフル機能の動画編集層なしで、独自パイプラインに投入する生の文字起こしテキストや字幕だけが必要なら、whisper.cppのレビューを参照してください。選択する前に、各プロジェクトのリポジトリで現在の機能セットを確認してください。

FunClipはどんな人に向いている?

FunClipは、長い収録を短いクリップに定期的に変換する必要があり、手動での確認ではなく文字起こしとLLMでそのプロセスを自動化したい人に向いています。

FunClipが向かないケース

FunClipは、インストール不要のホスト型サービスや、クリップ選択・字幕生成を超えた汎用動画編集ソフトを求めている場合には向いていません。

  • ホスト型製品ではない — マネージドクラウドプランは存在せず、git cloneとPython環境を使って自分自身でインストール・実行する
  • 汎用の動画編集ソフトではない — タイムライン編集、カラーグレーディング、エフェクトではなく、文字起こし主導のクリップ選択と字幕生成に特化している
  • ゼロコンフィグではない — LLM支援クリップ選択を機能させるには、Python/FunASRのインストールに加えて、自分でLLMバックエンドを設定する必要がある
  • 列挙された形でのOSレベルの対応が保証されているとは限らない — プロジェクト自身のドキュメントは、Python/Gradioアプリであるという説明以上に具体的な対応OSを列挙していないため、依存する前に自分の環境との互換性を確認する必要がある
  • PromptQuorumによって文字起こし精度が独自に検証されたわけではない — このレビューはFunClip自身のGitHubリポジトリとREADMEに基づいており、実際の精度テストに基づくものではない

FunClip評価時によくある誤解

FunClipに関する混乱の多くは、フル機能の動画編集ソフトを期待すること、言語モードのフラグを見落とすこと、追加のLLM設定が不要だと思い込むことから生じます。

競合とその他の選択肢

FunClipは、whisper.cpp、faster-whisper、MacWhisperなど、他のローカル・セルフホスト型の音声認識ツールと比較されることが最も多いです。主な差別化要因は、生の文字起こしにとどまらず、LLM支援によるフルのクリップ選択と字幕焼き込み動画エクスポートまで踏み込んでいる点です。

Tool
Best known for
Link
whisper.cppオンデバイス文字起こし向けの、無料でMITライセンスのOpenAI Whisper C/C++移植版Whisper.cppレビュー
faster-whisperGPU/CPUでの速度を最適化した、CTranslate2ベースのWhisper再実装Faster-Whisperレビュー
MacWhisperWhisperモデルを基盤とした、完成度の高いネイティブmacOS文字起こしアプリMacWhisperレビュー

このリストは、文字起こし面でFunClipとよく比較されるツールを反映したものであり、PromptQuorumによる独自のランキングではありません。選択する前に各ツールの現在の機能セットを確認してください。これら3つのツールはいずれも、FunClipのLLM支援クリップ選択と動画エクスポート層を備えておらず、クリッピングツールではなく文字起こしエンジン/アプリです。上記のFunClip vs. Whisper.cppの比較も参照してください。

よくある質問

FunClipとは何ですか。

FunClip(github.com/modelscope/FunClip)は、ModelScopeが開発した無料・オープンソース・セルフホスト型の動画クリッピングツールで、FunASRの音声認識モデルで動画を文字起こしし、LLMで切り出したい区間を見つけてカットします。

FunClipは無料ですか。

はい、FunClipは無料でオープンソースです(ソースコードはMITライセンス。FunASRのモデル重みは別途Apache 2.0ライセンス)。有料プランやホスト型サービスはなく、自分のハードウェア上で実行します。

FunClipのインストール方法は?

プロジェクト自身のREADMEによれば、GitHubリポジトリをクローンし、Python 3.12以上の仮想環境内でrequirements.txtから依存関係をインストールします。SHA256チェックサム付きのバージョン管理されたリリースアーカイブも、リリースページで入手できます。

FunClipは英語に対応していますか。

はい、FunClipはデフォルトで標準中国語を文字起こししますが、-l enフラグによる英語モードと、SenseVoiceモデルによる多言語対応を文書化しています。

FunClipはコマンドラインから動作しますか。

はい、ローカルGradio Web UI(デフォルトでlocalhost:7860)に加えて、FunClipは動画の直接認識・クリッピング用のコマンドラインスクリプトvideoclipper.pyを提供しています。

FunClipは字幕を自動生成しますか。

はい、FunClipは統合されたタイムスタンプ付きのFunASRの文字起こしを使い、動画全体と個々の切り出しクリップの両方についてSRT字幕を自動生成します。

FunClipは誰が開発していますか。

Alibabaのオープンモデルプラットフォームである ModelScope が、TONGYI音声研究室の取り組みの一環としてFunClipを開発しています。正式なGitHubリポジトリはmodelscope/FunClipです。

FunClipを使うにはLLMが必要ですか。

中核となる文字起こしと手動でのクリップエクスポート機能はLLMなしでも動作します。瞬間を説明するとツールが見つけてくれるLLM支援のクリップ選択機能には、LLMバックエンドを別途設定する必要があります。

FunClipは収録中の異なる話者を識別できますか。

はい、FunClipにはCAM++による話者認識が組み込まれており、特定の話者ごとにセグメントを切り出せます。インタビューやパネルディスカッション、複数人の収録に有用です。

PromptQuorumはFunClipの文字起こし精度を独自に検証しましたか。

このレビューは、PromptQuorumによる実地でのベンチマークではなく、FunClip自身のGitHubリポジトリとREADMEに基づいています。

出典

← ローカルLLM活用 に戻る