Skip to main content
PromptQuorum
主页/本地LLM进阶/FunClip 评测:基于 FunASR 的自托管 AI 视频剪辑工具
Voice, Speech & Multimodal

FunClip 评测:基于 FunASR 的自托管 AI 视频剪辑工具

·阅读约9分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

FunClip 是阿里巴巴开源模型平台 ModelScope 开发的免费、开源、自托管视频剪辑工具,使用 FunASR 语音识别模型转录视频,再用 LLM 查找并剪出你想要的片段,同时自动生成字幕。 它采用 MIT 许可证(底层 FunASR 模型权重采用 Apache 2.0 许可证),可通过本地 Gradio Web 界面或命令行运行,默认转录普通话,同时也提供英语模式和支持多语言的 SenseVoice 模型。

FunClip(github.com/modelscope/FunClip)是由阿里巴巴开源模型平台 ModelScope 开发的免费、开源、自托管视频剪辑工具。它使用 FunASR 语音识别模型转录视频,再用 LLM 识别并剪出你想要的片段,同时自动生成字幕,GitHub 星标数已超过 6,300。这篇评测介绍它到底能做什么、如何安装运行、支持哪些语言,以及适合什么人使用。

关键要点

  • FunClip(github.com/modelscope/FunClip)是免费、开源、自托管的视频剪辑工具,而不是托管的网页服务
  • 由阿里巴巴开源模型平台 ModelScope 开发,是其通义语音实验室工作的一部分
  • 源代码采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;底层 FunASR 模型权重单独采用 Apache 2.0 许可证
  • 语音转文本基于 FunASR 的 Paraformer-Large 模型,配合 CAM++ 说话人识别和 SeACo-Paraformer 热词定制
  • LLM 辅助片段选择:描述你想要的片段,LLM 后端会识别匹配的时间戳
  • 界面:本地 Gradio Web UI(默认地址为 localhost:7860)和命令行脚本 videoclipper.py
  • 语言支持:默认普通话,通过 -l en 参数启用英语模式,并通过 SenseVoice 模型支持多语言(含情感检测)
  • 截至本评测撰写时的最新版本:v2.2.1
  • 截至本评测撰写时,GitHub 星标数已超过 6,300

📍 简单一句话

FunClip 是 ModelScope 出品的免费、开源(MIT)、自托管视频剪辑工具,GitHub 星标超过 6,300,它使用 FunASR 语音识别模型转录视频,并用 LLM 查找并剪出你想要的片段,同时提供自动字幕生成和说话人识别。

💬 简单来说

FunClip 会替你看一遍长视频,把说的内容全部记录下来(转录),然后当你描述想要哪个瞬间时,AI 模型会找到那个瞬间并自动剪出片段,字幕已经烧录或附加在其中。它通过本地网页或命令行,在你自己的电脑或服务器上运行——完全免费,但需要自己安装,而且 AI 部分需要足够的硬件来运行语音和语言模型。

📌: 本评测基于 FunClip 自身的 GitHub 仓库和 README。本文并未声称 PromptQuorum 对 FunClip 的转录准确率进行过实测,对 ModelScope/阿里巴巴作为开发者的角色仅作事实陈述,不带地缘政治色彩。

FunClip 是什么?

FunClip 是一款自托管的开源工具,它将语音转文本转录与 LLM 辅助的片段选择结合起来,自动完成视频剪辑,而不需要你手动翻看原始素材。 它由阿里巴巴开源模型平台 ModelScope 开发,基于该团队自研的 FunASR 语音识别模型构建。

  • 产品类型:自托管的 Web/CLI 工具——通过 git clone 和 Python 安装,不是可下载的桌面应用,也不是托管的 SaaS 产品
  • 开发者:ModelScope(阿里巴巴开源模型平台),具体来自其通义语音实验室的工作
  • 许可证:FunClip 源代码本身采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;其依赖的底层 FunASR 模型权重单独采用 Apache 2.0 许可证
  • 核心依赖:FunASR,ModelScope 自研的开源语音识别工具包,FunClip 用它来做转录,而不是从零构建自己的 ASR 模型
  • 规模:截至本评测撰写时,GitHub 星标数已超过 6,300
  • 最新版本:v2.2.1,该项目自身的更新日志称此版本通过基于 Pillow 的渲染器保留了所选的字幕颜色

FunClip 实际能做什么?

FunClip 接收一个视频文件,转录其中的语音,然后让你(或根据你的描述由 LLM)选择特定瞬间,剪成带有已生成字幕的独立片段。

  • 自动转录:FunASR 的 Paraformer-Large 模型转录视频中的语音,并内置时间戳预测,使每个说话片段都精确对应视频中的某一时刻
  • 说话人识别:CAM++ 说话人识别功能让你可以按特定说话人剪辑片段,适用于访谈、圆桌讨论或多人录制内容
  • 热词定制:SeACo-Paraformer 集成允许你提前指定实体名称或特定术语,以提升这些词语的识别准确率
  • LLM 辅助片段选择:无需手动翻查完整转录文本,只需描述你想要的瞬间,LLM 后端就会识别出应剪辑的匹配时间戳
  • 自动字幕生成:FunClip 会为完整视频和每个剪辑片段分别自动生成 SRT 字幕
  • 字幕渲染:2.2.1 版本新增了基于 Pillow 的渲染器,可在输出视频中保留所选的字幕颜色
  • 多片段输出:FunClip 可以在一次处理中从同一个源视频生成多个片段,无需为每个片段单独运行一次

使用示例:两种使用 FunClip 的方式

以下是基于 FunClip 自身文档化功能构建的工作流程,并非假设性的使用场景。

平台、价格与许可证

平台

FunClip 的说明:
自托管的 Python 应用;提供本地 Gradio Web UI 和命令行脚本。原则上跨平台,但文档中未列出具体支持的操作系统。

费用

FunClip 的说明:
免费且开源。没有付费套餐,也没有托管服务;你需要在自己的硬件上运行。

许可证

FunClip 的说明:
源代码采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;FunASR 模型权重单独采用 Apache 2.0 许可证。

安装方式

FunClip 的说明:
根据该项目自身的 README,克隆 GitHub 仓库,并在 Python 3.12 以上的虚拟环境中从 requirements.txt 安装依赖。也提供带 SHA256 校验和的版本化发布压缩包(例如 FunClip-2.2.1.tar.gz/.zip)。

安装前请直接在 GitHub 仓库 中确认当前推荐的 Python 版本和依赖列表,因为不同版本之间的要求可能会变化。

FunClip 对比 Whisper.cpp

FunClip 和 whisper.cpp 都在本地运行语音转文本,但解决的是不同的问题。 Whisper.cpp 是一个精简、依赖极少的 C/C++ 转录引擎,可嵌入其他项目;FunClip 则是构建在 FunASR 转录之上的完整应用层,增加了 LLM 辅助片段选择、说话人识别和字幕烧录视频导出功能。

方面
FunClip
Whisper.cpp
主要用途基于转录构建的端到端视频剪辑应用可嵌入其他工具的转录引擎
语音模型FunASR Paraformer-Large / SenseVoiceOpenAI Whisper 权重(C/C++ 移植版)
输出带生成字幕的剪辑视频片段仅转录/字幕文本
界面本地 Gradio Web UI + CLI 脚本命令行和库绑定
运行依赖Python 3.12+、FunASR、一个 LLM 后端无需 Python 运行环境
开发者ModelScope(阿里巴巴)Georgi Gerganov / ggml-org

如果你的目标是以最少的手动编辑得到带字幕的成品视频片段,FunClip 内置的片段选择和导出流程开箱即可完成更多工作。如果你只需要原始转录文本或字幕、并接入自己的流程,而不需要 Python 或完整的视频编辑层,可参考 whisper.cpp 评测。选择前请在各项目自己的仓库中确认当前功能集。

谁适合使用 FunClip?

FunClip 适合那些需要定期把长录制内容剪成短片段、并希望通过转录加 LLM 实现自动化,而不是手动翻查的人群。

FunClip 不适合哪些场景

如果你想要的是无需安装的托管服务,或者超出片段选择和字幕生成范围的通用视频编辑器,FunClip 并不适合。

  • 不是托管产品——没有托管云端套餐;你需要通过 git clone 和 Python 环境自行安装和运行
  • 不是通用视频编辑器——它专注于转录驱动的片段选择和字幕生成,而不是时间线编辑、调色或特效
  • 不是零配置的——要让 LLM 辅助片段选择正常工作,除了 Python/FunASR 安装外,还需要自己配置一个 LLM 后端
  • 不保证列出具体的操作系统级支持——该项目自身的文档除了将其描述为 Python/Gradio 应用之外,并未列出具体支持的操作系统,因此在依赖它之前应先确认与自身环境的兼容性
  • 转录准确率未经 PromptQuorum 独立测试——本评测基于 FunClip 自身的 GitHub 仓库和 README,而非实测的准确率测试

评估 FunClip 时的常见误区

关于 FunClip 的大多数困惑,来自期望它是一个完整的视频编辑器、忽略语言模式参数,或者假设它不需要额外的 LLM 配置。

竞品与替代方案

FunClip 最常被拿来与 whisper.cpp、faster-whisper、MacWhisper 等本地自托管语音转文本工具相比较——它的主要差异化之处在于,不止步于原始转录,而是进一步提供了完整的 LLM 辅助片段选择和字幕烧录视频导出能力。

Tool
Best known for
Link
whisper.cpp免费、MIT 许可证的 OpenAI Whisper C/C++ 移植版,用于设备端转录Whisper.cpp 评测
faster-whisper基于 CTranslate2 的 Whisper 重新实现,针对 GPU/CPU 速度做了优化Faster-Whisper 评测
MacWhisper基于 Whisper 模型构建的精致原生 macOS 转录应用MacWhisper 评测

此列表反映的是转录方面常与 FunClip 比较的工具,并非 PromptQuorum 的独立排名——选择前请确认各工具当前的功能集。这三款工具都没有 FunClip 的 LLM 辅助片段选择和视频导出能力;它们是转录引擎/应用,而不是剪辑工具。另请参见上方 FunClip 对比 Whisper.cpp 的详细比较。

常见问题

FunClip 是什么?

FunClip(github.com/modelscope/FunClip)是 ModelScope 开发的免费、开源、自托管视频剪辑工具,它使用 FunASR 语音识别模型转录视频,并用 LLM 查找并剪出你想要的片段。

FunClip 是免费的吗?

是的,FunClip 免费且开源(源代码采用 MIT 许可证;FunASR 模型权重单独采用 Apache 2.0 许可证)。没有付费套餐,也没有托管服务——你需要在自己的硬件上运行它。

如何安装 FunClip?

根据该项目自身的 README,克隆 GitHub 仓库,并在 Python 3.12 以上的虚拟环境中从 requirements.txt 安装依赖。带 SHA256 校验和的版本化发布压缩包也可以在发布页面获取。

FunClip 支持英语吗?

是的,FunClip 默认转录普通话,但文档说明可通过 -l en 参数启用英语模式,并通过 SenseVoice 模型支持多语言。

FunClip 能通过命令行使用吗?

可以,除了本地 Gradio Web UI(默认地址为 localhost:7860)之外,FunClip 还提供了用于直接识别和剪辑视频的命令行脚本 videoclipper.py

FunClip 会自动生成字幕吗?

会,FunClip 使用带有内置时间戳的 FunASR 转录结果,为完整视频和每个剪辑片段分别自动生成 SRT 字幕。

FunClip 由谁开发?

阿里巴巴开源模型平台 ModelScope 开发了 FunClip,是其通义语音实验室工作的一部分。官方 GitHub 仓库是 modelscope/FunClip。

FunClip 运行需要 LLM 吗?

核心的转录和手动剪辑导出功能无需 LLM 即可使用。而描述某个瞬间、由工具自动找到的 LLM 辅助片段选择功能,需要单独配置一个 LLM 后端。

FunClip 能识别录制内容中的不同说话人吗?

可以,FunClip 内置了 CAM++ 说话人识别功能,让你可以按特定说话人剪辑片段——适用于访谈、圆桌讨论或多人录制内容。

PromptQuorum 是否独立测试过 FunClip 的转录准确率?

本评测基于 FunClip 自身的 GitHub 仓库和 README,而非 PromptQuorum 的实测转录准确率基准测试。

资料来源

← 返回 本地LLM进阶