关键要点
- FunClip(github.com/modelscope/FunClip)是免费、开源、自托管的视频剪辑工具,而不是托管的网页服务
- 由阿里巴巴开源模型平台 ModelScope 开发,是其通义语音实验室工作的一部分
- 源代码采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;底层 FunASR 模型权重单独采用 Apache 2.0 许可证
- 语音转文本基于 FunASR 的 Paraformer-Large 模型,配合 CAM++ 说话人识别和 SeACo-Paraformer 热词定制
- LLM 辅助片段选择:描述你想要的片段,LLM 后端会识别匹配的时间戳
- 界面:本地 Gradio Web UI(默认地址为
localhost:7860)和命令行脚本videoclipper.py - 语言支持:默认普通话,通过
-l en参数启用英语模式,并通过 SenseVoice 模型支持多语言(含情感检测) - 截至本评测撰写时的最新版本:v2.2.1
- 截至本评测撰写时,GitHub 星标数已超过 6,300
📍 简单一句话
FunClip 是 ModelScope 出品的免费、开源(MIT)、自托管视频剪辑工具,GitHub 星标超过 6,300,它使用 FunASR 语音识别模型转录视频,并用 LLM 查找并剪出你想要的片段,同时提供自动字幕生成和说话人识别。
💬 简单来说
FunClip 会替你看一遍长视频,把说的内容全部记录下来(转录),然后当你描述想要哪个瞬间时,AI 模型会找到那个瞬间并自动剪出片段,字幕已经烧录或附加在其中。它通过本地网页或命令行,在你自己的电脑或服务器上运行——完全免费,但需要自己安装,而且 AI 部分需要足够的硬件来运行语音和语言模型。
📌注: 本评测基于 FunClip 自身的 GitHub 仓库和 README。本文并未声称 PromptQuorum 对 FunClip 的转录准确率进行过实测,对 ModelScope/阿里巴巴作为开发者的角色仅作事实陈述,不带地缘政治色彩。
FunClip 是什么?
FunClip 是一款自托管的开源工具,它将语音转文本转录与 LLM 辅助的片段选择结合起来,自动完成视频剪辑,而不需要你手动翻看原始素材。 它由阿里巴巴开源模型平台 ModelScope 开发,基于该团队自研的 FunASR 语音识别模型构建。
- 产品类型:自托管的 Web/CLI 工具——通过 git clone 和 Python 安装,不是可下载的桌面应用,也不是托管的 SaaS 产品
- 开发者:ModelScope(阿里巴巴开源模型平台),具体来自其通义语音实验室的工作
- 许可证:FunClip 源代码本身采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;其依赖的底层 FunASR 模型权重单独采用 Apache 2.0 许可证
- 核心依赖:FunASR,ModelScope 自研的开源语音识别工具包,FunClip 用它来做转录,而不是从零构建自己的 ASR 模型
- 规模:截至本评测撰写时,GitHub 星标数已超过 6,300
- 最新版本:v2.2.1,该项目自身的更新日志称此版本通过基于 Pillow 的渲染器保留了所选的字幕颜色
FunClip 实际能做什么?
FunClip 接收一个视频文件,转录其中的语音,然后让你(或根据你的描述由 LLM)选择特定瞬间,剪成带有已生成字幕的独立片段。
- 自动转录:FunASR 的 Paraformer-Large 模型转录视频中的语音,并内置时间戳预测,使每个说话片段都精确对应视频中的某一时刻
- 说话人识别:CAM++ 说话人识别功能让你可以按特定说话人剪辑片段,适用于访谈、圆桌讨论或多人录制内容
- 热词定制:SeACo-Paraformer 集成允许你提前指定实体名称或特定术语,以提升这些词语的识别准确率
- LLM 辅助片段选择:无需手动翻查完整转录文本,只需描述你想要的瞬间,LLM 后端就会识别出应剪辑的匹配时间戳
- 自动字幕生成:FunClip 会为完整视频和每个剪辑片段分别自动生成 SRT 字幕
- 字幕渲染:2.2.1 版本新增了基于 Pillow 的渲染器,可在输出视频中保留所选的字幕颜色
- 多片段输出:FunClip 可以在一次处理中从同一个源视频生成多个片段,无需为每个片段单独运行一次
使用示例:两种使用 FunClip 的方式
以下是基于 FunClip 自身文档化功能构建的工作流程,并非假设性的使用场景。
平台、价格与许可证
平台
- FunClip 的说明:
- 自托管的 Python 应用;提供本地 Gradio Web UI 和命令行脚本。原则上跨平台,但文档中未列出具体支持的操作系统。
费用
- FunClip 的说明:
- 免费且开源。没有付费套餐,也没有托管服务;你需要在自己的硬件上运行。
许可证
- FunClip 的说明:
- 源代码采用 MIT 许可证,已通过 GitHub 仓库的 LICENSE 文件确认;FunASR 模型权重单独采用 Apache 2.0 许可证。
安装方式
- FunClip 的说明:
- 根据该项目自身的 README,克隆 GitHub 仓库,并在 Python 3.12 以上的虚拟环境中从
requirements.txt安装依赖。也提供带 SHA256 校验和的版本化发布压缩包(例如 FunClip-2.2.1.tar.gz/.zip)。
安装前请直接在 GitHub 仓库 中确认当前推荐的 Python 版本和依赖列表,因为不同版本之间的要求可能会变化。
安装 FunClip
FunClip 可通过 git clone 和 pip 免费安装,其源代码和版本化发布压缩包都在 GitHub 上。
Source | Link |
|---|---|
| GitHub 仓库(源代码,MIT) | github.com/modelscope/FunClip |
| 版本化发布压缩包(带 SHA256 校验和) | github.com/modelscope/FunClip/releases |
| FunASR(底层语音识别工具包) | github.com/modelscope/FunASR |
| ModelScope 平台 | modelscope.cn |
FunClip 需要 Python 3.12 以上的环境,以及足够运行 FunASR 语音识别模型和你所选 LLM 后端的本地硬件——没有图形安装程序,也没有可以登录的托管免费套餐。
FunClip 对比 Whisper.cpp
FunClip 和 whisper.cpp 都在本地运行语音转文本,但解决的是不同的问题。 Whisper.cpp 是一个精简、依赖极少的 C/C++ 转录引擎,可嵌入其他项目;FunClip 则是构建在 FunASR 转录之上的完整应用层,增加了 LLM 辅助片段选择、说话人识别和字幕烧录视频导出功能。
方面 | FunClip | Whisper.cpp |
|---|---|---|
| 主要用途 | 基于转录构建的端到端视频剪辑应用 | 可嵌入其他工具的转录引擎 |
| 语音模型 | FunASR Paraformer-Large / SenseVoice | OpenAI Whisper 权重(C/C++ 移植版) |
| 输出 | 带生成字幕的剪辑视频片段 | 仅转录/字幕文本 |
| 界面 | 本地 Gradio Web UI + CLI 脚本 | 命令行和库绑定 |
| 运行依赖 | Python 3.12+、FunASR、一个 LLM 后端 | 无需 Python 运行环境 |
| 开发者 | ModelScope(阿里巴巴) | Georgi Gerganov / ggml-org |
如果你的目标是以最少的手动编辑得到带字幕的成品视频片段,FunClip 内置的片段选择和导出流程开箱即可完成更多工作。如果你只需要原始转录文本或字幕、并接入自己的流程,而不需要 Python 或完整的视频编辑层,可参考 whisper.cpp 评测。选择前请在各项目自己的仓库中确认当前功能集。
谁适合使用 FunClip?
FunClip 适合那些需要定期把长录制内容剪成短片段、并希望通过转录加 LLM 实现自动化,而不是手动翻查的人群。
FunClip 不适合哪些场景
如果你想要的是无需安装的托管服务,或者超出片段选择和字幕生成范围的通用视频编辑器,FunClip 并不适合。
- 不是托管产品——没有托管云端套餐;你需要通过 git clone 和 Python 环境自行安装和运行
- 不是通用视频编辑器——它专注于转录驱动的片段选择和字幕生成,而不是时间线编辑、调色或特效
- 不是零配置的——要让 LLM 辅助片段选择正常工作,除了 Python/FunASR 安装外,还需要自己配置一个 LLM 后端
- 不保证列出具体的操作系统级支持——该项目自身的文档除了将其描述为 Python/Gradio 应用之外,并未列出具体支持的操作系统,因此在依赖它之前应先确认与自身环境的兼容性
- 转录准确率未经 PromptQuorum 独立测试——本评测基于 FunClip 自身的 GitHub 仓库和 README,而非实测的准确率测试
评估 FunClip 时的常见误区
关于 FunClip 的大多数困惑,来自期望它是一个完整的视频编辑器、忽略语言模式参数,或者假设它不需要额外的 LLM 配置。
竞品与替代方案
FunClip 最常被拿来与 whisper.cpp、faster-whisper、MacWhisper 等本地自托管语音转文本工具相比较——它的主要差异化之处在于,不止步于原始转录,而是进一步提供了完整的 LLM 辅助片段选择和字幕烧录视频导出能力。
Tool | Best known for | Link |
|---|---|---|
| whisper.cpp | 免费、MIT 许可证的 OpenAI Whisper C/C++ 移植版,用于设备端转录 | Whisper.cpp 评测 |
| faster-whisper | 基于 CTranslate2 的 Whisper 重新实现,针对 GPU/CPU 速度做了优化 | Faster-Whisper 评测 |
| MacWhisper | 基于 Whisper 模型构建的精致原生 macOS 转录应用 | MacWhisper 评测 |
此列表反映的是转录方面常与 FunClip 比较的工具,并非 PromptQuorum 的独立排名——选择前请确认各工具当前的功能集。这三款工具都没有 FunClip 的 LLM 辅助片段选择和视频导出能力;它们是转录引擎/应用,而不是剪辑工具。另请参见上方 FunClip 对比 Whisper.cpp 的详细比较。
常见问题
FunClip 是什么?
FunClip(github.com/modelscope/FunClip)是 ModelScope 开发的免费、开源、自托管视频剪辑工具,它使用 FunASR 语音识别模型转录视频,并用 LLM 查找并剪出你想要的片段。
FunClip 是免费的吗?
是的,FunClip 免费且开源(源代码采用 MIT 许可证;FunASR 模型权重单独采用 Apache 2.0 许可证)。没有付费套餐,也没有托管服务——你需要在自己的硬件上运行它。
如何安装 FunClip?
根据该项目自身的 README,克隆 GitHub 仓库,并在 Python 3.12 以上的虚拟环境中从 requirements.txt 安装依赖。带 SHA256 校验和的版本化发布压缩包也可以在发布页面获取。
FunClip 支持英语吗?
是的,FunClip 默认转录普通话,但文档说明可通过 -l en 参数启用英语模式,并通过 SenseVoice 模型支持多语言。
FunClip 能通过命令行使用吗?
可以,除了本地 Gradio Web UI(默认地址为 localhost:7860)之外,FunClip 还提供了用于直接识别和剪辑视频的命令行脚本 videoclipper.py。
FunClip 会自动生成字幕吗?
会,FunClip 使用带有内置时间戳的 FunASR 转录结果,为完整视频和每个剪辑片段分别自动生成 SRT 字幕。
FunClip 由谁开发?
阿里巴巴开源模型平台 ModelScope 开发了 FunClip,是其通义语音实验室工作的一部分。官方 GitHub 仓库是 modelscope/FunClip。
FunClip 运行需要 LLM 吗?
核心的转录和手动剪辑导出功能无需 LLM 即可使用。而描述某个瞬间、由工具自动找到的 LLM 辅助片段选择功能,需要单独配置一个 LLM 后端。
FunClip 能识别录制内容中的不同说话人吗?
可以,FunClip 内置了 CAM++ 说话人识别功能,让你可以按特定说话人剪辑片段——适用于访谈、圆桌讨论或多人录制内容。
PromptQuorum 是否独立测试过 FunClip 的转录准确率?
本评测基于 FunClip 自身的 GitHub 仓库和 README,而非 PromptQuorum 的实测转录准确率基准测试。