Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/FunClip: recorte de video con IA autoalojado con FunASR
Voice, Speech & Multimodal

FunClip: recorte de video con IA autoalojado con FunASR

·9 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

FunClip es una herramienta gratuita, de código abierto y autoalojada para recortar videos, desarrollada por ModelScope (la plataforma de modelos abiertos de Alibaba), que transcribe un video con modelos de reconocimiento de voz FunASR y luego usa un LLM para encontrar y cortar los segmentos que quieras, generando subtítulos automáticamente. Tiene licencia MIT (los pesos del modelo FunASR subyacente tienen licencia Apache 2.0), se ejecuta como una interfaz web Gradio local o desde la línea de comandos, y transcribe por defecto en chino mandarín, con un modo en inglés y soporte multilingüe SenseVoice también disponibles.

FunClip (github.com/modelscope/FunClip) es una herramienta gratuita, de código abierto y autoalojada para recortar videos, desarrollada por ModelScope, la plataforma de modelos abiertos de Alibaba. Transcribe un video usando los modelos de reconocimiento de voz FunASR y luego usa un LLM para identificar y cortar los segmentos que quieras, generando subtítulos automáticamente en el proceso, con más de 6300 estrellas en GitHub. Esta reseña cubre qué hace realmente, cómo instalarlo y ejecutarlo, su soporte de idiomas y a quién le conviene.

Conclusiones clave

  • FunClip (github.com/modelscope/FunClip) es una herramienta de recorte de video gratuita, de código abierto y autoalojada — no un servicio web alojado
  • Desarrollado por ModelScope, la plataforma de modelos abiertos de Alibaba, como parte del trabajo de su laboratorio de voz TONGYI
  • Con licencia MIT para el código fuente, confirmado a través del archivo LICENSE del repositorio de GitHub; los pesos del modelo FunASR subyacente tienen licencia Apache 2.0 por separado
  • Voz a texto mediante el modelo Paraformer-Large de FunASR, con reconocimiento de hablantes CAM++ y personalización de palabras clave SeACo-Paraformer
  • Selección de clips asistida por IA: describe el segmento que quieres y un LLM identifica las marcas de tiempo correspondientes
  • Interfaces: una interfaz web Gradio local (por defecto en localhost:7860) y un script de línea de comandos, videoclipper.py
  • Soporte de idiomas: chino mandarín por defecto, un modo en inglés mediante la opción -l en, y soporte multilingüe (más detección de emociones) mediante el modelo SenseVoice
  • Última versión al momento de esta reseña: v2.2.1
  • Más de 6300 estrellas en GitHub al momento de esta reseña

📍 En una frase

FunClip es una herramienta de recorte de video gratuita, de código abierto (MIT) y autoalojada de ModelScope, con más de 6300 estrellas en GitHub, que transcribe video con modelos de reconocimiento de voz FunASR y usa un LLM para encontrar y cortar los segmentos que quieras, con generación automática de subtítulos y reconocimiento de hablantes.

💬 En términos simples

FunClip mira un video largo por ti, anota todo lo que se dice (transcripción) y luego, cuando describes qué momento quieres, un modelo de IA encuentra ese momento y recorta el clip automáticamente, con subtítulos ya integrados o adjuntos. Funciona en tu propia computadora o servidor a través de una página web local o la línea de comandos — es gratis, pero tienes que instalarlo tú mismo, y las partes de IA necesitan suficiente hardware para ejecutar modelos de voz y lenguaje.

📌Nota: Esta reseña se basa en el propio repositorio de GitHub y el README de FunClip. No afirma que PromptQuorum haya realizado pruebas prácticas de precisión de transcripción de FunClip, y presenta el rol de ModelScope/Alibaba como desarrollador de forma objetiva, sin enmarcarlo geopolíticamente.

¿Qué es FunClip?

FunClip es una herramienta autoalojada y de código abierto que automatiza el recorte de video combinando la transcripción de voz a texto con la selección de momentos asistida por IA, en lugar de exigirte revisar manualmente el material bruto. Está desarrollada por ModelScope, la plataforma de modelos abiertos de Alibaba, y se basa en los propios modelos de reconocimiento de voz FunASR de ese equipo.

  • Tipo de producto: una herramienta web/CLI autoalojada — se instala vía git clone y Python, no es una app de escritorio descargable ni un producto SaaS alojado
  • Desarrollador: ModelScope (la plataforma de modelos abiertos de Alibaba), específicamente el trabajo de su laboratorio de voz TONGYI
  • Licencia: MIT para el propio código fuente de FunClip, confirmado a través del archivo LICENSE del repositorio de GitHub; los pesos del modelo FunASR subyacente de los que depende tienen licencia Apache 2.0 por separado
  • Dependencia principal: FunASR, el propio kit de herramientas de reconocimiento de voz de código abierto de ModelScope, que FunClip usa para la transcripción en lugar de construir su propio modelo ASR desde cero
  • Escala: más de 6300 estrellas en GitHub al momento de esta reseña
  • Última versión: v2.2.1, que el propio registro de cambios del proyecto describe como que preserva los colores de subtítulos seleccionados mediante un renderizador basado en Pillow

¿Qué hace realmente FunClip?

FunClip toma un archivo de video, transcribe el habla que contiene y luego te permite a ti (o a un LLM, según tu descripción) seleccionar momentos específicos para cortarlos en clips independientes con subtítulos ya generados.

  • Transcripción automática: el modelo Paraformer-Large de FunASR transcribe el habla del video con predicción de marcas de tiempo integrada, de modo que cada segmento hablado se asocia a un punto exacto del video
  • Reconocimiento de hablantes: la identificación de hablantes CAM++ permite recortar segmentos por un hablante específico, útil para entrevistas, paneles o grabaciones con varias personas
  • Personalización de palabras clave: la integración de SeACo-Paraformer permite especificar de antemano nombres de entidades o términos específicos para mejorar la precisión de reconocimiento de esas palabras
  • Selección de clips asistida por IA: en lugar de revisar manualmente la transcripción completa, puedes describir el momento que quieres y un LLM identifica las marcas de tiempo correspondientes a cortar
  • Generación automática de subtítulos: FunClip genera subtítulos SRT tanto para el video completo como para cada segmento recortado individualmente
  • Renderizado de subtítulos: la versión 2.2.1 añadió un renderizador basado en Pillow que preserva los colores de subtítulos seleccionados en el video de salida
  • Salida multi-segmento: FunClip puede generar varios clips a partir de un solo video fuente en una sola pasada, sin necesidad de una ejecución separada por clip

Ejemplos de uso: dos formas de usar FunClip

Estos son flujos de trabajo construidos a partir de las propias funciones documentadas de FunClip, no casos de uso hipotéticos.

Plataforma, precios y licencia

Plataforma

Lo que indica FunClip:
Aplicación Python autoalojada; una interfaz web Gradio local más un script de línea de comandos. Multiplataforma en principio, aunque la documentación no enumera un soporte específico por sistema operativo.

Costo

Lo que indica FunClip:
Gratis y de código abierto. Sin plan de pago ni servicio alojado; lo ejecutas en tu propio hardware.

Licencia

Lo que indica FunClip:
MIT para el código fuente, confirmado a través del archivo LICENSE del repositorio de GitHub; los pesos del modelo FunASR tienen licencia Apache 2.0 por separado.

Método de instalación

Lo que indica FunClip:
Según el propio README del proyecto: clona el repositorio de GitHub e instala las dependencias desde requirements.txt dentro de un entorno virtual con Python 3.12 o superior. También hay disponibles archivos de versión numerados (por ejemplo, FunClip-2.2.1.tar.gz/.zip) con sumas de verificación SHA256.

Verifica la versión de Python recomendada actualmente y la lista de dependencias directamente en el repositorio de GitHub antes de instalar, ya que los requisitos pueden cambiar entre versiones.

FunClip vs. Whisper.cpp

FunClip y whisper.cpp ejecutan voz a texto localmente, pero resuelven problemas distintos. Whisper.cpp es un motor de transcripción C/C++ ligero y con pocas dependencias que se integra en otros proyectos; FunClip es una capa de aplicación completa sobre la transcripción de FunASR, que añade selección de clips asistida por IA, reconocimiento de hablantes y exportación de video con subtítulos integrados.

Aspecto
FunClip
Whisper.cpp
Propósito principalAplicación de recorte de video de extremo a extremo basada en transcripciónUn motor de transcripción, integrable en otras herramientas
Modelo de vozFunASR Paraformer-Large / SenseVoicePesos de OpenAI Whisper (portado a C/C++)
SalidaClips de video recortados con subtítulos generadosSolo texto de transcripción/subtítulos
InterfazInterfaz web Gradio local + script CLILínea de comandos y bindings de biblioteca
Dependencia en tiempo de ejecuciónPython 3.12+, FunASR, un LLMNo requiere entorno de ejecución Python
DesarrolladorModelScope (Alibaba)Georgi Gerganov / ggml-org

Si tu objetivo es obtener clips de video terminados con subtítulos y una edición manual mínima, el pipeline integrado de selección y exportación de clips de FunClip hace más de fábrica. Si solo necesitas texto de transcripción bruto o subtítulos para alimentar tu propio pipeline, sin Python ni una capa completa de edición de video, consulta la reseña de whisper.cpp. Verifica el conjunto de funciones actual de cada proyecto en su propio repositorio antes de elegir.

¿Para quién es FunClip?

FunClip le conviene a quienes necesitan convertir grabaciones largas en clips cortos con regularidad y quieren automatizar ese proceso con transcripción más un LLM, en lugar de revisar manualmente.

Para qué no es bueno FunClip

FunClip no es una buena opción si quieres un servicio alojado sin instalación o un editor de video de propósito general más allá de la selección de clips y los subtítulos.

  • No es un producto alojado — no existe un nivel de nube gestionado; lo instalas y lo ejecutas tú mismo vía git clone y un entorno Python
  • No es un editor de video general — se enfoca específicamente en la selección de clips guiada por transcripción y la generación de subtítulos, no en edición por línea de tiempo, corrección de color o efectos
  • No es de configuración cero — hacer que funcione la selección de clips asistida por IA requiere configurar tú mismo un LLM, además de la instalación de Python/FunASR
  • No garantiza tener enumerado el soporte a nivel de sistema operativo — la propia documentación del proyecto no enumera sistemas operativos específicos compatibles más allá de describirlo como una app Python/Gradio, así que verifica la compatibilidad con tu propio entorno antes de confiar en ello
  • No ha sido evaluado de forma independiente por PromptQuorum en cuanto a precisión de transcripción — esta reseña se basa en el propio repositorio de GitHub y el README de FunClip, no en pruebas prácticas de precisión

Errores comunes al evaluar FunClip

La mayor parte de la confusión sobre FunClip surge de esperar un editor de video completo, pasar por alto la opción de modo de idioma o asumir que no necesita configuración adicional de LLM.

Competidores y alternativas

FunClip se compara más a menudo con otras herramientas locales y autoalojadas de voz a texto como whisper.cpp, faster-whisper y MacWhisper — su principal diferenciador es ir más allá de la transcripción bruta hasta la selección de clips asistida por IA y la exportación de video con subtítulos integrados.

Tool
Best known for
Link
whisper.cppPuerto C/C++ gratuito y con licencia MIT de OpenAI Whisper para transcripción en el dispositivoReseña de Whisper.cpp
faster-whisperReimplementación de Whisper basada en CTranslate2 optimizada para velocidad en GPU/CPUReseña de Faster-Whisper
MacWhisperApp de transcripción nativa para macOS, pulida, construida sobre modelos WhisperReseña de MacWhisper

Esta lista refleja herramientas comúnmente comparadas con FunClip en el aspecto de transcripción, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones actual de cada herramienta antes de elegir. Ninguna de estas tres añade la capa de selección de clips asistida por IA y exportación de video de FunClip; son motores/apps de transcripción, no herramientas de recorte. Consulta también la comparación FunClip vs. Whisper.cpp arriba.

Preguntas frecuentes

¿Qué es FunClip?

FunClip (github.com/modelscope/FunClip) es una herramienta de recorte de video gratuita, de código abierto y autoalojada de ModelScope, que transcribe video con modelos de reconocimiento de voz FunASR y usa un LLM para encontrar y cortar los segmentos que quieras.

¿Es gratis FunClip?

Sí, FunClip es gratuito y de código abierto (código fuente con licencia MIT; los pesos del modelo FunASR tienen licencia Apache 2.0 por separado). No hay plan de pago ni servicio alojado — lo ejecutas en tu propio hardware.

¿Cómo instalo FunClip?

Según el propio README del proyecto, clona el repositorio de GitHub e instala las dependencias desde requirements.txt dentro de un entorno virtual con Python 3.12 o superior. También hay disponibles archivos de versión numerados con sumas de verificación SHA256 en la página de versiones.

¿FunClip admite inglés?

Sí, FunClip transcribe en chino mandarín por defecto, pero documenta un modo en inglés mediante la opción -l en, además de soporte multilingüe a través del modelo SenseVoice.

¿FunClip funciona desde la línea de comandos?

Sí, además de la interfaz web Gradio local (por defecto en localhost:7860), FunClip ofrece un script de línea de comandos, videoclipper.py, para reconocimiento y recorte directo de video.

¿FunClip genera subtítulos automáticamente?

Sí, FunClip genera automáticamente subtítulos SRT tanto para el video completo como para cada segmento recortado individualmente, usando la transcripción de FunASR con marcas de tiempo integradas.

¿Quién desarrolla FunClip?

ModelScope, la plataforma de modelos abiertos de Alibaba, desarrolla FunClip como parte del trabajo de su laboratorio de voz TONGYI. El repositorio canónico de GitHub es modelscope/FunClip.

¿FunClip necesita un LLM para funcionar?

Las funciones principales de transcripción y exportación manual de clips funcionan sin un LLM. La función de selección de clips asistida por IA, donde describes un momento y la herramienta lo encuentra, requiere configurar un LLM por separado.

¿FunClip puede identificar distintos hablantes en una grabación?

Sí, FunClip incluye reconocimiento de hablantes CAM++, que te permite recortar segmentos por un hablante específico — útil para entrevistas, paneles o grabaciones con varias personas.

¿Ha probado PromptQuorum de forma independiente la precisión de transcripción de FunClip?

Esta reseña se basa en el propio repositorio de GitHub y el README de FunClip, en lugar de en pruebas prácticas de precisión de transcripción realizadas por PromptQuorum.

Fuentes

← Volver a LLM locales avanzados