video-use AI视频剪辑 开源视频编辑 自动剪辑工具 音频转录 智能剪辑 视频后期 GitHub开源 斩获20.4K stars

文章目录(快捷跳转)

简介说明

我过去两周的剪辑工作量少了一半。

不是因为我变勤快了。是因为我换了一种方式干活。我不再打开剪映或者 Premiere,一帧一帧地找那些卡壳的地方,删掉那些多余的嗯、呃、然后,再把断开的音频接起来。这些事情,现在由一个开源项目替我干了。它叫 video-use。

◆ 它不看画面,只听声音

video-use 最反直觉的一点是,它对画面几乎不感兴趣。你丢给它一堆视频素材,它不会逐帧分析构图、色彩或者镜头运动。它做的第一件事是调用 ElevenLabs Scribe 把音频转成文字。然后它对着这段文本做剪辑决定。

你仔细想想这背后的逻辑:一段 10 分钟的采访,真正影响剪辑节奏的并不是画面本身,而是说话的内容、停顿的位置、语气的变化。这些信息全部编码在音频和文字里。video-use 用一段十几 KB 的文本转录替代了成千上万帧的视频画面,让 LLM 在这个极小的信息面上完成所有决策。只有遇到需要对比两个 take 的模糊情况时,它才生成一张带时间线的预览图。

和 browser-use 给 LLM 提供结构化 DOM 而不是截图一样,这套思路的核心是——用最小的信息做最有效的决策,不做多余的事。

◆ 剪辑点上的细节,比手动做得还稳

我第一次跑完一条素材的时候,最意外的是剪辑点的平滑度。每一个被裁切的位置,video-use 都自动加了 30 毫秒的淡入淡出。这个细节我以前手动剪辑时经常忽略,或者觉得太琐碎懒得调。但就是这一点点,让整条视频听不到任何爆音和咔哒声。

它处理 filler 词的逻辑也很直接。那些嗯、呃、然后,以及超过设定阈值的沉默区间,在转录文本里被精确标记出来,然后直接裁掉。剩下的片段重新拼接,节奏立刻变得紧凑。我第一次处理 10 分钟的采访素材,整个自动剪辑过程不到五分钟。要我手动干,光找那些卡壳点就得花上半小时。

◆ 两周,两条视频

我用它剪了两条片子。一条是工具评测,原始素材 15 分钟。自动剪辑花了两个小时,然后我自己又花了一小时调整背景音乐和字幕样式,总共三小时。按我过去的习惯,八小时打底。另一条是旅行 VLOG,20 分钟素材自动剪成 8 分钟成片,2.5 小时收工。过去这种长度,我得在时间线上耗掉大半天。

省下来的时间很具体。每周五六小时,足够我多写一个选题,或者多拍一组素材。以前这些时间全部消耗在时间线上,反复拖拽、裁剪、对齐,没什么创造性,只是体力活。

◆ 它不完美,但方向对

video-use 目前有两个明显的短板。一个是风格化调色,如果你想做自定义的颜色分级,需要自己写 ffmpeg 脚本,项目自带的预设不算多。另一个是多说话人场景,diarization 偶尔会把两个人搞混,尤其当音色相近的时候。

但这些瑕疵不影响它的核心价值。它解决的是剪辑里最枯燥的那部分——删废话、减空白、接断点。这些工作占了我整个制作流程的六成以上,而这六成恰恰是最不需要创意、最容易被规则化描述的工作。

◆ 用最小的信息做最有效的决策

翻了一下它的 GitHub 仓库,设计文档里有一句话我印象很深:文本是唯一真相层,视觉按需生成。这跟传统剪辑软件的思路是反着来的。大多数工具先给你一个时间线,然后你看着画面去调整。video-use 先把一切还原成文本和音频,让 AI 在信号层面处理,最后才输出画面。

这样做的效率差异是量级的。LLM 处理 12KB 的文本转录只需要几秒钟,但分析 30,000 帧的画面需要庞大的计算资源和时间。video-use 选择了一条更轻、更快的路径,而且这条路径恰好覆盖了视频剪辑中最机械的那部分劳动。

◆ 谁适合用它

如果你产出的内容以说话为主——访谈、评测、教程、播客、VLOG 解说部分——video-use 会很适合。它的核心能力就是处理语音内容,把冗余部分去掉,让节奏紧凑起来。这类视频的剪辑工作大部分是减法,而减法恰好是最容易被自动化的。

如果你做的是叙事性很强、依赖镜头语言和视觉蒙太奇的内容,它可能帮不上太多忙。它对画面的理解还很浅,做不了基于视觉内容的剪辑决策。

安装和配置不复杂。克隆仓库,装好 ffmpeg,用 uv sync 安装 Python 依赖,配置 ElevenLabs API Key,然后把 skill 链接到你的 AI 编程助手的 skill 目录。支持 Claude Code、Codex、Hermes、Openclaw 这些主流 Agent。之后把素材丢进一个文件夹,对你的 Agent 说一句“edit these into a launch video”,它就会自动盘点素材、输出剪辑方案、等你确认后出片。

◆ 剪辑不该是瓶颈

我最早开始做视频的时候,以为最难的是内容本身。后来发现不是,最难的是那些重复劳动消耗掉的时间。你构思一个选题可能只需要半天,但把它剪出来可能要两天。这两天花在时间线上的时间越多,你留给思考、拍摄、迭代的时间就越少。

video-use 不打算替代剪辑师。它只是把最没有技术含量的那部分工作扛过去了。那些卡壳的、重复的、不需要判断力的事情,它替你做了,你把时间留给真正需要判断力的事情。

图片预览
video use使用
video use工作原理
video use工作原理

安装方法

方式一:一键安装(推荐)
在你的 AI 编程助手(Claude Code、Codex 等)里,直接粘贴下面这段话

Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it.

方式二:手动安装

1.克隆仓库到稳定路径

git clone https://github.com/browser-use/video-use ~/Developer/video-use
cd ~/Developer/video-use

2. 安装 Python 依赖

uv sync
# 或者
pip install -e .

3. 安装 FFmpeg

macOS:
brew install ffmpeg

Linux (Debian/Ubuntu):
sudo apt-get update && sudo apt-get install -y ffmpeg
4. 注册 Skill 到你的 Agent

Claude Code:

mkdir -p ~/.claude/skills
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
Codex:
mkdir -p ~/.codex/skills
ln -sfn ~/Developer/video-use ~/.codex/skills/video-use


5. 配置 ElevenLabs API Key

cp .env.example .env
# 用编辑器打开 .env,填入你的 API Key

使用方法
安装完成后,每次使用只需要三步:

第一步:把素材放进文件夹

把你拍的原始视频素材,全部放进一个文件夹里。比如:

~/my_videos/
├── take1.mp4
├── take2.mp4
└── b-roll.mp4

第二步:打开 AI 编程助手

在终端里进入这个文件夹,然后启动你的 Agent:

cd ~/my_videos
claude   # 或者 codex、hermes 等

第三步:用自然语言说出你的需求

在 Agent 的对话里,直接说你想怎么剪。最简单的:

edit these into a launch video

就这么一句话。

Agent 会先盘点你文件夹里的所有素材,然后给你一个剪辑方案,等你确认后再开始执行。整个流程是:问 → 确认 → 执行 → 迭代 → 保存。

下载地址

https://github.com/browser-use/video-use

https://pan.baidu.com/s/1E361aqIYOQcel_WdXyjRuw?pwd=kxwn 提取码: kxwn

https://pan.quark.cn/s/0338a2c98bbe

未经允许不得转载:网站源码、软件资源与技术教程分享 - 今夕资源网 » video-use AI视频剪辑 开源视频编辑 自动剪辑工具 音频转录 智能剪辑 视频后期 GitHub开源 斩获20.4K stars
扫码在手机上阅读本页
赞(0)

评论抢沙发

评论前必须登录!