简介说明
我过去两周的剪辑工作量少了一半。
不是因为我变勤快了。是因为我换了一种方式干活。我不再打开剪映或者 Premiere,一帧一帧地找那些卡壳的地方,删掉那些多余的嗯、呃、然后,再把断开的音频接起来。这些事情,现在由一个开源项目替我干了。它叫 video-use。
◆ 它不看画面,只听声音
video-use 最反直觉的一点是,它对画面几乎不感兴趣。你丢给它一堆视频素材,它不会逐帧分析构图、色彩或者镜头运动。它做的第一件事是调用 ElevenLabs Scribe 把音频转成文字。然后它对着这段文本做剪辑决定。
你仔细想想这背后的逻辑:一段 10 分钟的采访,真正影响剪辑节奏的并不是画面本身,而是说话的内容、停顿的位置、语气的变化。这些信息全部编码在音频和文字里。video-use 用一段十几 KB 的文本转录替代了成千上万帧的视频画面,让 LLM 在这个极小的信息面上完成所有决策。只有遇到需要对比两个 take 的模糊情况时,它才生成一张带时间线的预览图。
和 browser-use 给 LLM 提供结构化 DOM 而不是截图一样,这套思路的核心是——用最小的信息做最有效的决策,不做多余的事。
◆ 剪辑点上的细节,比手动做得还稳
我第一次跑完一条素材的时候,最意外的是剪辑点的平滑度。每一个被裁切的位置,video-use 都自动加了 30 毫秒的淡入淡出。这个细节我以前手动剪辑时经常忽略,或者觉得太琐碎懒得调。但就是这一点点,让整条视频听不到任何爆音和咔哒声。
它处理 filler 词的逻辑也很直接。那些嗯、呃、然后,以及超过设定阈值的沉默区间,在转录文本里被精确标记出来,然后直接裁掉。剩下的片段重新拼接,节奏立刻变得紧凑。我第一次处理 10 分钟的采访素材,整个自动剪辑过程不到五分钟。要我手动干,光找那些卡壳点就得花上半小时。
◆ 两周,两条视频
我用它剪了两条片子。一条是工具评测,原始素材 15 分钟。自动剪辑花了两个小时,然后我自己又花了一小时调整背景音乐和字幕样式,总共三小时。按我过去的习惯,八小时打底。另一条是旅行 VLOG,20 分钟素材自动剪成 8 分钟成片,2.5 小时收工。过去这种长度,我得在时间线上耗掉大半天。
省下来的时间很具体。每周五六小时,足够我多写一个选题,或者多拍一组素材。以前这些时间全部消耗在时间线上,反复拖拽、裁剪、对齐,没什么创造性,只是体力活。
◆ 它不完美,但方向对
video-use 目前有两个明显的短板。一个是风格化调色,如果你想做自定义的颜色分级,需要自己写 ffmpeg 脚本,项目自带的预设不算多。另一个是多说话人场景,diarization 偶尔会把两个人搞混,尤其当音色相近的时候。
但这些瑕疵不影响它的核心价值。它解决的是剪辑里最枯燥的那部分——删废话、减空白、接断点。这些工作占了我整个制作流程的六成以上,而这六成恰恰是最不需要创意、最容易被规则化描述的工作。
◆ 用最小的信息做最有效的决策
翻了一下它的 GitHub 仓库,设计文档里有一句话我印象很深:文本是唯一真相层,视觉按需生成。这跟传统剪辑软件的思路是反着来的。大多数工具先给你一个时间线,然后你看着画面去调整。video-use 先把一切还原成文本和音频,让 AI 在信号层面处理,最后才输出画面。
这样做的效率差异是量级的。LLM 处理 12KB 的文本转录只需要几秒钟,但分析 30,000 帧的画面需要庞大的计算资源和时间。video-use 选择了一条更轻、更快的路径,而且这条路径恰好覆盖了视频剪辑中最机械的那部分劳动。
◆ 谁适合用它
如果你产出的内容以说话为主——访谈、评测、教程、播客、VLOG 解说部分——video-use 会很适合。它的核心能力就是处理语音内容,把冗余部分去掉,让节奏紧凑起来。这类视频的剪辑工作大部分是减法,而减法恰好是最容易被自动化的。
如果你做的是叙事性很强、依赖镜头语言和视觉蒙太奇的内容,它可能帮不上太多忙。它对画面的理解还很浅,做不了基于视觉内容的剪辑决策。
安装和配置不复杂。克隆仓库,装好 ffmpeg,用 uv sync 安装 Python 依赖,配置 ElevenLabs API Key,然后把 skill 链接到你的 AI 编程助手的 skill 目录。支持 Claude Code、Codex、Hermes、Openclaw 这些主流 Agent。之后把素材丢进一个文件夹,对你的 Agent 说一句“edit these into a launch video”,它就会自动盘点素材、输出剪辑方案、等你确认后出片。
◆ 剪辑不该是瓶颈
我最早开始做视频的时候,以为最难的是内容本身。后来发现不是,最难的是那些重复劳动消耗掉的时间。你构思一个选题可能只需要半天,但把它剪出来可能要两天。这两天花在时间线上的时间越多,你留给思考、拍摄、迭代的时间就越少。
video-use 不打算替代剪辑师。它只是把最没有技术含量的那部分工作扛过去了。那些卡壳的、重复的、不需要判断力的事情,它替你做了,你把时间留给真正需要判断力的事情。
图片预览

video use工作原理

安装方法
方式一:一键安装(推荐)
在你的 AI 编程助手(Claude Code、Codex 等)里,直接粘贴下面这段话
Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it.
方式二:手动安装
1.克隆仓库到稳定路径 git clone https://github.com/browser-use/video-use ~/Developer/video-use cd ~/Developer/video-use 2. 安装 Python 依赖 uv sync # 或者 pip install -e . 3. 安装 FFmpeg macOS: brew install ffmpeg Linux (Debian/Ubuntu): sudo apt-get update && sudo apt-get install -y ffmpeg 4. 注册 Skill 到你的 Agent Claude Code: mkdir -p ~/.claude/skills ln -sfn ~/Developer/video-use ~/.claude/skills/video-use Codex: mkdir -p ~/.codex/skills ln -sfn ~/Developer/video-use ~/.codex/skills/video-use 5. 配置 ElevenLabs API Key cp .env.example .env # 用编辑器打开 .env,填入你的 API Key
使用方法
安装完成后,每次使用只需要三步:
第一步:把素材放进文件夹
把你拍的原始视频素材,全部放进一个文件夹里。比如:
~/my_videos/ ├── take1.mp4 ├── take2.mp4 └── b-roll.mp4
第二步:打开 AI 编程助手
在终端里进入这个文件夹,然后启动你的 Agent:
cd ~/my_videos claude # 或者 codex、hermes 等
第三步:用自然语言说出你的需求
在 Agent 的对话里,直接说你想怎么剪。最简单的:
edit these into a launch video
就这么一句话。
Agent 会先盘点你文件夹里的所有素材,然后给你一个剪辑方案,等你确认后再开始执行。整个流程是:问 → 确认 → 执行 → 迭代 → 保存。
下载地址
https://github.com/browser-use/video-use
https://pan.baidu.com/s/1E361aqIYOQcel_WdXyjRuw?pwd=kxwn 提取码: kxwn







评论抢沙发