video-use:基于AI与文本转录的智能视频剪辑新范式

📅 2026/7/25 2:18:57
video-use:基于AI与文本转录的智能视频剪辑新范式
你还在用剪辑软件一帧一帧地剪视频吗?或者,你还在为“剪掉‘嗯’、‘啊’这些语气词”这种重复性工作而头疼?过去,视频编辑要么是体力活,要么是艺术活,但很少有人把它看作是“逻辑活”。直到我看到一个项目,它把视频素材丢进文件夹,然后你只需要用自然语言告诉一个AI助手“把这些剪成一个发布视频”,它就能自动完成剪辑、调色、加字幕、加动画,最后给你一个可以直接发布的final.mp4。这个项目就是video-use。它不是一个新软件,而是一个给“编程智能体”(比如 Claude Code)使用的“技能”。它的核心逻辑非常反直觉:AI并不需要“看”视频,它只需要“读”视频。通过将视频的音频转录成带有精确时间戳的文本,AI就能像编辑文档一样,精准地切割、重组视频内容。这听起来简单,但它彻底改变了视频编辑的工作流——从手动操作界面,变成了用语言描述意图。很多人第一反应是:这不就是个自动剪辑工具吗?但它的价值远不止于此。自动剪辑工具很多,但它们往往依赖预设模板或简单规则,僵硬且不可控。video-use的不同在于,它把编辑的“策略制定权”交给了你,而把繁琐的“策略执行权”交给了AI。你不再是点按钮的操作员,而是下达指令的导演。这背后,是一套将视频编辑工程化、结构化的全新思路。1. 核心突破:为什么“读”视频比“看”视频更高效?理解video-use,首先要打破一个固有观念:编辑视频必须处理海量的视觉帧。一秒钟30帧,一分钟就是1800张图片。对于大语言模型(LLM)来说,直接处理这些帧信息是灾难性的——token量爆炸,成本高昂,且大部分是无效的视觉噪声(比如背景中一片不变的天空)。video-use采用了一种极其聪明的分层处理策略:1.1 第一层:音频转录(始终加载)这是整个系统的基石。它使用 ElevenLabs 的 Scribe API 对原始素材进行语音识别。关键不在于识别文字,而在于它产出的结构化数据:词级时间戳:每个单词在音频中精确的起止时间。说话人分离:区分不同讲话者(S0, S1...)。音频事件标记:自动识别并标记(笑声)、(掌声)、(叹息)等非语言声音。所有这些信息被压缩成一个约12KB的takes_packed.md文本文件。例如:## C0103 (duration: 43.0s, 8 phrases) [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted. [006.08-006.74] S0 We fixed this.现在,AI面对的不再是视频流,而是一份带有精确时间坐标的“脚本”。它可以通过分析文本来决定剪辑点:哪里是冗余的“嗯”、“啊”,哪里是自然的语句停顿,哪里需要保留强调的语气。剪辑的逻辑首次从像素域转移到了文本域。1.2 第二层:视觉合成(按需调用)纯文本无法解决所有问题。比如,两个镜头切换时画面是否跳跃?说话时的表情和口型是否匹配?这时才需要“看”。video-use提供了一个timeline_view功能,它能在需要决策时(如遇到模棱两可的停顿、需要对比不同镜头时),动态生成一张