我原本以为,把视频丢给 AI,再说一句“帮我剪成成片”,后面就可以等着收文件了。真跑完一遍才发现:它确实能剪,而且能从口播清理一路做到 B-roll、MG 动画、音乐、字幕和导出。但想拿到一条自己愿意发出去的视频,还是得一段一段验收。

嗨,大家好,我是格子,一个天天和 AI 打交道,但本质上还是技术小白的女生。

前几天我录了一条口播视频,原素材有 38 分 21 秒,里面有口误、重复、停顿,也有录屏内容需要放大。

如果按照我以前的做法,大概就是打开剪映,放着录制的视频,一点点找废话减掉。

粗剪的过程,我估计就需要1-2小时,还要识别字幕,校对字幕,添加一些关键性信息,没有三五个小时,我感觉自己搞不定。

于是我就想啊:codex能不能帮我剪辑呢?

搜了一圈资料,发现 codex 搭配 chatcut 可以达到我的目的。

于是我先让 Codex 安装 ChatCut,再直接用自然语言指挥它剪。

结果比我预想的完整,但过程也比“一键出片”真实得多。

下面我把安装指令、正式剪辑指令、每一轮修改,以及我踩到的坑都拆开写。不会代码也没关系,照着复制,再把素材和要求换成自己的就可以。

一、先把 ChatCut 安装进 Codex

这一步我没有打开命令行,也没有自己找安装包。

我直接在 Codex 里输入:

阅读 chatcut.io/chatgpt ,帮我安装 ChatCut 插件并创建一个新任务

Codex 先读取了 ChatCut 的安装说明,然后去添加插件市场、安装插件,并发起登录授权。

中间第一次没有直接完成,我又补了一句:

你帮我安装ChatCut 插件,看看怎样才能安装上

后面的事情基本由 Codex 接手了。根据当时的任务记录,它依次做了这些事:

找到 Codex 自带的命令行工具。

添加名为 chatcut-inc 的插件市场。

安装 chatcut@chatcut-inc。

执行 ChatCut 登录,并在浏览器打开 OAuth 授权页。

检查 ChatCut 插件和 MCP 是否已经启用。

创建一个新任务,让刚装好的工具能够被调用。

这里的 MCP,可以先把它理解成“Codex 和 ChatCut 之间的连接口”。

普通用户不用记命令,知道授权成功以后,Codex 才能真正操作 ChatCut 就够了。

浏览器弹出授权页时,需要自己完成确认。这一步不能跳过。

安装结束后,Codex 检查到 ChatCut 插件、ChatCut MCP 和相关运行工具都已启用,才算真正装好。

为什么还要创建一个新任务?

因为插件是在旧任务运行期间才装进去的。新任务重新加载以后,Codex 才能拿到刚增加的 ChatCut 工具。对我这种小白来说,最简单的判断就是:不要只看“安装成功”,还要确认新任务里真的能打开 ChatCut。

目前官方页面给出的方式也是在桌面端把安装要求交给 ChatGPT 或 Codex 执行。安装入口和支持范围可能变化,实际操作时建议再看一眼 ChatCut 官方安装说明。

如果现在让我重新写一遍安装要求,我会写得更完整一点:

请阅读 https://chatcut.io/chatgpt-plugin 的官方说明,
帮我安装 ChatCut 插件,完成登录授权并验证插件可以调用。
安装完成后,请创建一个能够使用 ChatCut 的新任务,
最后告诉我看到什么结果才算安装成功。

二、装好以后,怎么真正打开 ChatCut

进入新任务后,我发的指令很短:

帮我在这个页面打开chat cut

Codex 随后打开了 ChatCut 项目页。

判断是否成功,不只是“浏览器打开了”。还要看 Codex 能不能读取项目、素材库和时间线,并继续执行编辑操作。页面能看见,工具也能控制,这才叫接通了。

我之前测试过另一个素材,所以正式开剪前,还先让它把旧项目清理干净:

这个项目先不做了,我会给你另外一个口播+屏幕录制的视频,
你先把前面已经粗剪的视频删掉,确保chatcut是干净的,
完成后告诉我你已经准备好了,我再发视频素材给你

这句话值得保留。

如果项目里已经有旧视频、旧字幕或旧音乐,直接换素材很容易弄混。先清空,再等它明确回复“已经准备好”,后面排查问题会轻松很多。

三、导入 38 分钟素材后,我给了它什么要求

项目清理完成后,我导入了 7.23.mp4。这是一个 1920×1080 的横屏视频,内容是单人口播加屏幕录制,原始时长约 38 分 21 秒。

接下来是整次剪辑最重要的一条指令。我当时写的是:

帮我把这个口播+屏幕录制的视频剪成成片,
希望你在加载 talking head guide skill 后一步步带我做。
口播清理,卡顿的地方要清掉,语气词也要清掉,
但是不要影响整个视频的质感、B-roll、MG动画、音乐、字幕,一起敲定最终剪辑。
每一步需要什么尽管问我。

这段看着有点长,其实只说清了四件事。

第一,告诉它素材是什么。口播、访谈、课程和纯录屏,剪法不一样。

第二,说明清理尺度。我让它删卡顿和语气词,但不能把正常语气也剪碎。

第三,列出最终成片需要的东西:B-roll、MG 动画、音乐和字幕。这样它不会只给我一条“去掉废话的裸视频”。

第四,让它一步步问我,而不是自己闷头做到最后。

ChatCut 随后让我确认成片长度、画幅、B-roll 密度、MG 风格、音乐和字幕等选择。我选的是横屏 16:9、克制的屏幕放大、轻科技 MG、分段 Lo-fi 音乐、中文字幕,并且每个阶段都先让我验收。

这一步千万别嫌麻烦。

前面多确认两分钟,通常比最后对着一条十几分钟的成片逐帧返工省事。

四、第一阶段:粗剪

ChatCut 先复制出一条新的成片时间线,保留原始素材,再处理明显口误、重复、卡顿和低信息内容。第一轮结束后,时间线从约 38 分 21 秒变成了约 27 分 43 秒。

我检查的重点不是“删得多不多”,而是句子开头有没有被剪掉、剪切点有没有跳音、思考停顿是不是全被删光了,以及人的语气有没有被剪成机器人。

对了,ai粗剪完,一定要自己再听一遍,当时我发现有些重复的语句没被剪掉,所以我人工又过了一遍,千万不要觉得ai做完就行了。

我过一遍,没问题后,回答:

口播通过,继续 B-roll

如果你听到某个地方不对,不要只说“这里剪得不好”。最好按这个格式讲:

在 02:18 到 02:24 之间,上一句话结尾被剪断了。
请恢复完整句子,但保留后面重复内容的删除结果。
修改后检查前后两处衔接,不要影响后面的时间线。

时间点越准,问题越具体,AI 越不容易修错地方。

五、第二阶段:B-roll 不一定要去网上找素材

这条视频本身带屏幕录制,所以我没有让它额外找一堆“程序员敲键盘”的通用素材。

ChatCut 从原录屏里选了五个需要看清界面的地方,做成全屏放大:

03:29~03:35,模型选择区域;

07:31~07:37,模型市场和顶部导航;

13:19~13:27,图片模型入口;

15:08~15:14,生成结果和费用区域;

18:00~18:09,下载区域。

这种 B-roll 很朴素,但对教程视频挺实用。观众需要看的时候就放大,不需要看的时候回到口播画面。

审核时我又发现,02:45 左右到 03:23 左右的录屏里有二维码。我不想让它以清晰状态一直出现在画面里,于是补了一条:

有一个需要优化的,就是2分45秒开始,一直到3分23秒左右,
那一块的二维码,我觉得可以打个半模糊的码,
免得被平台识别,导致违规

ChatCut 随后只处理了这段二维码区域,没有把整张录屏都糊掉。

这一阶段我会检查三个地方:放大的位置对不对、放大后文字能不能看清、进出全屏时有没有突兀跳变。

确认以后,我回复:

B-roll通过,继续MG样片

六、第三阶段:MG 动画先做一个,别急着批量

MG 可以理解成覆盖在画面上的动态图形,比如关键词、步骤提示和小卡片。

ChatCut 先在大约 03:44 的位置做了一条轻科技风样片,而不是一口气铺满整条视频。这个做法很对,因为第一版确实不太合我心意。

我的反馈是:

你做的这个mg样片,我看了下,
一个是出场过早了,另外一个时间太长了,
我已经适当调整,可以按照我调整的去批量做MG了

我直接在 ChatCut 时间线上把样片的起点和长度拖到合适位置,再让 Codex 读取我的修改。后面它按照这个节奏批量补了 11 处 MG,每处大约 1.4 秒。

这个过程让我觉得 ChatCut 比纯聊天式剪辑更踏实的一点是:**我不用把所有调整都描述成文字。**能拖的,我自己拖一下;需要重复执行的,再交给 Codex。

我已经调整过了,请你按照我调整的,继续音乐字幕

七、第四阶段:音乐很省事,字幕最容易出问题

音乐部分,ChatCut 导入了一条 Lo-fi 音乐,并根据口播内容分成 13 段使用。有人声的地方压低音量,不需要氛围的时候不硬塞。

我对音乐没有大改,真正返工比较多的是字幕。

第一版中文字幕看着没问题,但继续看就会发现:有些本来属于一句话的内容,被硬拆成了两条字幕。

我这样反馈:

字幕还可以,但是有点瑕疵,
就是有时候一句话是完整的,但是字幕却隔开了。
一句完整的话,尽量不要隔开。

它重新整理了字幕分页。之后我又觉得字幕条位置偏高,于是补充:

我觉得字幕条还可以往下,
可以放到我框住的地方,看看能不能再调整下

这里也有个小经验:字幕审核不能只看有没有错别字。

至少要看四件事:专有名词、断句、每行长度、字幕有没有挡住按钮或演示区域。

八、第五阶段:第一次导出后,我还是让它返工了

音乐、字幕和画面都检查完以后,我回复:

终审通过,导出

ChatCut 导出了视频和 SRT 字幕文件。

按理说,到这里该结束了吧?

没有。

我看第一版成片时,还是发现了字幕错误。例如 Claude 被识别成了 Cloud,TokenHubHK 基本全程都没有识别对,另外还有 Codex、Claude Code 之类的专有名词需要统一。

于是我把错误词直接列给它,让它全片搜索并修正,而不是只改眼前这一条。

最后我还发现 00:13.13~00:15.05 之间有将近两秒内容是多余的。我的要求不只是“删掉这两秒”,还特别说明:

00:13.13 到 00:15.05 这一段内容是多余的,请删除。
删除后,后面的画面、字幕、音乐和 MG 都要一起向前调整,
保持原来的对应关系,不要出现音画错位。

这类修改在剪辑里叫联动或波纹调整。名字不重要,关键是要告诉它:删掉以后,后面的所有内容都得跟着走。

完成修改后,我回复:

没问题,导出

最终文件是 1920×1080、30fps,时长约 18 分 34 秒。

九、这次到底花了多久

如果只统计 Codex 在这次剪辑任务中的实际执行时间,大约是 2 小时 45 分钟

但从开始处理到最终修改并重新导出,整个流程跨了大约 19 个小时。中间包括我离开电脑、第二天继续审核、查看第一版成片,以及几轮人工反馈。

我不会把它写成“两小时自动剪完一条视频”,从开始到结束,确实花了19小时,包含我晚上睡了一觉哦,哈哈哈。

AI 替我做掉了大量寻找剪点、批量生成、调整时间线和导出的工作,但审核仍然是我自己的。

尤其是字幕专有名词、MG 出场时机,以及“这句话到底该不该删”,AI 没法替我做最终判断。

十、给小白的可复制指令包

1. 安装 ChatCut

请阅读 https://chatcut.io/chatgpt-plugin 的官方安装说明,
帮我安装 ChatCut 插件并完成登录授权。
安装后请验证 ChatCut 插件和 MCP 已启用,
再创建一个可以调用 ChatCut 的新任务。
每一步完成后告诉我结果,遇到需要我授权的页面就提醒我。

2. 打开并清理项目

请打开 ChatCut 项目。
如果项目中已经有旧素材、旧时间线、字幕或音乐,
先清理干净,但不要删除我这次新上传的素材。
完成后先告诉我当前项目状态,不要直接开始剪辑。

3. 口播完整剪辑

请把这个口播+屏幕录制视频剪成一条 16:9 横屏成片,
先加载 talking head guide skill,再分阶段带我完成。

第一阶段清理口误、明显重复、卡顿和多余语气词,
但保留自然停顿,不要把说话节奏剪碎。
口播通过后,再依次做 B-roll、MG 动画、音乐和中文字幕。

每完成一个阶段就停下来让我检查,
没有得到我的“通过”之前,不要进入下一阶段。

4. 阶段验收

口播通过,继续 B-roll
B-roll 通过,先做一处 MG 样片,不要直接批量
MG 样片通过,请按我调整后的时间批量制作,再继续音乐和字幕
终审通过,导出视频和 SRT 字幕

5. 返工通用模板

请修改 [开始时间] 到 [结束时间] 的内容。

现在的问题是:[描述看到或听到的具体问题]。
正确结果应该是:[说明要保留、删除、替换或恢复什么]。

这次修改 [需要 / 不需要] 联动后面的画面、字幕、音乐和 MG。
修改完成后请检查前后衔接,并告诉我具体改了什么。
先不要导出,等我复核通过。

这套模板里最有用的是时间点、问题、正确结果和联动范围。四样写齐,返工会少很多。

写在最后

这次跑完,我对 Codex+ChatCut 的判断很简单。

它适合不想自己处理每一个剪点,但愿意分阶段看视频、给反馈的人。你可以不会复杂的剪辑快捷键,也不用全程盯着时间线;但如果连成片都不想看一遍,那字幕错误和节奏问题大概率就存在。

我最喜欢的并不是“AI 自动剪辑”这几个字,而是可以用人话提要求,也能随时进入 ChatCut 时间线自己去调整。

它没有把我变成专业剪辑师,只是让我不需要花大量的时间去干重复的劳动,我觉得有了codex,我的时间可以拿去做更有价值的事情。

当然,上面的流程有一个前提:电脑里得先有 Codex。如果你还卡在 Codex 的安装和网络环境这一步,可以了解一下 tokenhubhk 里有个工具叫 QoPad,可以自动一键安装市面上的ai工具,比如codex,claude code等,先把 Codex 装好,再回来复现这套流程。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐