Post · mixed
八小时做了个 Video Agent,最后把自己剪出局了
第一次在 tokens& 纽约 Hackathon 做 Video Agent:真实素材、英文字幕、动画和音效,学到最重要的是 context。最后还有一个把自己剪出局的反转。

八小时,第一次做 Video Agent。剪辑完成了,参赛资格也顺手剪没了。
平时我在公司做过不少 enterprise workflow 的 agent,自己也做过其他 agent,最近还在做 voice agent。这次报名 hackathon,就是想逼自己换个题目:让 AI 帮我剪视频。
当时觉得,都是 agent,应该不会差太多吧。
现在回头看,这句话很适合配一个音效。
八小时、一堆素材,还有数据中心里的游戏机
这次参加的是 tokens& 在纽约举办的 Real-Time Video Agents Hack — NYC,属于 VAST Builders Challenge。活动的题目是从已有的视频里挖出新的价值。8:30 开门,16:30 开始 Demo,八小时把想法变成一个能拿出来展示的东西。
我的素材来自之前去 Nbox AI data center 的那次探访。服务器、GPU,听起来很硬核。结果里面居然能打街机。
故事就有了:本来去看 AI 基础设施,意外走进了游戏厅。
我给剪辑的方向大概是:
一次意外的 AI 数据中心探访,发现里面居然可以打街机。做成一个好玩的竖屏短片。
原视频里我讲中文,hackathon 是英语场,所以要有英文字幕;再加动态文字、动画和音效,分别做出 15 秒和 30 秒的版本。听起来只是几句话,实际做起来,每个词都在要求你做决定。
尤其是那个“好玩”。AI 到底要怎么知道,你说的好玩是哪一种好玩?
从一句话到一个 MP4,中间全是剪辑判断
我从已有的 Media Spotlight 和素材的 story context 开始。找到文件只是第一步,接下来还要找到能讲好这个故事的片段。
拉哪段素材,从哪里开始截,哪一秒结束,镜头停多久,字幕什么时候出现,游戏音效放在哪里才会让那个反差更好笑。然后通过 Remotion,把真实画面、文字、动画和声音编排成可以渲染的视频。
Demo 在这里:
Hackathon 的展示时间很短。我可以现场演示 Media Spotlight,再给大家看最终成片;中间找素材、截片段、组织剪辑的过程,就用录好的过程视频补上。
做完才发现,从“帮我剪得好玩一点”到最后那个 MP4,中间藏着好多平时觉得理所当然的判断。
粗略架构:两个 Agent,中间是一份 Story
这段视频把原型背后的思路走了一遍:
整个流程里有两个 Agent,通过一份 Story 接起来。
- Context Agent 先收集线索。 看画面里的场景和主体,听语音里的内容和时间戳,再读取文件与相机信息,把零散素材整理成可以搜索、可以定位到原片段的索引。
- 我的 context 给线索一个方向。 比如“想看到数据中心里人的那一面”。素材里的街机和惊讶反应,就有了意义。索引加上这个意图,组成一份 Story:开头的钩子、发现、收尾,以及支撑它们的原素材。Deck 里把它叫作 Story cartridge,故事卡带。
- Video Agent 根据 Story 来剪。 我在聊天里说时长、风格和想强调的地方,它沿着故事线索找片段、规划剪辑。同一份 Story,可以做出不同版本。
- 最后把剪辑渲染成视频。 这次的两支短片,通过 Remotion 把选中的真实画面、英文字幕、动态文字和声音编排在一起。
这是一个粗略架构,Deck 展示的是这些环节怎样接起来;文末的两支成片,是我这次在 hackathon 里沿着这个流程做出的结果。
最大的收获,还是 context
这次的学习比我想象中深。视频把语言、画面、节奏、声音和审美放在同一条时间线上。字幕翻译对了,也可能出现得太晚;动画做得漂亮,也可能刚好挡住了最有意思的反应。
能快速拿到算力,有好用的生成和剪辑工具,帮助确实很大。你可以更快试一个版本、看结果、改掉,再试。GPU 让这个反馈循环变得更实际。
但要剪得快,还要剪到你心里想要的那个东西,context 仍然很关键。
Agent 要知道这段素材为什么值得剪,给谁看,观众应该在什么地方感到意外。
最让我感叹的,是居然能从这一大堆素材里,根据我的 context 提取出一个 surprising 的 story。服务器机房、奇怪的声音、我怀疑“这里是不是闹鬼”的反应,再到发现街机——散着看的片段,接起来竟然成了一个有悬念、也有笑点的小故事。
如果只是按拍摄顺序整理 talking head,就很容易变成“我到了,我走了一圈,我看到了这些机器”的流水账。我想留下的是那个意外:这么硬核的 AI 数据中心,居然藏着这么好玩、这么有人味的一面。Context 让 agent 知道该从所有素材里挑出什么,再把铺垫、转折和收尾组织起来。
如果只给一句“做得好看一点”,很容易得到一堆很熟悉的转场、大字和音效。技术上都做完了,故事却没有讲出来。Talking-head AI slop,只是渲染得更快。
这次让我更想学习的,是怎样把意图、素材和故事背景交代清楚,让 agent 有足够的信息做剪辑判断。
最后被剪掉的是我
然后,就到了提交项目的环节。
我忘了用参赛要求里指定的 sponsor VM 来做项目,最后被取消了资格。
这个锅我自己背。研究了一整天视频的 context,漏掉了 hackathon 最关键的一条 context:提交规则。
Agent 把视频剪好了。我把自己剪出局了。
不过,Demo 留下来了,第一次做 Video Agent 的经验也留下来了。我学到了很多,还免费收获了一个很适合放在结尾的 plot twist。
字幕对齐了,参赛规则没对齐。
下次先读 brief,再读规则,最后才按 Render。
最后,给你看两支成片
同一堆真实素材里,剪出了这个意外的小故事。两支都保留我的中文原声,加上英文字幕、动态文字和声音。
15 秒:快速打出那个反差
一点铺垫,街机出现,再用我的反应把笑点收回来。
30 秒:把整个支线任务展开
多一点空间,留下奇怪的声音、那个小悬念,以及解释一切的游戏机。

