Video wird geladen...
Video konnte nicht geladen werden
兄弟们,我用 Jev 测了一轮 Computer Use + 滑雪视频混剪。 随机抽取 16 条滑雪素材,基于抽帧描述让 Jev 评分、选择开场和收尾,再通过 Computer Use 操作 CapCut,完成分割、裁剪、变速,输出 16 秒 Phonk 混剪。 我的判断标准:动作够不够刺激、切换是否流畅、配乐有没有力量,能不能按我的要求调整。 个人感觉效果不错。尤其提出“更重的运动 Phonk”后,配乐和节奏都更接近我想要的效果。 这一轮基本不到 5 分钟就剪好了,还保留了可编辑工程。 消耗也不大:20× 额度下使用 GPT‑6 Astra中,占用不到 1%——这里说的是额度变化,不是精确 token 统计。 Jev 负责判断,Computer Use 负责把判断落实到剪辑软件里。 以后批量混剪,视频切片分发这个行业可能不需要找外包了。全程jev写好判断,直接程序后台就能跑。 我这里演示操作computer-use 主要是让大家有个直观的感觉,全程无加速视频看下面,成片效果见评论。
60,507 Aufrufe • vor 9 Tagen •via X (Twitter)
29 Kommentare

这个完全是 Computer Use 结合 JEV 的一个正确使用场景,Computer Use 负责操作,JEV 负责分析选材,这个思路就对了

future of editing is just writing rules now

yes

你的意思是 视频-抽帧-GPT视觉理解-理解内容写成文本-jev去理解判断?

yes

混剪成片

我让jev配合computer use下国际象棋,目前没感觉到好的提升

jev最好是给在优先的范围让它选择。国际象棋可能走法太过灵活。反而不太好决策

这种分工思路挺清晰的,AI做判断执行工具,省了好多剪辑的手动操作,还能批量做,效率提升不少。

太强了。 短视频切片不是分分钟。

是。

真nb

这个实验好玩

猫哥这思路和执行力是真的强

AI时代想法比较重要。执行力取决于token

这类实操的价值在于把“能不能做”变成可复现的流程:素材、选择标准、执行步骤和最终验收都能对上。再补一组失败案例,大家会更容易判断哪些环节值得自动化。

jev还有视觉能力啊?

没有,用多模态配合。转成文字给它

感觉可能之后jev会有视觉,也很刚需

多模态不是那么好做的,目前这种完全够用。没必要单独去做

但是你这个视频,要抽帧去转义文字,总感觉不够直接,而且也要判断在哪里切开更好,要一次读很多帧才对

这个提前都codex处理好文本给jev了。 视频操作只是让你看看效果,其实不用剪映也能直接出的。

这个实验最有价值的是把“评分”和“执行”拆开了。要批量化,建议再补三类指标:素材选择的一致性、误剪后的可回滚性、以及每次判断到具体剪辑动作的映射。保留可编辑工程特别关键——漂亮成片之外,失败是否能定位和重跑才决定能不能上线。

这也太硬核了 自动化剪辑思路真有意思

我比较好奇这个场景下是怎么让Jev感知到画面内容去做评分判断的,可以分享一下吗

是的 先对素材内容做分析多模态大模型做 然后映射到时间戳上转化为文字丢给jev来决策

CS2 和 OW2 这号我养了好几年,小工具也换了好几轮@caijue_verdict🙃

jev没有多模态,如何做的素材判断?

codex GPT 本身是多模态的呀,分析完视频,映射成文本丢给 jev,jev按照个人品味要求来选精彩片段。
