正在加载视频...

视频加载失败

一直在琢磨一件事:如果把全球最强生图模型和最强视频模型接到同一条工作流里,会是什么结果? GPT-Image 2(beta) + Seedance 2.0,这两个摆一起就是王炸。 结果 Topview 先做了。 他们的工作流逻辑很简单:GPT-Image 2(beta) 先出分镜(Storyboard),确认故事版之后,再交给 Seedance 2.0 去跑长视频。 我觉得这才是 AI 视频该有的打开方式。 以前做 AI 视频基本靠抽卡,一条片子烧掉大把 token,还得等很久,不满意就刷新重来,算力和时间都在白白浪费。 现在可以先在分镜阶段把故事定死,图层面的问题图层面解决,视频层面的算力只花在已经确认好的镜头上。可控性的差距不是一个量级。 目前开通Ultra Plan可以365 天无限使用,两个最强模型无限跑。真的是很划算了,我接下来准备把英文视频账号的批量生产全切到这套工作流上。 这不就是我一直想要的么~ TopviewAI

102,685 次观看 • 3 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

50,997 次观看 • 1 个月前

之前用 Seedance 2 做了个做酸菜鱼的视频, 生成到第10秒的时候,美女的手直接伸进滚烫的锅里搅拌。AI完全不知道那样会烫。 当时觉得好笑,后来越想越觉得,这不只是 bug这么简单,现在的 AI 根本还没到理解物理世界怎么运转这一层。 这半年做了太多AI视频了,每次满心欢喜等它生成,结果经常是人物动作接不上、物体空间瞬移、手还没碰到东西物体就动了,各种幻觉 bug,真的挺折磨。 最近看到黄碧薇教授 Biwei Huang 的 Aether AI 官宣融资,认真看了一下方向,感觉它解释了很多视觉 AI 里反复出现的问题。 Aether AI 做的是因果世界模型。这个词听起来很学术,但放到视频生成里其实很好理解。 今天的视频模型,Sora、即梦、Veo,已经能生成非常真实的画面。杯子掉落、水洒出来、机械臂抓取,看起来越来越像真的。但它们很多时候是在根据海量视频经验预测下一帧,类似画面后面通常会发生什么,就生成什么。 所以桌子高了 2cm,机械臂就可能失效。明明伸过去的角度看起来对,杯子却自己飞起来了。画质够了,数据也不少,但模型没有真正理解这个动作为什么会带来这个结果。 Aether AI想做的,就是让 AI 学到变量之间的底层规律,比如桌子高度变了会带来什么影响,物体受力之后会怎么运动,一个动作会导致什么后果。 这类东西学进去,模型才能在没见过的场景里稳定推演、举一反三。对视频生成、机器人、自动驾驶、3D 世界模拟都会很关键。 视觉 AI 下一阶段的方向,可能就是从生成看起来合理的画面,走向理解画面为什么会这样变化。 黄教授 Biwei Huang 做因果AI 超过 12 年,这次 Aether AI 融资,我觉得是一个值得关注的信号:因果世界模型正在从学术前沿走向产业。 想了解的可以戳一下官网看看:

Adam也叫吉米

72,562 次观看 • 1 个月前

兄弟们,最近我扒了全网比较好用的电商提示词,做了一套「全平台通用电商视觉引擎工作流」。 目前已经在 SkildArt 跑通: 上传一张产品图,就能生成 12 张电商套图。 重点不是让 AI 随便出一张好看的商品图,而是把电商视 觉拆成可复用流程: 主视觉/产品中心图/卖点图/场景图/细节图/规格图/横版首屏图 每张图都有明确用途。 产品不能变形,Logo 不能乱跑,卖点不能瞎编,整组图风格要统一。 我实测下来,SkildArt 这类电商视觉工作台确实更适合做成套内容: 无限画布适合搭复杂生图流程; Agent 对话适合单张图灵活设计; 局部修改很方便; 视频模型也能和画布结合使用。 我还复刻了最近很火的「低能量穿搭换装」视频。 先在画布生成两组穿搭场景: 一组普通职业 Look, 一组明亮夏日多巴胺配色。 再切到视频模型,输入简单的转场和运镜描述,就能生成换装视频原素材。后面简单剪辑加 BGM 就能发。 以前这类内容要实拍两套造型,还要对镜头和节奏,现在工作流能直接把门槛拉低很多。 我觉得 AI 电商图真正的价值,不是单张图好看,而是稳定生成一整套能卖货的视觉资产。 完整工作流和低能量穿搭复刻提示词,可以去 SkildArt 广场搜关键词: 电商系统通用、夏日多巴胺换装 全部开源到里面了

知识猫AI实验室

82,828 次观看 • 2 个月前

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 次观看 • 3 个月前

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

17,728 次观看 • 26 天前

又找到了一晚上卖50w的AI视频项目,我已经部署到本地生成了视频,他不是个客户端,是类似于一堆skill的文件包。 老王之前做一条三分钟产品片子,找素材两天,排节奏一天,加字幕又一天。一个团队折腾一周。 然后我遇到了 OpenMontage。 说实话一开始没抱什么期望。开源视频工具,见多了,十个有八个是套壳。结果跑了一条,调研了grok的api一条命令,三分钟出了三段能直接发的片子。效果很炸。 它到底是个啥。 把你的 Claude 或 Cursor 变成视频制片人。你对着它说一句「做个 60 秒黑洞科普」,它自己去翻论文、写脚本、生成图表动画、扒免费素材、配字幕音乐,最后渲染出片。 不是你点按钮选模板,是每一步它自己做判断。 拆开看三件事。 第一,12 条流水线各管一种片型。explainer 做科普片,clip 做混剪,music 做 MV,data 做数据图表动画。你选对流水线,出来的结构就对了一半。 第二,每条流水线底下是一串 agent Skill——怎么查资料、怎么写分镜、什么时候加转场、字幕压在哪帧。500 个 Skill 叠出来的不是模板库,是决策链。你描述得越具体,它判断得越准。指令模糊,出来的也只能是模糊的东西。 第三,零密钥就能跑。不配任何 API,本地免费模型直接出片。付费版 Runway 干的活它全包了。 我做内容这些年最烦的不是没创意。是找素材卡半天、排节奏卡半天、字幕又卡半天,三个半天过去热情全没了。这东西把执行链里所有决定让 agent 替你做了,你只负责描述要什么。 怎么上手?很简单 我没可以生视频的Key,用网页调用supergrok的Oauth,和OpenMontage结合生成的弹唱视频,整体还是比较满意的。

老王霸 AI Lab

16,536 次观看 • 1 个月前

豆包上可以体验 Seedance 2.0 了,我已经试了一下。 最近 Seedance 2.0 在海外火得一塌糊涂,邀请码一码难求。 Seedance 2.0 已经不需要我多介绍了,是字节自研的视频生成模型,支持文生视频、图生视频、分身视频,还自带音效生成。 豆包视频生成模型Seedance 2.0今天正式接入豆包App、电脑端和网页版。 打开豆包App对话框,选择新增的“Seedance 2.0”入口,输入相关提示词,即可生成5秒或10秒视频。也可以选择“分身视频”,经过真人验证,创建自己的视频分身,体验更多创意玩法。 我重点说两个最值得玩的功能。 【1】文生视频 一句话描述你想要的画面,直接出视频。动作自然、镜头连贯,已经不是那种一眼假的 AI 视频了。复杂场景也能处理,比如多人互动、多镜头转场,生成质量在目前的视频模型里属于第一梯队。 你可以试试这种提示词: > 拍一段多场景转场的城市记录片,先是弄堂里挂红灯笼,然后在淮海路排队买年货,最后在厨房炸春卷。加上旁白和上海方言对话,带点复古滤镜。 这种复杂度的文生视频,Seedance 2.0 能搞定。 也可以整点好玩的,比如我记得马斯克和扎克伯格以前说要打架来着,后来取消了,现在可以在豆包里面用 Seedance 2.0 还原一下。 > Elon Musk (哪吒造型,但是脸型发色形似马斯克)和 Mark Zuckerberg(敖丙造型,但是脸型发色形似扎克伯格)的激烈对打,哪吒动画片风格,类似于哪吒和敖丙经典对战场景,只是人物形象换掉 > 马斯克:我 XAI 天下第一 > 扎克伯格:不对,我羊驼 LLAMA 才天下第一

宝玉

35,538 次观看 • 6 个月前