Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

Codex 官方「画布」的最优解来了。 刚发现 Codex 桌面端这个「画布」式视觉工作区,确实很好用。点击图片上的「画布」,就能进入独立界面,可以一次多选多张图片放进聊天框,统一下发修改指令;也可以直接选中图片里的具体位置,写下评论,让 Codex 针对这一处继续修改。 以前需要反复描述「左上角那个按钮」「第三张图的人物」「右边那块区域」,现在直接在画面上选出来、标出来、说清楚,图片、位置、上下文和修改要求都连在了一起,沟通成本低了很多。 前一阵很流行的侧边栏画布,本质上都在解决同一个问题:怎样让人和 AI 围绕视觉内容更准确地沟通。现在 OpenAI 直接把选图、标注、评论、修改和继续对话做进 Codex,一条链路完整跑通,确实有点官方下场终结比赛的感觉。 这种工作流,OpenAI 现在是越玩越溜了。

10,548 görüntüleme • 1 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

Phone Harness 最近挺火,它让我第一次很直观地看到,Claude Code 和 Codex 这种 Agent,已经可以通过 iPhone Mirroring 去操作真实 iPhone 里的 App。 但真放到自己的工作流里,我反而更喜欢 Airtap 这种思路。 不是把自己正在用的手机交给 Agent,而是直接发条 iMessage,让另一台云手机替我把活干了。比如做内容时经常会碰到一个很碎的小问题。文章已经写完了,临发布突然发现还缺一张配图。以前我得自己打开 Canva,找版式,改尺寸,换标题,调整字体和布局,最后再导出。每一步都不难,但就是需要人工来做耗时间。这次临发布缺图,我索性把设计要求直接发到了 Airtap Ai 的iMessage号码 +1 (650) 444-9517,让它去 Canva 里把图做出来。 我跟 AI 说的要求也很具体: 打开 Canva,帮我做一张横版配图,主题是 Claude Code vs Cursor vs Windsurf。做成简洁科技风,三栏布局,每个产品放 3 个特点,标题突出,文字不要太多。 接下来它自己在远程手机里打开 Canva,把版式、文字和布局一步步做出来。我觉得这里真正有意思的不是 AI 又会画图了。 而是原来只能停在建议层面的东西,现在可以继续往设计 App 里走。我只需要把主题、内容结构和想要的视觉方向说清楚,剩下那些选版式、排文字、调布局的机械操作,可以直接交给 Airtap。 以后做 AI 产品对比图、模型更新速览、工具推荐卡片、教程封面,其实都是类似的逻辑。内容每次都不一样,但没必要每次都从打开 Canva 开始重新点一遍。而且第一次做完不满意,也不用自己进去改。继续在 iMessage 里告诉它哪里要调整,它就回到 Canva 里接着改。 Phone Harness 更像是让 Agent 获得操作你 iPhone 的能力。 Airtap 对我更实用的一点是:我只负责把设计需求说清楚,真正进 Canva 执行的部分交给另一台云手机。

劳伦斯

120,499 görüntüleme • 1 ay önce

我把 AI 解说视频,彻底做成了一条“无人流水线” 丢进去文案和声音,后面的配音、分镜、画面、字幕、合成基本全自动 开源 4 天,350+ Stars,1000+ 人收藏。今天一次性把 cs-board 的全部功能讲透 并且新增加了自媒体封面修改功能,内置十种风格(还可以diy)还有市面上所有封面的尺寸(图二)👇 cs-board已经从一个 AI 白板视频工具,越改越像一个真正的 AI 内容生产工作台 以前用 AI 做一条内容,流程基本是这样的: 写文案 → 找模型改稿 → 克隆声音 → 拆分镜 → 生图 → 调风格 → 做动画 → 加字幕 → 做封面 → 导出 问题不是 AI 不够强 而是: 每一步都很强,但每一步都是孤岛 你要不断复制粘贴、切工具、重新上传素材、重新解释人物是谁、重新告诉模型你要什么风格 最后不是 AI 在替你工作,而是你成了 AI 工具之间的“人肉 API” 所以 cs-board 现在做的事情,本质上不是继续堆 AI 功能 而是把这些步骤做成一个有状态的内容生产工作台 1️⃣ 为什么我没有直接做“一键生成视频” 因为真正影响内容质量的,从来不是“一键” 而是中间状态能不能被控制和复用 比如现在 cs-board 生成一条视频,中间会留下: 配音 → 分镜 → 图片 → 分段视频 → 最终成片 这些都不是一次性的临时结果,而是检查点 假设你已经生成完所有图片,只是觉得字幕位置不对 正常 AI 工作流可能又得重新跑一遍 cs-board 不需要 直接从后面的渲染阶段继续 前面花过的钱和时间不重新花 我越来越觉得,AI 工具真正应该优化的,不是“第一次能不能生成”,而是: 第 17 次修改的时候,你还需不需要从头来一遍 2️⃣ 动态信息图为什么不是“让 AI 生成一张 PPT” 这个功能我改得比较久 因为我发现很多所谓 AI 视频,本质都有一个问题: 画面和人声是脱节的 旁白还没讲到第三点,画面已经把五点全部展示出来了 观众其实根本不会跟着你的表达走 所以 cs-board 的动态信息图不是: 文案 → HTML → 视频 而是先把真实旁白做成一个语义时间轴 一句话什么时候开始说、哪个关键词什么时候出现、哪个知识卡片什么时候展开,都跟实际音频绑定 所以画面不是按照“程序跑到第几秒”出现 而是: 你讲到哪,它才出现到哪 这其实是我现在做 cs-board 比较核心的一个思路: AI 负责理解内容,程序负责保证确定性 能交给代码控制的东西,我越来越不想交给模型猜 3️⃣ 为什么人物和画风要单独抽出来 以前最大的问题之一就是一致性。 第一张图是这个人。 第二张开始脸就变了。 第三张甚至连画风都换了。 所以现在自定义模式里,我把两件东西单独抽出来: 人物参考 + 风格参考。 可以放固定 IP,也可以放自己的品牌视觉。 人物最多可以提供多张参考图,风格也作为独立条件贯穿整个任务。 这意味着 cs-board 不只是帮你“生成一条视频”。 更重要的是: 它开始能够持续生产属于同一个 IP 的内容 对于真正做账号的人,这个区别非常大 4️⃣ 最近我又把封面也塞进去了 因为做完视频以后,我发现自己还得打开另一个工具做封面。 那干脆继续 Coding 现在封面制作直接放进工作台 粘贴文章 / 帖子内容以后: 自动理解内容 → 提炼标题 → 选择构图 → 生成人物与视觉 → 输出封面。 我没有只给一个“生成封面”按钮 而是先做了 10 种专业封面构图 因为封面的核心根本不只是图片好不好看 而是: 标题放哪、人物放哪、视觉重心在哪、第一眼先看到什么 构图是确定性的,审美才交给模型 这和前面动态信息图其实是同一套逻辑 5️⃣ 现在这个工作台正在慢慢变成什么 目前已经逐渐放进来了: 白板视频 / 自定义人物与画风 / 动态信息图 / 文案改写 / 对口型视频 / AI 封面制作 视觉模板现在也已经扩到了 12 套 音色克隆可以接本地 IndexTTS 任务、素材、配置、历史和成片默认都放本地 甚至同一个局域网里的电脑,可以共享制作队列 这也是我现在给 cs-board 定的方向: 不做一个 AI 视频生成器。 做一个可以不断往里面塞能力的 AI 内容生产工作台。 目前项目继续开源: 现在功能还远远没做完,下一步正在接入数字人工具 如图P3 但我觉得这条路,比继续做一堆“一键生成 XX”的小工具有意思多

陈硕KAI(耍门)

30,270 görüntüleme • 19 gün önce

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。 你也试一下,3 步就够: 打开 Ling Studio,选 Ling-3.0-flash-VL(免费) 丢一张 Codex / VS Code / 你常用软件的桌面截图 把下面提示词贴进去,看它怎么还原、怎么改 还原提示词(可直接复制): 这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。 按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code 对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框 配色、字号、间距、圆角、分割线、栏宽尽量贴近原图 原图能看清的文字按原样还原;看不清的用同等长度占位 先出第一版并渲染,再和原图对比对齐、颜色、组件位置 列出差异后改第二版,直到气质接近 Codex 桌面端 权重已开源,BF16 / FP8 都能下: Hugging Face: ModelScope: 官方介绍: Ant Ling 别只看评测表,丢一张你桌面上的截图,比什么都准。

程序员端哥

18,106 görüntüleme • 5 gün önce

久等啦,创作者神器Viko终于上线!🥳( 前段时间我随手发过一个 Viko 的 demo视频,就那么一个很糙的版本,结果评论区和私信隔三差五就有人来问,什么时候能用,什么时候上线。 因为对我自己也是刚需,于是闭关爆肝了一个多月,终于来啦~ 它最开始,其实只是我给自己做的一个小工具。 我每天都会刷 Pin和各种作品站找灵感,我相信做 AIGC 视觉创作的人应该都懂。以前看到一张喜欢的图,我的流程是这样的,保存图片,丢进 GPT 反推拆解,复制出来改一改,再贴到生图工具里跑一遍。 做一张还好,一天几十张、上百张的时候,这套流程就显得非常非常繁琐。 所以最开始,我只想做一件特别简单的事: 看到好图,Viko 一下。 浏览任何网页的时候,鼠标悬停在图上,一键捕捉,一键拆解,直接进入下一步创作。 我也试过市面上很多反推插件,还停留在一个特别初级的阶段,丢进去一张图,吐回来一整段 Prompt。 坦率的讲,一整段 Prompt,对真正做创作的人来说,远远不够。 我真正想知道的是,这张图为什么好看。 它是什么视觉风格,构图为什么成立,用了什么镜头和光线,色彩关系是怎么组织的,材质、氛围、人物状态又是怎么形成的。 以及最关键的,到底是哪几个关键词,激发了这张图的「美学基因」。 所以Viko我希望是有这样的能力的 。 人像、动漫、商图、产品图等等,都可以沿着不同的视觉维度爆破拆解,风格、构图、镜头、光线、色彩、主体、材质、氛围,还有真正值得留下来的核心关键词。 你可以直接用完整 Prompt,也可以把某一个视觉元素单独抽出来,改一改,迁移到新的主题里继续二创。 一张图带给你的,就不再只是一句提示词。 你开始知道它为什么成立,也开始有了继续延展它的方法。 在这个基础上,我还做了两个我自己特别喜欢的模式: 第一个是色卡模式。 很多时候一张图让你第一眼觉得「就是这个感觉」,真正起作用的其实是那套配色关系。Viko 可以直接提取画面的核心色彩,把喜欢的配色留下来,迁移到完全不同的主题里。 第二个,是我个人觉得最爽的,内测期间大家最爱用的,动作参考模式。 人物动作一直是 AI 生图里最难搞的问题之一,所以viko针对此项做了专门处理,即使面对复杂肢体动作和高难度透视关系,也能从容、一键完成精准动作还原。 到这里,从一张灵感图开始,捕捉、拆解、理解、二次创作,这条链路已经通了。 但这就够了吗?of course not ! 今天反推出来的 Prompt,过几天还能不能找到? 刚发现的那个神仙关键词,下次创作的时候还能不能想起来? 那套很漂亮的配色、那个难得的动作参考、一次次验证过的构图,还有最后生成出来的作品,用完之后,去哪了? 散落在聊天记录里,收藏夹里,下载文件夹里,各种软件里。 每一次创作结束之后,我们其实都在丢失自己的经验,没有产生创作复利! 所以,资产管理慢慢变成了 Viko 更核心的一部分。 参考图、关键词、Prompt、色卡、生成的作品,每一次创作里真正有价值的东西,都可以也应该沉淀下来。 今天发现的一个关键词,可能是未来某张作品的起点。存下的一套配色,可以迁移到新的主题。 慢慢的,你留在 Viko 里的,就不只是一堆图和 Prompt 了。 它会变成一套真正属于你自己的,视觉创作资产库。 这也是我做到今天,越来越确定的一件事。 反推只是第一步。 找到一张图的美学基因,把它拆开、理解、重新组合,再把每次创作里有价值的东西留下来,让过去的积累继续参与未来的创作。 每一次创作,都应该让下一次创作变得更轻松。 所以! Viko 由 Chrome 插件和网页工作台两端组成,插件负责在你刷图的时候随手捕捉,工作台负责拆解和沉淀。插件在 Chrome 商店搜 Viko 就能装,网页端在 首发期间也肯定有福利送给大家,优惠码: VIKO20,首月直接8 折! 如果你平时也喜欢找图、研究风格、拆 Prompt、做二创,来试试。 看到好图,Viko 一下。

古一

235,655 görüntüleme • 1 ay önce

#AI开源项目推荐:VisualStoryWriting 可视化故事创作:让你笔尖起舞,文思泉涌 想象一下,在你写作的同时,你笔下的世界就活生生地展现在眼前——时间线、世界地图、人物关系图……这一切都会被自动可视化。 更神奇的是,你对这些视觉元素的任何修改,都会立刻同步到你的故事文本中(比如,在地图上拖动一个角色,他在文中的位置也随之改变)。 这就是我们将要在 UIST2025 大会上分享的论文精髓。 我们开发了一款智能文字处理器,它能自动生成三种可视化视图:人物关系图、故事地图和场景时间线。这些视图能清晰地展示角色间的互动、他们在世界各地的足迹,以及故事场景的先后顺序,极大地帮助作者审阅和编辑自己的作品。 审视角色的移动轨迹,从此变成了一项直观的视觉任务。想改变一个角色在某个场景中的位置?太简单了,直接在地图上把他从一个地方拖到另一个地方就行。 调整故事场景的顺序,也只需要在时间轴上拖拽几下,就像整理幻灯片一样轻松。 想要创造一个新角色,或是让他们之间产生新的互动?同样简单,在关系图里新建一个节点,再连上一条线就搞定了。 我们邀请了经验丰富和初出茅庐的创作者们进行了两轮用户研究。结果发现,这些自动生成的可视化图表,能有效地帮助参与者规划故事的宏观修改、追踪故事元素,并探索情节的多种可能性,极大地激发了他们的创造力。 当然,能够帮助作者的可视化方式还有很多。因此,我们提出了一个设计框架,希望能启发未来更多样的可视化故事创作工具的设计。 我们的工作为未来的写作辅助工具奠定了基础——它不再仅仅依赖文字,更能借助视觉的

宝玉

35,626 görüntüleme • 1 yıl önce

哼哧哼哧用 Codex 又改了一整天的官网,对于网页注释功能是越来越爱不释手了。 总结了几个小技巧,记录和分享一下,👇 1. 网页注释只支持 Codex 的内置浏览器。通过 Codex 在本地跑起来的服务,只需要点击输出内容中的链接即可自动唤起。 如果没有链接,也可以通过窗口最右侧的侧边栏按钮,直接打开浏览器手动输入地址唤起。 2. 注释功能分为简要和详细模式,又分别是对应单个和批量两种修改执行方式。这一点估计是很多人没有注意到的,其实是用好注释功能的关键。 3. 先说简要模式。使用简要模式,只需要在开启了注释功能之后,使用对话气泡样式的鼠标 ICON ,在需要调整的元素上点击一下,即可唤出输入框,然后直接在输入框中描述期望的修改即可。 输入完毕之后,使用回车确认,注释的内容和相关上下文就会直接到进入到 Codex 的对话框,并立即开始执行修改操作。 4. 更有价值的是详细模式。打开详细模式,需要点击注释输入框的左侧的配置 ICON。打开之后,元素对应的属性值会一览无遗,需要做什么样的修改,都可以直接手动调整最底层的细节。 同时,也依然支持通过自然语言,在上方的输入框中输入期望的调整效果。 另外,在详细模式下,此前 ⬆️ 形状的确认按钮,变成了 ☑️ 的形状。在每一个注释确认了之后,也并不会立即执行,而是可以持续的添加多个注释,最后再一起通过右上角的“发送”发送至 Codex 进行批量处理。 5. 注释模式还有一些细节做的挺用心的,例如 Esc 键的逐级取消,在Codex 对话框的样式,甚至还有个很漂亮的轻微摆动的交互效果,很明显是花了不少的心思打磨的。 作为在 AI 时代依然坚守了 VS Code 三年的老顽固,最近沉迷于 Codex 无法自拔,已经好久好久没有打开过老伙计了。 原因无他,一个超级 App ,All in One 搞定一切需求,这种顺畅感实在是让人无法抗拒,也许 Codex 真的是那个带领用户从 Vibe Coding 阶段迈入 Vibe Working 阶段的天选之子。 我郑重承诺,只要你丫不封号,我就一直充值用下去!

李不凯正在研究

31,775 görüntüleme • 3 ay önce