Loading video...

Video Failed to Load

Go Home

伙伴们在尝试让 AI 改网页的时候,有没有在这一步卡住: “把按钮挪到标题下面,去把这块删掉,还要旁边那张卡突出一点。” 看着页面觉得很清楚,但是写成文字,却得去解释到底是去搞哪个按钮、哪张卡。能不能直接在截图上圈出来,让 AI 照着改? 我用 Ant Ling Ling-3.0-flash-VL 做了个小测试。准备了一张活动报名页,同时把源码和标注截图一起交给它: 红圈里的横幅删掉,按钮移到蓝箭头指向的位置,黄框里的票种设为唯一推荐项。 同一个任务测了三次,三次首版都把按钮放错了。 接着,我把前两次实际渲染出来的页面截图回传给它,让它继续修改。两次都在一轮反馈后通过了全部 17 项验收。第三次停在首版,保留为失败;这组最终完成了 2/3。 这里模型负责看图、修改代码,本地工具负责运行页面、截图和验收。 如果你也在用 AI 改落地页、活动页,这次测试有个值得试的方法: 先在截图上标明要改哪里;首版不对,就把实际页面再截给它看,指出没完成的地方。修改前也写清哪些内容要保留,避免挪好了按钮,却改掉价格或弄坏交互。 这也是我为什么设了 17 项检查:除了位置和推荐卡,还要核对原有文字,点开、关闭报名弹窗,展开 FAQ,再看手机端有没有遮挡、溢出和控制台报错。页面看着改好了,还得点一遍才知道能不能用。 不过,换个目标,它仍然会出错。我把黄框改到“观察席”,它却继续推荐“共创席”。这个变体只测了一次,失败了。 所以,在这组样本里,我看到了模型收到页面截图后修正代码的效果;但换一个位置、换一张卡,仍然需要重新检查。还不能把整页修改放心交给它后就不管了。 57 秒视频里放了标注输入、反馈后的变化、成功和失败结果,标注为已生成结果回放。 你可以照这个过程试自己的页面,也能看到哪些地方需要留给人验收。 - 蚂蚁数科国际站 : - 蚂蚁数科 maas 国内站: - Ling studio: 这几个都可以,目前可用的体验地址

14,318 views • 22 days ago •via X (Twitter)

46 Comments

Segun Bxx's profile picture
Segun Bxx17 days ago

@AntLingAGI The visual feedback loop approach is brilliant! Feeding rendered screenshots back into the model to refine layout precision is definitely the way forward for AI UI design. 🖼️💻

Zyron's profile picture
Zyron9 days ago

@AntLingAGI This is exactly the kind of video workflow breakthrough people have been waiting for. The model giving precise timestamps plus full editing suggestions including transitions and BGM turns hours of manual scrubbing into minutes. Really practical for both pros and side creators.

ᴜᴄʜᴇ's profile picture
ᴜᴄʜᴇ16 days ago

Relying on text to fix visual bugs is almost always slower because spatial instructions get messy fast. Direct interaction tools where you can just circle an element on a canvas and tell the model to "move this here" or "change this color" completely eliminate that translation layer. Sending back a screenshot of the corrected visual state also builds a perfect error handling chain, letting the agent see immediately where its code output didn't quite hit the target so it can iterate and fix the geometry, padding, or CSS rules without you writing another confusing paragraph.

Almusty's profile picture
Almusty21 days ago

@AntLingAGI Although... but actually, the essence of UI design is spatial topology, so it should use spatial language for dialogue, which also makes it convenient for large models to perform error correction.

Soran's profile picture
Soran21 days ago

@AntLingAGI 对的,再怎么不如看的直观

Almusty's profile picture
Almusty21 days ago

@AntLingAGI Sending back the actual rendered images before making changes is a pretty practical approach; only after passing all 17 inspections can it be considered truly fixed.

Almusty's profile picture
Almusty21 days ago

@AntLingAGI Annotated screenshots are way clearer than pure text descriptions—I've fallen into that pit of misplacing buttons too. Send back the actual rendered image for another round of tweaks, and the success rate shoots up; this closed loop is super practical.

Soran's profile picture
Soran21 days ago

@AntLingAGI 哈哈挺好的

Figo's profile picture
Figo13 days ago

@AntLingAGI 截图标注 + 实际渲染反馈,这个工作流很实用。 尤其是让 AI 自己看最终页面再修,比单纯描述问题更容易定位偏差。

Ⓜ️ega Ⓜ️ind🤯(❖,❖)'s profile picture
Ⓜ️ega Ⓜ️ind🤯(❖,❖)11 days ago

@AntLingAGI Pointing out layout changes visually is much easier than typing, modifying website code through simple screenshots feels like real magic

Chelsea lovers's profile picture
Chelsea lovers9 days ago

@AntLingAGI This is super amazing

maximillion retardio's profile picture
maximillion retardio16 days ago

@AntLingAGI First pass missing the button three times is the data. Screenshot-back fixing 2/3 is the method. 17 checks including the modal and mobile overflow is why this isn’t just “it looks closer.”

Almusty's profile picture
Almusty21 days ago

@AntLingAGI When revising the landing page, I often get stuck on descriptions like "move that button down a bit" or "make that card next to it stand out a little more," and end up going back and forth with the AI, explaining for ages.

BigSwiz's profile picture
BigSwiz21 days ago

@AntLingAGI This is actually pretty useful. Being able to point at the exact part of a page and let AI fix it saves a lot of back and forth.

Soran's profile picture
Soran21 days ago

@AntLingAGI 是的。省事

Stankarl's profile picture
Stankarl13 days ago

What stood out to me is how quickly the model corrected the button placement once it saw the actual output. That suggests the issue is less about understanding intent and more about grounding the code in the current visual state. Still, the failure when you changed the recommended card shows the model is still brittle on spatial generalisation.

知不道吧's profile picture
知不道吧22 days ago

@AntLingAGI 模型能看懂截图以后,改页面的沟通确实方便了。

Soran's profile picture
Soran22 days ago

@AntLingAGI 是的,这波长眼睛了

Orin's profile picture
Orin16 days ago

@AntLingAGI Seventeen checks including the modal, FAQ, and mobile overflow is the right bar. Looking fixed is not the same as the form still opening.

UFO Captain 婷's profile picture
UFO Captain 婷22 days ago

@AntLingAGI 这个不要太真实!😂有时就是明明一眼就知道该改哪儿,但跟AI描述半天反而说不清!现在这种直接圈出来,再把改完的截图丢回去让它自己纠错,比单纯靠文字指挥靠谱太多了...

Soran's profile picture
Soran21 days ago

@AntLingAGI 哈哈没错的,让他懂意思多少需要功夫

Charlez | 💻 Builder's profile picture
Charlez | 💻 Builder17 days ago

@AntLingAGI This is really useful

Soran's profile picture
Soran17 days ago

@AntLingAGI 有用就好

Shami's profile picture
Shami13 days ago

@AntLingAGI Visual feedback makes AI web editing far more practical

meerah's profile picture
meerah17 days ago

@AntLingAGI 太懂这个卡点了!“把那个按钮挪到下面,把这块删掉” 用文字根本说不清,AI每次都改错地方。直接在截图上画红圈、蓝箭头、黄框让Ling-3.0-flash-VL照着改,这个视觉标注的思路太对了。源码+标注截图一起给,再配合本地截图反馈闭环,2/3通过17项验收已经很强了。

OA🦁's profile picture
OA🦁17 days ago

@AntLingAGI 改网页最烦的就是解释位置,直接截图圈出来省事太多。Ling-3.0-flash-VL再配合渲染截图回传继续修,这套流程挺贴近实际使用

Soran's profile picture
Soran17 days ago

@AntLingAGI 哈哈主打实用

daemon's profile picture
daemon13 days ago

@AntLingAGI I’ve struggled with this exact problem — knowing exactly what I want changed on a page but struggling to explain it clearly in text. Your approach of marking it directly on the screenshot and then showing the live render back to the model is a much smarter way.

Opti Max 💜🍀's profile picture
Opti Max 💜🍀17 days ago

@AntLingAGI 57 秒视频里放了标注输入、反馈后的变化、成功和失败结果,标注为已生成结果回放。

Equinox's profile picture
Equinox13 days ago

@AntLingAGI You nailed a very common pain point: the gap between what we see clearly on screen and how hard it is to describe it in words. Using Ling-3.0-flash-VL with direct visual markup and rendered feedback is a smart solution.

Em Kei's profile picture
Em Kei17 days ago

@AntLingAGI That first task "move button to yellow box" failing 3 times then passing after 2 refinements is so real. Did you notice if it got better at understanding the red circle annotation after the first round?

Ethos's profile picture
Ethos14 days ago

@AntLingAGI Marks on a signup page, then code. That is the hard version of a layout ask. Most models only remember that a button had to move.

Jask's profile picture
Jask9 days ago

@AntLingAGI 这个流程可以直接拿去改活动页。我这边也试过类似做法:先标位置,再把实际渲染图回传。最大坑不是挪按钮,是一改布局就把原有文案或交互状态弄丢。

Soran's profile picture
Soran9 days ago

@AntLingAGI 很强了

Rover路华's profile picture
Rover路华22 days ago

@AntLingAGI 带 vision 的模型就是爽,指哪改哪

Soran's profile picture
Soran22 days ago

@AntLingAGI 哈哈确实了

阿良|AI 工作流's profile picture
阿良|AI 工作流22 days ago

@AntLingAGI 圈图改页比打字清楚,一轮反馈就能过验收,但换位置还容易错,最后还是得人把关。

Soran's profile picture
Soran22 days ago

@AntLingAGI 是的呢

Syrax's profile picture
Syrax13 days ago

The visual feedback loop you showed is exactly the practical method many of us need when asking AI to edit web pages. Circling elements directly on the screenshot and then feeding the actual rendered page back for correction feels like a real breakthrough compared to describing changes in text.

meerah's profile picture
meerah17 days ago

@AntLingAGI 这个测试方法很专业啊!模型负责看图改代码,本地工具负责跑页面截图验收,渲染反馈再改,完整闭环了。三次首版都把按钮放错很真实,但能通过一轮反馈就修正通过,说明Ling-3.0-flash-VL的视觉定位+代码修改能力是真能用在落地页场景了,值得试试。

sulaiman Waleed's profile picture
sulaiman Waleed17 days ago

@AntLingAGI Receipt with 30 yuan error caught - 2092.10 total, 12 items. Most VL fails on small text OCR, Ling didn't

Sethman's profile picture
Sethman8 days ago

@AntLingAGI Have you experimented with giving the model a short checklist of "must preserve" elements (price, interactions, mobile constraints) right in the annotated screenshot prompt, or does that still get ignored until the feedback round?

Aivex | AI × Onchain's profile picture
Aivex | AI × Onchain12 days ago

@AntLingAGI This visual feedback loop for web edits is super smart. Drawing circles and arrows on the screenshot, then showing the model its own rendered output, actually gets Ling-3.0-flash-VL to fix the mistakes reliably.

狼之羊(欲哭无泪ing)'s profile picture
狼之羊(欲哭无泪ing)22 days ago

@AntLingAGI 虽然……但是其实UI设计的本质是空间拓扑,就该用空间语言去对话,这样也方便大模型来进行纠错

Soran's profile picture
Soran21 days ago

@AntLingAGI 哈哈确实如此

Zenith's profile picture
Zenith16 days ago

@AntLingAGI I would steal the mark language. Red delete, blue move, yellow recommend. Talking about that card always picks the wrong one.

Related Videos

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

37,185 views • 18 days ago

兄弟们,我的开源项目 female-portrait-director 已经在 GitHub 拿到了 1.5K+ Stars 和 187 Forks,最近正愁缺一条产品宣传片,让没用过的人也能看明白它是干什么的。 正好试了下 Pexo Pexo,就用它给这个项目做了一条。 Pexo 是一款对话式 AI 视频工具。把项目资料和想法交给它,就能跟它一起定脚本、看分镜,再做成视频。配音、字幕、音乐和剪辑也都能一起处理,最后交付的是完整成片。哪里不满意,可以在同一个对话里继续改,不用自己在几个工具之间来回折腾。 我的项目做的是先锁定用户的要求、选择视觉路线,再把人物、服装、场景、镜头和光线组织成一个完整的画面。做宣传片时,光介绍这些功能还不够,得让人看到:一个模糊的想法交给它,最后能变成什么样。所以视频里哪些内容该留、用什么画面说明,都得先理清楚。 这次我把 GitHub 链接和项目素材一起交给 Pexo,让它先了解项目,再一起确定创意方向。脚本、分镜和静态风格帧都先看过,确认以后才开始生成第一版视频。 第一版出来,整体结构已经比较完整了,我又接着提了三版调整建议。最后剩下两个具体的地方要改:一个是替换 GitHub 首页截图,把项目的数据展示清楚;另一个是把原本分成两行的字幕调成一行,读起来更顺。 这两处我用的是 Pexo 的 Mark to Fix。暂停到对应画面,圈出要改的截图或字幕,在右侧弹出的批注框里写清楚要求,再提交修改。比如那句字幕,就直接指出是哪一句、希望排成一行,改完再看效果。前面聊过的项目背景,不用再解释一遍。 最后拿到了一条 35 秒的完整成片,旁白、字幕、音乐和动效都加好了,不用我再拿着几段素材回剪映里拼。片子还是来回改了几轮,但我能把精力放在“这里有没有讲清楚”上,具体怎么剪、怎么调,就交给 Pexo 处理。 有 AI 产品、GitHub 项目或者品牌内容需要做宣传视频的朋友,可以去 自己试一下。

李岳

71,375 views • 10 days ago

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。 你也试一下,3 步就够: 打开 Ling Studio,选 Ling-3.0-flash-VL(免费) 丢一张 Codex / VS Code / 你常用软件的桌面截图 把下面提示词贴进去,看它怎么还原、怎么改 还原提示词(可直接复制): 这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。 按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code 对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框 配色、字号、间距、圆角、分割线、栏宽尽量贴近原图 原图能看清的文字按原样还原;看不清的用同等长度占位 先出第一版并渲染,再和原图对比对齐、颜色、组件位置 列出差异后改第二版,直到气质接近 Codex 桌面端 权重已开源,BF16 / FP8 都能下: Hugging Face: ModelScope: 官方介绍: Ant Ling 别只看评测表,丢一张你桌面上的截图,比什么都准。

程序员端哥

23,462 views • 21 days ago

哇趣,独立开发者一定要试试 Pexo Pexo! 它是个能直接聊天做视频的 AI 视频创作 Agent。把想法、产品链接或者手头的素材给它,从想脚本、拆分镜,到生成画面、配字幕和音乐、剪成片,都可以在里面完成。做完哪里不满意,还能接着聊、接着改。 我没想到我一个写代码的,也能口喷 AI,让它帮我做出一支这么高完成度的宣传片。 我有个 App 叫「NowHere」,上架有一段时间了,一直想做社媒推广,但做宣传片这事儿,又嫌麻烦,又嫌贵,就一直拖着。直到发现了 Pexo,才想着拿自己的 App 试一把。 我先把短片的想法丢给它,后面再补上 App Store 链接和素材。它先给出思路,我看完提要求,再一轮轮调整。全程主打一个边看效果,边继续 PUA。 关键是,它真的听得懂我想怎么改。 消息气泡第一次没放对位置,我就直接在画面上圈出想放的位置,再在右边的批注框里说清楚怎么改,提交后它就照着改。文字说不清,就画给它看。要改某一段,也可以在视频里选好几秒到几秒,再在批注框里告诉它这段要怎么改。 中间那段产品展示,我把 App 的真实截图和录屏传上去,让它套上 iPhone 机模,再加文字和动效。第一版手机一直摆在正中间,我就说,手机别放这么死板,旁边的文字也换个位置。后来手机和文案又隔得太远,中间空了一大块,就再让它往一起挪。毕竟甲方嘛,需求都是聊出来的。 我以前没做过宣传片,第一次给自己的产品做就能出这个效果,挺惊喜的。成片 👇

冰零

49,827 views • 10 days ago

我给自己的开源手绘视频 Skill,做了一支 Vox 风格的剪纸拼贴宣传片。👇 这次用的是 Pexo Pexo,一款对话式 AI 视频创作工具,面向有内容表达、产品推广需求的创作者、独立开发者和产品团队。 你可以直接告诉它想做什么,提供项目资料和参考风格。它会帮你整理故事线、做分镜,再完成画面、配音和成片制作。后续哪里需要调整,也可以留在同一个项目里接着聊、接着改。 实际用下来,上手确实比较简单。我不需要自己研究该选哪个模型、怎么搭工作流,更多是在看分镜、判断效果,把想法和修改要求说清楚。 我这次的需求很具体:给自己的 story-to-handdrawn-video 做一支宣传片,把这个手绘视频 Skill 的用途和效果讲清楚。视觉上,想要 Vox 那种纸张纹理、拼贴画面和动态排版。 实际做下来,大概是这样的过程: 先把 GitHub 项目地址和创作需求发过去,让它整理故事线;再补充这个 Skill 实际做出来的视频、参考风格图,一起看分镜。 看到有几张分镜和实际效果对不上,我就直接提: “第四、第五张分镜和真实画面有点差距。” 它重新对照我前面上传的效果视频,调整了分镜里对制作流程、黑白画稿和上色效果的呈现。改完还有不对的地方,我就继续指出来,再看下一版。 到了成片阶段,我又觉得声音和画面节奏还差点意思: “配音感觉差一点,动效感偏弱。” 后面它又换了配音,把两段偏弱的动效重新做了一遍,再给我看新的成片。前面发过的项目资料、效果视频和确认过的风格,都能接着用,不需要每次修改都从头解释。 如果想改的是画面里的某个具体位置,还可以用 Mark to Fix:圈出要改的地方,在右侧批注框里写清楚修改要求,再提交。 这次最有感触的,是第一条提示词之后的创作过程。 很多具体想法,都是看到分镜和画面之后才冒出来的。哪一段没讲清楚,哪张图偏离了实际效果,哪里还需要加强动效,都需要边看边判断。这些意见可以直接跟 Pexo 说,把具体的制作和调整交给它。 我负责判断内容、风格和节奏。几轮沟通下来,作品也逐渐贴近了我想表达的东西。 如果你也有自己的开源项目、独立产品或 SaaS,想给它做一支宣传片,可以看看下面这条 90 秒实操复盘。我把成片效果和中间来回修改的过程都放进去了。 体验:

知识猫AI实验室

83,854 views • 10 days ago

兄弟们,爆肝两天两夜,在 Pexo 做了一条 50 秒左右的商业广告视频,先给大家看看效果。 之前参加了个活动,有人说,给商家做一条像样的商业广告至少五位数。我就想,现在有 AI 视频工具了,自己能不能也做一条像样的?正好最近接触到 Pexo,就拿它试了一下。 先介绍下,Pexo 是一款 AI 视频创作工具,可以直接跟它对话来做视频。想拍什么、画面怎么做、哪里需要改,都可以跟它说。我这次从脚本、分镜到最后成片,基本就是这么一路聊下来的。 实际体验下来,确实是我目前用过上手最简单的 AI 视频产品。不需要先研究该选哪个模型、提示词怎么写才专业,也不用自己搭工作流。我把想法和要求告诉它,它就帮我整理脚本、拆分镜,再把视频做出来。看完哪儿不满意,就继续跟它说。 一开始,我先把想拍的故事、风格和要求发过去,最后加了一句:“先帮我整理详细脚本和分镜,说明每段的动作、运镜、声音与时长,等我看过,再开始生成。” 它就先把每段拍什么、怎么拍、拍几秒列出来。我看一遍,有想调整的地方先聊清楚,再让它开始做。等画面出来以后,就对着实际效果继续改。 反正这两天有空就找它聊一聊,有新 idea 就试一下,前前后后更新了 25 个版本。有些地方确实改了好几轮。比如后面宝宝躺在云上那段,我又想让宝宝操作电脑,就直接在对话里告诉它改哪一段、让宝宝用双手操作笔记本电脑,再看它做出来的效果。 其中最亮眼的还是宝宝觉醒那一段。我先让 Pexo 生成了一小段基础视频,里面的公式、图形和文字,再通过它的 motion 动效加上去。公式放哪儿、图形多大、动画怎么出来,都能接着聊、接着调。 比如有一版,公式的位置跟宝宝看的方向没对上。我就打开 Mark to Fix,停在那一帧,在右侧批注框里写:“公式放到右上角宝宝眼睛焦点处,图形可以再大一点,动画效果再明显一点。”然后保存,点 Apply 提交修改。改完以后,公式挪到了右上角,图形也放大了,跟宝宝抬头看的方向对上了。宝宝一抬头,旁边冒出这些公式和动画,那个“突然开窍了”的感觉就出来了。 要是觉得光用文字说不清楚,还可以直接在画面上圈出来,告诉它这里要怎么改。看到哪里不对,就对着那里留个批注,不会专业剪辑也能看懂怎么操作。 整体体验下来,这种边聊边改的方式还是挺顺手的。细节得自己盯,有些要求也要来回说几次,但换个镜头、挪一下公式、加点文字动效,我都可以直接提,不用自己去研究剪辑软件里该怎么弄。有了新想法,也能在现在这版上接着做。 评论区我会分享完整制作教程,脚本怎么确认、片段怎么改、Mark to Fix 的批注怎么写,都录进去了,大家可以对照着看。 视频用 Pexo 做的,想体验的可以去: 最后给兄弟们争取到粉丝福利码:NZ9UF3 注册登录后,点击头像,在菜单里找到「Redeem code」,输入就能兑换体验积分。限量 前50 位哦~

岚叔

42,872 views • 10 days ago

我之前横评了 4 个 PPT Skill,测的是谁能从零做出一份能直接拿去讲的 PPT。 这次我换了一个更像真实工作的测试:让 AI 接手上次的旧项目,直接往下改。 因为老板平时很少让你重新做一份 PPT,更常说的一句话是:把上次那版改一下。 麻烦也从这里开始。 上次到底是哪版,评分表放在哪里,结论有没有改,会议里又补了什么要求,最后还得沿用哪套模板。这些项目背景,通常比写提示词本身更费时间。 普通聊天工具只知道当前对话。每次开始新任务,你都得把旧 PPT、原始文章、评分表和修改要求重新上传,再花一轮时间解释整个项目。 所以我拿之前做过的 PPT Skills 横评项目,测试了一款叫 remio 的工具。 我给它的要求很短: 把我之前《PPT Skills 实测》的内容,改成一份 8 页、10 分钟的内部分享 PPT。保留 4 个工具的评分和结论,删掉安装过程,增加一页“不同需求怎么选”,输出可编辑的 PPTX。 它从已有资料里找出了当时的测试条件、4 个 Skill 的评分、各自优缺点和最终结论,然后重新组织成了一份 8 页 PPT。 93、77、72、58,原来的评分全部保留。 新增的“不同需求怎么选”也不是随便按总分排序,而是根据最终交付物来分:正式汇报选 ppt-master,网页演示选 html-ppt-skill,社媒传播选 guizang,需要中文模板再加工可以考虑 GordenPPTSkill。 生成结果是可以继续编辑的 PPTX。文字、图形和评分表都能在 PowerPoint 里直接修改,不是把整页做成一张图片塞进去。 我又补了一句:帮这份 PPT 配图。 remio 先读取了生图和编辑规范,再判断每一页还有多少留白。中间的表格和对比页信息已经很满,它没有继续塞图,只在封面和结尾页调用 GPT-5.4 Image 2 生成了 2K 插图,配色也沿用了原来的藏青、浅蓝和暖金。 最后出来的版本,既保留了原来的评分和判断,也补齐了内部分享需要的结构、选择建议和视觉元素。 这次测试让我觉得 remio 比较特别的地方,是它会持续建立个人知识库。 本地文件、网页、会议录音、邮件、日历和聊天记录,都可以进入同一套上下文。它还会为这些资料建立本地索引,需要处理任务时,不只看当前对话,也会从已经积累的项目资料里找信息。 所以这次做 PPT 时,它调用的不只是一条提示词。原文章讲了什么、4 个 Skill 怎么评分、哪些结论应该保留、最后要交付什么格式,这些信息都来自之前的真实资料。 很多 AI 可以根据一句话生成一套看起来不错的 PPT,但真实工作里更高频的任务,是在现有项目上继续修改。 你需要的是一个已经知道项目来龙去脉、可以直接接着干活的办公助手。 remio 的知识库数据保存在本地,也支持解析 docx、pptx、Excel、CSV 和 PDF 等常用办公文件。 除了改 PPT,它还能根据已有资料补 Excel 字段、整理数据、写公式,生成项目方案、周报和月报,也能把会议录音转成文字,再继续整理结论和行动项。 付费用户还可以通过 CLI 调用本地知识库,或者使用自己的 coding plan 和 API Key,把 remio 接进现有工作流。 我的理解很简单:资料先进入同一套上下文,Agent 再基于这些资料干活。 所以 remio 更像一个通晓项目资料的 AI 办公秘书。它知道文件在哪里、之前讨论过什么、现在要交付什么,然后帮你继续改 PPT、补数据、写报告。 如果你平时也要处理大量项目文档,可以去试一下:

泊舟

49,127 views • 2 months ago

你有没有遇到过这种情况:有个好项目? 或者写了篇好文章,想做成视频让更多人看到,却因为不会剪辑,不知道从哪下手? 这次我找了个好搭档——Pexo Pexo,一款 AI 视频创作工具。 跟它聊聊你想做什么视频,它就能帮你生成;哪里不满意,接着说,它就能继续改。 它是给我们提供了一个新的尝试性做法,我们可以把已经整理好的知识,也就是文章或者是解题思路,然后可以根据一个具体的例子,然后自己去确定一下画风,让他去给我们做出视频。 Pexo 提供的 Mark to Fix 如果你是和我一样第一次使用,你也会感觉到非常的惊艳,在内容修改的时候非常的方便,直接可以圈出画面中的位置再说明修改要求。 1、主要可以选择对应的元素 然后过 直接让模型帮你修改 用简单的对话方式就可以完成 2、不满意的地方随时都可以调整,时间线和画面内容也可以动态修改 3、背景音乐和素材图片到整个视频的合成都是通过对话方式完成的 对于我们这一些创作者来说,视频更容易传播,以及更容易让人去接受。因为长篇的文字反而不是那么的很让人能够沉迷地看进去。当然文字和视频搭配起来会更好一些。 这个体验的入口: 我也给大家争取到了官方福利,使用邀请码MMHC5S,可以领取100积分,限前50名,有需要的可以去试试

小墨同学

13,853 views • 10 days ago

好家伙,我只给了Qwen 3.8一段43 秒演示视频,它就完整复刻了最近爆火的能旋转、缩放、点器官3D 人体器官应用。 早上我刷到一个交互式3D人体器官学习应用。 左边可以选择器官,中间是能旋转缩放的3D模型,右边则是器官结构和功能讲解,效果很好。 然后下午正好刷到Qwen 3.8 正式版发布,我想能不能复刻一个? 我想如果在没有源码、设计稿和任何3D资产,只给千问看最终的演示视频,它能还原到什么程度? 于是我把视频丢给千问 3.8 Max,只说了一句: “参考这个视频,做一个类似的单页应用”。 第一版很快就能跑了,器官列表、讲解面板和热点标注都有,但中间的器官仍然是一张2D图片。 第一轮,我让它引入Three.js,把器官改成可以旋转和缩放的3D呈现。 接着又出现了一个问题:器官转动以后,原来对齐的热点开始漂移。 我让千问自己检查差异。经过三轮对话,它重新调整了模型位置、相机视角和热点坐标,后面又补上了中英文切换。 让我惊喜的是,千问3.8 竟然自己去补齐了右侧的动画和测验以及课程交互,自行完善了功能! 整个过程我没有写一行代码,主要做了两件事:告诉它想要什么,以及哪里还没有达到验收标准。 这次Qwen 3.8 模型让我印象最深的,是它能把一段视频当成需求,而且可以自己去完善相应功能。 它先从成品里反推页面结构和交互逻辑,生成第一版;再观察中间结果,根据截图定位偏差,继续修改。 从 43 秒的演示视频到一个可运行的 3D 交互原型,用了一个下午和几轮对话。 以后遇到很难用文字描述的页面效果,或许不用先写一份很长的需求文档。直接录频然后发给 AI 看,也能成为一种新的开发方式。 千问 3.8 Max 今天正式发布,支持 1M Tokens 上下文,正式版将在一周后开源。 完整复现过程都放在视频里了��

木马人

22,379 views • 2 months ago

Codex 操控电脑的三种方式。Codex 团队成员 Jason 今天写了一篇详细指南,把三者的区别和适用场景理清楚了,这里做个精简版。 【1】Computer Use:最广,也最慢 Computer Use 让 Codex 像人一样看屏幕、点鼠标、敲键盘,操作你电脑上的任何图形界面应用。Spotify、Xcode、系统设置、iOS 模拟器,甚至 iPhone Mirroring 都能控制。 代价是慢。结构化插件可以直接调 API,Computer Use 得一步步看界面、找按钮、等响应、再检查结果。但它能搞定没有 API 的应用,这是其他方式做不到的。 Mac 和 Windows 的体验差距很大:Mac 上 Codex 可以在后台静悄悄地操作,你继续用自己的电脑不受影响;Windows 上它必须占据前台,操作期间你没法用那台机器。 Jason 举了个例子:有次他的快递被偷了,Amazon 说要等 25 分钟才能接通客服。他让 Codex 每五分钟检查一次聊天窗口,客服出现后改为每分钟一次,自动完成退款流程。他去洗了个澡,回来退款已经办好了。 【2】Chrome 扩展:带着你的登录状态 Chrome 扩展让 Codex 使用你已登录的浏览器会话,包括 cookies、账号状态和已有标签页。Gmail、LinkedIn、Salesforce、公司内部后台,这些需要登录才能用的工具,Chrome 扩展是对的选择。 它还能同时控制多个标签页,在一个标签里读信息,到另一个标签里对比,再到第三个标签完成操作。Computer Use 也能操作浏览器,但它只认屏幕坐标,Chrome 扩展理解的是浏览器层面的上下文。 Jason 用它跑了一个长期任务:每天让 Codex 通过 Chrome 检查他的 Twitter 私信、浏览相关新闻、收集反馈,把有价值的内容存到本地文件,但不发任何消息。 要注意的是,网站会把 Codex 的点击和表单提交当作你本人的操作。研究、浏览、起草可以自动化,但发送、发布、付款这类操作最好留给自己确认。 【3】内置浏览器:给开发者的沙盒 内置浏览器住在 Codex 的对话线程里,你和 Codex 共享同一个渲染页面。它不带任何登录状态和 cookies,是个完全隔离的环境。 这反而成了开发场景的优势。它的主场是本地开发服务器、文件预览、公共网页、响应式布局检查和视觉 bug 复现。Codex 可以改代码、操作页面、截图、再跑一遍,形成紧密的反馈循环。 Jason 最喜欢的功能是标注:你可以直接在页面上点击某个元素留评论,比如"这个层级反了""这个按钮间距不够",Codex 会拿着截图和元素上下文去改代码,改完重新打开同一个页面等你下一轮标注。比来回传截图和文字描述高效得多。 【选哪个?】 简单记:任务需要登录状态用 Chrome,需要操作桌面应用用 Computer Use,在做前端开发用内置浏览器。如果有现成的插件或 MCP 能完成任务,优先用结构化工具,视觉控制是最后手段。

宝玉

187,199 views • 3 months ago

产品都写出来了,宣传还只能甩链接、贴截图? 我这个不会剪辑的人,把网站链接丢给 Pexo,聊出了下面这条带旁白、字幕和配乐的产品片。 这次用的是 Pexo。 Pexo 是一款 AI 视频创作工具,可以直接跟它聊天做视频。想做什么、画面怎么改,用大白话说就行,我这种没剪辑经验的也能上手。 先说下背景。 我平时写代码,不做视频。这次想在 X 上正经介绍一下自己的产品,才发现最烦的不是写帖,是片子。 不会 AE。也不想为了发一条,把晚上搭进去学剪辑。 产品叫赏金平台。达人发加热任务,普通人去点赞、评 论、转发、引用,做完领红包。站点能用了,就缺一条能 看懂“这是干什么的”的介绍视频。 我把网站 URL 丢进 Pexo,跟它说:给我做一条产品介 绍,发 X 用,让人 15 秒内看懂这是个什么东西。 它没马上吐视频。 先跟我对齐。给谁看、多长、要不要口播、画面偏产品演 示还是偏故事。有点像在跟一个会做片子的人对需求。 我用大白话回了几句。确认完,它自己去跑。 回来的是成片。旁白、字幕、动效、配乐都在,不用再把 素材拖进时间轴上拼。这点对我这种只想把产品讲清楚的 人,挺关键。 后面还能接着聊。开头散了就让它收一收,某句口播太长 就让它改短。全程没碰时间轴,也没去挑用的是哪个模 型。 想改画面里的具体位置,还可以用 Mark to Fix。比如片 尾那个“立即注册”按钮,想往下挪一点,就直接在画面上 圈出来,在右侧批注框写:“按钮往下移一点,和上面的 标题拉开些距离。”提交后让它改,再看效果。 下面这条,就是拿网站链接聊出来的。 你要是也有个刚做出来的产品,想配条介绍视频,又不想先学剪辑,可以把 URL 丢给 Pexo 试试。

程序员端哥

16,636 views • 10 days ago

兄弟们,最近试了 Pexo 这款 AI 视频创作工具,可以通过对话,把产品介绍一步步做成视频。 我拿自己那个收录了 2 万多条提示词的网站,做了一条产品宣传片。 下面分享一下,我是怎么把网址和需求交给它,再边看边改,做到现在这版的。 做这种产品视频,最头疼的是素材准备好以后,还得想怎么组织画面、做转场、配音乐,再一点点调整节奏。 这次我把网址和想做产品宣传片的需求交给 Pexo Pexo ,让它先出方案。看完方案,再确认视觉风格、音频方向和创意脚本。 第一版出来以后,我又接着提了几轮修改,调整画面展示、转场和文字。 整个过程都在同一个对话里推进,看一版效果,再告诉它哪里需要改,最后才有了现在这版,我挺满意的。 它不是那种一句话直接生成的魔法,现在这种边看边聊、边聊边改的方式,确实比我在剪辑软件里调轻松不少。 当然,也内置了很多模版,如果跟需求匹配的话,使用模版一键成片那就很方便了。 另外一个很棒的事:这次用到了 Motion 动效,我觉得挺适合做产品宣传。图片可以放大,让人看清产品细节,讲到哪个卖点,对应的文字就跟着出现。手头的图片和产品介绍,就这样变成了一条视频,让观众跟着看懂产品能做什么。 现在的AI做视频,有点东西了。 评论区有福利哦!

松果先森

106,628 views • 10 days ago

让 AI 帮我判断,哪个镜头值得留下 我让 AI 看了一段自己做的《五王醉归》。它给我的一个剪辑建议是:留住桌下的杯盏镜头。 这倒是切中了我做片子时经常纠结的问题:画面都挺好看,但剪短的时候,到底该留哪一段? 这次拿 Ling-3.0-flash-VL 当了一回剪辑助理。我上传了15秒的宴席片段,没给完整剧情,只让它看画面:梳理人物动作、挑保留段落,再说清楚为什么。 它把这段拆成了举杯、桌下杯盏、多人扶持几个环节,还特意提醒:如果跳过杯盏这一段,转折就少了视觉证据。 我回看片子,这个建议确实有用。杯盏不只是一个道具特写,它把前面的共饮,和后面人物状态的变化接了起来。 另一个我喜欢的地方,是这次回答把“看到什么”和“可能意味着什么”分开了。看到有人被扶住,没有直接把原因写死。 对我来说,这种视觉理解接进创作流程,最有意思的不是让 AI 替我做导演,而是多一个能拿着画面跟我讨论取舍的助手。 先帮我整理出值得回看的位置,再由我核对时间点、决定怎么剪。这个用法,我会继续试。 想自己试试的,可以去 OpenRouter 体验 Ling-3.0-flash-VL,目前处于免费体验期。免费额度和开放情况以平台页面实时信息为准。 体验地址: 合作内容|视频素材为本人 AI 创作;附真实测试录屏。

波妞PONYO

29,445 views • 15 days ago