Загрузка видео...

Не удалось загрузить видео

На главную

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。...

12,293 просмотров • 1 день назад •via X (Twitter)

Комментарии: 36

Фото профиля Almusty
Almusty1 день назад

Domestic models have indeed become powerful. They don't just look at the picture and hand in the paper all at once; instead, they follow an awesome "observe → act → verify → revise" process, reducing rework time—perfect!

Фото профиля Almusty
Almusty1 день назад

Ling-3.0-flash-VL Domestic models will grow stronger and stronger... until they surpass foreign ones. At the current stage, domestic models, as long as they can get the job done, will have a huge domestic audience.

Фото профиля Almusty
Almusty1 день назад

Ling-3.0-flash is indeed a good model, and its coding capabilities are pretty solid too.

Фото профиля Almusty
Almusty1 день назад

Give the AI a reference image, and sometimes it will even enthusiastically help you swap out color schemes or add modules. When it comes to faithful reproduction, what you fear most is this kind of improvisation. First, make it exactly like the original image, then discuss whether optimizations are needed—this can save a lot of unnecessary revisions.

Фото профиля 睿奇Re7
睿奇Re721 часов назад

这个还原确实还挺有水平的,Ling-3.0-flash-VL多模态能力有说法

Фото профиля VkDream
VkDream1 день назад

最想看第一版到最后一版的对比 尤其是哪些地方它自己看出来不对 又改回来了

Фото профиля 马识途
马识途16 часов назад

牛掰啊 这玩意儿挺实用的 我突然想到 这种能够识别视频帧的模型 可以做很多事情 比方替代人看监控之类的

Фото профиля 问旋🌸
问旋🌸14 часов назад

应该没人比我玩的开了吧🪁🌷我福不黑不信你看

Фото профиля 甜之可👉无偿约
甜之可👉无偿约18 часов назад

parting 😹 🦗 challenger

Фото профиля 冬儿🌸
冬儿🌸14 часов назад

应该没人比我玩的开了吧🖤🍟我福不黑不信你看

Фото профиля 阿链
阿链1 день назад

这个太完美了。渲完还愿意自己盯着看,还能改!这才叫会看图呀。

Фото профиля 栖亦叶👉无偿约
栖亦叶👉无偿约18 часов назад

hardy 🌈 🤌 horizon

Фото профиля 平蝶🌸
平蝶🌸13 часов назад

应该没人比我玩的开了吧🏹🦋我福不黑不信你看

Фото профиля 疏予语👉无偿约
疏予语👉无偿约13 часов назад

misunderstood 💜 😴 morbid

Фото профиля vinson
vinson1 день назад

拿截图直接还原成单文件,这个工作流有点像给代码做了“看图复印”;要是成品能跑,确实省掉不少来回描述。

Фото профиля Hello AI with Jia
Hello AI with Jia1 день назад

它识别图片的功能也太用了 玩了一天

Фото профиля AI_Laodi
AI_Laodi1 день назад

是不是 coding 能力也还行

Фото профиля 微念雪👉无偿约
微念雪👉无偿约20 часов назад

astonished 🍓 🫁 dissertation

Фото профиля UFO Captain 婷
UFO Captain 婷23 часов назад

最怕AI一本正经地告诉你“已高度还原”,然后一打开:这谁啊😂能自己渲染完再回头改,这点确实实用👍

Фото профиля 硅谷AI玩家
硅谷AI玩家1 день назад

会看图写代码的一堆,会自己盯着原图改到像的不多,这波确实有点东西。

Фото профиля 青曼🌸
青曼🌸1 день назад

应该没人比我玩的开了吧🏊🥰我福不黑不信你看

Фото профиля Feng
Feng1 день назад

国内模型确实强大起来了,它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」牛逼克拉斯,减少返工的时间,完美!

Фото профиля 程序员端哥
程序员端哥1 день назад

是的 真的是写代码的好帮手

Фото профиля willAch5
willAch522 часов назад

试了下还原挺准,观察再修正这套很实用,国内模型进步明显

Фото профиля 天天不好哄
天天不好哄20 часов назад

纯文本AA Index从38到42,加上视觉能力没掉还涨了。多模态不是牺牲文本能力换来的,这个平衡做得不错!

Фото профиля Jevon | AI企业级布局
Jevon | AI企业级布局1 день назад

Ling-3.0-flash-VL 国模会越来越强劲... 直到超越国外 现阶段国模 只要能干活 国内受众j就会很多

Фото профиля 程序员端哥
程序员端哥1 день назад

国内大模型越来越厉害了是 一张截图直接还原 我真的会服

Фото профиля 从寒🌸
从寒🌸15 часов назад

应该没人比我玩的开了吧😄🌮我福不黑不信你看

Фото профиля Near
Near18 часов назад

蚂蚁百灵首个原生多模态模型,不是在纯文本模型外挂视觉编码器,而是原生联合训练,最大亮点就是你演示的视觉反馈闭环:观察→行动→验证→修正,不再是一次性看图生成代码

Фото профиля Wukong
Wukong15 часов назад

我也试过「截图 → 让百灵出单文件 HTML → 本地打开再圈错回灌」这一套。第一版布局能齐,细看输入框灰底和按钮发光还是差点意思;第二轮带着圈错图回去,白底描边才贴回来。视觉闭环靠的是把渲染结果当证据,不是一次 prompt 赌命。

Фото профиля 惜霜🌸
惜霜🌸13 часов назад

应该没人比我玩的开了吧🐚🐋我福不黑不信你看

Фото профиля 魔王w3👿
魔王w3👿1 день назад

看图还原界面还能自查修正,前端写页面这个模型真的好用

Фото профиля 慕灵🌸
慕灵🌸16 часов назад

应该没人比我玩的开了吧🩻🚤我福不黑不信你看

Фото профиля 晚晚
晚晚15 часов назад

连组件清单都省了,前端切图党要失业了

Фото профиля 强南
强南1 день назад

国产模型是越来越特厉害了,以后有需求直接发图片就行,比用语言描述半天都清楚

Фото профиля 怀蕾🌸
怀蕾🌸12 часов назад

应该没人比我玩的开了吧🚶🥯我福不黑不信你看

Похожие видео

预告一下,给社区做了一个图像解构插件:Viko。 一键爆破任何图片,让你功力大增!(哈哈哈哈夸张了) 当你在网上冲浪,刷 X、小红书、Pinterest、VSC 论坛,或者任何网页时,看到一张有感觉的图,不用再只是截图收藏。 Viko 可以帮你把这张图: - 画面解构:拆出风格、构图、光线、色彩、成像质感等关键元素 - 反推提示词:输出适合 GPT 图像模型使用的自然语言提示词,即关键词词组,绝对不用JSON - 提示词变体:在保留原图核心气质的基础上,生成新的创作方向 - 直接生成图片:一键从参考图到新图 - 保存到 Eagle:图片和提示词一键保存到本地素材库,方便后续管理和复用 为什么要做这个插件? 其实我个人一直不太喜欢传统意义上的反推。尤其 GPT-Image2 出来以后,那种把图片拆成一大段 JSON,然后追求 1:1 复刻的玩法,对我来说实在太无聊了。 复刻出一张差不多的图,然后呢? 我真正想要的是: 当我们看到一张好图时,能快速抓住它最核心的画面结构,知道它为什么好看,风格在哪里,构图在哪里,光线和质感在哪里。 然后基于这些信息继续发散,做出同一视觉体系下的新图、新玩法、新方向。 这也是 Viko 现在最核心的三个能力: 解构,反推,变体。 目前 Viko 还在内部测试中,等后面上架 Chrome 插件商店,再同步给大家。

古一

91,452 просмотров • 2 месяцев назад

一张图,一段提示词。 我让 Apodex 做了一次「AI黄果短剧」逆向研究,最后拿到了一份10万字的拆解文档。 对这种能把复杂任务做完的 Agent 感兴趣,可以先给他们开源的 FrontierAgent 仓库 点个 ⭐ Star,支持一下,也方便后续自己上手。 完整操作我录下来了。 前半段看怎么做,后半段直接打开文档,看这10万字到底拆了什么。 先说操作。 在 Apodex 网页端上传之前流出的黄果制作流程图,再把研究目标和交付要求写清楚。 这里有个关键:需要一段提示词帮你把Apodex能力拉到极限。 一张图是研究入口,不是全部证据。 Apodex 可以在同一个任务里处理文件、检索资料、执行代码,并通过任务看板展示进展。过程中也能追加要求,保留仍然有效的成果,再调整受影响的部分。官方介绍 不过,真正值得展开的,是后面这份文档。 我会重点翻四块内容。 第一,视觉拆解。 角色外形、配色、构图、光影、材质……把一句“这个画风很特别”,拆成具体能描述、能比较的要素。 第二,制作流程。 从角色设定、分镜,到图像与视频生成,再到配音、剪辑。重点看每一步需要什么输入、产出什么,以及前后怎样接起来。 第三,提示词与示例。 不是只收藏一段很长的提示词,而是看懂角色、动作、场景、镜头和风格分别承担什么作用。换一个人物或故事时,才知道哪里该改、哪里要保持一致。 第四,问题与验证。 哪些判断有来源?哪些只是合理推测?角色一致性、镜头衔接这些问题,后面还需要怎么测试? 尤其是一张图无法证明原作者用了哪个模型、哪段提示词。 逆向研究的价值,是找到有依据的制作路径,而不是把猜测写成答案。 所以,我想展示的并不只是“AI能写10万字”。 而是一个模糊的起点,能不能被推进成一份有结构、有依据、可以逐项检查的交付物。 能回答一个问题,和把一件事做完,是两回事。 这次我把输入、操作和最终文档放在一起。 你可以直接看:这10万字,到底有没有把问题讲明白。 想体验可以从 Apodex 网页端开始。 想放到自己的环境里运行,也可以看官方开放的 Mini 模型权重和 FrontierAgent 框架。 Apodex 网页端: API Platform: 开源框架 FrontierAgent: Apodex 1.1 mini 模型权重: #Apodex

知识猫AI实验室

40,947 просмотров • 4 дней назад

Codex 做 PPT 合集:15 个 Skills 和开源方案,按用途整理好了 我现在做 PPT,基本都交给 AI,下面把课件、汇报、生图和图片转 PPT 的方案列出来,效果看视频,网址直接放在每项下面。 一、自己讲课、演讲、做分享 1)Marp 把文字和图片整理成课件,后续换案例、补内容,改源文件就能重新生成。适合常规培训,默认导出的 PPTX 是图片式。 2)Slidev 适合讲代码、公式和操作过程,支持分步动画和网页互动。让 Codex 整理逐页内容,再补演示效果;交互多了,也需要多调试。 3)归藏 guizang-ppt-skill 电子杂志、瑞士国际主义等风格,适合整套分享保持统一。先选风格、试一页正文,再继续做;主要用浏览器播放。 4)张咋啦 frontend-slides 先出视觉样张,再选字体、配色和布局,适合想跳出固定模板的分享。输出以 HTML 为主,离线播放前检查字体和图片。 二、做汇报、答辩,交给客户继续改 1)ppt-master 把页面做成可编辑的文字、形状,也支持部分原生图表和表格。先让 Codex 试做正文和数据页,导出后改一个数字,看看图表是否跟着变。 2)slide-skill 提供主题和模板流程,适合反复制作同类汇报。内容更新后可以重新生成,中文断行、字号和图表编辑能力要检查。 3)deck-dna 给两三份认可的旧 PPT,提炼字号、配色和布局,再做新稿。适合沿用公司风格;有严格母版要求,仍要保留原模板。 三、做科普、知识卡和图文课件 1)宝玉 baoyu-slide-deck 黑板、水彩等风格,背景、插画和文字整页生成。先定文案再生图,效果直观,但改字可能要重做一页。 2)宝玉 baoyu-design 先用 HTML 调整设计,再按对应流程导出,也包含可编辑 PPTX 的导出方式。需要配套工具,不能把任意网页直接无损转成 PPT。 3)PPTAgent 把论文、报告接到材料解析、大纲规划和页面生成流程里。长材料可以试,配置比单个 Skill 多,生成的结论和数字要对回原文。 四、只有图片或 PDF,想继续修改 1)GordenSuperPPTSkills 通过 Image2PPTX 相关流程拆文字、补背景、分离元素,适合拿现成图片改标题、挪配图。部分对象仍是图片,不会全部变成原生图形。 2)LRriver/AIPPT 在一个工作台里生成图片、拆分和编辑,少一些导出再导入。效果取决于接入的服务,正式使用前先试一页。 3)NBLM2PPTX 分离 PDF 页面的文字和背景,再组装成 PPTX。没有源稿、只想改字时可以试,复杂图表可能仍保留为图片。 五、想在界面里管理整套制作过程 1)codex-slides 先改大纲、顺序和风格,再生成页面,适合边看边调整。它偏图片式制作,不适合需要频繁更新表格数据的文件。 2)Presenton 模板、模型接入、编辑和导出放在一起,适合长期反复做 PPT。让 Codex 协助搭建,部署和模型费用需要自己管理。 日常课件用 Marp,需要互动再用 Slidev;正式交付用指定模板加 ppt-master;知识卡用宝玉整页生图;只有图片、没有源稿时,再用 Gorden 拆。 建议先做封面、正文和最复杂的一页,满意了再做整套

Miles Ma

28,949 просмотров • 6 дней назад

久等啦,创作者神器Viko终于上线!🥳( 前段时间我随手发过一个 Viko 的 demo视频,就那么一个很糙的版本,结果评论区和私信隔三差五就有人来问,什么时候能用,什么时候上线。 因为对我自己也是刚需,于是闭关爆肝了一个多月,终于来啦~ 它最开始,其实只是我给自己做的一个小工具。 我每天都会刷 Pin和各种作品站找灵感,我相信做 AIGC 视觉创作的人应该都懂。以前看到一张喜欢的图,我的流程是这样的,保存图片,丢进 GPT 反推拆解,复制出来改一改,再贴到生图工具里跑一遍。 做一张还好,一天几十张、上百张的时候,这套流程就显得非常非常繁琐。 所以最开始,我只想做一件特别简单的事: 看到好图,Viko 一下。 浏览任何网页的时候,鼠标悬停在图上,一键捕捉,一键拆解,直接进入下一步创作。 我也试过市面上很多反推插件,还停留在一个特别初级的阶段,丢进去一张图,吐回来一整段 Prompt。 坦率的讲,一整段 Prompt,对真正做创作的人来说,远远不够。 我真正想知道的是,这张图为什么好看。 它是什么视觉风格,构图为什么成立,用了什么镜头和光线,色彩关系是怎么组织的,材质、氛围、人物状态又是怎么形成的。 以及最关键的,到底是哪几个关键词,激发了这张图的「美学基因」。 所以Viko我希望是有这样的能力的 。 人像、动漫、商图、产品图等等,都可以沿着不同的视觉维度爆破拆解,风格、构图、镜头、光线、色彩、主体、材质、氛围,还有真正值得留下来的核心关键词。 你可以直接用完整 Prompt,也可以把某一个视觉元素单独抽出来,改一改,迁移到新的主题里继续二创。 一张图带给你的,就不再只是一句提示词。 你开始知道它为什么成立,也开始有了继续延展它的方法。 在这个基础上,我还做了两个我自己特别喜欢的模式: 第一个是色卡模式。 很多时候一张图让你第一眼觉得「就是这个感觉」,真正起作用的其实是那套配色关系。Viko 可以直接提取画面的核心色彩,把喜欢的配色留下来,迁移到完全不同的主题里。 第二个,是我个人觉得最爽的,内测期间大家最爱用的,动作参考模式。 人物动作一直是 AI 生图里最难搞的问题之一,所以viko针对此项做了专门处理,即使面对复杂肢体动作和高难度透视关系,也能从容、一键完成精准动作还原。 到这里,从一张灵感图开始,捕捉、拆解、理解、二次创作,这条链路已经通了。 但这就够了吗?of course not ! 今天反推出来的 Prompt,过几天还能不能找到? 刚发现的那个神仙关键词,下次创作的时候还能不能想起来? 那套很漂亮的配色、那个难得的动作参考、一次次验证过的构图,还有最后生成出来的作品,用完之后,去哪了? 散落在聊天记录里,收藏夹里,下载文件夹里,各种软件里。 每一次创作结束之后,我们其实都在丢失自己的经验,没有产生创作复利! 所以,资产管理慢慢变成了 Viko 更核心的一部分。 参考图、关键词、Prompt、色卡、生成的作品,每一次创作里真正有价值的东西,都可以也应该沉淀下来。 今天发现的一个关键词,可能是未来某张作品的起点。存下的一套配色,可以迁移到新的主题。 慢慢的,你留在 Viko 里的,就不只是一堆图和 Prompt 了。 它会变成一套真正属于你自己的,视觉创作资产库。 这也是我做到今天,越来越确定的一件事。 反推只是第一步。 找到一张图的美学基因,把它拆开、理解、重新组合,再把每次创作里有价值的东西留下来,让过去的积累继续参与未来的创作。 每一次创作,都应该让下一次创作变得更轻松。 所以! Viko 由 Chrome 插件和网页工作台两端组成,插件负责在你刷图的时候随手捕捉,工作台负责拆解和沉淀。插件在 Chrome 商店搜 Viko 就能装,网页端在 首发期间也肯定有福利送给大家,优惠码: VIKO20,首月直接8 折! 如果你平时也喜欢找图、研究风格、拆 Prompt、做二创,来试试。 看到好图,Viko 一下。

古一

234,076 просмотров • 1 месяц назад