Загрузка видео...
Не удалось загрузить видео
我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。... show more
12,293 просмотров • 1 день назад •via X (Twitter)
Комментарии: 36

Domestic models have indeed become powerful. They don't just look at the picture and hand in the paper all at once; instead, they follow an awesome "observe → act → verify → revise" process, reducing rework time—perfect!

Ling-3.0-flash-VL Domestic models will grow stronger and stronger... until they surpass foreign ones. At the current stage, domestic models, as long as they can get the job done, will have a huge domestic audience.

Ling-3.0-flash is indeed a good model, and its coding capabilities are pretty solid too.

Give the AI a reference image, and sometimes it will even enthusiastically help you swap out color schemes or add modules. When it comes to faithful reproduction, what you fear most is this kind of improvisation. First, make it exactly like the original image, then discuss whether optimizations are needed—this can save a lot of unnecessary revisions.

这个还原确实还挺有水平的,Ling-3.0-flash-VL多模态能力有说法

最想看第一版到最后一版的对比 尤其是哪些地方它自己看出来不对 又改回来了

牛掰啊 这玩意儿挺实用的 我突然想到 这种能够识别视频帧的模型 可以做很多事情 比方替代人看监控之类的

应该没人比我玩的开了吧🪁🌷我福不黑不信你看

parting 😹 🦗 challenger

应该没人比我玩的开了吧🖤🍟我福不黑不信你看

这个太完美了。渲完还愿意自己盯着看,还能改!这才叫会看图呀。

hardy 🌈 🤌 horizon

应该没人比我玩的开了吧🏹🦋我福不黑不信你看

misunderstood 💜 😴 morbid

拿截图直接还原成单文件,这个工作流有点像给代码做了“看图复印”;要是成品能跑,确实省掉不少来回描述。

它识别图片的功能也太用了 玩了一天

是不是 coding 能力也还行

astonished 🍓 🫁 dissertation

最怕AI一本正经地告诉你“已高度还原”,然后一打开:这谁啊😂能自己渲染完再回头改,这点确实实用👍

会看图写代码的一堆,会自己盯着原图改到像的不多,这波确实有点东西。

应该没人比我玩的开了吧🏊🥰我福不黑不信你看

国内模型确实强大起来了,它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」牛逼克拉斯,减少返工的时间,完美!

是的 真的是写代码的好帮手

试了下还原挺准,观察再修正这套很实用,国内模型进步明显

纯文本AA Index从38到42,加上视觉能力没掉还涨了。多模态不是牺牲文本能力换来的,这个平衡做得不错!

Ling-3.0-flash-VL 国模会越来越强劲... 直到超越国外 现阶段国模 只要能干活 国内受众j就会很多

国内大模型越来越厉害了是 一张截图直接还原 我真的会服

应该没人比我玩的开了吧😄🌮我福不黑不信你看

蚂蚁百灵首个原生多模态模型,不是在纯文本模型外挂视觉编码器,而是原生联合训练,最大亮点就是你演示的视觉反馈闭环:观察→行动→验证→修正,不再是一次性看图生成代码

我也试过「截图 → 让百灵出单文件 HTML → 本地打开再圈错回灌」这一套。第一版布局能齐,细看输入框灰底和按钮发光还是差点意思;第二轮带着圈错图回去,白底描边才贴回来。视觉闭环靠的是把渲染结果当证据,不是一次 prompt 赌命。

应该没人比我玩的开了吧🐚🐋我福不黑不信你看

看图还原界面还能自查修正,前端写页面这个模型真的好用

应该没人比我玩的开了吧🩻🚤我福不黑不信你看

连组件清单都省了,前端切图党要失业了

国产模型是越来越特厉害了,以后有需求直接发图片就行,比用语言描述半天都清楚

应该没人比我玩的开了吧🚶🥯我福不黑不信你看
