Loading video...

Video Failed to Load

Go Home

实测阶跃星辰 Step 3.7 Flash 大模型 在 Claude Code 工作流里的表现不俗 最近看到阶跃星辰5月29日开源的 Step 3.7 Flash,最大的标签就是快——最高约 400 Token/s。底层是稀疏 MoE 架构,196B 总参、激活仅 11B,还内置 1.8B ViT 原生支持视觉理解,能直接读懂 UI 截图、图表和文档,再转化成可执行任务。 在同级别开源模型普遍还不支持多模态的当下,这一点本身就很稀缺。但更让我感兴趣的是官方的定位——为生产级 AI Agent 打造的高效 Flash 模型。这句话含金量很高,所以我直接上手测了三个场景: 1、给四张网易云音乐客户端截图,让它根据图片生成一个还原度尽量高的网站——主要验证多模态图片理解能力(如视频所示)。 2、给一个 URL,让它抓取页面内容后生成对应网站——测试结合工具链的端到端能力。 3、给一张动效 GIF,让它复刻成网页版动画效果——看它对动态视觉信息的拆解能力。 最后这是StepFun 两个平台地址,评论区还有两个demo,有兴趣的也可以继续看看 阶跃星辰海外平台: 阶跃星辰国内平台:

33,550 views • 3 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 views • 3 months ago

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。 你也试一下,3 步就够: 打开 Ling Studio,选 Ling-3.0-flash-VL(免费) 丢一张 Codex / VS Code / 你常用软件的桌面截图 把下面提示词贴进去,看它怎么还原、怎么改 还原提示词(可直接复制): 这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。 按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code 对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框 配色、字号、间距、圆角、分割线、栏宽尽量贴近原图 原图能看清的文字按原样还原;看不清的用同等长度占位 先出第一版并渲染,再和原图对比对齐、颜色、组件位置 列出差异后改第二版,直到气质接近 Codex 桌面端 权重已开源,BF16 / FP8 都能下: Hugging Face: ModelScope: 官方介绍: Ant Ling 别只看评测表,丢一张你桌面上的截图,比什么都准。

程序员端哥

12,293 views • 1 day ago

Phone Harness 最近火了以后,大家开始意识到 Agent 终于可以真的操作手机了。 Phone Harness 的路线过于极客。 它需要 Mac 和本地 iPhone,通过 iPhone Mirroring 把手机画面交给 Claude Code 或 Codex,再通过截图和 OCR 理解屏幕内容,最后模拟点击、滑动和输入去操作这台 iPhone。 但同样是 Phone Agent,我觉得 Airtap 把场景往外扩了一层。 它不只是给 Agent 一个遥控手机的能力,而是真的给 Agent 配了一台完整的云端 Android。 我想看看这台 Android 到底能走多远,就给 Airtap Ai 的公开测试号 +1 (650) 444-9517 发了条 iMessage,让它直接打开 Termux 跑 Python。 这件事有意思的地方在于,Airtap 后面跑的本来就是完整 Android。 所以不只是能打开 TikTok、Amazon、Google 这些 App。 还可以直接装 Termux,Termux 本身就是 Android 上的终端和 Linux 环境。 打开以后运行 pkg install python 就能把 Python 环境装进去。 到这里,这台远程手机就多了一层完全不同的能力。 它不只可以点 App。 还可以直接成为一个远程代码执行环境。 这次我让它用 Python 获取 Hacker News 当前 Top 100 热门帖子,从里面筛出 AI、LLM、Agent、AI Coding 相关内容,再根据 score 和评论数排序,最后生成一份 HTML 报告。 整个过程都发生在远程 Android 里。 Airtap 打开 Termux,跑 Python,获取数据,处理结果,再生成 ai_hn_report.html。 报告完成以后,它还能把 HTML 打开,截图,再直接通过 iMessage 把图片发回来。 这也是我觉得 Airtap 和 Phone Harness 虽然都在做 Phone Agent,但使用边界很不一样的地方。 Phone Harness 更像是让 Claude Code 或 Codex 获得操作本地 iPhone 的能力。 Airtap 更像是直接给 Agent 一台可以自己干活的 Android。 App 是它的 GUI,Termux 是它的命令行,iMessage 是我给这台手机派任务的入口。 它可以去 App 里点,也可以进终端跑 Python。 可以抓数据,可以处理文件,可以生成 HTML,最后还能把图片和结果直接发回消息里。 所以比起 AI 终于会点手机了,我现在更感兴趣的是另一件事。 当 Agent 自己拥有一台完整的手机以后,还有多少原本需要电脑和手机来回切换的工作,可以直接丢给它

白骏知识分享

59,190 views • 29 days ago

Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏! 给大家带来刚刚正式发布的 kimi-k2.6 的正式版本的实测! 本次为了考验它的长程Agentic Coding能力, 我用 kimi-k2.6-code-preview 写了个 harness 游戏自动生成框架, 它可以根据给到的人设/场景/数值设计等规则, 自动生成关卡, 背景图片, 甚至配音! 其中框架驱动和草稿模型使用 kimi-k2.6, 文生图和生成语音由 kimi-k2.6 生成 prompt 后调用其它大模型生成. 最好玩的是, 我做了个"无头"版本的游戏cli接口, kimi-k2.6 能像玩互联网早期Mud游戏一样, 使用纯文本玩这个游戏, 每当它生成关卡之后, 他就可以直接进入游戏游玩一下, 来验证关卡设计得是否正确. 而内部设计又分为了对话生成skill, 脚本生成skill, 关卡生成skill, 游戏测试大师skill, 游戏资深玩家skill(由于检讨游戏性) 等等, 从而实现了让大模型自己写游戏自己玩! 每个关卡大概需要一个小时生成和验证, 如果并行验证应该还能更快一些(做多线程BFS/DFS). 另外本次依旧使用大家都熟悉的测试项目进行了前端/后端/Agent能力测试, 从测试来看, 复杂项目前端能力(建模, 空间理解, 物理模拟等)略有下降, 但后端和 Agent 能力有明显提升. 不过如果你是纯做网站的话, 可以用 kimi 网站上的的 k2.6 Agent 模式, 由于 Agent 能力足够强所以可以在这个模式下多步来提升生成的网站质量和交互体验. #kimi #kimik26 #moonshot #月之暗面 #kimicli

karminski-牙医

40,177 views • 4 months ago