正在加载视频...

视频加载失败

谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。 Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT-5.6 Sol。 从上一代第18名直冲榜首,整整跃升17个名次,完成了同级模型里绝无仅有的跨越式爆发。 7个前端细分赛道拿下6个第一,品牌营销参考设计数据分析消费产品模拟工具内容创建全线领跑,仅游戏赛道暂居第二。 这不是刷题库的纸面跑分,是全球开发者匿名盲测投出来的真实战力,代码质量交互体验全维度硬碰硬。 更炸裂的是完整模型权重7月27日前就会开放,顶级前端编码能力直接无差别下放给所有开发者。 当开放权重的中国模型能在核心开发赛道正面打赢闭源顶流,维持多年的双巨头格局是不是真的要改写了。 #KimiK3 #Moonshot #AI大模型 #前端开发 #开源AI

153,819 次观看 • 8 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

50,339 次观看 • 29 天前

OpenAI 深夜放炸弹,GPT 5.4 来了!🤯 这次是真 “大一统” 了,推理、编程、操控电脑、搜索、百万 Token 上下文,一个模型全干了!之前得在不同模型之间反复横跳,现在一个 GPT 5.4 全搞定,恐怖的是每条线都拉到顶尖水平,几乎没有短板。 来看看跑分,SWE-Bench Pro 57.7% 编程登顶,FrontierMath 数学第一,ARC-AGI-2 抽象推理 83.3% 创下新高,把 Gemini 3.1 Pro 和 Opus 4.6 全踩脚下。幻觉率比 GPT-5.2 暴降 33%,工具搜索功能直接把 Token 消耗砍掉 47%,又准又省。 值得关注的是「原生操控电脑」能力,OSWorld-Verified 拿下 75% 成功率,超过了人类的 72.4%。也就是说,GPT 5.4 操作电脑比大部分人都熟练了😂 而且是真的能看截图,自己点鼠标键盘完成任务 实际工作能力的表现也很不错,在GDPval 测试里,GPT 5.4 拿了 83%,追平甚至超越行业专业人士!这个测试横跨 44 种职业,让 AI 真刀真枪交付成果,做 PPT、建 Excel 模型、写法律分析,也就是说 AI 干活比大多数打工人还靠谱了。 有意思的是,两天前 GPT 5.3 Instant 撞车 Gemini 3.1 同一天发布,算是给 GPT 5.4 铺路了,先出个日常对话版本,再放大招。 OpenAI 最近这波节奏很猛,短时间连发两个模型,明显是要把之前被 Claude 抢走的编程用户拉回来。 AI 模型的军备竞赛已经白热化了,你现在主力用的是哪个 AI 模型?打算换 GPT 5.4 试试吗?

程序员鱼皮

23,679 次观看 • 4 个月前

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

15,968 次观看 • 2 天前

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 次观看 • 1 个月前

最近一段时间都在关注模型、建模、仿真、优化 这些都是有趣课题,值得去了解学习 在这里我简单介绍两款开源项目: Webots 和 Modelica & OpenModelica 视频1是Webots的自动驾驶仿真 视频2是OpenModelica 6气缸的 v6 引擎仿真 模型,模拟仿真,物理引擎,机器人,自动驾驶,都是非常重要的课题和基础 Webots 是一款用于模拟机器人的开源多平台桌面应用程序 之前也提及:汽车自动驾驶其实就是一个大号机器人,软件定义汽车已是趋势 Webots 提供了一个完整的开发环境来建模、编程和模拟机器人 它为专业用途而设计,广泛应用于工业、教育和研究 Webots 基于 C++/Qt 构建,支持 ROS Webots 依靠 ODE(Open Dynamics Engine,开放动力学引擎)进行物理模拟 因此,一些 Webots 参数、结构或概念引用了 ODE ODE 有着广泛的应用,值得更多关注 Webots + ODE + ROS 一个完整的机器人自动驾驶模拟仿真工具链 一个思考:我们的世界是个建模仿真还是一个真实存在 -------------- 建模很重要 Model knowledge is stored in books and human minds which computers cannot access 数值分析、科学计算软件包基本都会搭载建模仿真工具,比如 MATLAB 有 Simulink Scilab 有 Xcos 当然,也有很多专注建模和仿真的开源工具,上面介绍的 Webots,接着再给大家介绍下 Modelica & OpenModelica Modelica 是开源建模语言 OpenModelica 是一个基于 Modelica 的开源建模和仿真环境 (基于 C/C++/Qt 构建),包含编译器和运行时,旨在供工业和学术用途 基于建模语言和仿真环境去学习研究和实践数学建模、物理模拟和科学工程都是非常好的方式 类似将 MATLAB/Octave/Scilab 用于数值分析和科学计算是同样道理 Modelica 基本理念: 设计一种建模语言,满足多领域物理系统建模与仿真工程应用,可用于几乎所有工程领域的建模,从而摆脱针对特定专业领域工具的限制 换言之,Modelica 即是建模语言,同时也是模型交换与重用的标准 众多面向对象建模语言开发商共同一起,基于他们的经验,研究建立多领域物理系统的建模规范 Modelica 可以解决用连续微分代数方程组(DAEs)表示的许多问题 Modelica 使用 DAEs,而避免使用常微分方程 (ODEs) 描述物理世界,从而在建立方程方面减轻了建模人员的负担 Modelica 支持连续变量和离散变量两种方式在同一组件模型或系统模型中使用 Modelica 模型标准库,Modelica Standard Library, MSL 开发 MSL 的目的是让使用 Modelica 语言的用户,不用开发底层基本的组件模型,就可以开展物理系统的建模和仿真工作 用户需要掌握 Modelica 语言的基础,并学会怎样有效地使用 MSL 目前版本的 MSL 包含 1417 component models and blocks, 512 example models, and 1219 functions Modelica 是开源建模语言,采用类似 C++ 的发展模式,希望能最终纳入 ISO, ANSI, IEEE 标准体系 如果不出意外,Modelica 极有可能会像 C++ 一样成为一种流行的物理系统建模语言,我们拭目以待吧 有关 Modelica & OpenModelica 的介绍和快速了解,可下载官方提供的 200 多页幻灯片资料 从 1997 年 1.0 版到现在正在开发的 3.7 版,Modelica 建模语言之路也已走了快 30年 ---------------------- ps: 国内外的很多差距其实就体现在这些方面,国外很多研究和应用可以一直持续几十年不间断。(展开,包括很多知名摇滚重金属乐队,动不动就是30,40年历史,国内乐队大多昙花一现,有些东西确实没办法) 我们更多是热点来了一哄而上,热度退却,再一哄而散。没有10年,几十年甚至上百年的积累沉淀,怎么比和竞争呢 所以不要盲目的瞎高潮,克制住站在巨人肩上取得一点进展的狂喜中迷失自我

灰狐

12,904 次观看 • 1 年前