正在加载视频...

视频加载失败

Qwen-3.8 max 实战测评来啦! 体验下来: 参数量 2.4T,同任务下,速度上要比kimi-k3快很多,甚至有十倍的差距,对需要频繁交互的探索性任务比较友好,性价比较高 这次也支持了多模态,上下文长度支持1M 前端能力从测评任务可以看到整体上还是不错的,与其他SOTA模型不相上下 目前,Qwen3.8-Max 预览版模型(Qwen3.8-Max-Preview)已首发上线阿里 Token Plan、Qoder 及 QoderWork。当前 3.8看是限时一折,夜间更是0.2折,感兴趣的朋友可以试试 且 Qwen3.8 正式版很快将发布并开源,正在以“天”为单位持续进化,今天意外发现测评的效果比昨天发布的版本要好很多,值得长期关注 Qwen3.8-Max-Preview 相比上一代 Qwen3.7-Max 提升明显;面对 KIMI-K3、GLM-5.2 和 Opus-4.8-Max 时也有一定优势,尤其擅长 Cowork 类 Agent 任务,但对 Fable-5-Xhigh 仍处于下风,很期待后续优化。 评论附办公类测评👇

102,672 次观看 • 13 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,657 次观看 • 4 个月前

国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能力、算力能力和 Agent 能力,确实可以叫做国产第一了。 之前用 DeepSeek-v4 Pro 和 Kimi 2.6 做测试的时候,一次执行的完成度均不如 Qwen3.7-Max,体感上大概是 Qwen3.7-Max > Kimi 2.6 > DeepSeek-v4 Pro,这次千问在 Terminal-Bench 排行榜也确实反超了Claude Opus 4.6,体感是一致的。 推理能力我是用奥数题和几道 HMMT 的题压了一下,准确率不是第一,但明显感觉比上个月测的 3.6 又高了一档。有个细节:遇到不会的题它会老实说自己不确定,而不是硬编一个看起来合理的错误答案——这点跟 Claude 很像。 还有一点,现在 Qwen 的迭代速度也太猛了,在推上虽然声量没有 Kimi 和 DeepSeek 大,但是 Qwen 在 3 月发 3.5,4 月发 3.6,5 月直接上 3.7,已经变成月更节奏了,而且每次迭代都有不小进步,现在已经是名副其实的第一梯队。 在海外 OpenRouter 上 Qwen3.6-Plus 的调用量刚破了平台纪录,日调用 1.4 万亿 Token,开发者们是在拿真金白银在投票。 千问这一代明显是往 Agent 方向走的,极限压测下长程任务能跑 35 小时不崩,跨 Agent 框架兼容性也比上一代好很多。 具体测试视频见 ⬇

耳朵

33,499 次观看 • 2 个月前

Kimi K3 和 Qwen3.8 前后发新模型,都说自己仅落后 Fable5,K3 套餐现在抢都抢不到,千问还是随便买,我干脆买来测一测到底有没有那么强!!! 结果让我很震惊,某些情况下国产模型做的比 Fable5 还好,并且 Qwen3.8 同一个任务比 Fable5、K3便宜5-10倍,详细聊一聊: 第一个活,让 Qwen3.8、KimiK3、Fable5 复刻 macOS,同样一条一条 prompt(具体对比参考视频): Qwen 3.8 做的最好,一口气写1500 多行代码,菜单栏、Dock 弹性动画、可拖拽窗口等基础的不说,Spotlight、终端、通知中心全都真的能用。这是三板中能做得最全的,UI 也是最舒服的。 第二个活,让它写一个植物大战僵尸那样的塔防游戏。植物、僵尸、阳光经济、10 波进攻,最后一波有僵王坐镇,每条路还配了救场小推车。点开就能玩,同样一句话完成。 中间还顺手让它搓了个黄金矿工,像素怀旧风,放钩抓金块、炸药、道具商店、关卡倒计时全有,一次成型零报错。 然后计算了一下Token消耗和价格,这几个活加起来,Qwen3.8 花 4 毛钱,我以为自己少数了俩零,Fable 5 折算 5块4,K3 收了我 3块4。。。 同样的题三个模型的测试下来都能交货,但测完我的结论是: 国产这俩说仅落后 Fable 5,还真不算吹,差距已经缩小。但价格上 Qwen3.8 确实香,限时优惠+39 块上车不限购,烧 token 多但还是最便宜,而且这还只是预览版,2.4T 参数的正式版说是很快开源。 所以说,国产模型现在都很不错,兄弟们,你会选哪家呢🤔

余温

141,042 次观看 • 12 天前

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,566 次观看 • 3 个月前