Загрузка видео...

Не удалось загрузить видео

На главную

Qwen-3.8 max 实战测评来啦! 体验下来: 参数量 2.4T,同任务下,速度上要比kimi-k3快很多,甚至有十倍的差距,对需要频繁交互的探索性任务比较友好,性价比较高 这次也支持了多模态,上下文长度支持1M 前端能力从测评任务可以看到整体上还是不错的,与其他SOTA模型不相上下 目前,Qwen3.8-Max 预览版模型(Qwen3.8-Max-Preview)已首发上线阿里 Token Plan、Qoder 及 QoderWork。当前 3.8看是限时一折,夜间更是0.2折,感兴趣的朋友可以试试 且 Qwen3.8 正式版很快将发布并开源,正在以“天”为单位持续进化,今天意外发现测评的效果比昨天发布的版本要好很多,值得长期关注 Qwen3.8-Max-Preview 相比上一代 Qwen3.7-Max 提升明显;面对 KIMI-K3、GLM-5.2 和 Opus-4.8-Max 时也有一定优势,尤其擅长 Cowork 类 Agent 任务,但对 Fable-5-Xhigh 仍处于下风,很期待后续优化。 评论附办公类测评👇

104,896 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 15

Фото профиля 岚叔
岚叔2 месяцев назад

办公场景我设计了一个复杂的:多模态多文档+决策推理:整体看Qwen3.8-Max-Preview 还可以,拍板事项提炼得最好,速度最快、性价比较高。 测评细节: 让gpt image 2生成一张高密度图片,然后让三家模型(gpt-5.6 sol vs kimi-k3 vs Qwen3.8-Max-Preview)进行对比 对比结果: 1.视觉信息提取:20/20 均是满分: gpt-5.6 = kimi-k3 = Qwen3.8-Max-Preview 2.冲突识别:gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 3.计算逻辑: gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 4.行动清单: gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 5.整理表达: gpt-5.6 = Qwen3.8-Max-Preview > kimi-k3 6.执行速度:Qwen3.8-Max-Preview > gpt-5.6 > kimi-k3 综合评估: gpt-5.6 sol :9 分 、kimi-k3 8分 、 Qwen3.8-Max-Preview 8分 Qwen3.8-Max-Preview 有很强的简报包装和决策推动能力、但是数据计算略有瑕疵,需要交叉验证

Фото профиля 岚叔
岚叔2 месяцев назад

补充测评的在线查看地址:

Фото профиля SK
SK2 месяцев назад

GPT5.6 sol is such a disappointment

Фото профиля whiling
whiling2 месяцев назад

你这个测评软件是啥?

Фото профиля 岚叔
岚叔2 месяцев назад

自己开发的,我一会发地址

Фото профиля Berryxia.AI
Berryxia.AI2 месяцев назад

比3.7 比较明显,优劣势其实还是各有千秋,我也试试怎么样

Фото профиля 岚叔
岚叔2 месяцев назад

可以的,整体还不错😃

Фото профиля GuangWong
GuangWong2 месяцев назад

你测的是今天晚上它更新过的,还是之前的?

Фото профиля 岚叔
岚叔2 месяцев назад

今天下午重测的,发现比昨天好很多

Фото профиля GuangWong
GuangWong2 месяцев назад

2nd 2 fable5 可能不是吹的,我晚上用了下,感觉也好的一些了

Фото профиля mario zhai
mario zhai2 месяцев назад

这是什么评测软件,自己码的吗

Фото профиля 岚叔
岚叔2 месяцев назад

自己码的,我一会发地址

Фото профиля YOLO
YOLO2 месяцев назад

@gork Qwen-3.8 max 不是文本模型么?还是多模态?

Фото профиля Origenius Law
Origenius Law2 месяцев назад

卖断货和打折都没人要的差距

Фото профиля 古一 🔶 ETH
古一 🔶 ETH2 месяцев назад

焚决

Похожие видео

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 просмотров • 6 месяцев назад

国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能力、算力能力和 Agent 能力,确实可以叫做国产第一了。 之前用 DeepSeek-v4 Pro 和 Kimi 2.6 做测试的时候,一次执行的完成度均不如 Qwen3.7-Max,体感上大概是 Qwen3.7-Max > Kimi 2.6 > DeepSeek-v4 Pro,这次千问在 Terminal-Bench 排行榜也确实反超了Claude Opus 4.6,体感是一致的。 推理能力我是用奥数题和几道 HMMT 的题压了一下,准确率不是第一,但明显感觉比上个月测的 3.6 又高了一档。有个细节:遇到不会的题它会老实说自己不确定,而不是硬编一个看起来合理的错误答案——这点跟 Claude 很像。 还有一点,现在 Qwen 的迭代速度也太猛了,在推上虽然声量没有 Kimi 和 DeepSeek 大,但是 Qwen 在 3 月发 3.5,4 月发 3.6,5 月直接上 3.7,已经变成月更节奏了,而且每次迭代都有不小进步,现在已经是名副其实的第一梯队。 在海外 OpenRouter 上 Qwen3.6-Plus 的调用量刚破了平台纪录,日调用 1.4 万亿 Token,开发者们是在拿真金白银在投票。 千问这一代明显是往 Agent 方向走的,极限压测下长程任务能跑 35 小时不崩,跨 Agent 框架兼容性也比上一代好很多。 具体测试视频见 ⬇

耳朵

34,216 просмотров • 4 месяцев назад

给大家带来小米 MiMo-v2.6-pro 的测试速报! 简单来讲, 这次不愧是直播RL带来的效果, AgenticCoding 能力提升明显, 之前的 MiMo-v2.5-Pro 在我的向量数据库测试中得分只有2505, 而这次直接翻了3倍, 得分来到了7810. 与 Claude Fable-5 分数接近了. 而且算法也进化为了单图HNSW分层近邻图(M=16/M0=28) + AVX-512精确距离 + 每线程visited stamp. 可以说只要再优化一下算法细节就是SOTA水平了. 而前端测试则是MiMo需要提升的重点了, 这次演示效果虽然有提升, 但是无奈横评的其他模型都太强大了, 而小米的加分项也是本身的算法Coding能力, 比如它是可以 one-shot 写出一个光追引擎的. 但是由于空间理解/物理模拟能力不到位, 小球没办法完成把墙壁撞破的演示. 另外本次还给大家测试了输出速度, MiMo-v2.6-pro-ultraspeed 版本可以达到464tps的速度, 着实恐怖. 而根据MiMo的技术报告, 峰值可以达到900tps, 常态化请求也可以稳定在500tps左右, 考虑到模型 1.02T 的总参数量, 以及高达 42B 的激活参数量, 再加上同等规模模型一般都在60-80tps的水平, 这个成绩相当亮眼. 当然也有值得注意的点, 比如这次测试我发现它还是有早停的问题的, 上面的向量数据库测试, 每轮最大迭代50次, 但是三次测试中, 有两次它迭代到30轮左右就没办法提升分数, 于是选择了直接交卷, 浪费了测试机会. 以及, 模型思考偏长, 而且暂时不支持调整思考强度, 加上普速接口现在异常火爆, 所以最好给大一些超时, 避免无法输出结果. 总结: MiMo-v2.6-Pro 适合搞后端AgenticCoding开发! 要算法有算法要质量有质量. 但是前端空间理解和美学还需要加强. 考虑到直播后训练的时候看到的67%的训练语料都是Coding, 这个结果丝毫不惊讶了. 希望下个版本前端能力也有提升! #mimo #mimov26 #mimov26pro #x小米mimo

karminski-牙医

11,951 просмотров • 4 дней назад

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 просмотров • 5 месяцев назад