Загрузка видео...
Не удалось загрузить видео
Qwen-3.8 max 实战测评来啦! 体验下来: 参数量 2.4T,同任务下,速度上要比kimi-k3快很多,甚至有十倍的差距,对需要频繁交互的探索性任务比较友好,性价比较高 这次也支持了多模态,上下文长度支持1M 前端能力从测评任务可以看到整体上还是不错的,与其他SOTA模型不相上下 目前,Qwen3.8-Max 预览版模型(Qwen3.8-Max-Preview)已首发上线阿里 Token Plan、Qoder 及 QoderWork。当前 3.8看是限时一折,夜间更是0.2折,感兴趣的朋友可以试试 且 Qwen3.8 正式版很快将发布并开源,正在以“天”为单位持续进化,今天意外发现测评的效果比昨天发布的版本要好很多,值得长期关注 Qwen3.8-Max-Preview 相比上一代 Qwen3.7-Max 提升明显;面对 KIMI-K3、GLM-5.2 和 Opus-4.8-Max 时也有一定优势,尤其擅长 Cowork 类 Agent 任务,但对 Fable-5-Xhigh 仍处于下风,很期待后续优化。 评论附办公类测评👇
104,896 просмотров • 2 месяцев назад •via X (Twitter)
Комментарии: 15

办公场景我设计了一个复杂的:多模态多文档+决策推理:整体看Qwen3.8-Max-Preview 还可以,拍板事项提炼得最好,速度最快、性价比较高。 测评细节: 让gpt image 2生成一张高密度图片,然后让三家模型(gpt-5.6 sol vs kimi-k3 vs Qwen3.8-Max-Preview)进行对比 对比结果: 1.视觉信息提取:20/20 均是满分: gpt-5.6 = kimi-k3 = Qwen3.8-Max-Preview 2.冲突识别:gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 3.计算逻辑: gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 4.行动清单: gpt-5.6 > kimi-k3 = Qwen3.8-Max-Preview 5.整理表达: gpt-5.6 = Qwen3.8-Max-Preview > kimi-k3 6.执行速度:Qwen3.8-Max-Preview > gpt-5.6 > kimi-k3 综合评估: gpt-5.6 sol :9 分 、kimi-k3 8分 、 Qwen3.8-Max-Preview 8分 Qwen3.8-Max-Preview 有很强的简报包装和决策推动能力、但是数据计算略有瑕疵,需要交叉验证

补充测评的在线查看地址:

GPT5.6 sol is such a disappointment

你这个测评软件是啥?

自己开发的,我一会发地址

比3.7 比较明显,优劣势其实还是各有千秋,我也试试怎么样

可以的,整体还不错😃

你测的是今天晚上它更新过的,还是之前的?

今天下午重测的,发现比昨天好很多

2nd 2 fable5 可能不是吹的,我晚上用了下,感觉也好的一些了

这是什么评测软件,自己码的吗

自己码的,我一会发地址

@gork Qwen-3.8 max 不是文本模型么?还是多模态?

卖断货和打折都没人要的差距

焚决
Похожие видео
Sensitive content
做过投票发现蛮多人想看Bela说说假发,就录了一期 ——《女装避坑指南——假发/假发片》 和之前义乳评测一样是脱稿说,紧张,也不完美, 但是视频还是有蛮多干货呢 毕竟视频时长也和上次评测一样比较长(5min) 对假发感兴趣的姐妹同好们可以上 Umate解锁单篇 或者patreon订阅任何一个等级即可看😘
Cyber Bela
65,458 просмотров • 2 лет назад
