正在加载视频...
视频加载失败
这次用一个“订单对账”小测试试了下 Claude Opus 4.8,最大的感受是:它更愿意把活做完整。 这次测试不靠联网、不靠写代码,就是用最贴合业务场景的,给了它三组数据:订单、付款、退款,然后要求按规则逐条核对。 里面埋了几个容易漏的坑:重复付款 id 只能算第一次、字符串金额要忽略、EUR 不能混进 USD、0.1+0.2 要按两位小数处理,还有一个客户只有付款没有订单,也必须出现在结果里。 Opus 4.8 的表现挺稳。它算出了正确余额,把每条被忽略的记录单独列出来,还在最后做了自检。 尤其是第二条重复的 p3=999.00 没被误算进去,c6 这种“只有付款”的客户也没漏,说明它对边界条件扫得比较认真。 我的感觉:这个模型在细节任务里的耐心和完整性更好了。至少在这个纯文本核对任务里,它体现出了比较强的边界意识,也没出现“扫一半就开始总结”的情况。 当然,这不等于它永远不会偷懒。代码 Agent 场景还得看它会不会真的写文件、跑测试、失败后继续修。但单看这个测试,Opus 4.8 的“少偷懒”是能感受到的。 现在在 ZenMux 可以体验 Opus 4.8,还有 PK 功能,建议可以去试一下和 Opus 4.6 的对比🤣,链接我放在评论区~
14,167 次观看 • 2 个月前 •via X (Twitter)
0 条评论
暂无评论
原始帖子的评论将显示在这里
