Loading video...
Video Failed to Load
国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能力、算力能力和 Agent 能力,确实可以叫做国产第一了。 之前用 DeepSeek-v4 Pro 和 Kimi 2.6 做测试的时候,一次执行的完成度均不如 Qwen3.7-Max,体感上大概是 Qwen3.7-Max > Kimi 2.6 > DeepSeek-v4 Pro,这次千问在 Terminal-Bench 排行榜也确实反超了Claude Opus 4.6,体感是一致的。 推理能力我是用奥数题和几道 HMMT 的题压了一下,准确率不是第一,但明显感觉比上个月测的 3.6 又高了一档。有个细节:遇到不会的题它会老实说自己不确定,而不是硬编一个看起来合理的错误答案——这点跟 Claude 很像。 还有一点,现在 Qwen 的迭代速度也太猛了,在推上虽然声量没有 Kimi 和 DeepSeek 大,但是 Qwen... show more
34,216 views • 3 months ago •via X (Twitter)
44 Comments

别吹了,我刚叫它写一个桌面版codex操作教程,它一本正经回答说还没有所谓的桌面版,甚至连联网搜索都懒得做。

这个我需要纠正你一下,联网搜索和你用的 Agent 工具呈相关性,而不是模型。 比如 DeepSeek 网页版是支持联网搜索的,但是 api 版本它根本没有联网搜索这个功能。 GLM 模型的 api 是有联网搜索的,但是如果你使用 Claude code 的话,需要额外安装一个联网搜索的 MCP,你用 Claude code 用 Claude 之外的任何模型都没联网搜索,除非你提前安装好了对应的 MCP。

app版

你说的 APP 版是指啥, Qoder 吗?我不记得千问有独立的客户端。

qwen的更新确实快

月更的节奏,国产模型的发力节奏明显比国外的快。

Qwen是唯一一个能跟上老美模型更新速度的国模,估计阿里云在基础设施上的多年积累功不可没

在国内,大家一般是看不上 Qwen,但是老外那,Qwen 就是当年 DeepSeek 出来之前最好的开源模型,现在也是最佳之一。

qwen模型确实不错,我等ds4的更新

听说 ds4 新版本要加入多模态了

你是拿屁股测试的吗。这种人趁早拉黑。kimi2.6这种预训练垃圾到家的东西,更ds比什么?懂点技术的人都不会拿Kimi2.6来比,你百分百收钱了。

追求性价比我还是推荐 DeepSeek 的,评论区我也说了,性价比方面 DeepSeek 最好。

一次出,不进行多轮迭代,能达到这个效果真的猛

我反而很认同你提到那个细节:不会就说不确定。 现在模型最贵的不是“偶尔答错”,而是一本正经地胡说八道。能承认边界,才说明它开始像一个可协作的系统,而不是只会表演聪明。

Qwen3.7-Max 这波直接把国产模型的 Agent 能力拉到新高度,35小时长程任务不崩、跨框架兼容性又提升,实测体感确实把 Kimi 和 DeepSeek 甩开了。 迭代速度更是离谱,月更+每次都有质的飞跃

你们这种水军傻逼,你能不能换点说词?

网页版问过几个问题,回答的很专业,现在有些项目规划就先让Qwen3.7来写的

国产模型个个都来卷啊! 卷完你的卷你的。

按照现在国产模型的能力,很多工作流都可以国产模型来做了,我司很多业务都是国产模型支持的。

agent 的成本常常被 tool loop 放大。每一步用什么模型、失败几次、fallback 到哪、花了多少,都应该能追。

这个时候考验的就是 harness,成熟的 harness 会把 tool loop 的结果丢掉,需要用的时候做召回。

前端题能跑通的话含金量不低

国产模型请继续卷下去

对,尤其是 Qwen 这种有超多版本的模型😂

跟v4pro的价格对比如何?

DeepSeek 性价比更高,Qwen 3.7 现在是半价优惠中。

又他妈来了。谁他妈信国产模型谁傻逼。

比DeepSeek和Kimi都强?

对 你可以试试,我在视频中也给了三个例子 都是只执行了一次,没有多轮迭代出的效果。

有点模型依赖了

可是codex 5.5甩了opus 4.7一节,opus4.7甩了sonnet 4.6一节

坐等3.7的开源模型,27B左右的本地算力做agentic organizer绝对棒棒的

这波国产模型确实支棱起来了还没试的赶紧冲

前端、算力、Agent 三项一起过线,含金量确实比单看跑分高。真要说服更多人,后面还是得看 Agent 场景下的稳定性,尤其是长步骤任务会不会中途掉链子。

测试这些题目完全没有屁用 你问千问印度2025年空调销量是多少 它都答错 这就说明问题了

国产模型快冲阿 便宜又大碗!!

这可以本地跑吗?本地跑的话需要什么样子的配置呢?或者说本地跑的最高级的配置能比得上哪一个模型的能力呢?

这么大模型 一般机器肯定跑不起来的

咋没有 minimax

Qwen再不发力都快把它忘了,得加油啊

再次突破👍

被安利到,这就去测一下

放狗屁,但凡好点你能在推上看到老外集体发帖推荐,就跟之前glm跟kimi一样,实际上就是一坨💩掀不起风浪。模型都还没像样就开始闭源,真把自己当回事了,接广接个有实力的吧,接这种垃圾不仅被人骂还要想怎么吹

收钱推广就别误人子弟了
