Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Anthropic的创始人Dario Amodei,把话挑明了。 他说,多数中共国的开源AI模型,都是幻觉。 是专为跑分优化的“考试型选手”。 公开测试,个个是学霸。 榜单分数,高得吓人。 可一旦遇到没见过的题,私下一考。 马上露馅,表现差一大截。 为什么? 因为它们本来就不是为了解决真实世界的问题。 而是为了刷榜。 技术根源上,很多模型还是从美国大实验室的模型里“蒸馏”出来的。 听着是不是很耳熟? 只为高分,不为真才实学。 应试教育那套,原封不动搬到了AI领域。 Amodei还打了个比方。 AI就像雇员。 你是要世界第一的程序员,还是要排名第一万的? 能力的天壤之别,任何一个老板都懂。 真正顶级的AI,认知能力最强的那个,才是唯一的赢家。 价格和形式,在绝对的聪明面前,都不重要。 靠刷分和模仿,能做出最聪明的AI吗? 这条路,到底能走多远?

249,731 Aufrufe • vor 6 Monaten •via X (Twitter)

32 Kommentare

Profilbild von SweetieRT
SweetieRTvor 6 Monaten

你不能一方面说中国模型抄袭的你,一方面说中国模型是假的,你能不能稍微有点智商啊

Profilbild von Wt
Wtvor 6 Monaten

这个货越来越不像AI公司了,越来越像个政治人物,实话说这个公司也是最近才冒出来的,现在想博取一点知名度。

Profilbild von chenweifei
chenweifeivor 6 Monaten

李彦红到底对他做了什么

Profilbild von CV066
CV066vor 6 Monaten

跟国内安卓机一样。个个刷分奇才,真跑起来系统就拉了。系统里塞了垃圾功能加上app里塞入垃圾功能,时间一长就卡

Profilbild von g
gvor 6 Monaten

自己蒸馏deepseek咋不提了?贼喊捉贼?

Profilbild von MY
MYvor 6 Monaten

高benchmark = 刷分?Dario也是头昏了。Claude的幻觉好好解决一下吧。就claude提取不了过长context这个问题,他在产品上做了多少了乱七八糟的功能了,适应成本极高。奉劝有功夫好好提升一下自己的基础模型,别老是一天天的阴谋论别人了

Profilbild von 币圈狗狗侠
币圈狗狗侠vor 6 Monaten

深度使用智谱ai和gemini深有感触,gemini对复杂的私人逻辑问题解决更加聪明

Profilbild von 𝒟𝒶𝓃𝓉ℯ 𝑨𝑰
𝒟𝒶𝓃𝓉ℯ 𝑨𝑰vor 6 Monaten

这个其实有个悖论,因为人类没办法定义什么叫做“理解”,什么叫做“学会”。人类自己对理解和学会的界定,也是依靠考试来对齐的。 我说一个理论,你说你理解了,但我不知道你的理解和我的理解是不是对齐的,我不知道你理解的是不是跟我理解的一样。 那怎么办呢?我就会问你几个问题。如果你回答跟我一致,那我觉得你跟我理解的就是一样的。 这就好比你看到的苹果是红色,我看到的苹果也是红色,但是你看到的那个红色和我看到的这个红色,真的是同一种颜色吗? 我们只是把类似这种颜色的定义叫做“红色”,但没办法确定你跟我看到的,到底是不是同一个红。

Profilbild von Frontier surfer gal 🌊 ✨
Frontier surfer gal 🌊 ✨vor 6 Monaten

还算中肯。现在qwen 3.5虽然已经非常好了,但用下来和opus,sonnet还是有一些细微差距。但个人觉得并不是什么不可逾越的鸿沟。 “认知限制”和“想象力天花板”才是很多中国企业的瓶颈。而美国公司强大模型和openclaw的公开面世其实也是一种可行性的验证。竞争会推动没有最好,只有更好。

Profilbild von 美利坚共产党委员会政法委书记 ❤️ Memecoin
美利坚共产党委员会政法委书记 ❤️ Memecoinvor 6 Monaten

Grok的使用体验明显好于豆包,但豆包写八股文是真方便。Seedance2.0,智者见智 仁者见仁吧,接下来就看ai的集成应用了

Profilbild von hume LU
hume LUvor 6 Monaten

以后顶级的 ai 肯定来自于有大量优质数据的公司,数据库公司,或者行业顶级头部公司。其他 ai 都会趋同甚至消失

Profilbild von Yo Max
Yo Maxvor 6 Monaten

哈哈哈哈 一个靠蒸馏的公司指责别人是蒸馏的模型 好的好的好的

Profilbild von 张彧
张彧vor 6 Monaten

那为什么大量的美国公司放着美国先进的模型不用,要用中国的模型呢?他们疯了么?!

Profilbild von Neo@Matrix
Neo@Matrixvor 6 Monaten

kimi 2.5就是垃圾中的战斗机

Profilbild von Click#10
Click#10vor 6 Monaten

全世界的ai工程师多少中国人?天天“中共中共”。 垃圾

Profilbild von fa
favor 6 Monaten

得了吧,也就是唬点啥也不懂的,中国公司的token生产量已经是美国公司的两倍了

Profilbild von Eric Miao
Eric Miaovor 6 Monaten

@suquan789 先把 claude 服务恢复再说吧。

Profilbild von Tsz wing Lai
Tsz wing Laivor 6 Monaten

Amodei說得狠但中肯。刷榜+蒸餾短期衝分易,長期難出真正「聰明」AI。 中國若只玩應試教育2.0,贏不了頂級認知賽道。創新才是王道,抄襲永遠追不上💪💪💪

Profilbild von Wabbit Wampage 無名小卒
Wabbit Wampage 無名小卒vor 6 Monaten

你這是個笑話吧 他的說法有甚麼根據? 你有確實使用過中國任何一個AI嗎?

Profilbild von Muzple Studio
Muzple Studiovor 6 Monaten

明显感觉到了Deepseek就很蠢,理解不了人类的真实意图,有时候字打错它就按照错字的意面理解,同比GPT明显智能很多,CN 山寨AI

Profilbild von keep
keepvor 6 Monaten

典型的中共AI😀

Profilbild von 轻骑踏月
轻骑踏月vor 6 Monaten

@grok 他的发言是否是因为中国的大模型的使用量远远超过他的模型而产生的焦虑?是不是有一点?

Profilbild von yuzhijian
yuzhijianvor 6 Monaten

墓碑之下 倒真是你这样的傻B僵尸🧟‍♂️

Profilbild von Xiao xiao Ping
Xiao xiao Pingvor 6 Monaten

确实在理,别看说,整天超越这超越那的。实际能力能超过GPT 4O就算不错了。都是稳定性极差的。执行的时候总是差点意思,总是执行不到位。

Profilbild von San | ⚡
San | ⚡vor 6 Monaten

可以看看我在2025/12/13的贴文, 华人要走出来,一定要避免复制,不然你只是另外一个三星而已

Profilbild von Mark Pan 𐤊
Mark Pan 𐤊vor 6 Monaten

这是个拉丁人吧,你还别说,这个世界的进步,灵感和奇思妙想都是来自拉丁人,日耳曼人去制造实现,我们东亚人一直负责打磨抛光

Profilbild von 诺亚今天吃什么
诺亚今天吃什么vor 6 Monaten

对啊,一点都不用担心,为什么要限制中国进口芯片,反正都是幻觉。

Profilbild von 王二胖
王二胖vor 6 Monaten

中国模型不解决实际问题,你老美有多少实际问题可以给模型去解决啊😂😂😂

Profilbild von xiaoqiang
xiaoqiangvor 6 Monaten

原始视频在哪里呀?

Profilbild von 无云夜空
无云夜空vor 6 Monaten

他对大模型的理解超越人类和大模型。

Profilbild von lifeissuck
lifeissuckvor 6 Monaten

这不是常识嘛,墙国有哪样东西不作假的

Profilbild von Miki Liu
Miki Liuvor 6 Monaten

做題家AI

Ähnliche Videos

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,696 Aufrufe • vor 2 Monaten