Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

卧槽!DeepMind掌门人公然炮轰DeepSeek,怒斥其宣称的超低训练成本完全是虚假宣传! 昨晚,DeepMind CEO在访谈中直接向近期爆火的中国AI团队DeepSeek开炮。虽然他承认这是目前中国跑出来的最强团队,但他毫不留情地直言,对方大肆宣传的超低成本数据存在严重夸大,甚至带有极强的误导性! 他当场扒开了所谓低成本的底裤。他尖锐地指出,DeepSeek对外公布的开销仅仅只是最后一次正式训练的费用,完全隐瞒了前期海量试错、探索和底层测试阶段砸进去的天价真金白银,这笔账算得极不老实。 更狠的是,他直接爆料DeepSeek在研发过程中严重依赖了西方现有的先进模型进行蒸馏和微调,而这些借力的隐形成本根本没有被计算在内。 他强硬地表示,这支团队根本没有发明任何一击致命的革命性新技术,仅仅只是把业内现成的技术栈拼凑应用得比较出色而已,压根算不上打破效率曲线的奇迹。 这位AI巨头最后更是直接贴脸开大:如果真要严格对比投入产出比,自家的Gemini模型在效率上其实完全碾压DeepSeek,只是他们作为老牌巨头平时低调,不屑于拿这些数据出来到处吹嘘罢了!

336,354 Aufrufe • vor 5 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

Uber 在一个季度内,把全年的 AI 预算烧光了。但这钱没白花,换来了反常识的结果。CEO Dara 发现,自家的工程师用上 AI 后效率暴增,产出简直像"超人"一样。于是 Uber 做了一个极其现实的决定:既然现有人手这么能干,那就不招新人了。他们开始严格控制增员节奏,用高昂的算力成本,直接锁死了未来的人力扩张。而且这场改造根本不局限于写代码。从工程开发、找 bug、平台迁移,一直到法务和营销团队,AI 已经钻进了 Uber 的每一根毛细血管。Dara 给团队下了死命令:自下而上,用 AI 把系统和流程彻底重构一遍。就算第一步只是让 AI 提升个两三成的效率,那也是赚的。最聪明的还是他们在成本上的算计。搞探索和研发时,闭着眼睛用最贵的 OpenAI 和 Claude,因为前沿模型确实聪明,适合试错。但只要某个场景跑通了、要大规模铺开,他们会立刻切回按 token 算更便宜的模型,或者是开源模型。为什么这么抠细节?因为 Uber 一年哪怕跑出远超 100 亿次的行程,手握 100 多亿自由现金流,本质上依然是个低毛利的苦生意。他们只能靠榨干内部的每一滴效率,来换取终端降价的空间。这就是现在顶尖科技公司的真实玩法。没有空喊口号,算力直接替代人力,用最贵的工具探路,用最省的方案落地。一场冷酷又高效的生产力洗牌,已经在看不见的地方完成了。

墓碑科技

53,243 Aufrufe • vor 3 Monaten

Dario没有理由因为Kimi蒸馏Claude而生气。Anthropic自己刚刚才同意为盗版书籍训练模型一事,向相关作者支付总计15亿美元赔偿。平均下来,每一本被侵权的书大约赔偿3000美元。更有意思的是,Dario自己也承认,在百度工作的一年让他意识到,数据隐私并没有那么重要。当时他主要从事语音识别研究,而很多训练数据都是未经授权直接拿的。这段经历进一步强化了他对Scaling Law的信念。因此,自己干Anthropic之后,他们同样尽可能收集各种数据用于训练模型。 我认为,他真正气的并不是知识产权,而是这从根本上破坏了前沿AI实验室的商业模式。历史上,每一代最先进大模型的训练成本通常都会比上一代增长约4到10倍,甚至更多。例如,GPT-2的训练计算成本约为10万美元,而GPT-3已经达到约1000万美元,GPT-4的计算成本则约为1亿美元。这些数字还仅仅是算力成本,并没有包括研究人员薪酬、数据获取以及其他研发支出。因此,即使没有开源模型竞争,仅靠API收费模式,要获得正向投资回报也变得越来越困难,因为模型性能提升正在放缓,而训练成本却持续飙升。 如今,开源模型通过蒸馏技术,大约只需要6个月就能追赶到最先进闭源模型的水平。这意味着OpenAI、Anthropic等前沿实验室,实际上只有约半年的时间,依靠最新模型尽可能创造收入。半年之后,就会出现性能达到其90%,但成本只有10%的开源替代方案。 越来越多的美国企业也已经意识到,最顶尖模型带来的那一点性能优势,并不足以支撑其高昂的价格,因此开始转向成本更低的中国开源模型。就连Sam Altman的铁哥们儿Brian Chesky,公开说在Airbnb的部分AI开发中也采用了阿里的千问,而不是ChatGPT。

GeLun Ding

63,388 Aufrufe • vor 1 Monat

《现在全世界最抢眼的新闻就是:中国144小时过境免签旅游,甚至China Travel的话题已经超过10亿搜索量》 随着中国对外国人144小时过境签政策的实施,越来越多的外国人来到中国旅游。这些外国人随手在网上发布的记录中国正面形象的视频,现在打开外网比比皆是,他们宣传的最多的两个方面,一个是安全,一个是美食,其他比如基建,城市规划等等也很多,但是安全和美食是描述最多的,因为外国最缺的就是这两样,尤其是安全问题,已经成了西方国家的通病。 外国人来了中国,发现他们看到的中国,也就是实际上的中国和西方媒体描述得完全不一样,甚是感慨,于是从下飞机进入机场的那一刻起,他们当中的很多人就已经开始记录了。 于是,中国的正面形象(日常形象)呼啦啦在外网铺开了。 如此通过外国人的视频,没完没了地宣传中国的正面消息,西方国家肯定是不舒服的,所以,才会有美国要禁tiktok一说(当然美国要禁tiktok也有其他方面的原因),甚至想强买强卖,到手之后再按照他们之前惯用的伎俩强加到tiktok上,于是tiktok还会成为西方抹黑中国的枪杆子。 但是,在tiktok还没被抢走之前,这里依旧是宣传中国正面形象的工具,而且是外国人自己做的宣传大使,这一点尤其让西方恼火,因为如果再这样发展下去的话,说明他们这之前几十年上百年的洗脑,几乎是白洗了,全废了。 从西方的角度想,这该如何应对呢? 既然你们宣传top1是中国安全,那么就从中国安全问题入手呗~我不让你安全就是了。 所以接下来的问题是如何在我们原有的安全的基础上,不给恶人以可乘之机,但是说实话,这个问题比较严峻,操作起来有一定的难度。 拉拢一些人冒着坐牢的风险故意袭击外国人,是一种策略,但也不是长久之计,只能先买通个把亡命徒,抓住他们的短处,让他们先制造一拨儿混乱,然后疯狂造势,搞媒体轰炸,也不失为一记良策。 #China

零敲牛皮糖537.7

214,608 Aufrufe • vor 2 Jahren

OpenAI 创始人 John Schulman 访谈节选:为什么 GPT-4 比一年前更“聪明”了?主要都是后训练(Post-Training)带来的! 另外他认为,在强化学习研究领域,研究人员需要具备丰富的经验和敏锐的直觉。了解整个技术堆栈,并对各个部分充满好奇心是关键。此外,从第一性原理出发思考问题,而不仅仅依靠实验证据,也能够帮助研究人员在数据操控和环境设置方面做出更好的决策。 *** Dwarkesh Patel:在未来,用于训练的计算力中,预训练与后训练的比例是否会明显偏向后训练呢? John Schulman:确实,有一些观点支持这种说法。 Dwarkesh Patel:我是说,现在这个比例非常不平衡。 John Schulman:但你可以认为,模型生成的输出质量比网上的大多数内容都要高。因此,让模型自己思考似乎更有道理,而不仅仅是训练来模仿网络上的内容。所以,我认为从第一性原理上来说,这是有说服力的。我会说,我们通过后训练取得了很多进步。因此,我不确定。所以,我希望我们会继续推动这种方法,并且可能会增加投入到后训练中的计算力。 Dwarkesh Patel:当前的 GPT-4 的 ELO 分数比最初发布的版本高出了大约 100 分。这是否全都是后训练带来的改进呢? John Schulman:对,我会说大部分都是后训练带来的。 Dwarkesh Patel:这很有意思。 John Schulman:因此,有很多不同的改进方向。我们会考虑数据质量,数据数量,进行更多的部署和收集新数据的迭代,改变你收集的注解种类。因此,有很多因素叠加在一起。但是全部加在一起,就会带来一个相当不错的,有效的计算力提升。 Dwarkesh Patel:后训练的优化程度对于竞争优势有多大影响呢? John Schulman:目前,我会区别公司是通过我们的模型有多大等等。那么,找出你之前提到的所有这些数据的复杂问题的公司,会占据大优势吗? John Schulman:我认为这确实是一个优势,因为这是一个非常复杂的任务。因此,你必须有很多有技能的人来执行它。因此,存在大量的隐性知识。同时也需要大量的组织知识。我认为后训练的过程,创建一个具备人们所关心的所有功能的模型,是十分复杂的。这需要付出大量的努力,它是大量研发工作的积累。我会说这种情况在某种程度上形成了一种壁垒,要想立即启动这种模型并非易事。 Dwarkesh Patel:看起来那些正在进行最严肃的预训练努力的公司,也在进行严肃的后训练努力。因此,看起来这种模型有可能被复制或有更多的类似努力出现。 John Schulman:另外,还有一种情况使得这个壁垒并非那么明显,那就是你可以提取模型,或者复制别人的模型输出,或者使用别人的模型进行比较。我认为大公司可能并不会这样做,因为这违反了服务条款,也会损害他们的自尊心,但我预计一些规模较小的参与者可能正在这样做以便更好地起步。 Dwarkesh Patel:那些真正擅长进行这种强化学习(RL)研究的人有什么样的特质呢?我听说这种研究非常具有挑战性,但是什么样的直觉能帮助你找到操控数据和设置环境的方法呢? John Schulman:我觉得有相当多的经验是关键。自从研究生时期以来,我一直在研究 RL 算法,涉及到数据收集、到注释过程,再到与语言模型的交互。所以,我算是涉猎了这些领域。我认为,在这类研究中表现出色的人通常对整个技术堆栈有全面的了解,并且对其中的各个部分充满好奇心。他们不仅依靠实验证据来更新自己的观点,还会从第一性原理出发思考问题。比如,假设深度学习是有效的,那么理想的收集数据的类型应该是什么,等等。

宝玉

57,189 Aufrufe • vor 2 Jahren

印度正在干一件大事。 一件很安静,但可能影响深远的事。 他们在从零开始,构建一个梵语大语言模型。 梵语,是世界上最古老的结构化语言。 这个项目,不是简单的翻译工具。 更不是把古籍扫描数字化就完事了。 他们要让AI真正“学会”梵语,用梵语的逻辑去思考。 牵头的是一家有118年历史的梵语学院,和印度顶尖的理工学院IIT马德拉斯分校。 学者和数据科学家坐到了一起。 第一步,也是最难的一步,建立语料库。 他们收集了超过11万份梵文文本。 包括经文、孤本、还有数千份手稿。 为了处理这些古老的手稿,团队自己开发了专有软件。 结果惊人。 24小时内数字化了超过1000本梵语书籍。 每页只有三到四个错误,准确率接近97%。 梵语的语法结构极其复杂和精确。 比如“Sandhi”这种连音变化规则,还有复杂的词形变化,对AI的挑战远超英语。 解决这些难题,需要全新的算法和模型。 这暴露了一个关键问题。 当下的AI模型,本质上是基于英语世界的逻辑和数据结构建立的。 而印度这个项目,试图用一种完全不同的文明底层逻辑来训练AI。 这不仅仅是技术问题。 这关乎一个文明的记忆,能否在机器时代被完整保留,甚至被激活。 当全球科技巨头都在追求更大规模的模型、更快的算力时,印度选择了一条不同的路。 深度优先,而非规模。 结构优先,而非噪音。 意义优先,而非模仿。 这引出了一个更深层的问题。 AI的未来,是否也依赖于人类最古老的智慧? 如果这个实验成功,梵语将不再仅仅是被“保存”的遗产。 它将成为一种可计算的,具备严谨逻辑推理能力的工具。 这是一个国家在尝试用自己的文化之根,去定义自己的科技未来。 而不是被动地接受硅谷制定的标准和游戏规则。 这种对自己文明的自信和投入,值得深思。 当一个国家开始系统性地将自己的古典智慧与最前沿的科技结合,它的目标可能远不止是开发一个AI模型那么简单。

墓碑科技

22,272 Aufrufe • vor 7 Monaten

当总统,到底亏了多少钱? 川普算了一笔账。 他说,损失了20亿到50亿美元。 但他说,无所谓。 “如果你有钱,这就不重要了。” 他反复强调,这么做是为了国家,为了人民。 这是一个很有意思的视角。 富人从政,到底是为了什么? 华盛顿,美国国父,也是当时最富有的人之一。 据说他有两张办公桌。 一张处理总统公务,一张处理自己的生意。 奥巴马卸任后,和Netflix签下天价合约。 这笔交易是什么时候开始谈的? 这些问题,媒体似乎很少深入追问。 川普的逻辑是,他的品牌价值因为政治立场而分裂。 原本100%的市场,现在只剩下一半。 另一半因为政治而厌恶你。 这就是他为竞选付出的商业代价。 这笔账,主流媒体和他的反对者们算过吗? 他们似乎只关心他有没有利用总统职位为自己牟利。 却从不计算他为了这个职位可能付出的机会成本。 这种计算方式公平吗? 一个成功的商人,放弃了更容易的赚钱机会,投身于一场无休止的政治斗争。 背后的动机,仅仅用“权力”或“自恋”来解释,是否过于简单化了? 他提到集会场场爆满。 这是民意最直接的体现。 他提到重建的军队和强劲的经济数据。 这是执政最实在的成绩单。 他提到和朝鲜的斡旋,避免了一场潜在的战争。 奥巴马政府时期,电话都打不通。 这些事实,为什么在一些叙事中被选择性忽略? 损失50亿和获得权力,哪个更重要? 对一个已经拥有了一切的亿万富翁来说,这个问题的答案可能和普通人想的完全不一样。

墓碑科技

46,936 Aufrufe • vor 7 Monaten