Loading video...

Video Failed to Load

Go Home

看姚顺雨的访谈,Google的内部战略确实在全力以赴、迎头赶上了🤣 Google之前和Open AI一直卷chatbot,好在gemini 3的效果还不错,把市占率提了上来。 可是Anthropic的崛起让谢尔盖·布林意识到大模型决战在写代码的能力上🤣这要中途调整还是有点难度的。 之前Google的ceo在内部会议上就讲,我只希望我们公司内部用的写代码的模型是我们自己的。可见这个赶超的急迫感啊。

87,160 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

“我们内部已经有 Gemini 3 水平的模型,并且有信心很快发布,之后还会有更强的型号!” OpenAI 首席研究负责人 Mark Chen 在 Core Memory 的播客上透露。Sam 的职责之一就是“放大紧迫感”,他自己的角色也类似,会刻意强调竞争压力让整个组织保持高压前进,所以大家才会看到那封内部的“红色警戒”备忘录🚨 前两天和 OpenAI 的同学吃饭还提到他们内部确实都在体验 Gemini 3。因为但单看公开基准测试不足以判断真实差距,让足够多的研究员在真实任务中摸一摸,再形成集体判断。 Mark 说自己有一个“私藏的数学难题”(“42 问题”),专门用来测试不同模型的推理能力 —— 包括最新的“思考模型”。到目前为止,所有模型都只能接近最优解,还没有完全攻克它,这对他来说是一件“好事”:说明还有空间可以继续前进。 在 SWE‑bench 这类软件工程基准上,Google 模型的表现虽然不错,但在“用多少数据/算力达成一定效果”这件事上,还有明显的优化空间,而 OpenAI 在这方面的算法储备非常强,这是他们下一轮反击的一个核心筹码! 过去两年。OpenAI 其实把大量资源都投向推理模型,预训练和后训练的“肌肉”有所退化;最近半年,在组织层面重新把焦点拉回预训练。Mark 明确反对“Scaling 已死”的说法,他认为在预训练和数据塑形上还有巨大空间; 现在要做的是更精细的“数据塑形”和“合成数据”,通过更聪明的预训练策略,让模型从“模仿人类写作/代码”的模式,转向真正学会更高层次的抽象✨

indigo

72,121 views • 7 months ago

闭源大模型领域的“四大天王”正在进行一场全面战争!视频截取自上周在温哥华的线下分享“智变时代 II”,Groq 的 CEO 有一句话说得很好:OpenAI 和 Anthropic 之间的竞争,不是在存量市场里抢客户的“零和游戏”。它们是在创造一个全新的蓝海市场 —— 白领劳动力市场,对于它们来说,万亿市值只是起点👀 1. Anthropic (Claude):白领杀手 目前 Anthropic 凭借 Sonnet 4.5 暂时领跑。 他们最巧妙的创新是“Skills”功能。你可以把一项技能(比如“按我的风格写 PPT”)打包,上传,你的 AI 就学会了。你还可以把这个技能分享给别人。这就像《黑客帝国》里一样,插个芯片,“I know kung fu.”。 Anthropic 的目标非常明确:干死白领。他们的路线图是:先替代程序员,再替代白领,最后替代研究员。因为这些工作是纯数字化的,并且结果是“可验证”的,最容易被 AI 自动化。 2. Google (Gemini):护城河之王 如果非要选一个,我认为 Google 是这场战争中护城河最深的公司。模型的领先只是暂时的,分发才是护城河。 OpenAI 和 Anthropic 必须费力地去获取企业客户。而 Google,同时拥有个人(搜索引擎、Android)和 企业(Workspace、Google Cloud)两大用户群体。它只需要在 Gmail 和 Google Docs 里上线新的 Agent,一夜之间就能触达全球数十亿用户。 同时,Google 拥有自己的 TPU 芯片,它的 DeepMind 团队在科研上无人能敌。他们不只在做 LLM,还在做世界模型、做机器人,他们是真正想做 AGI 的公司! 3. xAI (Grok):物理与数字的野蛮生长 马斯克的 xAI 走的是“大力出奇迹”的路线。他正在建造一个拥有 30 万块 GPU 的超级 AI 工厂,就是为了训练 Grok 5。xAI 有两条清晰的战线: - 数字世界: 利用 X 的数据,Grok 走的“擦边”路线,限制最低、最幽默。他们正在开发 AI 伴侣和 AI 游戏—— 甚至挖走了《底特律:变人》的制作人; - 物理世界: Grok 的大脑将装进 Tesla 和 Optimus; 4. OpenAI:全线开战 最后是 OpenAI。它在干什么?它在“全面开打”。它既要和 Google 打,也要和 Anthropic 打,还要和 xAI 打。它也是这场泡沫中负债最多的公司。那张错综复杂的万亿融资图谱,基本都是 Sam Altman 一个人签下的。要倒,也是他先倒🤪

indigo

22,245 views • 8 months ago

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 views • 2 months ago

小扎吐槽苹果和 Google,以及谈为什么开源 AI **Mark Zuckerberg**: 我认为移动生态系统中普遍存在的一个问题是有两个把持入口的公司,Apple 和 Google,它们可以告诉你可以构建什么。 在我们的历史中有很多次,比如有经济层面的情况,就是我们构建了些东西,然后它们就会拿走我们大部分的收入,但还有一种是质量层面,这实际上让我更加不满,也就是有很多次我们推出或希望推出某些功能,然后Apple就会说,不,你不能推出这功能。 这真的很糟糕。 问题是,这样的世界是否会在AI领域复现,就像你会有一小部分拥有封闭模型的公司,它们控制API,因此将能够告诉你可以构建什么。 我可以说,对我们来说,自己构建一个模型以避免处于那种位置是值得的。 我不希望那些其他公司告诉我们可以构建什么,而且我认为从开源的角度来看,很多开发人员也不希望那些公司告诉他们可以构建什么。这就是我坚定支持开源的原因之一,我认为未来AI的集中化可能像其广泛传播一样具有潜在危险。 我发现很多人都在思考,如果我们能实现这种技术,那么让它广泛传播是否不利。 我认为另一种可能也很糟糕的情况是,如果一个机构掌握了一种强大的AI远超其他所有人的,这同样是非常糟糕的。在我看来,一个理想的世界应该是这样的:AI技术被广泛而均衡地应用,随着时间推移逐步增强其健康性。在这样的世界里,各种系统能够相互制衡,这种平衡的状态比一个高度集中化的世界要健康得多。 虽然风险无处不在,但我觉得有一个风险我想人们我并没有听到太多人提及。 **Dwarkesh Patel**:举例来说,一个价值100亿美元的模型,如果经过评估是完全安全的,你们会选择开源吗? **Mark Zuckerberg**:我的答案是,只要这个模型对我们有所帮助,那我们就会开源。 **Dwarkesh Patel**: 那如果这个模型是用100亿美元的研发经费研发出来的,然后现在要开源呢? **Mark Zuckerberg**: 我们一直以来都有开源软件的传统,但是我们并不会开源我们的产品。 比如说,我们并不会将Instagram的代码开源,但我们会开源许多底层的基础设施。我们历史上最大的一个项目可能就是开放计算项目。在这个项目中,我们将我们所有的服务器的设计网络交换机和数据中心的设计开源了,这对我们来说非常有帮助。 因为很多人可以设计服务器,但现在,大家普遍都采用了我们的设计,这就意味着整个供应链都围绕我们的设计展开,规 模变大,对所有人来说都变得更便宜,为我们节省了数十亿美元。 这真是太棒了,对吧? 因此,我认为开源有多种方式可以对我们有所帮助。 一种就是,如果有人能够找出更便宜的运行模型的方法,我们将花费数十亿甚至上千亿美元,在所有这些模型上,所以如果我们能做的更有效率,那我们就可以节省数十亿甚至上百亿美元,这可能本身就非常有价值。 **Dwarkesh Patel**: 关于开源,我很想知道你是否认为像PyTorch、React、Open Compute这样的开源项目,对世界的影响是否已经超过了Meta在社交媒体方面的作用。 **Mark Zuckerberg**: 因为我曾经和使用这些服务的人交谈过,他们觉得这是有可能的,因为互联网的很大一部分都在运行这些项目。这是一个有趣的问题,我认为几乎有一半的世界人口都在使用我们的产品,这是一个真实的点,所以我觉得这很难超越。 但不管怎样,我还是认为开源是一种新的、非常強大的建设方式。 来源:

宝玉

74,721 views • 2 years ago

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 views • 10 months ago

🔴 2025年4月30日 川普总统内阁会议中涉及中共国的内容: 到现在为止,关税还没有真正开始生效。我知道,也不愿看到,但现在中国的情况确实很糟。我刚看到一些新出的报告,说他们的经济正在遭受重创。我并不希望这种事情发生在中国,我其实挺喜欢习近平主席的。听到这个消息我确实感到难过,但事实是:中国正在被打得很惨。 你看,他们派出了世界上最大的货轮,装满了前所未见的大宗商品。这些是全球最大的货轮。他们正往这边开来——结果在太平洋上直接调头返航了!他们在海上来了个大掉头,直接返航了——因为没人要这些货了,因为145%的关税! 当然,我还是希望某个时间点我们能跟中国达成协议。我们现在正在与他们对话。但中国的工厂正在全国范围内关闭,因为我们不再接收他们的产品。我们不想要他们的货,除非他们愿意公平地对待我们。这包括知识产权等问题,远远不仅仅是买卖这么简单。 所以我们走着瞧。有人问我:“你看到这个情况,是不是很开心?”我说:“不,我一点都不开心。我希望中国好,也希望所有国家都好。”但他们也必须公平对待我们! “总统先生,您什么时候会与中国的习近平主席通话?” 什么时候?这事会发生的。现在嘛——我之前也说过——他们遇到了大麻烦,因为他们的工厂生意不好做了。他们在拜登任上赚了一万亿美元!一万亿美元!靠向我们卖货发的财。而其中很多东西我们根本不需要! 你知道,有人还说:“哎呀,货架会空掉。”那好吧,也许小孩原本能有30个玩偶,现在只买两个,也没什么嘛!可能这两个玩偶贵上几块钱,也不是不能接受。但我们说的可不是非买不可的必需品。他们那边有船装得满满的,全是货——虽然不是全部,但很大一部分我们根本用不上! 我们必须达成一份公平的协议!我们被全世界的国家占了便宜!但我认为,中共国是最主要的、最有可能成为全球头号掠夺者的国家(the chief ripper offer)。

糯米团 ⬜️

21,091 views • 1 year ago