Загрузка видео...
Не удалось загрузить видео
最新:Meta CEO小扎今天接受采访的重磅观点: “12-18个月内,Meta 大部分代码将由AI独立完成,超过顶尖工程师。” “(meta的新模型)Behemoth,参数超两万亿。” “制裁限制下,中国团队(如 DeepSeek)不得不做大量优化,才能在模型上达到竞争对手相近的效果” AI 定会带来知识工作的新革命。。。 🧵
93,937 просмотров • 1 год назад •via X (Twitter)
Комментарии: 10

阅读前别忘粉赞转三连 采访要点总结: 用户规模与个性化 Meta AI 月活用户近十亿,正在搭建“个性化闭环”——结合社交图谱、个人偏好与实时互动,为每位用户提供高度定制化的 AI 体验。 Llama 4 系列模型布局 Scout & Maverick:中小规模、原生多模态、低延迟、高性价比,可在单机高效运行;已开源供社区使用。 Little Llama:8 0亿参数版,几个月内发布。 Behemoth:超两万亿参数的前沿大模型,需专门基础设施;规划蒸馏出更小、更易部署的版本。 开源与性能比拼 过去一年开源模型迭代迅猛,不再只有 Llama 一家。 Benchmark(如 Chatbot Arena)分数会受“调参”影响,因此 Meta 更以产品使用反馈与用户价值作为优化目标,而非盲跑公开基准。 推理与响应速度的权衡 专门的推理模型(o4、Gemini 等)在数学、编程等任务上更强,但会牺牲延迟。 对于消费者场景,半秒内给出“足够好”答案比耗时 30 秒的极限性能更实用。 未来人机交互愿景 全双工语音、智能眼镜、全天候对话:你可以在刷信息流、发消息,甚至走路时随时与 AI 沟通,获得上下文建议与即时帮助。 AI 自动化编码与超智能爆发 Meta 投入编码 agent 和研发 agent,目标是在 12–18 个月内让 AI 撰写大部分研发代码(不仅自动补全,还能跑测试、修复问题、优化质量)。 部分团队预测,一旦完成软件工程全流程自动化,就可能引发智能爆炸,几周内实现数年积累的里程碑。 蒸馏技术的重要性 从超大模型蒸馏出 10% 大小、却保留 90–95% 智能的小模型,大幅降低部署与算力成本。 不同开源模型可交叉蒸馏,取长补短,为多场景定制最佳小模型。 基础设施与国际竞争 持续扩建大型算力集群需耗费大量时间与能源,物流与监管都是瓶颈。 出口管制下,中国团队为绕过受限芯片做了大量底层优化,但在多模态上仍落后。 商业模式多元化 消费者端会保持“免费+广告”模式,同时推出高价值、按用量付费的高级服务(如大规模 agent 套件、企业编程助理等)。 社会与文化影响 AI 不会大规模裁人,反而可能创造新岗位(例如大规模客户支持、测试工程、内容策划等)。 未来文化娱乐表达将更丰富:从互动视频、虚拟陪伴,到全息社交与沉浸式体验,AI 将解锁“前所未有的创意与连接”。 全文如下:👇

(以下为经过去除多余语气助词与重复口语后的中文译文,保留所有原意,并按讲话顺序分段。) (00:47) 马克,谢谢你再次来参加播客。 ——很高兴来,见到你也很高兴。 ——上次你来时刚发布了 Llama 3,现在又推出了 Llama 4。 ——对,是第一个版本。有什么新变化?有什么让你兴奋的地方?这个领域变化太快了。 (01:05) 自上次谈话以来,我感觉变化巨大。Meta AI 月活用户已近十亿,这相当惊人。我觉得今年会很关键,尤其是一旦我们真正搭建好个性化闭环——既利用算法对你兴趣的理解(如信息流、个人资料、社交图谱等),也利用你和 AI 互动时的上下文——那将是下一件超级令人振奋的事,我对此十分重视。 (01:41) 模型本身也在持续取得令人印象深刻的进展。对于首批 Llama 4 系列,我很满意。我们公布了四款模型,目前已发布中小规模的 Scout 和 Maverick。最受欢迎的 Llama 3 是 80 亿参数模型,我们 Llama 4 系列也会跟进这款,内部代号“Little Llama”,预计几个月内推出。Scout 和 Maverick 在成本智能比上表现出色,原生支持多模态,非常高效,可在单机上运行,设计目标就是低延迟、高效率,满足内部多种场景需求。我们先把自用的版本开源,等大家一起用,我对此很期待。 (02:44) 更大型的 Behemoth 模型也在路上——它将是我们的前沿之作,参数超过两万亿。“巨兽”也不是随便取的名字,因为它确实非常庞大。为了后训练,我们为此搭建了大量基础设施。现在我们在思考:普通开发者如何使用这么巨量的模型?或许需要先将它蒸馏成可运行的小模型,因为显然没人会在消费端直接部署如此庞大的模型。就像去年 Llama 3 一样,初版发布后,我们陆续推出 3.1 的 4050 亿参数版,接着 3.2 引入多模态,我们今年也有类似路线图。所以事情很多,我也很想听听你的看法。 (03:45) 外界有种印象,封闭源模型与开源最优模型之间的差距在拉大。虽然 Llama 4 全家桶还未完全发布,但 Llama 4 Maverick 在 Chatbot Arena 排名第 35。有些主流基准显示 o4-mini 或 Gemini 2.5 Flash 超过了 Maverick。你怎么看? 我认为这一年对开源生态整体很有益。回顾去年,Llama 是为数不多的真正创新型开源模型。现在已有一大批优秀开源模型。总体来看,开源超越封闭源成为主流的预测,大概率正在成真。另一个有趣现象是:不仅仅是 Llama,其他团队也做出了很好的模型,这对整个行业都很利好。 还有你提到的推理模型趋势:如果你想要在数学、编程等任务上夺冠,专门的推理模型会投入更多推理时间和算力,以换取更高智能性,这是一种极具竞争力的范式。我们也在打造 Llama 4 推理模型,未来会发布。但对许多应用而言,延迟和性价比才是关键指标。如果是面向消费者产品,没人愿意等半分钟,能在半秒内给出“足够好”的答案,就是很合理的权衡。 (06:26) 我认为这两种方向都很重要,并且将来它们会互相融合。这正是谷歌的 Gemini 最新版本所走的路,我也觉得非常有前景。总之,行业会涌现多样化发展。 你提到 Chatbot Arena,这恰恰凸显了基准测试的挑战:怎样判定一个模型在哪些场景下更好?过去一年我们尝试让模型更多地围绕 Meta AI 产品的“北极星”场景优化。很多公开基准往往偏向极少数用例,而非普通用户在产品中实际做的事。过度追求基准分数,会让我们偏离最优产品方向。用户价值和真实的使用反馈,才是我们要紧盯的目标。有的基准还容易被“调参”干扰:Arena 上就能看到一些模型本来很强,但因为我们未特别调教,所以排名并不靠前。 (07:50) 因此我们更注重从产品层面衡量,而非单纯基准。至于能否有一个“客观比较不同模型、又能衡量用户北极星价值”的基准?目前我们内部的确是以 Meta AI 用户价值作为衡量标准,但这难以与他家模型做对等比较。好处是开源社区可以自由跑不同模型,指明优劣。 当下主流实验室都在打造“通用智能”或“超智能”,目标是让人人都能用上超人般的生产力工具,从而释放经济价值。但各家在优化目标上略有差异:Anthropic 更聚焦编码与 agent,OpenAI 则近期更注重推理。 (10:29) 如果要押宝一年后最常用的模型形态,我会说:快速响应、原生多模态、全天候自然交互。你试用了我们新发布的 Meta AI App,其中的全双工语音演示虽然尚未默认启用,但自然流畅度让人印象深刻。配合个性化记忆环路,未来你会在浏览信息流、聊天时、戴着眼镜环顾世界时,随时与 AI 对话、询问、请教。这才是我们心中的“北极星”体验。 (12:21) 你还问及各家实验室的不同优化策略,来从最严谨的一面“给对方最强论证”:很多团队相信,一旦完全实现软件工程自动化与 AI 研究自动化,就能引发智能爆炸,成千上万的“AI软件工程师”以极快速度复现各代模型间的进步。能否率先实现这一闭环,就可能第一步迈向超智能。 我个人觉得这思路很有吸引力——这也是我们大力投入编码 agent 的原因。我们并非要做传统的企业开发工具,而是想打造专注于推进 Llama 研究的编码 agent,完全集成在我们的研发流程中。我估计在未来 12–18 个月内,真正撰写大部分相关代码的,会是 AI,而不仅仅是自动补全;AI 将设定目标、运行测试、发现问题、编写高质量代码,可能超越优秀工程师。 (14:21) 然而这并非全部。AI 研发是一个浩瀚赛道,不会只有一家实验室独占鳌头。各领域会出现分工:企业级、编码型、生产力型、娱乐型等不同派别;在助手领域,也会有信息型与陪伴型之分。AI 的前景充满想象,但也有大量尚待发明的细分赛道。 (15:35) 有趣的是,你基本认可“智能爆炸+超智能必至”的前提。那为何还要做个人助手?为何不先冲超智能,再谈其他应用?我认为,物理基础设施建置需要时间:从集群到机房到网络到许可到能源上网,每个环节都耗时。解决一个瓶颈,就会出现下一个瓶颈。另外,人与系统需共同进化:人得学会使用,系统得了解人需求;若要 AI 能引用两年前的对话,显然需经过两年的共生积累。 因此,一个急速增长的智能与一个人机共学反馈飞轮,会与物理供应链、法规体系并行发展。举个内部案例:我们曾让 AI 自动生成广告实验假设,结果发现,即便是现有工程师最佳想法也超出我们实际测试能力,瓶颈在于算力与样本规模。只有当 AI 提供的假设质量超过最佳人类,且我们有足够资源测试,才能开始带来增量价值。 (20:47) 但第一步并不意味着“一旦 AI 能写代码,一切价值猛增”。真实世界的制约不少:算力、人员、测试资源都需跟上。五至十年后,或许 AI 假设真的超越人类,但就在此之前,这一连串环节都要同步推进。 (22:35) 为何看好 Meta?我们掌握了分发优势和庞大用户群;Meta AI App 还刚起步,但真正大头是 WhatsApp 中的 AI 功能,月活用户超百亿,尤其在美国之外极受欢迎。美国市场因 iMessage 主导,对我们有所低估。独立 App 的重要性在于——美国太关键,需要一个一流体验直接面向用户。 (23:45) 若未来 AI 更像“虚拟同事”而非单纯问答,那 WhatsApp 内的数据训练价值是否足够?我认为两者都需要:互联网初期你会有企业应用,也有社交应用;无需二选一。人们不会在 WhatsApp 写代码,但会通过 AI 执行很多代码层面的操作,这两条主线能并行。 (25:05) Meta 有庞大的内部编码与 AI 研发生态(如 MetaMate、各类 agent)。AI 定会带来知识工作与代码的新革命,也将成为下一代搜索与复杂信息处理方式,更会丰富我们的娱乐与文化表达。 回顾信息消费演变:10–20 年前大家主要看文字信息,后来手机配备相机后流行图片,再后来网络视频普及至今,人们在社交平台上看视频的时间占绝大多数。未来五年,呈现内容不会仅止于视频,而将变得可互动:视频可对话、可变更,甚至可如游戏般深度参与,一切都将由 AI 驱动。 (27:35) 目前已有 AI 治疗师、AI 朋友等陪伴场景,随着 AI 个性化与拟人化提升,这些关系会越来越紧密。关键在于如何确保健康的互动。最重要的是——在产品设计的每一步都认真思考这些问题。但过度前设“这不行”“那不行”也会扼杀价值。我的产品设计原则之一是:相信用户最了解自己所需。有时你以为某行为有害,但用户却觉得有价值,那么往往是你尚未找到理解其价值的框架。 (28:41) 例如,用户用 Meta AI 帮助准备与恋人、上司等的“艰难对话”,效果不错。随着个性化环路逐渐完善,AI 会越来越了解你,你也会更依赖它。 一个社交调研数据显示:美国人平均“真正的朋友”不足 3 个,却渴望有 15 个左右;人们普遍渴望更多社交连结。AI 陪伴并不取代线下人际,而是在用户无法获得足够现实人际时,提供补充,满足他们未被满足的交际需求。未来几年,随着 Avatar 和手势捕捉技术成熟,我们会拥有始终在线、用肢体语言与微表情与你交流的 AI 伙伴,这才是真正的“大规模社交互联”。 (31:59) 总体我对这项技术十分乐观,倾向于让用户自主选择如何使用。人是聪明的,知道对自己有价值的事。虽然也要关注极端沉迷的风险,但更多时候,让有价值的体验出现,才是技术设计的初衷。 (32:33) 眼镜式 AR 硬件也需以“先做人,就列功能”为设计原则:它首先要做得像一副好眼镜,然后在用户需要时无缝提供 AI 服务。这也是 Ray-Ban Meta 产品成功的秘诀:戴着很自然,需要时可听音乐、打电话、拍照,AI 能力则在边缘待命,不打扰日常。 (34:30) 数字世界如此重要,却只能通过实体屏幕访问,实在可惜。未来我们要实现物理与数字世界的全面融合:全息叠加、三维交互、多人共享场景,无论是看视频还是玩卡牌,都能以一种直观自然的方式完成。 (36:13) 关于国际竞争,若中国在电力与数据中心建造方面更具优势,那美国需优化建站流程与能源供应,否则后期会处于劣势。另一方面,制裁限制下,中国团队(如 DeepSeek)不得不用受限芯片做大量底层优化,才能在文本模型上达成与开放市场实验室相近的效果;但他们在多模态上仍落后,这也说明出于出口管制的缘故,他们不得不将精力浪费在这种“补芯片短板”上。 (40:41) Sam Altman 表示 OpenAI 将发布开源顶级推理模型,并不会设奇怪的用户量门槛。Llama 许可要求达到 7 亿用户需与 Meta 商谈、并需标注“built with Llama”,有些开源 purist 觉得不够“纯粹”。对此我并不抗拒:我们是开源 LLM 的先驱,为了确保大型云商用我们的模型时能与我们协同,我们才提出这些简单商谈条件。至今尚未出现真正因为许可门槛而放弃 Llama 的大公司。 (43:42) 如果未来开源生态百花齐放,许可若成阻碍,我们会再评估策略。不过目前,依然没有企业因此不选 Llama 的先例。 你还提问:若有其他模型更擅长某些场景,Meta 是否会直接用它们?答案是可以。我们并不想“束手束脚”,某条团队若觉得 Claude 在某个开发工具上更合适,就用 Claude;我们承认各模型在不同场景各有所长。关键在于:自行构建模型能让我们精准把控架构与参数,以满足我们对延迟、推理成本、语音体验等的具体需求。 (46:55) 如果以后市场上再不开源,我们也担心他人会“开源弃车”。回顾 Android:最初是开源,后来越来越闭源。这说明若我们不一直推动行业开源化,可能会被大厂重新封闭。所以,我们需要保持引领姿态。 (48:14) “为何要以 Llama 为标准,而非任意 LLM?”我认为模型本身承载了价值观与世界观——早期我们用 Llama 翻译法语,法国用户反馈“它听起来像学会说法语的美国人”,可见训练数据与模型架构深刻影响其“思想”。更高级的世界模型,乃至推理模型,也会在细微之处体现文化或政治倾向。因此,谁来定义开源标准、谁控制大模型生态,未来都将对全球科技话语权与安全有深远影响。 (51:04) 基于此,模型蒸馏(Distillation)变得尤为重要。你可以将超大模型蒸馏出 10% 大小、却保留 90–95% 智能的小模型,极大节省成本。更有趣的是,现在可从多模型融合蒸馏,取长补短:让 Llama 善用多模态能力,让另一款模型专注编码,然后再合成一个更优小模型。但蒸馏的安全性也需严防:语言模型中混入的价值观,需要谨慎对待;而针对可验证领域(如数学、代码)的蒸馏,则更易保证安全与纯净。 (55:14) 谈商业化模式,广告模式适合免费大规模分发;但对于需要高算力或高价值服务,就要收费或订阅,这与视频网站行业模式类似。部分用户愿为上千、甚至数万台 agent 花费高昂费用;因此从“免费+广告”到“付费高级版”将并存,覆盖不同需求。 (59:24) 如何管理众多项目?作为 CEO,我主要做两件事:一是招揽杰出人才,二是推动跨团队协作。比如让 Meta AI 团队与 WhatsApp、Instagram 团队对接,解决“AI 聊天界面风格应更像 WhatsApp 还是更像 AI App?”之类问题。此外,还要统筹基础设施、政治与金融决策,以及定义“何时产品达标可以发布”的品味与质量标准。AI 相比其他产品更偏研究与模型驱动:我们先要定义模型能力,再去衍生各类产品。 (1:02:58) 最后聊聊政治参与:我们向历届行政部门提供支持,关键在于与政府保持对话,推动必要政策,而非甩锅式对抗。谈及 AI 治理,我们会在内容审核与安全投入更多资源,积极建构更可靠、可扩展的治理体系,而非单纯依赖外部媒介或政府。 (1:07:46) 最具杠杆效应的工作?对我而言,招人永远是最高杠杆。每周都有不同焦点,但优秀团队才是成败关键。 (1:08:01) 若未来两年软件开发效率提升 100 倍?我想不仅仅是解决疾病与科学难题,还会出现丰富的文化娱乐创作,网络会变得更有趣、更奇特,帮助人们以幽默与创意深度表达自我。 (1:11:30) 历史看来,技术进步往往不是减少就业,而是创造更多岗位与新需求。例如,若 AI 可大幅降低客服成本,那么本可因成本太高而无法设立的全球客服中心反而会成立,带来更多工作机会。 (1:14:40) 感谢你的犀利拷问与畅聊。我对 AI 未来充满乐观——它将让世界更丰富、更有美感,也将驱动无尽的创新与文化繁荣。 (1:14:58) 至于最信赖的建议来源,我并不只依赖单一导师,而是汇集公司内外各方智囊,和志同道合的人一起在动态世界中创造、学习,这就是我生活的意义。 视频来自:Dwarkesh Patel

得了吧,llama 的丑闻还不够,还能吹呢

这个坏逼被另一个坏逼阿三采访?能干出好事儿来?

用AI取代人力的妄想,结果产品质量越来越差

快拉倒吧,AI替代不了人类编程。

llama 4都烂尾了,还2000b。

AI是真正的两国较量,欧洲还没摸到门道,日本自动放弃,韩国充其量是个硬件辅助商,印度屁都不是。

还在吹llama。。。

哇,这玩意儿真有点儿吓人!看来程序员们要准备好迎接“机器人同行”了,竞争真的会变得很有趣!
