Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

昨晚看了极客公园「今夜科技谈」的直播,张鹏对谈黄碧薇教授 Biwei Huang,聊的是因果大模型 本来只想随便听听,结果完整看完了,有几个点想分享 黄教授的经历挺特别,因果发现(Causal Discovery)是个小众但很深的领域,1989 年由 CMU 的 Clark Glymour 和 Peter Spirtes 开创,这两位是她的博士导师;后来推动第二代方法的 Kun Zhang、Bernhard Schölkopf,也是她的导师 今年她从学校出来创办了 Aether AI( 这期直播最值得记住的,是她那张"四代范式"2×2(模型大小 × 学相关还是学因果): ① 90 年代:相关性 × 小模型 ② 2010 年代:因果 × 小模型 ③ 现在:相关性 × 大模型 = LLM ④ 下一站:因果 × 大模型 她的解释也很直觉:语言和代码的信息比较浅、数据离散,堆相关性就能做得很好;但物理世界变量太多,VLA 的 demo 再漂亮,桌面高两厘米可能任务就做不了。 机器人需要的不只是预测下一帧,而是理解"为什么"...

43,708 görüntüleme • 1 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 görüntüleme • 10 ay önce

OpenAI 的大神 Andrej Karpathy 前几天在他的 YouTube 频道讲了一堂课,系统的介绍了大语言模型,内容深入浅出,非常赞,抽空将它翻译成了双语,由于内容较长,我将分批上传,以下是第一部分精校后的双语视频,字幕文稿如下: Intro: Large Language Model (LLM) talk 大家好。最近,我进行了一场关于大语言模型的 30 分钟入门讲座。遗憾的是,这次讲座没有被录制下来,但许多人在讲座后找到我,他们告诉我非常喜欢那次讲座。因此,我决定重新录制并上传到 YouTube,那么,让我们开始吧,为大家带来“忙碌人士的大语言模型入门”系列,主讲人 Scott。好的,那我们开始吧。 LLM Inference 首先,什么是大语言模型 (Large Language Model) 呢?其实,一个大语言模型就是由两个文件组成的。在这个假设的目录中会有两个文件。 以 Llama 2 70B 模型为例,这是一个由 Meta AI 发布的大语言模型。这是 Llama 系列语言模型的第二代,也是该系列中参数最多的模型,达到了 700 亿。LAMA2 系列包括了多个不同规模的模型,70 亿,130 亿,340 亿,700 亿是最大的一个。 现在很多人喜欢这个模型,因为它可能是目前公开权重最强大的模型。Meta 发布了这款模型的权重、架构和相关论文,所以任何人都可以很轻松地使用这个模型。这与其他一些你可能熟悉的语言模型不同,例如,如果你正在使用 ChatGPT 或类似的东西,其架构并未公开,是 OpenAI 的产权,你只能通过网页界面使用,但你实际上没有访问那个模型的权限。 在这种情况下,Llama 2 70B 模型实际上就是你电脑上的两个文件:一个是存储参数的文件,另一个是运行这些参数的代码。这些参数是神经网络(即语言模型)的权重或参数。我们稍后会详细解释。因为这是一个拥有 700 亿参数的模型,每个参数占用两个字节,因此参数文件的大小为 140 GB,之所以是两个字节,是因为这是 float 16 类型的数据。 除了这些参数,还有一大堆神经网络的参数。你还需要一些能运行神经网络的代码,这些代码被包含在我们所说的运行文件中。这个运行文件可以是 C 语言或 Python,或任何其他编程语言编写的。它可以用任何语言编写,但 C 语言是一种非常简单的语言,只是举个例子。只需大约 500 行 C 语言代码,无需任何其他依赖,就能构建起神经网络架构,并且主要依靠一些参数来运行模型。所以只需要这两个文件。 你只需带上这两个文件和你的 MacBook,就拥有了一个完整的工具包。你不需要连接互联网或其他任何设备。你可以拿着这两个文件,编译你的 C 语言代码。你将得到一个可针对参数运行并与语言模型交互的二进制文件。 比如,你可以让它写一首关于 Scale AI 公司的诗,语言模型就会开始生成文本。在这种情况下,它会按照指示为你创作一首关于 Scale AI 的诗。之所以选用 Scale AI 作为例子,你会在整个演讲中看到,是因为我最初在 Scale AI 举办的活动上介绍过这个话题,所以演讲中会多次提到它,以便内容更具体。这就是我们如何运行模型的方式。只需要两个文件和一台 MacBook。 我在这里稍微有点作弊,因为这并不是在运行一个有 700 亿参数的模型,而是在运行一个有 70 亿参数的模型。一个有 700 亿参数的模型运行速度大约会慢 10 倍。但我想给你们展示一下文本生成的过程,让你们了解它是什么样子。所以运行模型并不需要很多东西。这是一个非常小的程序包,但是当我们需要获取那些参数时,计算的复杂性就真正显现出来了。 那么,这些参数从何而来,我们如何获得它们?因为无论 run.c 文件中的内容是什么,神经网络的架构和前向传播都是算法上明确且公开的。

宝玉

1,122,890 görüntüleme • 2 yıl önce

图灵奖获得者、 AI 三大教父之一的 LeCun在达沃斯的发言,算是把整个硅谷的遮羞布扯了。 他说现在整个行业都被LLM彻底洗脑了,所有人都在同一条赛道上互相挖人,谁敢偏离主流谁就被骂落后。 这也是他离开Meta的真正原因,连Meta都已经LLM-pilled,他不想再跟风了。 最扎心的一句话是:纯生成式架构,不管是LLM、VLM还是VLA,永远造不出哪怕猫级的智能体。 因为它们本质上只是下一个token预测机,只能在文字和像素的空间里做统计关联,从来没有真正理解过这个世界的因果。 它们不会预测行动的后果,不会真正的规划,更没有常识。 当然,我不是说LLM没用,短期来看,scaling LLM+微调+工具调用,已经能吃掉80%的白领工作,硅谷所有人往这里冲,也算是完全理性,毕竟钱和机会就在这里。 但长期来看,这是一条有天花板的路。因为你永远不可能在文字地图上,开出一辆真正的车。 机器人、具身智能、长期自主代理、真正的科学发现,这些坎,纯LLM永远跨不过去。 LeCun说,真正的智能必须有世界模型。就是说给定当前的状态和你要做的动作,你要能准确预测下一秒世界会变成什么样。不是简单的像素级的生成,还需要对物理规律和因果关系的抽象建模。 最近Figure、特斯拉、谷歌的机器人项目,其实都在偷偷补这一课,只是没人愿意公开说,LLM不是万能地基。 我理解未来真正的智能,一定是混合栈,LLM负责语言交互和符号推理,世界模型负责因果预测和长期规划,执行层负责把计划变成动作。 LeCun从来没说过要抛弃LLM,他只是反对把LLM当成一切的答案。 硅谷现在最可怕的问题不是卷,是所有人都在同一条赛道上卷得太狠,以至于忘了终点其实根本不在这条赛道上。 世界模型这道坎,迟早要跨。 而谁先跨过去,谁就是下一个时代的赢家。 #YannLeCun #世界模型 #AGI #大模型 #具身智能

AYi

337,460 görüntüleme • 3 ay önce

下一个诺贝尔奖,可能非他莫属。 还记得谷歌Deepmind团队,靠AI也就是Alpha fold拿了诺贝尔奖吗?就在刚刚,他们又扔出了一枚“核弹”——AlphaGenome新的 AI 模型。 这次,他们直接把人类基因组这本“天书”给读懂了。 我刚看完 DeepMind 团队最新的访谈,信息量大到爆炸。 这次,他们不仅比人类医生更早预测癌症,更主要的是,他们开始触碰生命的底层代码。 如果你关心 AI,关心人类寿命,关心未来医疗,这几点你必须知道。 第一:AI 终于攻破了 98% 的“暗物质”。 访谈一开场,DeepMind 就指出了一个事实。 我们人类的基因组里,真正负责编码蛋白质的,只有 2%。剩下的 98%,在过去很长一段时间里,都被认为是“垃圾 DNA”。 但 Alpha Genome 告诉我们:这 98%,根本不是垃圾,而是进化的源代码。 Alpha Genome 厉害在哪呢? 它可以预测,在这 98% 的非编码区里,哪怕只有一个字母、一个基因突变,会给生命体带来什么后果。 这意味着,我们终于能看懂剩下的 98% 的基因天书。 第二:打破技术的“不可能三角”。 这点真的非常反直觉。 以前搞生物 AI,有个死规矩: 如果你想看的广,就看不清细节; 你想看清细节,视野就会变得很窄。 就好比我们看地图: 你要么看清整个城市的轮廓,但是看不清街道; 要么你放大看清街道,但是不知道是城市的哪个角落。 而 Alpha Genome 的神奇之处在于,它能够一口气读完长达几百万字的基因天书,同时还能拿着放大镜,看清里面每一个单碱基的错误。 DeepMind 团队在访谈里透露,为了做到这一点,他们采用了一种极其变态的数据压缩技术,真正把生命代码给看透了。 第三:它比医生更早发现癌症。 大家知道,在癌症病人的基因里,通常有两种突变。 一种是“司机突变”,叫 driver。 它是导致癌症的元凶,就像是劫持了一辆车的疯狂司机。 另一种叫“乘客突变”,passenger。 它其实对身体没什么大的影响。 那以前怎么区分这两者呢? 主要就是靠医生,在实验室里一个一个做实验。 但在这次访谈中,DeepMind 团队做出了一个极其大胆的实验。 他们没有专门去教模型什么是癌症,也没有给模型去喂各种癌症的数据库,而是直接把一堆混杂着司机和乘客的突变序列,扔给了 Alpha Genome。 然后问它: 你觉得,哪些突变会破坏生物功能? 实验结果太震撼了。 模型给出的预测排名中,最靠前的那些突变,精准地对应了现实中已知的癌症凶手。 这就意味着,Alpha Genome 并不是像过去那样,通过检索已知的癌症点位,而是像一个资深的侦探,通过分析基因序列的上下文,通过逻辑推理出了谁是坏人。 视频里,研究人员非常自豪地说: 把模型的预测结果,和生物学家在实验室里花了几年时间做出来的结果放在一起,结果惊人地一致。 这意味着,未来的医生不再需要拿着小白鼠一个个试错。 AI 扫一眼基因代码,就能揪出那个藏在几百万个基因字母里面的元凶。 最良心的是:它开源了。 DeepMind 这次没有把技术锁在护城河里,他们已经发布了开源模型权重和 API 接口。 最后我想说: 我们正处于一个科技大爆发的历史性转折点。 就像Elon Musk说的——我们正活在起点当中。 如果说 AlphaFold是让我们看清了生命的砖块, 那 AlphaGenome,就是在教我们阅读生命的蓝图。 AI 不仅在生成视频、写代码、写文章。 它正在以我们无法想象的速度,从底层去理解生命。 我现在 95% 的工作,都是指挥 AI 来完成。 我深深感到,现在最可怕的不是 AI 会不会取代你的工作。 而是,当 AI 这样的划时代科技出现时,一个人却因为傲慢、恐惧,甚至是懒惰,拒绝学习和使用它。

另一面

57,887 görüntüleme • 4 ay önce

Google的教学视频《Introduction to Large Language Models | 大语言模型介绍》(中英双语字幕) 这个视频介绍了大型语言模型(Large Language Models,LLMs)的概念、使用场景、提示调整以及Google的Gen AI开发工具。 大型语言模型是深度学习的一个子集,可以预训练并进行特定目的的微调。这些模型经过训练,可以解决诸如文本分类、问题回答、文档摘要、跨行业的文本生成等常见语言问题。然后,可以利用相对较小的领域数据集对这些模型进行定制,以解决零售、金融、娱乐等不同领域的特定问题。 大型语言模型的三个主要特征是:大型、通用性和预训练微调。"大型"既指训练数据集的巨大规模,也指参数的数量。"通用性"意味着这些模型足够解决常见问题。"预训练和微调"是指用大型数据集对大型语言模型进行一般性的预训练,然后用较小的数据集对其进行特定目的的微调。 使用大型语言模型的好处包括:一种模型可用于不同的任务;微调大型语言模型需要的领域训练数据较少;随着数据和参数的增加,大型语言模型的性能也在持续增长。 此外,视频还解释了传统编程、神经网络和生成模型的不同,以及预训练模型的LLM开发与传统的ML开发的区别。 在自然语言处理中,提示设计和提示工程是两个密切相关的概念,这两者都涉及创建清晰、简洁、富有信息的提示。视频中还提到了三种类型的大型语言模型:通用语言模型、指令调整模型和对话调整模型。每种模型都需要以不同的方式进行提示。 原始视频链接:

宝玉

114,646 görüntüleme • 3 yıl önce

白宫加密政策主管David Sacks: 四年内AI 大模型能力将增长一百万倍 ! “我认为目前至少在三个关键维度上,进步的速度都是指数级的。” “首先是算法本身。模型每年提升的速度大概是 3-4 倍。” “它们不仅仅是在速度和性能上更快更好,而且将从量变到质变。” “接着是推理模型。” “我们甚至还没有真正进入智能代理时代,但这将是继推理模型之后的下一个重大飞跃。” “在这个领域,我们才刚刚开始(推理算力增加带来的能力增加也将是倍数增长)。” “接下来是芯片。” “根据多种衡量标准,每一代芯片的性能可能比上一代提高 3-4 倍。” “不只是单个芯片在不断进步,他们还在研究如何将这些芯片联网在一起。” “就像 NVL72 系统,它类似于一个机架系统,可以在数据中心级别大幅提升性能。” “计算能力是第三个你会看到基本上呈指数级进步的领域。” “只需要看看数据中心中部署的 GPU 数量。” “当马斯克最初开始训练 Grok 时,我认为他们大概有 10 万块 GPU。现在已经有 30 万块 GPU,而且正朝着百万块 GPU的目标迈进。OpenAI 的数据中心 Stargate 也是同样的情况。” “在接下来的几年中,他们可能会发展到 500 万、1000 万块 GPU。” 1,000,000 倍的增长是怎么得出的: “算法、芯片和数据中心的扩展和改进速度都是每年 3-4 倍。” “也就是说,每两年进步 10 倍。” “很多人没有理解指数级进步的含义:如果每两年提升 10 倍,并不意味着四年后你只是提升 20 倍。” “这实际上意味着提升 100 倍。” “把这些因素相乘:算法、芯片,以及可用于 AI 的原始计算能力。” 100 倍模型 🧠 × 100 倍芯片 💾 × 100 倍计算能力 ⚡️ = 1,000,000 倍的 AI 大模型🤖 “你所谈论的就是 1,000,000 倍的能力增长。” “但这种变革的影响将是绝对巨大的。” “我觉得人们还没有充分认识到这一点,因为他们不了解指数级进步的意义。”

夜谈

25,895 görüntüleme • 1 yıl önce