Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

千万别拿我和张雪峰这个大傻逼作对比。 网友:我想学AI相关的专业,我对AI很感兴趣,请问我应该选计算机还是数学? 我:你一定要选计算机,先把python和数据结构基础打好, 然后从deep learning这门课开始学,可以在家配置一个nvidia GPU的笔记本或者台式机,或者用google colab,先从最简单的 CNN 开始训练,找一个dataset,自己安装好pytorch和cuda、cudnn,抄一个经典CNN model,训练你的第一个神经网络, 然后可以学习transformer,学习encoder only的BERT,学习decoder only的GPT模型,从minGPT开始,训练你的最小版本的GPT模型, 如果你对训练模型感兴趣,可以读个PhD,如果你的inference感兴趣,可以多花点时间看cuda,简单学习一下nvidia tensor core architecture,可以了解GPT后续的模型的架构, 如果你对inference感兴趣,你也可以直接看vllm的架构,读里面的代码,理解vllm是如何load一个用pytorch训练好的LLM模型, 如果你对AI Agent感兴趣,可以从ReAct Agent开始看,然后看SWE Agent,知道一个Agent是如何抽象出来的,如何调用function call,如何自己做reasoning,如何把一个软件开发的任务用agentical的方式拆分和执行的, 然后你可以看codex的架构,看看codex是如何设计memory、auto compact、multi agent、background task这些现代coding Agent功能的。 张雪峰(下面视频中可以找到原话): 孩子,你一定要学数学,数学学好了可以转互联网、AI、科技、半导体、金融所有专业,数学是一切专业之母,所有专业的老祖宗! 孩子,deepseek就是一群纯数学博士造出来的,这些人天天研究数学,就把deepseek造出来了! 孩子,AI本质就是数学建模,就是一个个自变量,你只有研究数学,一直读到数学博士,才能把这些数学建模研究明白,计算机毕业生是永远研究不明白AI的! 我的结论是,鼓吹“数学万能论”、“数学是一切专业的老祖宗”、“只有数学博士才能研究AI”的张雪峰和他们的粉丝,都是彻彻底底的大傻逼。

269,442 Aufrufe • vor 5 Monaten •via X (Twitter)

29 Kommentare

Profilbild von 稻草人
稻草人vor 5 Monaten

揪着一个人说过的一段话反复证明自己的正确,你有点可怜

Profilbild von lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)vor 5 Monaten

后续:

Profilbild von Sakura
Sakuravor 5 Monaten

你说的这些难道不需要数学吗

Profilbild von lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)vor 5 Monaten

@scooomaker 不需要

Profilbild von Aurora
Auroravor 5 Monaten

能在这件事上信张雪峰的,但凡会用点搜索引擎呢? 梁文锋 :浙江大学的信息与电子工程 / 信息与通信工程

Profilbild von Banana
Bananavor 5 Monaten

他归为成功学那类人了,把他当成知识资源库的人被提现真是不冤枉。

Profilbild von jkliu
jkliuvor 5 Monaten

补充一点,如果只是为了显卡跑模型,推荐新手不要装cuda和cudnn,因为新版pytorch已经自带。很多老的入门教程都还在坑人,然后装出一堆新手解决不了的问题。。除非想直接调试cuda本身的代码的那才要装。

Profilbild von jerry
jerryvor 5 Monaten

那能读懂你说的这些专业的内容,尤其是Transformer和tensor core architect的人,读的都是什么专业?

Profilbild von lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)vor 5 Monaten

为什么一个字都不看就直接开杠?

Profilbild von Tsz wing Lai
Tsz wing Laivor 5 Monaten

哈哈,**张雪峰这波“数学万能论”被锤得太狠了**!AI入门实战路径清晰实用,数学博士确实牛但不是唯一钥匙,计算机+工程实践才是王道。别拿你和张雪峰比,你赢太多了😂

Profilbild von Awoo
Awoovor 5 Monaten

发现区别了吗?你是在跟学生说,家长不懂。张雪峰呢?是在跟家长说,家长就很容易懂了,哪怕错的离谱,学生呢呵呵哒。

Profilbild von TimDrake
TimDrakevor 5 Monaten

好多年前我就反驳过一个人,也是类似的说法,他说数学要很好,才能计算机编程做好,计算机本质是数学,这和生物本质是碳基生物有什么区别,照这个逻辑,最优秀的跑步运动员一定是最优秀的足球运动员,因为足球基于跑步

Profilbild von weichao liang
weichao liangvor 5 Monaten

他的性格气质就是 Mr.know all 那种

Profilbild von bisi桦萍平
bisi桦萍平vor 5 Monaten

你说的那一大堆,光看那些英语单词就晕了。张雪峰的表达,学数学吧,学好数学你就无敌了,干啥都行。基本盘们最喜欢这种话术了。

Profilbild von 墙头不是草🌿
墙头不是草🌿vor 5 Monaten

关键是张雪峰他是真不懂AI

Profilbild von zz zzffeee
zz zzffeeevor 5 Monaten

和推荐股票的所谓分析师用的是同一个诈骗套路🤣

Profilbild von 月亮大虾C.ly
月亮大虾C.lyvor 5 Monaten

没有计算机,数学博士造不出 DeepSeek,只能造草稿纸

Profilbild von GeoRAMIEL
GeoRAMIELvor 5 Monaten

在本科、硕士阶段开设ML课程的大学是不是全都在招摇撞骗?非数学博士发表的ML文章是不是全都是找的数学博士代写?

Profilbild von waterwu
waterwuvor 5 Monaten

数学和数学是不同的,应用数学一点都不应用数学。这是很多人都不明白的问题,也导致很多人选各种数学专业其实都是被误导了。但有一说一,理科本科的高等数学还是有用的,比如计算机专业也要学高数。

Profilbild von 中华民族亡于女拳(新东方俞敏洪说的对版)
中华民族亡于女拳(新东方俞敏洪说的对版)vor 5 Monaten

一个墙内信息源一个墙外的信息源。立党秒杀张雪峰了

Profilbild von Dalin Huang
Dalin Huangvor 5 Monaten

张雪峰的水平比那些仰起头看城市高楼,深切感悟出“国家已经很发达了”的农民和农民孩子们更高明,因为,他从算法的“算”字中深切地看透了数学的重要性和数学博士是最高级别的博士,同时他还发现“数学读到博士,就成为万能人”的结论无人能撼动,每用之,咨询者个个都服服帖帖,心怀恭敬、脸带羞涩而退。

Profilbild von greenman
greenmanvor 5 Monaten

彪哥是镰刀,韭菜十里送彪哥,黑色幽默。

Profilbild von Eric
Ericvor 5 Monaten

你和他对比?苹果开始对比小米了吗?😂

Profilbild von Hhailch
Hhailchvor 5 Monaten

数学确实很重要啊

Profilbild von Enoyp
Enoypvor 5 Monaten

哈哈哈,我当时上学时基本上就是学的你说的这些😉

Profilbild von kakashi_in_2026
kakashi_in_2026vor 5 Monaten

lidang总, 骂人不好

Profilbild von Yuchen Li (Chuck Li) @ Heidelberg Laureate Forum
Yuchen Li (Chuck Li) @ Heidelberg Laureate Forumvor 5 Monaten

minigpt4。。。这个不是我师兄的杰作吗,现在他们在 seed 和meta 工作

Profilbild von 藤井弥平
藤井弥平vor 5 Monaten

计算机这些不可以自学吗?党哥?

Profilbild von Bruce Lee
Bruce Leevor 5 Monaten

一般不骂人,但你这狗日的欠骂,人家去世了,你还满口喷粪,观点不同,可以理解,你骂人家就合适吗,你再有能耐,也是臭狗屎

Ähnliche Videos

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

303,716 Aufrufe • vor 2 Jahren

陶哲轩给数学学不好但有兴趣的学生的建议: “现在的人必须具备适应性和灵活性。大家需要掌握那些“可迁移的技能”(transferable skills)。比如,仅仅学习一门特定的编程语言,或者数学的某个特定分支,其本身并不是一种特别有价值的可迁移技能。 但是,学习如何运用抽象概念进行推理,或者在遇到问题时如何解决问题的能力——我认为这些才是我们未来依然需要的核心能力。即便我们的工具(比如 AI)越来越强大,你仍然需要与它们协同工作。” --- 莱克斯·弗里德曼 (Lex Fridman): 接着这个话题,您会对那些在数学上遇到困难,但又很感兴趣、想要学得更好的年轻学生们提些什么建议呢?在如今复杂的教育环境下,您觉得他们可以做些什么? 陶哲轩 (Terence Tao): 是的,这确实是个棘手的问题。但有个好消息是,现在课堂之外,能让孩子们接触和拓展数学学习的资源越来越多了。在我那个年代,就已经有数学竞赛,图书馆里也有很多数学科普读物。而现在,我们有了 YouTube,还有各种专门讨论和解决数学谜题的论坛,数学也开始在更多意想不到的地方出现。 从兴趣爱好入手,数学也可以很亲民 陶哲轩: 比如,有些业余爱好者喜欢玩扑克,纯粹是为了好玩。但为了某些非常具体的原因,他们会对一些特定的概率问题产生浓厚的兴趣。实际上,在扑克圈子里,已经形成了一个业余概率学家的社群。同样的情况也出现在国际象棋、棒球等领域。数学其实无处不在。 公民科学:让公众参与到数学研究中 陶哲轩: 我其实非常希望,借助像 Lean(一个定理证明助手)这样的新工具,我们能让更广泛的公众参与到数学研究项目中来。 这在目前几乎是从未发生过的事。在其他科学领域,已经有了一些“公民科学”(citizen science) 的实践。比如在天文学,有业余爱好者发现新的彗星;在生物学,有普通人帮忙识别蝴蝶种类等等。 在数学领域,之前也只有极少数的活动能让业余数学爱好者参与,比如寻找新的素数。但过去,我们必须验证每一个贡献的正确性。因此,对于大多数数学研究项目来说,引入公众的参与非但没有帮助,反而会因为大量的错误检查工作而非常耗时。 但是,像数学形式化这样的项目有一个好处,那就是它们能把更多的人聚集起来。我相信,现在已经有高中生为 Mathlib(一个数学定理库)这样的形式化项目做出了贡献。想要参与进来,解决一个小小的、原子级别的问题,你并不需要拥有博士学位。 编程:一条通往数学的捷径 莱克斯·弗里德曼: 数学的形式化似乎也为编程社区打开了一扇大门。那些对编程感到习以为常的人,或许能更容易地走进数学世界。给我的感觉是,编程似乎比数学更容易上手。 数学,特别是现代数学,被看作是一个门槛极高的领域,而编程则不同。所以,编程或许可以成为一个很好的切入点。 陶哲轩: 是的,你可以运行代码,然后立刻看到结果,比如很快就能打印出 "Hello world"。如果编程也被当作一门纯理论的学科来教,只教计算机科学、函数理论、程序理论等等,而不让你在周末为了好玩去实际写写代码,那么它也会被认为和数学一样难。 在热爱的领域里,发现数学、应用数学 陶哲轩: 正如我刚才所说,在很多非数学家的圈子里,人们为了某个非常具体的目标而在运用数学,比如优化他们的扑克策略。对他们来说,数学因此变得非常有趣。 给年轻人的职业建议:拥抱不确定的未来 莱克斯·弗里德曼: 总的来说,对于年轻人如何选择职业、如何找到自己的定位和天赋所在,您有什么建议? 陶哲轩: 这个问题真的非常难回答。当今世界充满了不确定性。你知道,战后曾经有过一段时期,至少在西方,如果你来自一个不错的家庭背景,通往好职业的道路是非常稳定的:上大学、接受教育、选择一个专业,然后一直做下去。 莱克斯·弗里德曼: 那样的时代越来越成为过去了。所以我认为,现在的人必须具备适应性和灵活性。大家需要掌握那些“可迁移的技能”(transferable skills)。 陶哲轩: 的确。比如,仅仅学习一门特定的编程语言,或者数学的某个特定分支,其本身并不是一种特别有价值的可迁移技能。但是,学习如何运用抽象概念进行推理,或者在遇到问题时如何解决问题的能力——我认为这些才是我们未来依然需要的核心能力。即便我们的工具(比如 AI)越来越强大,你仍然需要与它们协同工作。 莱克斯·弗里德曼: 确实,您本人就是一个很有趣的案例。 完整视频:Terence Tao: Hardest Problems in Mathematics, Physics & the Future of AI | Lex Fridman Podcast #472

宝玉

88,601 Aufrufe • vor 11 Monaten

学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单😂 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。 说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。 这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。 还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。 Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。 真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。 大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ 而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈 这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。 当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。 它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。 我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。 最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。 想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了👇

AYi

64,297 Aufrufe • vor 5 Monaten

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,309 Aufrufe • vor 10 Monaten

想和大伙聊聊,在 AI 时代我是如何深入学习一个技术领域的。 之前没有 AI 之前更多是看书、翻这个领域有名的国内外人的所有博客,然后摘抄记录到笔记本,这种速度挺慢,但是很有学习的乐趣,比如当时学习 WebGL 就是这种感觉,可能学懂一个东西差不多要半年空闲时间,慢但快乐。 现在有了 AI 之后,其实我很讨厌网上那种3分钟教你看完百年孤独,也讨厌一切短剧和倍速看电视剧的方式,更多还是挑好的看,吃好一点。 不过最近写你不知道的 Claude Code 和 Agent 系列,除了自己懂的部分外,其实还有大量不太清楚的领域,好在之前收藏了不少文章,刚好借助这一块清库存,全部搞懂输出出去,一直认为,很多时候,不在于看了多少东西,听了多少东西,输入了多少东西,其实用处不大,更加看重你输出了多少东西,这个才是你自己的。 然后我上上周启动了一个深坑挑战自己,研究大模型的训练流程,确保非专业的人也听得懂,探索了2周,刚好这个经验可以分享给大伙,当然成文也差不多好了,最近会发出。 我会把这个学习过程当做写代码一样的组织,第一步收集高质量的资料,比如与之相关的近几年的精品论文,各大模型厂商发布的关键模型的博客,X上模型负责人发表的一些文章,以及斯坦福等高校的近两年关于这一块的课程学习,还有经典的手搓一个大模型的代码仓库等等,这些都是我的一个资料来源过程,我会借助工具自动化全部下载、转md、清洗,梳理,弄好结构化分门别类到我这次研究的仓库。 然后对于自己看得懂的内容就全部看一遍,把不好的删掉,好的留下,对于看不懂的内容,直接借助 Claude 帮我的理解,更复杂一点的直接翻译成中文去阅读,对于代码本地可以跑的就跑起来,不能跑的那种就去看结构,总之会有一个大概的认识和知晓技术原理,这个阶段可以去掉原有一半可能没有用的内容。 到了这个阶段,其实你对这个领域有一个大概的认知了,就可以给这篇文章开始写一个大纲,以及大纲应该结合的来源内容,这里均可以用markdown很多表达,你要讲什么,或者说你想讲什么更想让读者知道,一定一定,文章是写给你给给看的人看的,需要知晓对方的认知水平,和汇报其实差不多。 然后接下来就是苦力活加之前内容的复习过程,和大学时候考试前复习很像,把每一章的内容填充完整,这样下来,你会得到一篇非常长而且有点啰嗦的文章。 这个时候AI就可以帮太忙,你可以让他帮你不改变你原有的内容意思你的语气的情况下,帮我去掉无用的啰嗦内容,以及连贯不到位的内容,或者是这一块缺少的内容,还需要补充什么知识的地方,借助AI继续去完善补充,这里又可以学到很多原来遗漏的东西。 最后整理好以后,可以继续自己读一遍,而非让AI读一遍,这里AI只是工具,千万不要把你的脑袋被AI代替了,这就没有啥意思来,自己读的过程中可以对文章继续修改调优,这里和写代码又非常像了,自测那种感觉,修复问题修问题,最后读了2遍以后,基本感觉完美了,然后就可以发出来给大伙看看。 有小伙伴肯定是担心自己写的东西没有人看,就不太喜欢发出来,或者说就不写了,其实只要你的内容有意义,自然就有读者,而非是你偷懒的理由。 花10min写完这个碎碎念,结束,欢迎交流你是如何学习一个新领域的,下面视频就是我后面要发的那篇你不知道的大模型训练文章的学习仓库,挺有意思,就录了一个视频给大伙看看我的工业化学习方式。

Tw93

111,923 Aufrufe • vor 5 Monaten

如何让小型语言模型高效工作。Yejin Choi在2024年数据与AI峰会上发表演讲(双语字幕) 演讲者:Yejin Choi,华盛顿大学教授、麦克阿瑟奖学金获得者,同时也是AI2常识AI的高级研究主任 这个演讲是将如何优化小模型的,他们训练了一个 0.5B 参数的小模型做文档摘要任务,超过了GPT-3.5。 按照演讲者的结论:AI 的性能,至少在目前的形态下,取决于它的训练数据。因此,过去和现在的 AI 主要依赖于人类生成的数据,但未来可能会依赖于 AI 生成的数据。很多可能担心合成数据质量不高,可能存在偏见,但是,越来越多的证据表明,这种方法是有效的。 例如,使用 Meta 的 SAM(Segment Anything)进行图像分割就是 AI 合成图像分割注释的一个例子。虽然有人类的验证帮助,但是单靠人类无法对如此多的图像样本进行注释。这是另一个例子。Microsoft 的论文"Textbooks are all you need"是另一个例证。当你有真正高质量的数据,例如教科书级别的数据,经过合成,你实际上可以在许多、许多不同的任务中与规模更大的对手竞争。可能在某些方面,它并不像大型模型那样具有广泛的适用性,但这对于满足许多商业需求来说是非常出色的。你可能不需要通才,你可能需要专家。 此外,"Textbooks are all you need"论文的观点也证明了,数据质量是最重要的。这并不仅仅关乎数量,更在于质量。DALL-3 就是一个很好的例子。为什么它会突然之间超越了 DALL-E 2 呢?很大程度上是因为它有更好的图像标注。但是,究竟是哪些更好的图像标注呢?在此之前,我们使用了所有好的图像标注。他们将这些图像标注进行了合成。这就是我们获得高质量数据的方式。 所以,AI 的质量更关乎数据的质量、新颖性和多样性,而不仅仅是数量。 * 引言 好的。我来这里要跟你们分享一些看似不可能实现的可能性。 * 介绍 去年,当有人问 Sam Altman 如何让印度的创业公司为印度创建基础模型时,他的回答是,不用费那个劲了。这根本没希望。 哇。首先,我希望印度的创业公司不会轻易放弃。其次,这种对话可能会在任何地方发生。无论是在美国的任何一所大学,或是创业公司,或是研究机构,他们都可能面临没有足够计算能力的问题。 所以,这就引出了我们要讨论的问题:不可能的提炼。如何以环保的方式训练出你的小型语言模型,使其效果堪比真实模型。 * 当前的方法与挑战 目前我们听到的最佳做法是大规模的预训练,紧接着进行大规模的后训练,例如 RLHF。如果我告诉你我打算从 GPT-2 开始,那个不被大众关注的小型、低质量模型,我也不知道为什么,但以某种方式,我们将创造或提炼出一个高质量的小型模型,然后与可能大两个数量级的更强大的模型竞争。这听起来应该很不可能,尤其是当你可能听说过一篇论文,标题是《模仿大型语言模型的虚假希望》。 虽然他们所报告的对于他们进行的特定评估实验来说是真实的,但请不要过分泛化,认为所有的小型语言模型都无法媲美大型模型。因为还有许多其他反例证明特定于任务的符号知识精馏可以奏效在许多不同的任务和领域中其中一些来自我的实验室。 然而今天,我只想关注一个任务即如何学习语言中的抽象。为了简化这个任务,我们从句子摘要开始这是我们的第一个不可能的任务。 * 任务一:句子摘要 目标是在没有极端规模的预训练、没有大规模的 RLHF、以及没有大规模的有监督数据集的情况下实现这一目标。这些东西并不总是必要的。但等一下,我们必须使用通常是所有三个,至少是其中一部分。 但如果没有这些,我们如何能和更大的模型一较高下呢?关键的直觉是当前的 AI 能做得多好取决于它所接受的训练数据。我们必须有某种优势。我们不能没有任何优势,所以那个优势将来自数据。顺便说一下,我们必须合成数据,因为如果数据已经存在于互联网上某处 OpenAI 已经对其进行了爬取,那就不是你的优势了,他们也有,所以你必须创造出一些真正新颖的东西,比现有的东西更好。 通常,精馏是从大型模型开始的,但我们将丢弃它,以向你展示我们可能对隐藏的可能性视而不见。所以我现在就开始示范。从 GPT-2 开始,那个质量很差的模型。然后我将进行一些创新,我马上就会概述,制作出高质量的数据集,然后可以用来训练小模型,这个模型将成为执行特定任务的强大模型。 但问题是,GPT-2 甚至无法理解你的提示词。你无法利用 GPT-2 进行提示词工程。你让它总结你的句子,它生成的一些输出,完全没有任何意义。所以你再试一次,因为它的输出通常有随机性。你可以生成很多不同的例子,比如几百个例子,我们发现它的表现几乎总是不好,像好的不到 0.1%。 * 解决方法与进展 但是有志者事竟成。所以我们想出了许多不同的办法。这其中包括我们的神经解码。这是一种即时推理算法,可以将任何逻辑约束加入到你的语言模型输出中。对于任何现成的模型,我们都可以使用这个来引导输出的语义空间。 但是因为 GPT-2 太糟糕了,即使使用了这个,成功率也只有 1%。但这比零要好。现在我们已经有了进展。因为如果你生成大量的样本,然后进行筛选,你实际上可以这样得到一些好的例子。然后,聪明的学生们提出了许多不同的想法。 我就不详述技术细节了,但我们找到了一些方法。为了能更容易找到好的例子,我们需要将成功的概率提高到 10% 以上。总体的流程是这样的:首先,从一个质量较差的教师模型开始,生成大量的数据点。然后,由于数据中存在大量的噪声,需要进行严格的过滤。 我们使用了一个三层过滤系统。虽然细节并不重要,但我要强调其中的第一个,即 Intel Monte 过滤器,它基于现成的 Intel Monte 分类器,能判断一个摘要是否能从原文中逻辑推断出来。这个模型并不完美,可能只有 70% 到 80% 的准确度。但是,当你大力使用它来过滤数据时,它的表现已经足够好了。 然后,我们使用这些数据来训练一个更小的模型,这个模型可以成为下一代学生的教师模型。我们重复了这个过程几次,最终得到了高质量的 DIMM sum 数据和高质量的模型。 在与那时最好的模型 GPT-3 进行对比时,那时,GPT-3 是最好的摘要模型。但当 ChatGPT 问世后,我们成功地超过了 GPT-3,人们似乎不再关心其他的,因为 ChatGPT 能做任何事情,包括摘要,所以我们为什么还要费心呢? * 任务二:文档摘要 接下来是我们的“不可能完成的任务 2”。我们现在将与 ChatGPT 3.5 展开竞争。并且,要让我们的挑战更具难度——我们现在要总结的是整个文档,而不仅仅是句子。然后,我们还要做到以上所有这些而不依赖于那个现成的蕴含分类器。 我的意思是,实际上你可以这么做,就像从学术角度来看,我们想看看我们能在多大程度上打破关于规模的普遍假设。因此,我们在 InfoSumm 的新工作是一种基于信息理论的蒸馏方法其中关键的想法是我们将不再使用那个现成的 Imitating Humans LLM。我们将使用一些公式,这个公式其实只有三行,包括一些你可以用现成的语言模型来计算的条件概率得分。 * 实验与成果 现在时间还早,所以我们不深入讨论这些公式的细节。但我可以大体上告诉你,如果你把这些公式重新排列一下,你可以将此理解为点对点互信息的特例。你可以用它来过滤你的数据。因此,我们使用的是和之前相同的整体框架。我们现在使用 PTHEA 2.8 亿参数模型,因为我们觉得它比 GPT-2 稍好一些。 至于过滤,我们现在使用的是我之前向你们展示过的那三个简短的公式。然后我们就做同样的事情。这一次,我们让模型变得更小,只有 5 亿参数模型。这带来了高质量的文档摘要数据集,以及模型。 那么我们的表现如何呢?正如我们所承诺的,至少在这个任务上,我们的表现能与 ChatGPT-3.5 媲美,或者,根据评测的设定和标准,我们的表现甚至有所超越。你可以在我们的论文中找到更多的细节。 * 任务三:学习抽象思考 总的来说,我展示了我们如何学习文档摘要,即使不依赖于大规模预训练模型和其他大规模资源。然而,这两篇论文背后的真正研究问题是,我们如何学习进行抽象思考。 因为现在的做法就是让模型尽可能地大。越大越好。但是我们人类,无法像模型那样记住所有的上下文,比如一百万个 Token。没有人能记住上下文中的一百万个 Token。你会立刻抽象出我刚才告诉你的所有事情。但是你仍然记得我到目前为止说的所有话。这就是人类的惊人智能,我们还不知道如何通过 AI 模型有效地实现这一点。我相信这是可能的。我们只是还没有尽力去探索,因为我们被大规模的迷惑了。 * 任务四:Infini-gram 好的。那么,Infini-gram 就是我们面临的第三个挑战。稍微转换一下话题,现在的任务是让经典的统计 N-gram 语言模型在神经语言模型中发挥一定的作用。你们中有多少人还在讨论 n-gram 模型呢?我也不清楚。你们现在还在学习这个吗? 这里我们设定 n 等于无穷大。我们将在数万亿的 token 上完成这个计算,反应时间必须非常快,而且我们甚至不需要使用一颗 GPU。哇!我来告诉你们这有多么困难。假设,如果你要在一个经典的 n-gram 语言模型中索引 5 万亿个 token,且 n 无限大,那么你大概需要处理 2 千万亿个唯一的 n-gram 序列。你需要枚举,排序,计数,存储一些错误,这可能需要占用大约 32 太字节的硬盘空间,甚至更多。我们又怎么知道 呢?但这个数据量实在太大了。我们无法处理。 如果你看看其他人建立的大规模经典 N-gram 模型,那就是 Google。在 2007 年,由 Jeff Dean 和其他人带领的团队,他们只处理了 2 万亿个 token——我的意思是,对于那个时代来说,这已经是很大的数量了。他们使用的是五元 n-gram,这就产生了大约 3000 亿个不同的 n-gram 序列,这些序列他们都需要进行枚举、排序、计数等操作。这个数量实在是太庞大了。大家其实并没有进一步增加这个数量。那么,我们到底是如何做到将这个数量无限扩大的呢? 在我解释我们如何做到这一点之前,如果你感兴趣的话,我邀请你去查看这个在线演示。 token。这里有一个例子,它是一个 48 个字符的词。我不明白为什么这个词会存在。但是如果你去搜索它,你会发现它不仅存在,而且还有超过 3000 个实例。这个搜索过程耗时 5.5 毫秒。此外,它还会向你展示如何对这个长词进行分词。你也可以试试搜索多个词,看看下一个可能出现的词是什么。比如,"行动胜过语言",那么接下来可能是什么词呢?该网站会向你展示可能出现的下一个词。而且,这个过程非常快速。 * 解决方法与进展 那么,我们是如何做到这一切的呢?你可能会惊讶地发现,我们的方法其实非常简单。有一种叫做后缀数组的数据结构,可能并不是所有的算法课程都会教授,但是有一些课程会教授。这是一种我们非常小心地实施的数据结构。所以我们用后缀数组索引整个网络语料库。事实上,我们并没有预先计算这些 n-gram 的统计数据。我们只是预先准备好这个数据结构。当你进行特定的查询时,我们会实时计算。多亏了这个数据结构——我们可以做得非常快,尤其是在使用 C++ 实现的情况下。我知道现在 AI 研究中,C++ 可能不是大家首选的语言,但实际上,使用 C++ 会让程序运行得更快。 这样做的成本有多低呢?其实我们只花了几百美元就索引了全部内容,而且,为 API 服务的成本也相当低。即便没有 GPU,它的速度也非常快。不同类型的 API 调用的延迟只有几十毫秒。你可以利用这个做很多事情。我现在可以分享的一点是,你可以用我们的 Infinigram 插值你的神经语言模型,降低困惑度,这是常用于评估语言模型质量的指标。我认为这只是我们能做的事情的冰山一角。实际上,我还在研究一些我希望能分享,但现在还不能告诉你们的东西。 不过我们已经开始提供这些 API 端点。从几周前开始计数,到现在我们已经提供了 6000 万次 API 调用,这还不包括我们自己的使用。我非常想知道人们是如何使用我们的 InfiniGram 的。 * 总结 总结一下,我的演讲主要是说,AI 的性能,至少在目前的形态下,取决于它的训练数据。因此,过去和现在的 AI 主要依赖于人类生成的数据,但未来可能会依赖于 AI 生成的数据。我知道人们对此有很多担忧,可能担心质量不高,可能存在偏见。因此,你不能以普通的方式来进行这项工作。你应该以更有创新性的方式来进行。但是,越来越多的证据表明,这种方法是有效的。 例如,使用 Meta 的 SAM(Segment Anything)进行图像分割就是 AI 合成图像分割注释的一个例子。虽然有人类的验证帮助,但是单靠人类无法对如此多的图像样本进行注释。这是另一个例子。Microsoft 的论文"Textbooks are all you need"是另一个例证。当你有真正高质量的数据,例如教科书级别的数据,经过合成,你实际上可以在许多、许多不同的任务中与规模更大的对手竞争。可能在某些方面,它并不像大型模型那样具有广泛的适用性,但这对于满足许多商业需求来说是非常出色的。你可能不需要通才,你可能需要专家。 此外,"Textbooks are all you need"也意味着,质量是最重要的。这并不仅仅关乎数量,更在于质量。DALL-3 就是一个很好的例子。为什么它会突然之间超越了 DALL-E 2 呢?很大程度上是因为它有更好的图像标注。但是,究竟是哪些更好的图像标注呢?在此之前,我们使用了所有好的图像标注。他们将这些图像标注进行了合成。这就是我们获得高质量数据的方式。当然,你需要小心翼翼地进行,但是有越来越多的任务特定符号知识蒸馏的例子,包括我自己实验室的工作,都证明了这是可行的。这真的可以让小模型发挥出惊人的潜力。 所以,这更关乎数据的质量、新颖性和多样性,而不仅仅是数量。 我就在这里结束我的演讲。谢谢。 视频来源:

宝玉

59,826 Aufrufe • vor 2 Jahren

Google 前 CEO 埃里克·施密特近期在斯坦福 CS323 课堂上的访谈(四/完结) 关于大语言模型对经济的影响以及学术界的选择 学生:大语言模型的经济影响,比如劳动力市场的影响,比你最初预期的要慢。Chegg(在线教育技术公司)和一些服务人员受到了影响。你认为学术界应该获得AI方面的补贴,还是应该选择与业界的大公司合作? Eric:我非常努力地推动为大学建立数据中心。如果我是这里的计算机科学系教师,我会非常失望,因为无法与研究生一起构建能够进行博士研究的算法。我被迫和这些公司合作。我认为这些公司在这方面并没有表现出足够的慷慨。我与许多你们认识的教师交谈,他们花费大量时间等待Google Cloud的配额。这是非常糟糕的情况。这个领域正在快速发展。我们希望美国能胜出,我们希望美国的大学——出于多种原因,我认为正确的做法是把资源提供给他们。我在这方面做了很多努力。 至于劳动力市场的影响,我将这个问题交给这里的真正专家。作为Eric教导的业余经济学家,我坚信那些接受过大学教育、从事高技能工作的人将会适应,因为人们将会与这些系统一起工作。我认为这些系统与以往的技术浪潮没有区别。那些危险的工作和不需要太多人为判断的工作将被取代。 关于计算机科学教育的未来 学生:我对“文本到行动”及其对计算机科学教育的影响非常感兴趣。你认为计算机科学教育应该如何变革以适应新时代? Eric:我认为计算机科学专业的本科生群体将始终有一位编程搭档。因此,当你学习你的第一个for循环时,你会有一个工具作为你的伙伴。这就是未来的教学方式,教授会讲解概念,但你会通过这种方式参与其中。这是我的猜测。 关于非Transformer架构与数学创新 学生:你提到了一些让你兴奋的非Transformer架构。我想其中一个被提到的是状态模型,但现在还有一种是更长上下文的模型。我更好奇的是你在这方面看到的情况。 Eric:我对数学的理解还不够深入,但我非常高兴我们为数学家们提供了工作机会,因为这里的数学太复杂了。但基本上,他们是在采用不同的方法来进行梯度下降和矩阵乘法,使其更快更好。Transformer架构是一种能够同时进行乘法运算的系统化方式,这是我理解的方式。它和其他的很像,但数学部分不同。我们将继续关注这些新的数学进展。 关于中美关系与国家安全 学生:你在关于国家安全的论文中提到,中美两国在现代架构的帮助下处于关键地位。接下来的10个国家,以及稍后的一组国家,都是美国的盟友,或者与美国盟友关系密切。我很好奇你对这些国家,尤其是那些中间地带但并非正式盟友的国家有什么看法。它们有多大可能愿意加入我们的安全阵营?是什么因素可能会阻碍它们加入? Eric:最值得关注的国家是印度,因为顶尖的AI人才从印度来到美国,我们应该让印度保留一部分顶尖人才。他们没有我们这里如此丰富的培训设施和项目。在我看来,印度是这一领域的重要摇摆国家。中国已经没有机会了,不会再回来。日本和韩国显然站在我们这一边。台湾在硬件方面很出色,但他们的软件开发较弱。在全球范围内,其他大国的选择并不多。欧洲因为欧盟的政策和管理机制陷入困境,这并不是什么新鲜事。我与他们斗争了10年,但他们仍然有许多限制,导致我们在欧洲开展研究非常困难。法国还有一些机会,但我不太看好德国。其余的国家都不够有影响力。 关于编程与AI 学生:我是编译器工程师。考虑到你设想这些模型将具备的能力,我们还需要花时间学习编程吗? Eric:是的,这是一个老生常谈的问题,为什么你已经会说英语还要学习英语呢?是为了让你的英语更好。你确实需要理解这些系统的工作原理,我对此非常坚定。 关于分布式计算与大语言模型的训练 学生:你是否探索过分布式环境?虽然构建大型集群很困难,但MacBooks的性能很强大。你认为类似“Folding@home”的想法适合训练吗? Eric:是的,我们对此进行了深入研究。算法的工作方式是你有一个非常大的矩阵,基本上是一个乘法函数。系统的速度完全受限于内存到CPU或GPU的传输速度。Nvidia的下一代芯片已经将所有这些功能整合到了一块芯片中,如今的芯片已经足够大到需要将它们都粘合在一起。短时间内,分布式计算在训练大语言模型方面的进展可能有限。 关于数据隐私与版权 学生:在ChatGPT发布后,OpenAI因使用他们的作品进行训练而被《纽约时报》起诉。你觉得这种情况会如何发展?这对数据隐私有何影响? Eric:我曾经从事过大量的音乐版权工作。我了解到在60年代,有一系列诉讼最终达成了一项协议:每次播放你的歌曲,你都能获得一定的版权费。我猜AI领域可能会有类似的情况。可能会有很多诉讼,最后可能会达成一种协议,要求你必须支付你的一部分收入,以便使用类似ASCAP BMI的版权管理机构。 关于AI领域的垄断与反垄断法规 学生:现在看起来几个主要玩家在AI领域占据主导地位,他们会继续维持这个地位。这些公司似乎与那些受到反垄断法规关注的大公司有所交叉。你对这两种趋势有何看法?像是监管部门会否对这些公司进行分拆?这将会对现状产生怎样的影响? Eric:在我的职业生涯中,我曾帮助微软避免被拆分,结果它确实没有被拆分。我也曾努力阻止谷歌被分拆,目前来看,谷歌还未被分拆。因此,从我的观察来看,这些公司被分拆的趋势并不明显。只要这些公司避免成为像约翰·D·洛克菲勒那样的企业巨头,政府可能不会采取行动。这些公司占据主导地位的原因是他们有足够的资本来建设数据中心。 关于技术差距对全球的影响 学生:这一切将会把那些不参与前沿模型开发和无法获取计算资源的国家带向何方?富国越来越富,穷国尽力而为。 Eric:事实上,这就是富国的游戏,对吧?巨大的资本,众多技术过硬的人才,强有力的政府支持。有些国家,比如印度,将会成为这一领域的重要参与者。其他国家可能需要找到合作伙伴或与其他国家联合。 对年轻人的建议 主持人:最后一个问题,Eric。你花了很多时间帮助年轻人,他们正在创造大量财富,你对在座的各位有什么建议吗?他们正在为这门课写商业计划书或撰写政策提案、研究提案,未来职业发展方面你有什么建议? Eric:我在商学院教过一门关于这个主题的课程。快速制作原型的能力真的非常重要,成为创业者的一个难点在于一切都发生得非常快。现在,如果你不能在一天之内利用这些工具构建你的原型,那你就需要考虑一下了,因为你的竞争对手正在这么做。所以我的建议是,尽快使用这些工具把你的想法制作成原型。这是关键,因为在其他公司、其他大学,或你从未去过的地方,一定有人正在做和你一样的事情。

宝玉

14,213 Aufrufe • vor 2 Jahren