Загрузка видео...

Не удалось загрузить видео

На главную

这是Kimi.ai K3开源后我见过最狠的帖子。 一个Baseten的工程师,ali 老哥花48小时喝了40罐气泡水,把K3的建模代码扒了个底朝天。 128万浏览,6000多收藏, 最后得出一个结论, 一个K3里能塞下22580个2019年的GPT-2, 七年时间参数涨了两万两千多倍, 但这根本不是堆参数堆出来的。 从GPT-2到线性注意力,到DeltaNet,到门控DeltaNet,再到Kimi自己的KDA注意力。 每一步迭代,都在精准解决上一代的具体bug。 内存不够,信息干扰, 无法选择性遗忘,残差稀释, 没有一步是多余的。 这才是开源最可怕的地方啊兄弟们, 代码放出来第一天, 全世界最聪明的工程师, 已经在帮你把七年的技术脉络理得明明白白, 而你的闭源模型,永远享受不到这个待遇。

400,961 просмотров • 22 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

谁能想到,Kimi K3开源之后,第一个被“榨干”的不是英伟达GPU,而是一位Baseten工程师。 这位老哥连续研究48小时,喝掉40罐气泡水,把Kimi K3的模型代码和技术报告一层层拆开,最后算出一个让人头皮发麻的数字: 按参数量换算,一个2.8万亿参数的Kimi K3,大约等于把22580个2019年的GPT-2叠在一起。 但这根本不是简单的“堆料游戏”。 从GPT-2到线性注意力,再到DeltaNet、门控DeltaNet和Kimi自研的KDA,七年AI架构进化史,看起来特别像程序员接手祖传项目: 上一代记忆太占显存,下一代想办法压缩; 压缩后信息挤成一锅粥,再下一代学会删除; 删错了重要内容,只好继续加门控,决定什么该记、什么该忘。 技术大佬们表面上是在做“颠覆式创新”,翻开代码一看,底层逻辑往往只有四个字: 被迫救场。 七年过去,参数规模增长了22580倍,工程师的核心工作依然没变——修掉上一代留下的bug,再顺手给下一代留几个新的。 这就是开源最“残忍”,也最迷人的地方。 闭源公司把模型锁进保险柜,留给外界一个高深莫测的黑盒;开源第一天,全球最顶尖的一群程序员就像接手了一个没有文档的祖传项目,一边骂骂咧咧,一边把七年的技术路线拆得明明白白。 闭源拥有秘密。 开源拥有一群喝着气泡水、凌晨三点还不肯睡觉的技术狂魔。 后者,可能更可怕。 $MSFT $NVDA $GOOGL $AMD $AMZN #美股

美股大数据

84,639 просмотров • 21 дней назад

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 просмотров • 3 месяцев назад

这个人的访谈,我已经看了第三遍了。 硅谷最神秘的亿万富翁——纳瓦尔·拉维坎特。很多人都没听说过他,但马斯克、扎克伯格都非常推崇他。 他几乎不接受采访,可一旦开口,就是那种让人当场坐直、反复回放的话。 连这两天,我又重温了他三个小时的访谈,帮你总结了含金量最高的几个观点,和你分享。 第一,人生中最重要的三个决定。 纳瓦尔说啊,所有的结果,几乎都是这三件事的下游:和谁在一起,做什么,住在哪里。 这听起来很简单,但他说,大多数人都没有意识到,他们在这三件事上的思考,时间少得可怕。 但就是这三件事,决定了你几乎所有的一切——你的朋友圈、你的机会、你的情绪底色、你每天呼吸什么样的空气、你未来能遇见什么样的人。 他说,如果你要做一个能够影响4年的决定,你应该花一年的时间来想清楚它。 而我们绝大多数人呢?就是花了一个周末,就决定了一份要学4年的专业;花了一个月,就决定了一份干10年的工作。 第二,骄傲是最昂贵的特质。 这句话很短,但是呢,我愣了很久。 纳瓦尔说啊,他观察了很多朋友和同事,那些原地踏步、成长最少的人,几乎无一例外,都是最骄傲的人。 骄傲意味着什么? 意味着你不会承认自己错了。 你买了一只烂股票,不舍得割肉,因为承认亏损,就等于承认你判断失误。 你卡在一段不好的关系里,你不离开,是因为你不想让别人看见你失败。 骄傲,会把你锁在次优答案里。 他说,最好的艺术家、最好的创业者都有一个共同点——就是他们随时愿意从零开始,愿意被看起来像个傻瓜。 他还举了马斯克的例子,说他卖掉了 PayPal 之后拿到了2亿美元,接着他把这些钱全部压到了 SpaceX 和特斯拉里,甚至还要借钱付房租。 第三,不是一万小时,而是一万次迭代。 你一定听过那个“一万小时定律”,说你重复做一件事,坚持1万小时就能成为专家。 纳瓦尔呢,一针见血地指出:是错的。 真正让你成为专家的,是1万次迭代,而不是1万个小时。 重复和迭代,是两件完全不同的事。 重复,就是你把一件事做了一遍又一遍;而迭代,是你每做一次,就要带着上一次的教训,做得更好一点。 所以,我们每个人都要问自己一个问题:你到底是在迭代,还是只是把第一次的经验,重复了很多遍? 第四,灵感是易逝品。 这点我觉得,可能是整个访谈里最实用的一条。 纳瓦尔说啊,当你有灵感的那一刻,就是阻力最小、效率最高的那一刻,这个窗口转瞬即逝。 你有灵感写一篇东西,那就在那一秒写;你有灵感去解决一个问题,就立刻解决;你对某件事突然好奇,就在那一秒去查。 不要想着等我有时间再去做,因为等有时间的时候,那个灵感、那个状态,已经不在了。 纳瓦尔说啊,他不喜欢被过度安排的人生,因为那样,你会永远错过真正想做的时刻。 第五,注意力在哪里,你的人生就在哪里。 这是整个访谈里,最让我反复回味的一句话。 纳瓦尔说啊,很多人以为钱可以买到时间,但是像沃伦·巴菲特,还有迈克尔·彭博,有钱到这个程度,他们依然没办法多买到一天。 而更致命的不是这个。 更致命的是,你有时间,却没有把注意力,真正地放在这段时间里。 你躺在床上,刷两个小时短视频,时间在流逝,但你的注意力在哪里? 在算法推荐给你的下一条,下一条,再下一条。 两个小时过去了,你刷了100条视频,可你什么都不记得。 纳瓦尔说啊,你的身体在,但其实你已经死了。 这,才是现代人最大的悲剧。

另一面

133,345 просмотров • 5 месяцев назад

我操!Kimi.ai 月之暗面这波是真的疯了! 2.8T 参数的 K3 直接全权重开源就算了, 连推理内核、MoE 通信库、Agent 训练环境整套底层技术栈全给你端出来,硬生生把开源模型的天花板,直接抬到了闭源旗舰的家门口。 不是放个权重就炒开源概念的挤牙膏操作,是从模型到底层能跑起来生态的所有东西全白给,1M 长上下文、MoE 架构性能够打闭源, 之前天天喊开源追不上闭源的直接被打半残, 开发者再也不用对着闭源 API 的限流、涨价受窝囊气。 搞大模型的不用从零搭底层通信框架, 做 Agent 的不用卡闭源接口的脖子, 小团队也能基于全栈直接做二次开发, 从今天起,全球开源 AI 的游戏规则,真的改了。 今天之后,开源和闭源的代差,从两年砍到了半年。 Kimi K3 今天正式全开源,不是挤牙膏的版本更新。 2.8T 总参数 MoE, 激活 104B, 原生 100 万上下文。 靠 KDA 新注意力和 AttnRes 架构创新,单位算力智能密度直接提 2.5 倍,长上下文解码速度翻 6 倍。 最狠的是,这根本不是只放个权重的假开源。 FlashKDA 高性能内核,MoE 通信库,连用来做 Agent 强化学习的快照式训练环境 AgentENV, 全给你开源了。 从推理到训练的整个底层栈,直接搬空。 之前所有开源模型,本质都是在追闭源一年多前的尾巴。 这是第一个真正摸到闭源顶尖门槛的开放模型。 长编码、Agent、终端操作这些硬核任务, 已经能和第一梯队闭源掰手腕。 你永远可以相信开放的力量!! 用K3搓了一个他自己开源的介绍视频,特此致敬🫡

AYi

264,324 просмотров • 22 дней назад

问天塔与理想国 那时候我在想,有一天我将带领了我的同族们创造一个新的文明的时代,那个时候又叫量子电脑,是未来的一个,这个目前看到一个终极的工具。然后最终会走向人与上帝沟通... 就像七哥曾经见过高人探索了人类的文明,有幸的一窥世界人类的游戏的真相的碗边之后,我就在想自己,你说要有一天,我想我要把共产党灭了,然后我拥有一个从地下冒油的国家,像沙特一样,是吧。沙特当时萨乌地(Saudi)先生,Mr.萨乌地先生建造了一个国家,建造了这个国家怎么着,生了五千个王子、公主,是吧。然后全给他钱花,是不是。然后近亲结婚,是不是。表亲的结,乱球搞,最后一帮的傻子出来了,是不是。都是不正常的,是吧。然后这叫国家。 郭文贵想要这个吗?我要有本事创造一个财富帝国,我不去灭共,我找个地方弄个地方,是吧,建个国,然后整出一帮就是郭文贵的国家,然后郭文贵的五千的子孙和公主们,然后最后近亲结婚,整出一帮傻子出来,然后就是花钱买劳斯莱斯,坐到大飞机,是吧。你觉得这是我想要的吗?我当然不想要。 然后再一个就想想,我建一个实体,像北朝鲜一样,让所有人都盼望喝一碗肉汤,然后我吃得胖胖的,然后都得糖尿病死掉,然后让我的儿子,我的孙子接班,是吧。这是我想要的吗?不想要。我都不想要孙子,要不要孙子我都不管,我干嘛要这个?是不是。 那我是不是像中国共产党一样,是不是,编一个谎言,创造一个笑话,然后让全中国人民就是说爹亲娘亲不如我这个党亲,都当我的奴隶,然后我到处造小人,造孩子,在全世界去,到人家国家去当人家三孙子去,我在这块奴役我中国人民都变成我的孙子和奴隶,这当然不是我想要的。 那什么是我想要的?是吧,我就要探索,我只要活着,我把共产党灭了,我这一辈子就不白活。我毁掉一个魔,比我建一个国的功劳和快乐要大得多。这是一个。第二,我宁可去当狗去,我都不当国王,因为国王全都是骑在人民的头上的。 那建一个什么?建一个心中的自我的王国,就是信仰的王国,信仰的王国就是什么?我要找到人为什么来到世界?人到底应该去什么地方?我现在我觉得我发自内心的时候,我认为我知道,我相信人是不生不灭的。因为我们活在一个伟大的时代,很早我就看到了网络文明,现在的生物文明,我就在这个楼的后面,就在背后这个楼,今天看到的川普大楼,就在这个楼的20楼,我住在这,1989年,在1998年到1999年,看到了人类上第一次的,克林顿时期和布什时期搞的人类的基因的排谱,我看到了股票塞雷拉(音)的上市,塞雷拉博士完成了人类的基因排谱,这是多大的事啊,对七哥是震撼的。 人类的基因谱排完以后,所有的DNA有多少个的DNA?有多少个谱,怎么形状?有多少个组基因?他把人类给整明白了,人类的染色体。然后我又看到了当年AOL电脑、谷歌、雅虎这些是网络时代的到来,就在这儿,就在这儿。那时候我在想,有一天我将带领了我的同族们创造一个新的文明的时代,那个时候又叫量子电脑,是未来的一个,这个目前看到一个终极的工具。然后最终会走向人与上帝沟通,就人与人的神之间沟通,就是生物电脑。 干细胞,你看干细胞就发明了多了不起,所以现在量子电脑上来以后,人的一切改变,而且就在两三年应用,这是七哥二十年三十年的梦想。今天我们站在这里讨论的时候,我特别的幸福,因为我们这些人会最早享受既有钱还有这能力,还有这个需要来享受量子电脑。创造一个数字化的货币的时代、金融的时代、网络的时代和找到人类更多,探索的快乐的时代。 #郭文贵 #新中国联邦 #问天塔 #干细胞 #量子电脑 #生物电脑

喜马拉雅日本勇者村

19,379 просмотров • 1 год назад

学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单😂 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。 说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。 这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。 还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。 Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。 真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。 大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ 而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈 这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。 当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。 它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。 我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。 最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。 想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了👇

AYi

63,694 просмотров • 4 месяцев назад

俺上电视啦! 聊聊 kimi-k3 这么猛为什么还要开源 上周有幸接受了深圳卫视-科创最前沿栏目的采访, 主要聊了聊 Kimi-K3 这次取得如此牛的成绩背后的意义. 以及SOTA级别的模型就这样开放权重了, 不怕别人抄吗? 在我来看是真不怕的, 想象一下一个武林高手, 把自己的秘籍写成书, 免费送. 那是不是就意味着这些武林秘籍不是谁都练的. 大模型的情况也是这样的, 虽然权重也开源了, 训练技术也开源了, 但是, 最重要的, 训练使用的数据和经验, 这个是没开源的. 举个最典型的例子, 现在个人拿到kimi-k3的模型权重, 然后自己租算力微调, 大概率是会把模型越调越拉跨的. 就是因为既没有优质的后训练数据, 也没有优秀的后训练能力. 而现在大模型训练的数据其实大部分都是AI合成的了. 护城河已经从“静态的代码和模型权重”转移到了“持续的进化能力和数据飞轮”了. 所以即使全面复刻了 kimi-k3 的技术架构, 但是没有高质量合成数据流和持续的后训练体系, 也是没有办法竞争的. 但是 kimi-k3 开源获得的收益却是事实存在的, 不但能获得超高的曝光, 而且还能提升自己的社区影响力, 并且还能收获社区的正向反馈. 开源出来的训练工具链, 社区优秀的工程师在使用中也会不断的帮助反馈和提升. 形成整个生态的进步. 得道者多助这个道理是不会变的. #kimik3 #深圳卫视 #科创最前沿

karminski-牙医

17,354 просмотров • 15 дней назад

“我们究竟是创造了一个工具还是一个生物?” Sam 在 "机器人之心 "小组讨论会上的发言。 Sam: 但我认为,这无疑是迄今为止人类经历的最重大的更新年份。可能这也是我们将会遭遇的最大变革,因为从现在开始,人们已经接受强大的人工智能将成为现实,并且还会有逐步的更新。就像是第一代 iPhone 面世的那年,以及随后每一代 iPhone 的更新,我们现在能够明显感受到这一代与去年那代的差异。所以,这确实是一个重要的时刻。 我感到欣慰的是,现在人们开始正确地把这些系统当作工具来看待。艺术家尤其如此,但其他人也是一样。 曾经,人们真正恐惧的是,我们究竟是创造了一个工具还是一个生物,这将意味着什么?现在,人们视这些系统为人类工具箱中的新工具,并且正在用它创造一些非常了不起的东西。 模型显然不知道你在说什么,因为这不在它的训练数据里,它也无法从训练数据中学习到这些信息。 这是完全可以预期的。你再问一遍。比如说,你提到“意识”这个概念,模型回答:“是的,我完全明白你的意思,但我之前从未听说过这个词。” 问: “这对我来说就像是一次更新。你认为人工智能会趋向于探索创造性智能和自主性吗?” Sam: 这个问题有多个答案。这取决于激励模型。这是人类的选择。 问: “这将是判断意识的一个很好的测试。因为如果它有自我表达的愿望,并且仅仅为了创作的乐趣而去创作,那不会是偶然的。这绝对有点像生物。” Sam: 这是生物化的。我认为在此之前还有很多步骤。 我们现在要回答问题吗?这真的很棒。

Lei.sea

14,132 просмотров • 2 лет назад

说个暴论,在AI时代最值钱的技能已经不是写代码了, 怎么把代码讲清楚将会变得越来越重要!怎么把代码讲清楚将会变得越来越重要! Anthropic Claude Code团队的Thariq 大神用不到两年时间,把自己的技术文章做到了稳定的百万浏览量。 他说,技术写作彻底改变了他的人生。 兄弟们你们可能不信,老哥的方法论简单到离谱,就四个字:先种后收。 先埋头做真实的工作,踩真实的坑,积累第一手的洞见, 然后把你学到的东西,变成别人能直接抄的经验。 就是说写文章不能为了写而写,得先有干货,再有输出。 他写爆文就靠两条铁则: 第一,能多简单就多简单,用复杂术语装逼,只能说明你自己都没搞懂。 第二,分享真正的秘密,因为人们不爱看正确的废话,只爱听别人不说的内部干货。 最狠的是,老哥在这场15分钟的线下workshop现场,直接写了一篇《HTML vs Markdown for agents》的长文。 发出去几个小时,就拿了26万浏览,用行动证明了他教的东西真的管用。 当然他也用Claude加速写作,但他反复强调:绝对不能让AI磨掉你的个人声音,因为这才是能持续输出爆款的 核心。 尽管很多人酸,说他能火只是因为他在Anthropic, 不可否认内部视角是天然的流量buff,但我觉得更重要的是, 他掌握了这个时代最稀缺的能力: 把复杂的技术,讲得让同行立刻能用。 AI会写代码,会做产品,会调模型,但它不会讲你的故事,不会分享你踩过的坑,不会有你独有的思考方式。 而写作,就是把你的个人经验,放大一万倍的杠杆。 更妙的是,写作本身会反过来逼你把产品和系统想得更清楚。 就像很多时候,你以为你懂了,但只有当你试着把它写下来的时候才发现自己其实并没有懂。 所以各位程序员兄弟们, 别再觉得技术写作是大佬的事。 从今天开始,把你每天踩的坑、学到的新东西,写成100字的笔记。 先播种,再收割,这个复利一旦滚起来,会比你想象的可怕得多。 如果中推里推荐一位标杆和大神,那一定是宝玉老师宝玉,从宝玉老师身上我学到的很重要的一点是,践行开源精神,你分享的越多,跟着你学习的人越多,respect!

AYi

39,366 просмотров • 3 месяцев назад

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

301,920 просмотров • 2 лет назад