Loading video...

Video Failed to Load

Go Home

谁能想到,Kimi K3开源之后,第一个被“榨干”的不是英伟达GPU,而是一位Baseten工程师。 这位老哥连续研究48小时,喝掉40罐气泡水,把Kimi K3的模型代码和技术报告一层层拆开,最后算出一个让人头皮发麻的数字: 按参数量换算,一个2.8万亿参数的Kimi K3,大约等于把22580个2019年的GPT-2叠在一起。 但这根本不是简单的“堆料游戏”。 从GPT-2到线性注意力,再到DeltaNet、门控DeltaNet和Kimi自研的KDA,七年AI架构进化史,看起来特别像程序员接手祖传项目: 上一代记忆太占显存,下一代想办法压缩; 压缩后信息挤成一锅粥,再下一代学会删除; 删错了重要内容,只好继续加门控,决定什么该记、什么该忘。 技术大佬们表面上是在做“颠覆式创新”,翻开代码一看,底层逻辑往往只有四个字: 被迫救场。 七年过去,参数规模增长了22580倍,工程师的核心工作依然没变——修掉上一代留下的bug,再顺手给下一代留几个新的。 这就是开源最“残忍”,也最迷人的地方。 闭源公司把模型锁进保险柜,留给外界一个高深莫测的黑盒;开源第一天,全球最顶尖的一群程序员就像接手了一个没有文档的祖传项目,一边骂骂咧咧,一边把七年的技术路线拆得明明白白。 闭源拥有秘密。 开源拥有一群喝着气泡水、凌晨三点还不肯睡觉的技术狂魔。 后者,可能更可怕。 $MSFT $NVDA $GOOGL $AMD $AMZN #美股

84,639 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

我操!Kimi.ai 月之暗面这波是真的疯了! 2.8T 参数的 K3 直接全权重开源就算了, 连推理内核、MoE 通信库、Agent 训练环境整套底层技术栈全给你端出来,硬生生把开源模型的天花板,直接抬到了闭源旗舰的家门口。 不是放个权重就炒开源概念的挤牙膏操作,是从模型到底层能跑起来生态的所有东西全白给,1M 长上下文、MoE 架构性能够打闭源, 之前天天喊开源追不上闭源的直接被打半残, 开发者再也不用对着闭源 API 的限流、涨价受窝囊气。 搞大模型的不用从零搭底层通信框架, 做 Agent 的不用卡闭源接口的脖子, 小团队也能基于全栈直接做二次开发, 从今天起,全球开源 AI 的游戏规则,真的改了。 今天之后,开源和闭源的代差,从两年砍到了半年。 Kimi K3 今天正式全开源,不是挤牙膏的版本更新。 2.8T 总参数 MoE, 激活 104B, 原生 100 万上下文。 靠 KDA 新注意力和 AttnRes 架构创新,单位算力智能密度直接提 2.5 倍,长上下文解码速度翻 6 倍。 最狠的是,这根本不是只放个权重的假开源。 FlashKDA 高性能内核,MoE 通信库,连用来做 Agent 强化学习的快照式训练环境 AgentENV, 全给你开源了。 从推理到训练的整个底层栈,直接搬空。 之前所有开源模型,本质都是在追闭源一年多前的尾巴。 这是第一个真正摸到闭源顶尖门槛的开放模型。 长编码、Agent、终端操作这些硬核任务, 已经能和第一梯队闭源掰手腕。 你永远可以相信开放的力量!! 用K3搓了一个他自己开源的介绍视频,特此致敬🫡

AYi

265,061 views • 1 month ago

这哥们儿的经历,比电影还离谱。 他之前在Jane Street带过一个量化团队,整整干了11年。结果去年4月,就因为一个季度业绩没达标,年薪41.2万美金的工作,说没就没了,一周内打包走人。 结果昨晚,他用一个免费下载的中国开源AI,在Polymarket上一天搞了91万7千多美金。 用的是 Kimi K3,2.8万亿参数,百万token级别的记忆力。 他就租了一台GPU服务器,跑了个agent循环。 链上钱包在这儿: 说起来挺讽刺的。他在Jane Street那十一年,学到的最值钱的东西,不是怎么用更贵的模型,而是怎么让系统跑得更快、更直接。 Moonshot这周刚把Kimi K3的开源权重放出来,他一眼就认出来了——这就是他等了快一年的东西。一个能长时间自己跑、还能自己改代码的agent。 他从春天就开始搭这个bot,一直缺的就是一个能把"整个世界塞进脑子里"的模型。 K3的百万token记忆,一口吞掉了他全部的交易日志、一整年的5分钟BTC K线、所有历史回测数据——什么都不用删,不用裁剪。 而且快得吓人:Kimi的Delta Attention让百万token推理速度提升了6.3倍,循环周期从原来的1分钟直接压到几秒。 它自己交易,自己看结果,自己改规则,接着跑。 第一个晚上就干完了917个循环。 这事儿最讽刺的地方在于,那些对冲基金砸了几个亿美金搭起来的私有模型,还在等风控委员会慢慢审批呢,一个被裁掉的quant,靠一台租来的GPU和一个免费开源模型,已经跑完917轮迭代了。 他不是在智商上碾压Jane Street——他是在速度上,彻彻底底地把他们甩开了。 K3上线才一天,这已经是第一个真实的暴富故事了。而且,这还只是开始。#Polymarket

Gazi

93,021 views • 10 days ago

他曾在 Jane Street 带了一个量化团队,整整 11 年。去年 4 月,公司把他裁掉了——一个季度的业绩没达标,年薪 41.2 万美元的工作,一周之内就没了。 昨晚,他用一个免费下载的中国开源 AI,在 Polymarket 上一天赚了 917,893 美元。 Kimi K3,2.8 万亿参数,百万 token 记忆。他只租了一个 GPU 集群,跑了一个 agent loop。 链上钱包在这儿: 说起来,他在 Jane Street 那十一年,学会的不是怎么用更贵的模型,而是怎么让交易系统更快、更直接。Moonshot 这周刚把 Kimi K3 的开源权重放出来,他一看就知道,这就是他等了大半年的东西——一个能长时间自主运行、还能自己改代码的 agent。 他从春天就开始搭 bot,缺的只是一款能把“整个世界塞进脑袋”的模型。K3 的百万 token 记忆,一次吃掉了他的全部交易日志、一整年的 5 分钟 BTC K 线、所有历史回测数据——什么都不用裁剪。而且它快得离谱:Kimi Delta Attention 让百万 token 推理速度提升了 6.3 倍,循环周期从原来的 1 分钟压缩到几秒。 它交易,观察结果,自己改规则,继续跑。第一晚就完成了 917 个循环。 这故事最讽刺的地方在于,那些对冲基金花了数亿美元搭起来的私有模型,还在等风控委员会审批的时候,一个被裁掉的 quant,用一台租来的 GPU 和一个开源模型,已经跑完了 917 轮迭代。他没有在智商上碾压 Jane Street——他只是在速度上,彻彻底底地把他们甩开了。 K3 上线才一天,这已经是第一个真实暴富故事了。而且,这只是个开始。

Medv

12,997 views • 1 month ago

学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单😂 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。 说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。 这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。 还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。 Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。 真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。 大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ 而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈 这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。 当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。 它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。 我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。 最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。 想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了👇

AYi

63,896 views • 4 months ago

印度正在干一件大事。 一件很安静,但可能影响深远的事。 他们在从零开始,构建一个梵语大语言模型。 梵语,是世界上最古老的结构化语言。 这个项目,不是简单的翻译工具。 更不是把古籍扫描数字化就完事了。 他们要让AI真正“学会”梵语,用梵语的逻辑去思考。 牵头的是一家有118年历史的梵语学院,和印度顶尖的理工学院IIT马德拉斯分校。 学者和数据科学家坐到了一起。 第一步,也是最难的一步,建立语料库。 他们收集了超过11万份梵文文本。 包括经文、孤本、还有数千份手稿。 为了处理这些古老的手稿,团队自己开发了专有软件。 结果惊人。 24小时内数字化了超过1000本梵语书籍。 每页只有三到四个错误,准确率接近97%。 梵语的语法结构极其复杂和精确。 比如“Sandhi”这种连音变化规则,还有复杂的词形变化,对AI的挑战远超英语。 解决这些难题,需要全新的算法和模型。 这暴露了一个关键问题。 当下的AI模型,本质上是基于英语世界的逻辑和数据结构建立的。 而印度这个项目,试图用一种完全不同的文明底层逻辑来训练AI。 这不仅仅是技术问题。 这关乎一个文明的记忆,能否在机器时代被完整保留,甚至被激活。 当全球科技巨头都在追求更大规模的模型、更快的算力时,印度选择了一条不同的路。 深度优先,而非规模。 结构优先,而非噪音。 意义优先,而非模仿。 这引出了一个更深层的问题。 AI的未来,是否也依赖于人类最古老的智慧? 如果这个实验成功,梵语将不再仅仅是被“保存”的遗产。 它将成为一种可计算的,具备严谨逻辑推理能力的工具。 这是一个国家在尝试用自己的文化之根,去定义自己的科技未来。 而不是被动地接受硅谷制定的标准和游戏规则。 这种对自己文明的自信和投入,值得深思。 当一个国家开始系统性地将自己的古典智慧与最前沿的科技结合,它的目标可能远不止是开发一个AI模型那么简单。

墓碑科技

22,272 views • 7 months ago

俺上电视啦! 聊聊 kimi-k3 这么猛为什么还要开源 上周有幸接受了深圳卫视-科创最前沿栏目的采访, 主要聊了聊 Kimi-K3 这次取得如此牛的成绩背后的意义. 以及SOTA级别的模型就这样开放权重了, 不怕别人抄吗? 在我来看是真不怕的, 想象一下一个武林高手, 把自己的秘籍写成书, 免费送. 那是不是就意味着这些武林秘籍不是谁都练的. 大模型的情况也是这样的, 虽然权重也开源了, 训练技术也开源了, 但是, 最重要的, 训练使用的数据和经验, 这个是没开源的. 举个最典型的例子, 现在个人拿到kimi-k3的模型权重, 然后自己租算力微调, 大概率是会把模型越调越拉跨的. 就是因为既没有优质的后训练数据, 也没有优秀的后训练能力. 而现在大模型训练的数据其实大部分都是AI合成的了. 护城河已经从“静态的代码和模型权重”转移到了“持续的进化能力和数据飞轮”了. 所以即使全面复刻了 kimi-k3 的技术架构, 但是没有高质量合成数据流和持续的后训练体系, 也是没有办法竞争的. 但是 kimi-k3 开源获得的收益却是事实存在的, 不但能获得超高的曝光, 而且还能提升自己的社区影响力, 并且还能收获社区的正向反馈. 开源出来的训练工具链, 社区优秀的工程师在使用中也会不断的帮助反馈和提升. 形成整个生态的进步. 得道者多助这个道理是不会变的. #kimik3 #深圳卫视 #科创最前沿

karminski-牙医

17,354 views • 26 days ago

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 views • 4 months ago

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,309 views • 9 months ago

Uber 在一个季度内,把全年的 AI 预算烧光了。但这钱没白花,换来了反常识的结果。CEO Dara 发现,自家的工程师用上 AI 后效率暴增,产出简直像"超人"一样。于是 Uber 做了一个极其现实的决定:既然现有人手这么能干,那就不招新人了。他们开始严格控制增员节奏,用高昂的算力成本,直接锁死了未来的人力扩张。而且这场改造根本不局限于写代码。从工程开发、找 bug、平台迁移,一直到法务和营销团队,AI 已经钻进了 Uber 的每一根毛细血管。Dara 给团队下了死命令:自下而上,用 AI 把系统和流程彻底重构一遍。就算第一步只是让 AI 提升个两三成的效率,那也是赚的。最聪明的还是他们在成本上的算计。搞探索和研发时,闭着眼睛用最贵的 OpenAI 和 Claude,因为前沿模型确实聪明,适合试错。但只要某个场景跑通了、要大规模铺开,他们会立刻切回按 token 算更便宜的模型,或者是开源模型。为什么这么抠细节?因为 Uber 一年哪怕跑出远超 100 亿次的行程,手握 100 多亿自由现金流,本质上依然是个低毛利的苦生意。他们只能靠榨干内部的每一滴效率,来换取终端降价的空间。这就是现在顶尖科技公司的真实玩法。没有空喊口号,算力直接替代人力,用最贵的工具探路,用最省的方案落地。一场冷酷又高效的生产力洗牌,已经在看不见的地方完成了。

墓碑科技

53,243 views • 2 months ago