Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

7月21日Moonshot最新回应视频:明确否认Kimi k3是模型蒸馏复刻。 我来简单总结4点Moonshot企业业务负责人黄震昕的回应: 1,否认蒸馏 明确表示K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。 2,老用户优先, 正在解决算力不足。 针对上线48小时被迫暂停C端新用户订阅,官方回应称是为优先保障存量付费老用户的使用体验底线,宁可放弃新增收入也要守住体验,目前正全速推进算力扩容。 3,自主架构 采用自主技术-Kimi Linear Tension 自研线性注意力机制,解决超长任务性能衰减,上下文窗口扩大10倍,训练成本仅同步扩大10倍。 4,坚持开源路线 明确开源与闭源并非对立,Kimi自K2起坚持的开源路线不会改变,核心底层技术与论文均对外公开,完整模型权重计划于2026年7月27日前发布。 我的看法: 对于中美来说大模型没有护城河, 两国都不缺相关的技术和人才, Kimi k3 没吹牛。 中国当下缺的是算力, 正在弥补中。

44,623 görüntüleme • 19 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

我操!Kimi.ai 月之暗面这波是真的疯了! 2.8T 参数的 K3 直接全权重开源就算了, 连推理内核、MoE 通信库、Agent 训练环境整套底层技术栈全给你端出来,硬生生把开源模型的天花板,直接抬到了闭源旗舰的家门口。 不是放个权重就炒开源概念的挤牙膏操作,是从模型到底层能跑起来生态的所有东西全白给,1M 长上下文、MoE 架构性能够打闭源, 之前天天喊开源追不上闭源的直接被打半残, 开发者再也不用对着闭源 API 的限流、涨价受窝囊气。 搞大模型的不用从零搭底层通信框架, 做 Agent 的不用卡闭源接口的脖子, 小团队也能基于全栈直接做二次开发, 从今天起,全球开源 AI 的游戏规则,真的改了。 今天之后,开源和闭源的代差,从两年砍到了半年。 Kimi K3 今天正式全开源,不是挤牙膏的版本更新。 2.8T 总参数 MoE, 激活 104B, 原生 100 万上下文。 靠 KDA 新注意力和 AttnRes 架构创新,单位算力智能密度直接提 2.5 倍,长上下文解码速度翻 6 倍。 最狠的是,这根本不是只放个权重的假开源。 FlashKDA 高性能内核,MoE 通信库,连用来做 Agent 强化学习的快照式训练环境 AgentENV, 全给你开源了。 从推理到训练的整个底层栈,直接搬空。 之前所有开源模型,本质都是在追闭源一年多前的尾巴。 这是第一个真正摸到闭源顶尖门槛的开放模型。 长编码、Agent、终端操作这些硬核任务, 已经能和第一梯队闭源掰手腕。 你永远可以相信开放的力量!! 用K3搓了一个他自己开源的介绍视频,特此致敬🫡

AYi

263,479 görüntüleme • 14 gün önce

俺上电视啦! 聊聊 kimi-k3 这么猛为什么还要开源 上周有幸接受了深圳卫视-科创最前沿栏目的采访, 主要聊了聊 Kimi-K3 这次取得如此牛的成绩背后的意义. 以及SOTA级别的模型就这样开放权重了, 不怕别人抄吗? 在我来看是真不怕的, 想象一下一个武林高手, 把自己的秘籍写成书, 免费送. 那是不是就意味着这些武林秘籍不是谁都练的. 大模型的情况也是这样的, 虽然权重也开源了, 训练技术也开源了, 但是, 最重要的, 训练使用的数据和经验, 这个是没开源的. 举个最典型的例子, 现在个人拿到kimi-k3的模型权重, 然后自己租算力微调, 大概率是会把模型越调越拉跨的. 就是因为既没有优质的后训练数据, 也没有优秀的后训练能力. 而现在大模型训练的数据其实大部分都是AI合成的了. 护城河已经从“静态的代码和模型权重”转移到了“持续的进化能力和数据飞轮”了. 所以即使全面复刻了 kimi-k3 的技术架构, 但是没有高质量合成数据流和持续的后训练体系, 也是没有办法竞争的. 但是 kimi-k3 开源获得的收益却是事实存在的, 不但能获得超高的曝光, 而且还能提升自己的社区影响力, 并且还能收获社区的正向反馈. 开源出来的训练工具链, 社区优秀的工程师在使用中也会不断的帮助反馈和提升. 形成整个生态的进步. 得道者多助这个道理是不会变的. #kimik3 #深圳卫视 #科创最前沿

karminski-牙医

16,492 görüntüleme • 6 gün önce

Dario没有理由因为Kimi蒸馏Claude而生气。Anthropic自己刚刚才同意为盗版书籍训练模型一事,向相关作者支付总计15亿美元赔偿。平均下来,每一本被侵权的书大约赔偿3000美元。更有意思的是,Dario自己也承认,在百度工作的一年让他意识到,数据隐私并没有那么重要。当时他主要从事语音识别研究,而很多训练数据都是未经授权直接拿的。这段经历进一步强化了他对Scaling Law的信念。因此,自己干Anthropic之后,他们同样尽可能收集各种数据用于训练模型。 我认为,他真正气的并不是知识产权,而是这从根本上破坏了前沿AI实验室的商业模式。历史上,每一代最先进大模型的训练成本通常都会比上一代增长约4到10倍,甚至更多。例如,GPT-2的训练计算成本约为10万美元,而GPT-3已经达到约1000万美元,GPT-4的计算成本则约为1亿美元。这些数字还仅仅是算力成本,并没有包括研究人员薪酬、数据获取以及其他研发支出。因此,即使没有开源模型竞争,仅靠API收费模式,要获得正向投资回报也变得越来越困难,因为模型性能提升正在放缓,而训练成本却持续飙升。 如今,开源模型通过蒸馏技术,大约只需要6个月就能追赶到最先进闭源模型的水平。这意味着OpenAI、Anthropic等前沿实验室,实际上只有约半年的时间,依靠最新模型尽可能创造收入。半年之后,就会出现性能达到其90%,但成本只有10%的开源替代方案。 越来越多的美国企业也已经意识到,最顶尖模型带来的那一点性能优势,并不足以支撑其高昂的价格,因此开始转向成本更低的中国开源模型。就连Sam Altman的铁哥们儿Brian Chesky,公开说在Airbnb的部分AI开发中也采用了阿里的千问,而不是ChatGPT。

GeLun Ding

63,179 görüntüleme • 19 gün önce

中国最近掀起了一波‘技术超越’的叙事狂潮:“全球领先宇”树机器人,蔚来电动车,第六代战机到最新的Deepseek媲美美国的AI模型,一切看起来都在宣告中国已经掌握了科技竞争的制高点。但真相呢?这些‘突破’的底层逻辑,其实是对美国开源技术和模式的高效嫁接与加工。如何理解?这不仅是一场技术战争,而是一场文明赌局,谁能笑到最后? AI模型的算法框架、训练数据来自于合成,电动车的核心技术、甚至机器人背后的生产生态——几乎每一项‘创新’都离不开美国无偿贡献的技术基础。中国的强项在应用层面的二次创新,而非从零开始的技术革命。这就是为什么中国的技术看似崛起迅猛,但在本质上依然依附于全球技术体系的底层逻辑。 但我们必须看到,这场技术竞争背后隐藏着更深刻的真相:技术的冲突只是文明冲突的冰山一角。美国为何将中国视为最大的威胁?不仅因为制造能力或技术模仿力,更因为两者的文明逻辑完全对立。 现代文明为何只能在西方诞生?新教伦理、基督教文化塑造了自由、理性和创新的基石,而中国模式则依靠集体主义和实用主义的动员力快速崛起。这种模式能在效率上赢得一时,却无法回答一个关键问题:没有信仰和自由为根基的文明,如何承载人类的未来? 这不仅是一场技术战争,而是一场文明的赌局。一边是长期“平权觉醒”,忽视精英和进步,去工业化的自我阉割;一边是试图复辟帝国梦想,忽视人的价值,没有终端消费支持。谁会笑到最后?

Tigris 会讲课教授是好老师

28,609 görüntüleme • 1 yıl önce

梁文锋深度采访(一) 主持人:为什么DeepSeek会让硅谷的很多人惊讶? 梁文锋:在美国每天发生的大量创新里,这是非常普通的一个,他们之所以惊讶是因为这是一个中国公司,在以创新贡献者的身份加入到他们游戏里去。毕竟大部分中国公司习惯follow,而不是创新。 主持人:但这种选择放在中国语境里也过于奢侈了,大模型是一个重投入游戏,不是所有公司都有资本只去研究创新,而不是先考虑商业化。 梁文锋:创新的成本肯定不低,过去那种拿来主义的惯性也和过去的国情有关,但现在你看无论中国的经济体量,还是字节腾讯这些大厂的利润,放在全球都不低。我们创新缺的肯定不是资本,而是缺乏信心,以及不知道怎么组织高密度的人才实现有效的创新。 主持人:为什么中国公司,包括不缺钱的大厂,这么容易把快速商业化当第一要义? 梁文锋:过去30年我们都只强调赚钱,对创新是忽视的,创新不完全是商业驱动的,还需要好奇心和创造欲。我们只是被过去那种惯性束缚了,但它也是阶段性的。 主持人:但你们究竟是一个商业组织,而非一个公益科研机构,选择创新又通过开源分享出去,那要在哪里形成护城河? 梁文锋:在颠覆性的技术面前,闭源形成的护城河是短暂的,即使OpenAI闭源也无法阻止被别人赶超,所以我们把价值沉淀在团队上。我们的同事在这个过程中得到成长,积累很多know-how,形成可以创新的组织和文化,就是我们的护城河。开源、发论文其实并没有失去什么,对于技术人员来说,被follow是很有成就感的事。其实开源更像一个文化行为,而非商业行为,给予其实是一种额外的荣誉。一个公司这么做也会有文化的吸引力。 主持人:你怎么看类似朱啸虎的这种市场信仰派观点? 梁文锋:朱啸虎是质朴的,但他的打法更适合快速赚钱的公司。你看美国最赚钱的公司都是厚积薄发的高科技公司。 主持人:但做大模型,单纯的技术领先也很难形成绝对优势,你们赌的那个更大的东西是什么? 梁文锋:我们看到的是中国AI Scene可能永远处在跟随的位置。我们经常说中国AI和美国有一两年差距,但真实的Gap是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的,因为达到领先不只是一个公司的努力,而是整个西方技术社区和产业共同努力的结果。他们能看到下一代的技术趋势,手里有路线图,中国AI的发展同样需要这样的生态。很多国产芯片发展不起来也是因为缺乏配套的技术社区,只有二手消息,所以中国必然需要有人站到技术的前沿。 主持人:海外认为DeepSeek雇佣了一批高深莫测的奇才,那做出DeepSeek的是怎样一群人? 梁文锋:并没有什么高深莫测的奇才,都是一些top高校的应届毕业生,没毕业的博士博五实习生,还有一些毕业才几年的年轻人。 主持人:很多大模型公司都执着地区海外挖人,很多人觉得这个领域前50名的顶尖人才可能都不在中国公司,你们的人才都来自哪里? 梁文锋:不要模型,没有海外回来的人,都是本土的前50名顶尖人才可能不在中国,但也许我们能自己打造这样的人。 主持人:听说你们很擅长从细节招人,AI让一些非传统评价指标里优秀的人被选出来。 梁文锋:我们选人的标准一直都是热爱和好奇心,所以很多人会有一些奇特的经历,很有意思。很多人对做研究的渴望远超对钱的在意。 主持人:这种发散性敏感的人才和你们完全创新型组织的架构很有关系,但AGI这种充满不确定性的前沿探索,是否多了管理动作?DeepSeek也全是自下而上? 梁文锋:而且我们一般不强制分工,而是自然分工,每个人有自己独特的成长经历,都是自带想法的,不需要push他,探索过程中他遇到问题自己就会拉人讨论,不过当一个idea显示出潜力,我们也会自上而下去调配资源。 主持人:创新很大程度也是一种偶然吗? 梁文锋:我觉得创新首先是一个信念问题,为什么硅谷那么有创新精神,首先是敢。ChatGPT出来时,整个国内对做前沿创新都缺乏信心,从投资人到大厂都觉得差距太大了,还是做应用吧。但创新首先需要自信,这种信心通常在年轻人身上更明显。 主持人:大部分中国公司都选择既要模型又要应用,为什么DeepSeek目前选择只做研究探索? 梁文锋:因为我们觉得现在最重要的是参与到全球创新的浪潮里去,过去很多年中国公司习惯了别人做技术创新,我们拿过来做应用变现。但这并非是一种理所当然,这波浪潮里,我们的出发点就不是趁机赚一笔,而是走到技术的前沿去推动整个生态发展。 主持人:你觉得创新很大程度也是一种偶然吗? 梁文锋:我觉得创新首先是一个信念问题,为什么硅谷那么有创新精神,首先是敢。ChatGPT出来时,整个国内对做前沿创新都缺乏信心,从投资人到大厂都觉得差距太大了,还是做应用吧。但创新首先需要自信,这种信心通常在年轻人身上更明显。 主持人:现在经济开始进入下行,资本也进入轮周期,所以它对原始创新是否会带来更多抑制? 梁文锋:我倒觉得未必,中国产业结构的调整会更依赖硬核技术的创新。当很多人发现过去赚快钱很可能来自时代运气,就会更愿意俯身去做真正的创新。 主持人:技术真的可以拉开差距吗?你也说过并不存在绝对的技术秘密。 梁文锋:技术没有秘密,但复制需要时间和成本。英伟达的显卡理论上没有任何技术秘密,很容易复制。但重新组织团队以及追赶下一代技术都需要时间,所以实际的护城河还是很宽。 主持人:互联网和移动互联网时代留给大部分人的惯性认知是,美国擅长搞技术创新,中国更擅长做应用。 梁文锋:我们认为随着经济发展,中国也要逐步成为贡献者,而不是一直搭便车。过去30多年IT浪潮里,我们基本没有参与到真正的技术创新里,我们已经习惯摩尔定律从天而降。躺在家里18个月就会出来更好的硬件和软件,但其实这是西方主导的技术社区一代代孜孜不倦创造出来的。只因为之前我们没有参与这个过程,以至于忽视了它的存在。 主持人:你对国内原始创新也是乐观的吗? 梁文锋:我是80年代在广东一个五线城市长大的,我的父亲是小学老师。90年代广东赚钱机会很多,当时有不少家长到我家来,基本就是家长觉得读书没用,但现在回去看,观念都变了,因为钱不好赚了,连开出租车的机会可能都没了。一代人的时间就变了,以后硬核创新会越来越多,现在可能还 不容易被理解是因为整个社会群体需要被事实教育。当这个社会让硬核创新的人功成名就,群体性想法就会改变。我们只是还需要一堆事实和一个过程。

宝玉

87,901 görüntüleme • 1 yıl önce

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 görüntüleme • 2 yıl önce

今年,AI机器人赛道真的是火得不行。 从家里用的扫地机器人到工业上的自动化设备,甚至现在都可以上台跳舞了,不得不说一句牛逼! 但是现在机器人和AI系统大多被少数几家大公司掌控,创新的步伐虽然快,却往往伴随着技术封闭性和使用限制。 OpenMind 却正在打破这种局限,提出了一个非常具有前瞻性的解决方案——开源的机器人操作系统。 这种做法不仅仅是技术上的创新,它从根本上重新定义了谁能控制机器人的智能,以及谁能参与到技术创新中去。 OpenMind的核心理念是开放和去中心化——这意味着不再是只有少数几家公司有能力和资源控制机器人的发展和应用。通过开源操作系统OM1,OpenMind赋予了全球开发者和创新者在机器人生态系统中发挥更大作用的机会。任何有创意、有技术的团队,都可以基于OM1平台构建自己的机器人应用,这种开放生态不仅能加速创新,还能促进更广泛的合作和资源共享。 最关键的是,OpenMind没有像传统公司那样将机器人生态系统封闭在一个小圈子里,而是推动它向全球开发者开放,鼓励他们参与并共同塑造机器人的未来。这不仅能避免技术的垄断,更能确保机器人系统的多样性和适应性——每个开发者、每个小团队都能贡献自己的智慧,推动机器人技术在各个行业中的应用。 这背后折射的是OpenMind对于去中心化理念的深刻理解和执行力。与传统企业垄断不同,这种去中心化的思维让更多的人和团队能通过开源平台参与进来,这也让机器人技术有了更多的可能性。 未来的机器人技术, OpenMind 无疑为其注入了一股新鲜的力量。在这场关于机器人智能的创新竞赛中,去中心化和开源将不仅仅是一个趋势,更是能让全球每个人都参与进来的机会。 #OpenMind

阿乐

60,904 görüntüleme • 6 ay önce

白宫加密政策主管David Sacks: 四年内AI 大模型能力将增长一百万倍 ! “我认为目前至少在三个关键维度上,进步的速度都是指数级的。” “首先是算法本身。模型每年提升的速度大概是 3-4 倍。” “它们不仅仅是在速度和性能上更快更好,而且将从量变到质变。” “接着是推理模型。” “我们甚至还没有真正进入智能代理时代,但这将是继推理模型之后的下一个重大飞跃。” “在这个领域,我们才刚刚开始(推理算力增加带来的能力增加也将是倍数增长)。” “接下来是芯片。” “根据多种衡量标准,每一代芯片的性能可能比上一代提高 3-4 倍。” “不只是单个芯片在不断进步,他们还在研究如何将这些芯片联网在一起。” “就像 NVL72 系统,它类似于一个机架系统,可以在数据中心级别大幅提升性能。” “计算能力是第三个你会看到基本上呈指数级进步的领域。” “只需要看看数据中心中部署的 GPU 数量。” “当马斯克最初开始训练 Grok 时,我认为他们大概有 10 万块 GPU。现在已经有 30 万块 GPU,而且正朝着百万块 GPU的目标迈进。OpenAI 的数据中心 Stargate 也是同样的情况。” “在接下来的几年中,他们可能会发展到 500 万、1000 万块 GPU。” 1,000,000 倍的增长是怎么得出的: “算法、芯片和数据中心的扩展和改进速度都是每年 3-4 倍。” “也就是说,每两年进步 10 倍。” “很多人没有理解指数级进步的含义:如果每两年提升 10 倍,并不意味着四年后你只是提升 20 倍。” “这实际上意味着提升 100 倍。” “把这些因素相乘:算法、芯片,以及可用于 AI 的原始计算能力。” 100 倍模型 🧠 × 100 倍芯片 💾 × 100 倍计算能力 ⚡️ = 1,000,000 倍的 AI 大模型🤖 “你所谈论的就是 1,000,000 倍的能力增长。” “但这种变革的影响将是绝对巨大的。” “我觉得人们还没有充分认识到这一点,因为他们不了解指数级进步的意义。”

夜谈

25,895 görüntüleme • 1 yıl önce