Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

7月21日Moonshot最新回应视频:明确否认Kimi k3是模型蒸馏复刻。 我来简单总结4点Moonshot企业业务负责人黄震昕的回应: 1,否认蒸馏 明确表示K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。 2,老用户优先, 正在解决算力不足。 针对上线48小时被迫暂停C端新用户订阅,官方回应称是为优先保障存量付费老用户的使用体验底线,宁可放弃新增收入也要守住体验,目前正全速推进算力扩容。 3,自主架构 采用自主技术-Kimi Linear Tension 自研线性注意力机制,解决超长任务性能衰减,上下文窗口扩大10倍,训练成本仅同步扩大10倍。 4,坚持开源路线 明确开源与闭源并非对立,Kimi自K2起坚持的开源路线不会改变,核心底层技术与论文均对外公开,完整模型权重计划于2026年7月27日前发布。 我的看法: 对于中美来说大模型没有护城河, 两国都不缺相关的技术和人才, Kimi k3 没吹牛。 中国当下缺的是算力, 正在弥补中。

44,996 Aufrufe • vor 2 Monaten •via X (Twitter)

9 Kommentare

Profilbild von meta cat|🌊RIVER
meta cat|🌊RIVERvor 2 Monaten

不是废话嚒,难道还有人明确说自己是蒸馏的?

Profilbild von Michael Chao e/acc🇸🇬🇺🇲🇮🇱
Michael Chao e/acc🇸🇬🇺🇲🇮🇱vor 2 Monaten

基本事实和逻辑是:中国没有芯片,除了软件硬件数据偷鸡摸狗,走私盗窃,没有如何办法长远生存,跟deepshit没有两样!!!

Profilbild von 我们能走到对岸吗
我们能走到对岸吗vor 2 Monaten

k3明显不是,或者至少不只是靠蒸馏,等国模sota的那天吧,还蒸馏不了

Profilbild von 雷电芽衣
雷电芽衣vor 2 Monaten

谁tm 拿 fable5 来蒸馏啊,真就听的风就是雨了。

Profilbild von 香港老雷
香港老雷vor 2 Monaten

这个很简单,你把你的智能体稍微调教下,你让他说他是Doge,他都会说

Profilbild von Coinfuture
Coinfuturevor 2 Monaten

谁来鉴定真伪

Profilbild von 花伤情犹在
花伤情犹在vor 2 Monaten

算力不够就暂停新用户,这操作太真实了老哥

Profilbild von LWXWBLH
LWXWBLHvor 2 Monaten

但是,架构创新和蒸馏并不冲突。当然,强调性能跃升主要来源于架构也不算错。。。

Profilbild von Lightning麦昆
Lightning麦昆vor 2 Monaten

谁在说谎啊

Ähnliche Videos

我操!Kimi.ai 月之暗面这波是真的疯了! 2.8T 参数的 K3 直接全权重开源就算了, 连推理内核、MoE 通信库、Agent 训练环境整套底层技术栈全给你端出来,硬生生把开源模型的天花板,直接抬到了闭源旗舰的家门口。 不是放个权重就炒开源概念的挤牙膏操作,是从模型到底层能跑起来生态的所有东西全白给,1M 长上下文、MoE 架构性能够打闭源, 之前天天喊开源追不上闭源的直接被打半残, 开发者再也不用对着闭源 API 的限流、涨价受窝囊气。 搞大模型的不用从零搭底层通信框架, 做 Agent 的不用卡闭源接口的脖子, 小团队也能基于全栈直接做二次开发, 从今天起,全球开源 AI 的游戏规则,真的改了。 今天之后,开源和闭源的代差,从两年砍到了半年。 Kimi K3 今天正式全开源,不是挤牙膏的版本更新。 2.8T 总参数 MoE, 激活 104B, 原生 100 万上下文。 靠 KDA 新注意力和 AttnRes 架构创新,单位算力智能密度直接提 2.5 倍,长上下文解码速度翻 6 倍。 最狠的是,这根本不是只放个权重的假开源。 FlashKDA 高性能内核,MoE 通信库,连用来做 Agent 强化学习的快照式训练环境 AgentENV, 全给你开源了。 从推理到训练的整个底层栈,直接搬空。 之前所有开源模型,本质都是在追闭源一年多前的尾巴。 这是第一个真正摸到闭源顶尖门槛的开放模型。 长编码、Agent、终端操作这些硬核任务, 已经能和第一梯队闭源掰手腕。 你永远可以相信开放的力量!! 用K3搓了一个他自己开源的介绍视频,特此致敬🫡

AYi

265,686 Aufrufe • vor 1 Monat

俺上电视啦! 聊聊 kimi-k3 这么猛为什么还要开源 上周有幸接受了深圳卫视-科创最前沿栏目的采访, 主要聊了聊 Kimi-K3 这次取得如此牛的成绩背后的意义. 以及SOTA级别的模型就这样开放权重了, 不怕别人抄吗? 在我来看是真不怕的, 想象一下一个武林高手, 把自己的秘籍写成书, 免费送. 那是不是就意味着这些武林秘籍不是谁都练的. 大模型的情况也是这样的, 虽然权重也开源了, 训练技术也开源了, 但是, 最重要的, 训练使用的数据和经验, 这个是没开源的. 举个最典型的例子, 现在个人拿到kimi-k3的模型权重, 然后自己租算力微调, 大概率是会把模型越调越拉跨的. 就是因为既没有优质的后训练数据, 也没有优秀的后训练能力. 而现在大模型训练的数据其实大部分都是AI合成的了. 护城河已经从“静态的代码和模型权重”转移到了“持续的进化能力和数据飞轮”了. 所以即使全面复刻了 kimi-k3 的技术架构, 但是没有高质量合成数据流和持续的后训练体系, 也是没有办法竞争的. 但是 kimi-k3 开源获得的收益却是事实存在的, 不但能获得超高的曝光, 而且还能提升自己的社区影响力, 并且还能收获社区的正向反馈. 开源出来的训练工具链, 社区优秀的工程师在使用中也会不断的帮助反馈和提升. 形成整个生态的进步. 得道者多助这个道理是不会变的. #kimik3 #深圳卫视 #科创最前沿

karminski-牙医

17,354 Aufrufe • vor 1 Monat

Dario没有理由因为Kimi蒸馏Claude而生气。Anthropic自己刚刚才同意为盗版书籍训练模型一事,向相关作者支付总计15亿美元赔偿。平均下来,每一本被侵权的书大约赔偿3000美元。更有意思的是,Dario自己也承认,在百度工作的一年让他意识到,数据隐私并没有那么重要。当时他主要从事语音识别研究,而很多训练数据都是未经授权直接拿的。这段经历进一步强化了他对Scaling Law的信念。因此,自己干Anthropic之后,他们同样尽可能收集各种数据用于训练模型。 我认为,他真正气的并不是知识产权,而是这从根本上破坏了前沿AI实验室的商业模式。历史上,每一代最先进大模型的训练成本通常都会比上一代增长约4到10倍,甚至更多。例如,GPT-2的训练计算成本约为10万美元,而GPT-3已经达到约1000万美元,GPT-4的计算成本则约为1亿美元。这些数字还仅仅是算力成本,并没有包括研究人员薪酬、数据获取以及其他研发支出。因此,即使没有开源模型竞争,仅靠API收费模式,要获得正向投资回报也变得越来越困难,因为模型性能提升正在放缓,而训练成本却持续飙升。 如今,开源模型通过蒸馏技术,大约只需要6个月就能追赶到最先进闭源模型的水平。这意味着OpenAI、Anthropic等前沿实验室,实际上只有约半年的时间,依靠最新模型尽可能创造收入。半年之后,就会出现性能达到其90%,但成本只有10%的开源替代方案。 越来越多的美国企业也已经意识到,最顶尖模型带来的那一点性能优势,并不足以支撑其高昂的价格,因此开始转向成本更低的中国开源模型。就连Sam Altman的铁哥们儿Brian Chesky,公开说在Airbnb的部分AI开发中也采用了阿里的千问,而不是ChatGPT。

GeLun Ding

63,388 Aufrufe • vor 2 Monaten

中国最近掀起了一波‘技术超越’的叙事狂潮:“全球领先宇”树机器人,蔚来电动车,第六代战机到最新的Deepseek媲美美国的AI模型,一切看起来都在宣告中国已经掌握了科技竞争的制高点。但真相呢?这些‘突破’的底层逻辑,其实是对美国开源技术和模式的高效嫁接与加工。如何理解?这不仅是一场技术战争,而是一场文明赌局,谁能笑到最后? AI模型的算法框架、训练数据来自于合成,电动车的核心技术、甚至机器人背后的生产生态——几乎每一项‘创新’都离不开美国无偿贡献的技术基础。中国的强项在应用层面的二次创新,而非从零开始的技术革命。这就是为什么中国的技术看似崛起迅猛,但在本质上依然依附于全球技术体系的底层逻辑。 但我们必须看到,这场技术竞争背后隐藏着更深刻的真相:技术的冲突只是文明冲突的冰山一角。美国为何将中国视为最大的威胁?不仅因为制造能力或技术模仿力,更因为两者的文明逻辑完全对立。 现代文明为何只能在西方诞生?新教伦理、基督教文化塑造了自由、理性和创新的基石,而中国模式则依靠集体主义和实用主义的动员力快速崛起。这种模式能在效率上赢得一时,却无法回答一个关键问题:没有信仰和自由为根基的文明,如何承载人类的未来? 这不仅是一场技术战争,而是一场文明的赌局。一边是长期“平权觉醒”,忽视精英和进步,去工业化的自我阉割;一边是试图复辟帝国梦想,忽视人的价值,没有终端消费支持。谁会笑到最后?

Tigris | 会讲课教授是好老师

28,621 Aufrufe • vor 1 Jahr

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 Aufrufe • vor 2 Jahren

今年,AI机器人赛道真的是火得不行。 从家里用的扫地机器人到工业上的自动化设备,甚至现在都可以上台跳舞了,不得不说一句牛逼! 但是现在机器人和AI系统大多被少数几家大公司掌控,创新的步伐虽然快,却往往伴随着技术封闭性和使用限制。 OpenMind 却正在打破这种局限,提出了一个非常具有前瞻性的解决方案——开源的机器人操作系统。 这种做法不仅仅是技术上的创新,它从根本上重新定义了谁能控制机器人的智能,以及谁能参与到技术创新中去。 OpenMind的核心理念是开放和去中心化——这意味着不再是只有少数几家公司有能力和资源控制机器人的发展和应用。通过开源操作系统OM1,OpenMind赋予了全球开发者和创新者在机器人生态系统中发挥更大作用的机会。任何有创意、有技术的团队,都可以基于OM1平台构建自己的机器人应用,这种开放生态不仅能加速创新,还能促进更广泛的合作和资源共享。 最关键的是,OpenMind没有像传统公司那样将机器人生态系统封闭在一个小圈子里,而是推动它向全球开发者开放,鼓励他们参与并共同塑造机器人的未来。这不仅能避免技术的垄断,更能确保机器人系统的多样性和适应性——每个开发者、每个小团队都能贡献自己的智慧,推动机器人技术在各个行业中的应用。 这背后折射的是OpenMind对于去中心化理念的深刻理解和执行力。与传统企业垄断不同,这种去中心化的思维让更多的人和团队能通过开源平台参与进来,这也让机器人技术有了更多的可能性。 未来的机器人技术, OpenMind 无疑为其注入了一股新鲜的力量。在这场关于机器人智能的创新竞赛中,去中心化和开源将不仅仅是一个趋势,更是能让全球每个人都参与进来的机会。 #OpenMind

阿乐

61,205 Aufrufe • vor 8 Monaten