Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

卧槽,我好像终于看懂,后训练到底训练了什么。 把Ling基模和后训练的金融 Fin 版左右同时跑了一遍。 最后出了个很离谱的结果: 同一个底座,经过后训练,居然表现出两种思考模式和工作习惯 1/n 👇

29,204 Aufrufe • vor 1 Tag •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。

实践哥 Li

59,029 Aufrufe • vor 7 Tagen

千万别拿我和张雪峰这个大傻逼作对比。 网友:我想学AI相关的专业,我对AI很感兴趣,请问我应该选计算机还是数学? 我:你一定要选计算机,先把python和数据结构基础打好, 然后从deep learning这门课开始学,可以在家配置一个nvidia GPU的笔记本或者台式机,或者用google colab,先从最简单的 CNN 开始训练,找一个dataset,自己安装好pytorch和cuda、cudnn,抄一个经典CNN model,训练你的第一个神经网络, 然后可以学习transformer,学习encoder only的BERT,学习decoder only的GPT模型,从minGPT开始,训练你的最小版本的GPT模型, 如果你对训练模型感兴趣,可以读个PhD,如果你的inference感兴趣,可以多花点时间看cuda,简单学习一下nvidia tensor core architecture,可以了解GPT后续的模型的架构, 如果你对inference感兴趣,你也可以直接看vllm的架构,读里面的代码,理解vllm是如何load一个用pytorch训练好的LLM模型, 如果你对AI Agent感兴趣,可以从ReAct Agent开始看,然后看SWE Agent,知道一个Agent是如何抽象出来的,如何调用function call,如何自己做reasoning,如何把一个软件开发的任务用agentical的方式拆分和执行的, 然后你可以看codex的架构,看看codex是如何设计memory、auto compact、multi agent、background task这些现代coding Agent功能的。 张雪峰(下面视频中可以找到原话): 孩子,你一定要学数学,数学学好了可以转互联网、AI、科技、半导体、金融所有专业,数学是一切专业之母,所有专业的老祖宗! 孩子,deepseek就是一群纯数学博士造出来的,这些人天天研究数学,就把deepseek造出来了! 孩子,AI本质就是数学建模,就是一个个自变量,你只有研究数学,一直读到数学博士,才能把这些数学建模研究明白,计算机毕业生是永远研究不明白AI的! 我的结论是,鼓吹“数学万能论”、“数学是一切专业的老祖宗”、“只有数学博士才能研究AI”的张雪峰和他们的粉丝,都是彻彻底底的大傻逼。

lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)

269,071 Aufrufe • vor 5 Monaten

OpenAI 创始人 John Schulman 访谈节选:为什么 GPT-4 比一年前更“聪明”了?主要都是后训练(Post-Training)带来的! 另外他认为,在强化学习研究领域,研究人员需要具备丰富的经验和敏锐的直觉。了解整个技术堆栈,并对各个部分充满好奇心是关键。此外,从第一性原理出发思考问题,而不仅仅依靠实验证据,也能够帮助研究人员在数据操控和环境设置方面做出更好的决策。 *** Dwarkesh Patel:在未来,用于训练的计算力中,预训练与后训练的比例是否会明显偏向后训练呢? John Schulman:确实,有一些观点支持这种说法。 Dwarkesh Patel:我是说,现在这个比例非常不平衡。 John Schulman:但你可以认为,模型生成的输出质量比网上的大多数内容都要高。因此,让模型自己思考似乎更有道理,而不仅仅是训练来模仿网络上的内容。所以,我认为从第一性原理上来说,这是有说服力的。我会说,我们通过后训练取得了很多进步。因此,我不确定。所以,我希望我们会继续推动这种方法,并且可能会增加投入到后训练中的计算力。 Dwarkesh Patel:当前的 GPT-4 的 ELO 分数比最初发布的版本高出了大约 100 分。这是否全都是后训练带来的改进呢? John Schulman:对,我会说大部分都是后训练带来的。 Dwarkesh Patel:这很有意思。 John Schulman:因此,有很多不同的改进方向。我们会考虑数据质量,数据数量,进行更多的部署和收集新数据的迭代,改变你收集的注解种类。因此,有很多因素叠加在一起。但是全部加在一起,就会带来一个相当不错的,有效的计算力提升。 Dwarkesh Patel:后训练的优化程度对于竞争优势有多大影响呢? John Schulman:目前,我会区别公司是通过我们的模型有多大等等。那么,找出你之前提到的所有这些数据的复杂问题的公司,会占据大优势吗? John Schulman:我认为这确实是一个优势,因为这是一个非常复杂的任务。因此,你必须有很多有技能的人来执行它。因此,存在大量的隐性知识。同时也需要大量的组织知识。我认为后训练的过程,创建一个具备人们所关心的所有功能的模型,是十分复杂的。这需要付出大量的努力,它是大量研发工作的积累。我会说这种情况在某种程度上形成了一种壁垒,要想立即启动这种模型并非易事。 Dwarkesh Patel:看起来那些正在进行最严肃的预训练努力的公司,也在进行严肃的后训练努力。因此,看起来这种模型有可能被复制或有更多的类似努力出现。 John Schulman:另外,还有一种情况使得这个壁垒并非那么明显,那就是你可以提取模型,或者复制别人的模型输出,或者使用别人的模型进行比较。我认为大公司可能并不会这样做,因为这违反了服务条款,也会损害他们的自尊心,但我预计一些规模较小的参与者可能正在这样做以便更好地起步。 Dwarkesh Patel:那些真正擅长进行这种强化学习(RL)研究的人有什么样的特质呢?我听说这种研究非常具有挑战性,但是什么样的直觉能帮助你找到操控数据和设置环境的方法呢? John Schulman:我觉得有相当多的经验是关键。自从研究生时期以来,我一直在研究 RL 算法,涉及到数据收集、到注释过程,再到与语言模型的交互。所以,我算是涉猎了这些领域。我认为,在这类研究中表现出色的人通常对整个技术堆栈有全面的了解,并且对其中的各个部分充满好奇心。他们不仅依靠实验证据来更新自己的观点,还会从第一性原理出发思考问题。比如,假设深度学习是有效的,那么理想的收集数据的类型应该是什么,等等。

宝玉

57,175 Aufrufe • vor 2 Jahren