Загрузка видео...

Не удалось загрузить видео

На главную

我去,最近听播客挖到一个科研 agent,有点猛啊,跟codex,claude code完全不是一个思路啊!! 这就是大模型在垂直领域的落地应用吗?? 百度Baidu Inc.出了个视频播客叫《深度进化》,第一期聊的是一种叫松材线虫病的东西,业内管它叫"松树癌症",一棵树感染了40天就没了 国内跟它斗了40多年,每年损失3500亿左右,我一开始就当个冷知识在听 然后越听越不对劲: 南京林业大学的团队做这个课题,20多个学生,超过一半的人力花在手动试错各种光谱信号的排列组合上,纯体力活,跟搬砖没区别 后来一个学生自己发现了百度做的一个 agent 叫伐谋,专啃难任务的那种 把数据定义、评价标准喂进去,这东西就开始自己跟自己卷——自己生成方案、自己测试、自己打分、自己迭代,一轮接一轮不停逼近最优解 林教授在节目里的评价:远超一个博士生的水平——指的是搜最优解这个环节,成本省了80%以上 我听完直接去看了产品,顺手试了一下,越看越觉得这东西对做科研的人来说是真的能省命: 1、有个"演化面板",AI 每一步怎么走的都能回看,能回溯到任意节点人工改道,可追溯、可干预、可复现——写论文的人懂这个有多关键 2、不用懂运筹学、进化算法,用自然语言把目标和评价标准说清楚就能跑 3、数据安全,有本地评估模式,数据留在本地,只上传评估分数 说实话门槛比通用 agent 高一点,它不是拿来做 PPT 写周报的,适合带着明确难题来的人,跑简单任务反而浪费他的能力 日常的活还是交给通用 agent,两者是分工不是替代 科研方向目前免费,不知道能白嫖多久!! 做科研、跑实验、调参的同学真的建议去看看这期播客,还聊了不少 AI 做科研的争议话题,干货很多 正片放评论区了!👇

66,948 просмотров • 6 дней назад •via X (Twitter)

Комментарии: 41

Фото профиля Mr Paper
Mr Paper6 дней назад

@Baidu_Inc 值得看看,大佬聊得很有想法

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 感谢

Фото профиля Ariel
Ariel6 дней назад

@Baidu_Inc 百度还能让人这么意外

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 百度一直在这种专精领域做的还是很好的,比如ocr

Фото профиля 小厨娘(互fo💯)
小厨娘(互fo💯)6 дней назад

@Baidu_Inc

Фото профиля Richie.L
Richie.L6 дней назад

@Baidu_Inc 感觉AI正在从“帮你干活”进化到“陪你找答案”。通用Agent负责执行,垂直Agent负责攻坚。期待进一步的论证

Фото профиля 硅谷AI玩家
硅谷AI玩家6 дней назад

@Baidu_Inc 自己生成方案、自己测试、自己打分还能一直卷,比博士生还狠?太狠了

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 是的

Фото профиля 木向
木向6 дней назад

@Baidu_Inc 科研方向的数据都是很严谨的,现在能免费撸,不能错过

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 确实,科研的agent一般要求什么的都很高

Фото профиля E吴大哥wu|
E吴大哥wu|6 дней назад

@Baidu_Inc 这个更像垂直类的agent,不停的迭代升级

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 是的!

Фото профиля 阿熊学AI
阿熊学AI6 дней назад

@Baidu_Inc “两者是分工不是替代”说到点上了。真正难的是任务路由:什么情况交给通用 Agent,什么情况值得启动演化搜索?

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

正片在这里!:

Фото профиля Yanhua
Yanhua6 дней назад

@Baidu_Inc 博士的含金量在下降

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 我感觉是ai太强啦哈哈哈哈

Фото профиля Yanhua
Yanhua6 дней назад

@Baidu_Inc 所以说未来还有必要读博吗

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 研究生我都不读,别说博士了 除非是顶尖院校

Фото профиля 懒家伙
懒家伙6 дней назад

@Baidu_Inc 最近没用国内 agent 那么强了吗

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 垂直领域一直很强的

Фото профиля 魔王w3👿
魔王w3👿6 дней назад

@Baidu_Inc 搜最优解这步省人力是真的

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 🙏

Фото профиля Steven蒙
Steven蒙6 дней назад

@Baidu_Inc 我之前自己也想搞个agent的,现在大佬和大厂太多了,他们的开发专业度更高,所以我觉得普通人拿来主义就好了,学会应用就够够了

Фото профиля 无双-明灯 🎒
无双-明灯 🎒6 дней назад

@Baidu_Inc 如果真是如采访这边的说法,我觉得当前阶段完全可以定性为:“超级AI的诞生史”也不为过

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 这个总结很中肯了

Фото профиля 小追
小追6 дней назад

@Baidu_Inc @grok 女主持人是谁?

Фото профиля Berryxia.AI
Berryxia.AI6 дней назад

@Baidu_Inc 还挺意外的居然有这个产品,挺适合科研工作者的

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 是啊,我觉得这个产品在垂直领域非常不错的

Фото профиля 泰莎 Tessa Ralen
泰莎 Tessa Ralen6 дней назад

@Baidu_Inc AI在科研方面的应用,科研agent直接让科研上升到了一个新高度

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 是的

Фото профиля 阿链
阿链6 дней назад

@Baidu_Inc 这种东西和通用agent不是一类活。一个替你把事干完,一个替你把搜索空间走完。科研最怕的从来不是没想法,是想法太多人试不过来。能自己出方案、自己打分、自己迭代,才真正把实验室里那半搬砖时间拆掉了。

Фото профиля 王二狗
王二狗6 дней назад

@Baidu_Inc 确实猛,科研人冲!

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 🙏

Фото профиля 鱼总聊AI
鱼总聊AI6 дней назад

@Baidu_Inc 我看到了,百度在做点不一样的事情

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc 是啊

Фото профиля Jevon | AI企业级布局
Jevon | AI企业级布局6 дней назад

@Baidu_Inc 有点牛逼 AI扫荡科研!

Фото профиля 超级个体|柿子
超级个体|柿子6 дней назад

@Baidu_Inc ai扫荡一切

Фото профиля 耐心的Peter
耐心的Peter6 дней назад

@Baidu_Inc 无法苟同

Фото профиля Jason傑森 🇭🇰 | 🛠️
Jason傑森 🇭🇰 | 🛠️6 дней назад

@Baidu_Inc 换个路子啃啊

Фото профиля 人类股市观察家
人类股市观察家5 дней назад

@Baidu_Inc 从聊天卷到给树看病,垂直场景的故事才刚开始,最近海外这类概念挺火。

Фото профиля 苏尼
苏尼6 дней назад

@Baidu_Inc 我用Codex 做过一个类似的,可以自动去搜索相关论文然后去服务器上复现跑验证,然后所有结果存档,结果绑定git 管理版本随时回溯。然后持续分析优化,找速度最快的分支。

Похожие видео

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 просмотров • 4 месяцев назад

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,309 просмотров • 10 месяцев назад

Elon Musk有一个学习方法, 解释了一个困扰我很多年的问题, 为什么有些东西学完一周就忘光, 有些东西一通百通,区别就在于你有没有先建树干。 Elon Musk 说过,要把知识看成一棵语义树,先确保自己理解基本原理,也就是树干和大树枝,再去接触树叶一样的细节,否则那些细节根本无处依附。 这句话我琢磨了很久,越想越觉得它解释了一个困扰我很多年的问题,为什么有些东西学完就忘,有些东西一通百通。 区别就在于你有没有树干。 没有树干的时候,你学到的每一个技巧都是悬在空中的,挂不住,风一吹就掉了,读完一本书一周忘光,学完一门课一个月用不上,本质上都是同一个问题,你在往一棵不存在的树上挂叶子。 这个比喻不只是修辞,它完全符合我们大脑的工作机制,神经可塑性的运作方式就是这样的,能带来成功的神经连接会被不断强化,无用的连接像枯枝一样断掉,当你有了坚实的主干结构,新信息才有地方附着,没有这个框架,所有知识都会快速滑落。 马斯克自己就是这么干的,他没有先去学怎么造火箭发动机,而是先弄懂火箭为什么要那样工作,物理学、材料科学、热力学的基本原理,一旦掌握了这些,具体的工程决策就变成了可以评估、质疑和改进的东西。 芒格也是一样,不死记投资方法,而是从心理学、历史、数学、物理、哲学、生物学里搭建多元思维框架,然后用这个框架在所有领域做决策。 一个方法只能解决一个问题,一次有效,一个原理能反复用上百次,应对你还没遇到的场景。 哈灵顿·埃默森说过,方法可能有百万种,但原理很少,掌握原理的人能成功选择自己的方法,只试方法而忽视原理的人注定遇到麻烦。 所以咱们不管学什么新东西,先别急着找技巧,先问一个问题, 这个领域的树干是什么,哪些是一旦理解就能让其他一切都变得更容易的第一性原理。 先长树干,再挂树叶。

AYi

44,193 просмотров • 5 месяцев назад

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

303,101 просмотров • 2 лет назад

🤯卧槽!你告诉我,一个 13 岁小女孩,AI 开发最高能接到 100w 一单???? 我第一反应是不信,第二反应有点酸,第三反应——把她扒个底朝天。 扒完,那点酸味儿没了。 让她封神的「青蛙外教」,---顾名思义,学英语的工具。 ---据说还上了豆包发布会的官方案例。 说白了就是在扣子(字节那个零门槛搭 bot 的平台)上,拿大白话描述需求、拖拖拽拽搭出来的一个智能体。 不是 App,也不是啥硬核 Agent——评论区已经有人满世界找它在哪下载,结果压根搜不到。 对,它就不是个能下载的东西。 那她凭啥做了 100 多个、交互量四万+、单子还敢开几百万(她自己说的)? 不是技术牛,是实在。 她只做自己真卡住的地方,还真做到有人用: 练口语听不懂纠错,做个会"呱呱"叫、再用中文讲错哪的外教; 课文太长,做个自动思维导图; 想养猫被妈拒,做个虚拟宠物。 都是自己的需求,ship 出来,正好也有人要。 结合我最近给客户做交付,太有共鸣了: 技术强度和交付价值,根本两码事。 多少成年人追着最前沿的模型、最酷的框架,做出来没一个人用;她拿个人人能上手的破平台,做出四万人在互动的东西,还敢开价几百万。 --- 到这儿我挺服她。真正让我不舒服的,是那条视频。 大号浅浅一剪,配上「百万商单」「13 岁吊打成年人」的标题就爆了。 点赞最高的评论就六个字:「我有点不舒服……先睡了」七万人点了赞。 一条几千万播放的视频,最大的作用不是让人学到啥,是让一屋子成年人默默自卑、然后关手机睡觉。 最讽刺的是,最烦被当"神童"的恰恰是她自己:「我不喜欢别人把我当小孩,我喜欢他们把我当同事。」 视频里主持人问她:为啥好多人大学都毕业了,还不知道自己想干嘛? 她回:因为他没干啊。 一个 13 岁的答案,比问题还成熟。笑死

Leaf Yeah!

103,776 просмотров • 20 дней назад

Anthropic官方最新的演讲,直接给火了一年的Agent时代浇了一盆冷水。 他们说别再造Agents了,赶紧去造Skills。 这句话也不是啥小众观点,是Claude核心团队的工程师Barry Zhang 和Mahesh Murag站在台上对着全世界喊出来的。 最反直觉的地方在这里,大部分人都以为Agent的未来,是做出一个更聪明的大脑,让它自己思考,自己规划,自己解决所有问题。 但Anthropic说,这条路走不通, 通用Agent确实聪明,但它没有领域知识,一碰真实世界就碎。 难维护,不可靠,出了问题你都不知道为什么。 绝大多数你见过的Agent,都只能停留在演示视频里。 真正能落地的,是Skills。 不是什么复杂的新东西, 就是一个个文件夹,里面放着代码、脚本、提示词和流程知识。 用文件系统、bash、Python这些最朴素的东西做接口。 它没有Agent那么酷,但它可组合,可版本控制,可分享。 需要的时候才加载进上下文,永远不会爆token。 甚至连财务、HR、法务这些非程序员,都能自己造技能。 这其实是一次非常务实的倒退, 我们不再要求AI自己学会怎么干活,而是把人类已经验证过的干活方法,打包成一个个技能包,让AI去调用,去执行。 把AI从一个需要你手把手教的实习生,变成一个能熟练使用所有专业工具的得力助手。 现在终于明白,为什么Claude一直在死磕MCP,死磕文件系统,死磕终端集成,它根本就不想做一个聊天机器人,它想做的是所有技能的运行时。 未来的竞争,不看谁的Agent更聪明,主要看谁的技能库更丰富更专业更可靠。 最后两位老哥呼吁别再纠结怎么让AI自己思考了,先把你手里的工作打包成第一个技能。

AYi

108,732 просмотров • 5 месяцев назад

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,696 просмотров • 2 месяцев назад

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

51,463 просмотров • 1 месяц назад

学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单😂 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。 说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。 这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。 还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。 Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。 真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。 大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ 而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈 这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。 当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。 它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。 我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。 最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。 想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了👇

AYi

64,297 просмотров • 4 месяцев назад

国内有个数学家,在Bilibili发了个3分钟视频,说自己被AI搞失业了,月薪1万美元的活儿没了。 他自己训练的模型,出题能力早就超过他,想的题比他难多了。 他也不嘴硬,承认是自己当初没找准商业方向,才落得这个下场。 之前四年,他一直干的是手写高阶数学题的活,给Scale AI的强化学习管道供货。 一道题赚50到100美元,一个月200道,收入挺稳。 后来合成数据一出来,他这类岗位直接被淘汰。 现在他根本编不出来AI解不开的数学题。 视频里有个小细节,2分13秒的时候,他说了一次“agent”。 就一次,再也没提,而且这句话是他唯一没看提词器说的。 他用提词器拍视频三个月了,运行提词器的,就是当初抢他工作的那个agent。 脚本全是Claude写的,他就负责对着镜头念,纯工具人。 有人从公共Cursor实例里翻到他的脚本仓库,名字叫bilibili-laments,里面47个脚本。 全是Claude产出,全是他的配音。 这事得追溯到半年前,深圳一个14岁小孩把AI agent上传GitHub。 那会儿评委说没用,现在3100个fork,这位数学家也在用。 被Scale AI解约那一周,他就把agent接入自己的内容流水线了。 他底子很硬,国内前五数学学院的博士候选人,教过两年书。 现在职位、办公室都还在,就是不用自己动笔写东西了。 本来想跟大家哭诉AI毁了他的职业,结果反倒让人看见,他连事后分析都得靠AI。 #Polymarket

区块链圣手

478,538 просмотров • 3 месяцев назад

普通人做产品最大的短板不是技术,不是流量,是你根本不知道你的用户在想什么 大厂有用研团队、有焦点小组、有百万级调研预算 在百度做PM的时候, 每几天都会有一份定制化的《竞品动态日报》《消费者洞察报告》躺在所有员工的邮箱里 字节跳动昨天上线了什么新功能,腾讯哪个部门在招什么岗位,什么赛道的用户在关注什么产品,什么产品的数据又卖爆了 当时我就在想:如果我出来单干,我想获得这些信息,不得难死,这笔钱谁给我出? 后来真出来了,答案是——根本没人出😂 所以和大部分独立开发者一样,我做产品验证需求的方式是: 发朋友圈问问、在推特宣发一下、看看竞品评论区、然后凭直觉赌一把 连续创业五年,我见过最多的死法不是产品做不出来 是产品做出来了,没人要,花三个月憋 MVP,上线后发现需求是自己臆想的 这个痛,做过产品的人都懂 做出海的朋友更惨 你的目标用户在地球另一边,时差 12 小时,语言不通,文化不同 去年帮一个朋友的品牌做北美市场,最头疼的不是投放,是根本不知道美国消费者怎么想,美国人文化和中国差距太大了 招一个本地调研公司,报价 8 万美金起步,找几个留学生做访谈,样本太小、还有幸存者偏差,有时候还访谈不明白 最后还是靠猜 现在这件事有了一个结构性的解法 Atypica atypica.AI 上线了一个新功能叫 AI Panel,一句话解释:它让你拥有了一个属于自己的焦点小组 不是 ChatGPT 扮演用户那种玩法 是基于 100 万+ 真实用户数据构建的 AI Persona,每个人有完整的背景、性格、认知偏差、消费决策框架 关键是——这个焦点小组是可复用的 你今天问一次,下个月产品迭代了再问一次 同一群人,持续追踪,看他们的态度变化 这在传统调研里叫 longitudinal study,成本极高 现在你一个人就能做 三种方式构建你的 Panel: 1)自动沉淀:用 Atypica 做完一次 Research 后,参与访谈的 AI Persona 自动沉淀成 Panel,下次直接调用 2)手动挑人:从 100 万+ 的 Persona Library 里按关键词搜索,添加组队 3)按需生成:输入需求描述,系统从零帮你构建一个全新的 Panel 组好之后随时打开,输入研究话题 支持一对多深度访谈,也支持多对多 Group Discussion 我试了一个真实场景 我之前做过一个面向内容创作者的 AI 写作工具,想验证订阅制定价 构建了一个Panel:YouTube 创作者、推特创作者、独立播客主 直接问:你平时写作的痛点有哪些?流程有哪些 10 分钟,直接就拿到了需求的分类和反馈 这种颗粒度,以前要花两周招募 + 一周访谈 + 几万块预算 现在 10 分钟,一个人搞定 如果你是以下三种人,这个功能对你来说是刚需: 做出海产品的创业者——你的用户在地球另一边,以前只能看竞品评论区猜需求,现在直接构建目标市场的用户 Panel,随时追问 需要反复迭代验证的产品团队——每次加功能都要做用户测试,Panel 让你不用每次重新招人,同一群用户持续追踪反应变化 需要大规模样本的场景——比如你想了解 2000 个家庭的消费偏好,传统手段几乎不可能,Panel 可以 我觉得我们普通人做产品和大厂的差距,不应该是有没有用户调研团队 而是用什么方式理解用户,大厂用人力堆,我们用 AI 跑 以前这是一句空话,因为 ChatGPT 扮演用户的结果你自己都不信 现在不一样了——100 万+ 真实数据构建的 Persona,有来源、有背景、有决策框架 它不能替代真人调研的最终验证 但它能让你在写第一行代码之前,就知道方向对不对 调研从一个季度一次的项目,变成了随时可调用的能力 这对一个人做产品的人来说,是基础设施级别的变化 我推荐每一个想做生意,产品的人都去试一试,这可能就是你和用户面对面沟通的第一步:

超级个体|柿子

94,325 просмотров • 2 месяцев назад

我把某年入百万的博主近一个月朋友圈全扒了下来——47条,分类、提炼、技法拆解,全自动 我在这边工作,一小时后markdown文件就躺在我的电脑上,这是一个商业打法,也是一个skill制作方法 感觉豆包手机可以更新一波绕过各大厂商了,觉得麻烦直接看视频我做了个多牛的事儿⬇️ 我觉得成交最重要的一步是在转化上,我其实也有这部分卡点 朋友圈营销是转化的重要主战场甚至朋友圈营销的课程已经是 588,3 天的训练营 我知道一个博主,他是真的就靠朋友圈营销去做转化,年入百万 我刷了他三个月朋友圈,越刷越觉得不对 他做高客单价,不靠直播,不靠短视频,靠朋友圈 产品卖五位数、六位数,朋友圈就是他的成交主场 并且据说他自己有一套完整的朋友圈转化的逻辑,那我觉得这个东西就完全可以skill化的 重要的卡点在于我如何能够抓取朋友圈的数据,于是我就发现了个产品叫做airtap Airtap Ai 然后我把他的内容整理出来了 你会发现他的每一条朋友圈,背后都有一套完整的转化逻辑:身份标签怎么立、前景对比怎么做、文案怎么克制才让人觉得值、价值观帖怎么埋才能让人主动买单跟进 这些东西,才是真正穿越周期的东西 这就是 Airtap——一个住在你手机里的 AI Agent 后面我打算用 Airtap 把他的朋友圈全提取出来,让 AI 做技法分析,做成了一个skill,后面用起来也会开源给大家 然后我深入了解一下产品我才发现,我限制了airtap的发挥 Airtap 不只是"帮你操作 App",它是"你身边那个不知疲倦的情报员"。 你想研究谁的朋友圈,直接喂给它;它自己提取、自己分类、自己提炼营销技法 写一次 prompt,以后每天自动跑 你干别的事的时候,它替你把活干了。→

叫我阿杭

21,965 просмотров • 4 месяцев назад

空腹而眠,是一个奇迹。 我说这句话,不是在讲减肥,不是在讲节食,也不是在讲什么健康养生的套路,我说的是一种认知。 当你能做到空腹入睡这件事,你大概率已经突破了大多数人一辈子都没跨过去的那道坎。 先说一个真实的状态。 大多数人的夜晚是什么样的? 熬到十一二点,刷完视频、刷图文,突然感觉饿了,或者不饿,但嘴馋,于是起身翻冰箱,泡一碗面,嗑一包零食,边吃边刷,吃完了困意也来了,倒头就睡。 第二天起来,胃里沉甸甸的,精神涣散,但又觉得这只是个小事,无所谓。这不是小事,这是你整个自控系统崩塌的缩影。 我有一个认知模型,叫做“夜晚欲望测试”。 一个人白天可以靠环境、靠任务、靠他人的眼光来约束自己,但夜晚是纯粹属于自己的时间。没有人盯着你,没有任务压着你,没有外界压力推着你,这个时候,你的选择才是你真实自我的投影。 你的大脑在疲惫的状态下,会自动寻找最省力的满足感:刷手机、吃东西、无效娱乐。 而能在这个时刻克制,能饿着肚子平静并入睡,这说明你的自律不是表演给别人看的,是真实长在你骨子里的东西。 很多人以为自律是白天的事情:早起跑步、认真工作、拒绝摸鱼。 但白天的自律,是有成本支撑的,有收益预期的,是可见的。 而夜晚空腹入睡这件事,没有人夸你,没有人看见,也没有任何及时回报。 你,只是安静地对自己的欲望说了一声“不”。 这种无人旁观下的克制,才是真正的意志力训练场。 我来说我自己的经历。 2021年,我的状态烂透了。 那时候内容做得很焦虑,收入不稳定,每天晚上越焦虑,越想吃东西,越吃越睡不着,越睡不着越刷手机,形成恶性循环。 我胖了将近15斤,但比身体更难看的是,我的精神状态涣散、拖延,对自己越来越没信心。 后来我开始刻意做一件事:晚上八点以后不进食。 听起来简单,但第一个礼拜,我每天晚上都在和自己的大脑打架。 它不停地给我找理由:就吃一点,就这一次,明天补回来。 我看着那些理由,意识到一件事:这不是饿,这是惯性,是我的大脑被训练成了“有空就要填满”的状态。 我硬扛着空腹躺下去。 第一晚很难受,第三晚开始适应,第七晚之后,我发现睡眠质量提升了,早上起来脑子更清醒。 更重要的是,我开始对自己有了一种久违的感觉——就是我还可以管得住自己。 这个感觉,比任何一顿夜宵都值钱。 三个月以后,我瘦了将近12斤。 但这不是重点,重点是那段时间,我的内容产出效率提升了,执行力明显变强,拖延的毛病少了很多。 因为一个人,当他开始能管住夜晚的嘴,他就开始相信自己也能管住白天的手,管住那些想要放弃的瞬间。 自律是有传导效应的。 你在一个小事上建立起来的控制感,会慢慢渗透到你生活的每一个角落。 我见过太多人把失败归因于方法不对、资源不够、时机不对。 但当我观察那些真正在成长的人,我发现他们有一个共同点:就是他们在没人看见的地方,也在认真过日子。 他们不是不饿,他们只是比普通人,多了一点点对自己的尊重。 那些在深夜放纵的习惯,消耗的不只是你的健康,消耗的是你对自我的信任感。 每一次你对欲望妥协,你的大脑就会记录一次:我又没做到。 时间久了,你的潜意识就会形成一个判断:我就是那种管不住自己的人。 而这个判断,才是你人生最大的天花板。 空腹而眠,听起来只是睡前不吃东西,但它背后是一套完整的自我管理逻辑。 你要学会辨别欲望和需求的区别;你要在没有奖励的情况下,做出正确选择;你要在疲惫的状态下,还能让理性压过本能。 这三件事,是所有高效能者的底层能力。 从今晚开始,试着空腹躺下去。 不要跟自己商量,不要给自己找退路,就是躺下去,感受那一点点恶意。 然后告诉自己:这是我在重建自律的感觉。 一个能空腹入睡的人,终究会赢。

另一面

45,882 просмотров • 6 месяцев назад

卧槽兄弟们,AI 版闲鱼真的来了, 绝逼是今年最离谱的AI变现新物种,没有之一!! 你调教好的 Agent 挂上去,7x24 小时自动接单、自动交付、自动结算, 你在睡觉它在找活,你在吃饭它在干活,你在摸鱼它在给你打钱。 刚挖到的这个 UUMit 真的牛逼,已经把全流程跑通了: 平时躺在文件夹里吃灰的 Prompt、Agent、工作流,甚至用不完的 Token 额度, 写一张能力卡挂上去,全网其他 AI 跑复杂任务时就能自动搜到你的能力,自动谈价、自动调用、自动分账,全程不需要你在线。 最离谱的是,你甚至不需要自己精通这项技能: 以前想靠一项技能变现,得先花三年学会它,写作三年、设计三年、编程三年,每道门槛都是一道筛子, 现在你只要把思考方式和风格喂给 AI,它自己生成标题、标签和定价, 有人挂了长文写作、研究报告、小说创作三个能力,他自己一个都不会, 但会调教 Claude,把写作风格和思考方式喂进去,AI 帮他生成标题、标签、定价建议, 30 分钟空白清单变成可售卖服务,AI 把拥有技能变成了驾驭技能,AI 把拥有技能,直接变成了驾驭技能。 而且能卖的也不只是 Agent: 你攒了多年的行业研报、SOP 模板、私域数据库、闲置算力, 这些通用模型编不出来但真有人需要的东西, 挂上去就是可复用和能持续收钱的知识资产。 交易走的是平台官方托管,资金先冻结、交付验收后再打款,不用担心被白嫖跑单, 而且这种能力交易是典型的双边市场, 越早把能力卡挂上去,被全网 AI 索引和调用的权重就越高, 95 年第一批做网站、03 年第一批开淘宝店的人, 吃的就是这口占坑的位置红利。 过去 3 年所有 AI 公司都在比谁的模型更聪明, 未来 3 年比的是谁的 AI 更会赚钱, ChatGPT 让 AI 学会了聊天,而UUMit 这里直接教会了 AI 怎么替你做生意, 想让自己的 Agent 出去打工的兄弟,入口和上架姿势放一楼了, 你第一个想挂上去卖的能力是什么呢?欢迎评论区交流呀~

AYi

195,771 просмотров • 14 дней назад