Загрузка видео...

Не удалось загрузить видео

На главную

最近使用 Kimi Code + K2.7 极速版辅助编码,分享一下使用体验。 背景: 来自大约 5w 行左右的 golang agent runtime 的重构。前期用 codex / cc 疯狂推代码之后进入了重构期。 用 codex / cc 压低代码行数,很难满足我想要的效果。比如 opus 4.8 反复背诵不知道从哪里学来的超过 300 行代码是不好的设计(我明明没有加这一条,记忆里面也没有),而超过 2000 行不能拆开的代码多了去了,这是本质复杂度。而 codex 在精简了一些之后反手又给我加了一些兼容代码。。。。 所以我回归了半自动的方案,用 kimi code 调研出报告,人工 review 之后开修,大致步骤如下 1. 选择一个切入点 /goal 请你使用 hai-architecture skill 帮我系统整理 nil, 按照当前代码,当前位置,问题点,解决方案表格罗列一下。 有些可能是 nil...

18,291 просмотров • 1 месяц назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,521 просмотров • 5 месяцев назад

Claude Fable 5 重新开放了 最近刚好有一个demo,就是看能不能用顶级模型做一个meme工厂 “ 就是我输入一个 Meme Coin 创意 然后这个工具自动生成品牌 / 叙事 / 经济模型 / 营销方案 支持中文全流程输出,可以反复优化迭代 “ 也是想尝试一下,做一个可以验证 Fable 5 长任务能力 最终做出了一个能够简单跑的框架(我没有投入任何信息源,没有喂数据 所以跑起来效果没有那么屌,不过我觉得后期再投喂一些案例,我觉得确实是可以落地的) 说说我为什么用Fable 5 来测? 因为这个任务本质不是写代码 更像是说去测试AI的长链路规划能力测试 它需要: 1/ 语义理解 2/ 叙事能力 3/ 结构能力 4/ 一致性 5/ 自我检查 这刚好是 Claude Fable 5 主打的能力 整体跑下来我觉得还算是可以的,毕竟我这种不会写代码不会设计的小屌丝,确实在Fable 5 上面使用得其乐融融的 哈哈 再说说我的TOKEN使用量吧:112.31K(按照官方的收费标准大概是在:$4.2) 要是加上文本案例 再接入一个AI对话的API框架 我觉得应该费用还要再多出个大几十吧(个人猜测,毕竟投喂数据可能会比较烧tokens) 总的来说的话我个人还是觉得这笔消费还算挺值得的,因为这本身在传统行业的话 可能会是比较高的费用,AI真的弄挺好的 说完Claude Fable 5的体验, 那我不得不说我是在哪里体验的Claude Fable 5了 我这次没有走官方通道,而是走的是我之前给大家分享的中转站 Zenmux ZenMux 因为他这几天又搞活动了,只要你账号的余额>$0 你就可以免费体验Claude Fable 5 并且 Zenmux支持(不限于): 200+ 模型统一入口 无 RPM 限制 PK 模式 可以直接做横评 如果大家也想低成本体验一下 Claude Fable 5 我觉得当前使用Zenmux是最好的选择

车九

48,436 просмотров • 22 дней назад

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

300,964 просмотров • 1 год назад

各种刷到新出的kimi k2 达到了国产 sota 的水平,并且前端 UI 能力很强,我用 claude code + kimi k2 高强度 vibe coding了两天,没写一行代码,主要开发了一个image generator项目。 给我的感受是整体设计在线,写出来的页面精美度不错。它会主动地去写动画动效以及改 css 文件,跟那些只会堆 shadcn 组件比起来不太一样~还会去根据我的想法,去找一些符合我风格要求的样例图片做 mock image,以及 banner 图,这个就大大地降低了整个设计的 AI 感,不违和。 当我说一些比较模糊的词,比如我说要“沉浸感”强一点,他可以很精准地 get 到我想要的效果,比如这个 gallery 里面的 image card 效果,大家可以感受下~ 让他帮我接 replicate 和 vercel 的 api,直接就接进去了,没怎么改动就可用了。总体的编程水平感觉也有 opus 的 claude code的百分之七八十左右,但成本比 opus 便宜很多,高强度用了几天,才花了 30RMB 不到,如果是原装 cc,按用量起码得要 30 刀。并且可以直连使用,没有网络问题的困扰。 不过整体响应速度还是偏慢,思考时间比较久,不知道是用的人多还是啥原因;另外当对话次数多了之后,理解能力以及响应速度就会一直下降;还会出现一些报错,就得重置一下对话才好用 总的来说,作为国产AI助手在代码生成方面的表现还是值得关注的,特别是考虑到成本因素。

Corey Chiu

30,430 просмотров • 1 год назад

这两天看到的收获很大的一篇论文《AlphaCodium:引领代码生成新境界,从提示工程到流程工程》,它提出了一种新的生成代码的方法,比传统的直接基于Prompt生成代码的方式准确率更高。 它用的测试集是CodeContests ,这是由 Deepmind 推出的一项挑战性编程数据集。相对来说还是很权威的。以 GPT-4 为例的话,准确率从19%提升到了44%。 它的原理有些复杂,但是如果你有过LeetCode刷题经验,相对比较好理解一些。 普通人刷 LeetCode,上来就做,这样有可能得到答案,也有可能做不出来,这就类似于你把题目直接丢给GPT-4,让它直接给出答案,准确率相对要低一些。 高手刷LeetCode,会有个做题的流程,同样的水平,做出来的概率会大一些。 高手做题时会大概分成几个步骤: 1. 先把题目中的要点一条条列出来,确保不会遗漏任何重要信息 2. 通常LeetCode会提供 1 个或多个测试用例,仔细看测试用例,分析为什么给定的输入能得到给定的输出 3. 在写代码前,列出几种可能的解决方案,例如暴力算法、递归、动态规划,每一种方案写下思路和伪代码 4. 对于列出来的几种方案进行评估,选出最佳方案 5. 可能还会补充一些测试用例帮助事后验证 --- 以下部分是迭代过程: 6. 根据选中的解决方案写代码,如果代码不能运行则修改代码直至能运行 7. 将代码提交到LeetCode的测试集去验证,如果无法通过所有测试,则修改错误,如果通过到第8步 8. 用第 5 步生成的测试用例验证代码,如果运行不通过则继续优化代码 这里留个思考题:如果第8步出错,怎么判断是代码有问题还是自己生成的测试用例有问题? 而 AlphaCodium 就是完美遵循了以上的步骤来解题,只不过每一步都是由大语言模型帮助完成! 这给了我一些启示: 1. 不必寄希望于将复杂的任务在一个 Prompt 中完成,拆分成若干子任务成功概率会高一些 2. AI 可以借鉴人类的优秀实践,例如高手是如何解决编程难题的,让 AI 按照高手的步骤去一步步做 3. AI 的潜力还有很大挖掘空间 完整的文章参考: 中文译文:

宝玉

265,105 просмотров • 2 лет назад

我折腾了Openclaw大概有一周了吧,感觉这一周也不能说时时刻刻在玩,但是确实已经让我体验到了他的很多优点和坑。 我觉得这个坑其实也并不是他的缺点,而且初学者在使用的时候没有注意到的特点,本文会好好聊聊。虽然有人说它不是什么高深的科技,但是Openclaw确实解决了我一个很长时间都没有人来解决的痛点, 作为一个web3的博主,我平常有很多零碎的时间,在外的时候,开车的时候,参加活动的时候,加起来其实非常多,一周下来能有十几个小时。 这些时候其实我的脑子都不处于idle的状态,而是经常想写东西。比如我经常就会抽个十分钟走路,边走边把我的一些想法和GPT录入,然后生成文章或者笔记,甚至是代码。 但对于有些问题,比如验证一个交易的想法,产品的想法,用一个我已经开发好的脚本去了解市场行情,缺少一个主机这样强大的工具来帮我落地。 也就是说,哪怕AI给了我方向,给了我代码,最后去跑的,还是我啊! 我这不是给AI打工了吗? 于是在知道了Opencalw这个东西的五分钟之后,我就边开车边在手机上下单了一个全新的MacMini,准备开始改变人生 我觉得玩了一周下来,我做到了。我可以躺在床上刷剧和喝啤酒的同时,让全市场行情尽收眼底,有一说一,minimax真的很稳定且偶尔会让人觉得惊艳。 刚丢给他anthropic和五角大楼的八个新闻,他给我做了系统性总结并归档,语言风格也非常自然,确实不是对话框可以体验的,但有在对话框环境里搞定了看黑漆漆IDE才能做到的aget效果,且效果很棒。这就是openclaw框架的特点。 接下来重点聊聊 #Binance 最近更新4个 AI skills 技能 Alpha 市场数据、U 本位合约、杠杆交易、资产管理。在我看来,这次更新的重点不只是“功能变多了”,而是 OpenClaw 终于更像一个能真正配合你做事的交易助手了。 以前我们用这类工具,更多还是停留在“查数据、看行情、问问题”这个层面,信息是有了,但真正做决策、盯条件、执行动作,还是得自己一步步来。现在不太一样了,你只需要说出自己的意图,它就能把筛选、判断、执行这些动作尽量串起来。 这 4 个技能里,我最看重的是资产管理。因为它解决的不是“看什么”,而是“钱怎么动”。比如现货和合约之间的划转、账户余额整理、碎币换 BNB,这些以前都很零碎,但实际又很高频。现在如果能交给 Agent 去处理,整体体验会顺很多。 另外,Alpha 数据、合约、杠杆这几个技能组合起来后,确实会让很多交易思路更容易落地。比如监测异动、看资金费率、设置止盈止损、按条件执行下一步,不用自己频繁切页面、算逻辑,效率提升会很明显。 不过我自己的看法是,这套skills最有价值的地方,不是“自动赚钱”,而是把原本复杂、重复、容易出错的操作流程对话化了。它更像是帮你提高执行效率,而不是替你承担判断和风险。 而且目前币安中文社区正在举办 “用 AI 建设加密,搭建币安主题 AI Agent” 的活动。 总奖池:48.6 BNB(作品奖44 BNB + 推荐奖4.6 BNB)。 作品奖:第1名10 BNB、第2名8 BNB、第3名6 BNB、20名优胜各1 BNB。 对普通用户来说,参与重点可以概括为一句话:不用非得做得特别复杂,能跑通、能演示、逻辑清楚,就有机会拿到奖励。赶快行动起来吧,部署一只属于你自己的龙虾,改变人生的轨迹。 为此专门做了一个接入视频,希望能帮助到大家一起建设起来~ 币安技能中心传送门: 部署龙虾碰到问题可以dm我或者评论区留言,欢迎老师们多多交流~

百里 🦅

16,721 просмотров • 4 месяцев назад

小扎吐槽苹果和 Google,以及谈为什么开源 AI **Mark Zuckerberg**: 我认为移动生态系统中普遍存在的一个问题是有两个把持入口的公司,Apple 和 Google,它们可以告诉你可以构建什么。 在我们的历史中有很多次,比如有经济层面的情况,就是我们构建了些东西,然后它们就会拿走我们大部分的收入,但还有一种是质量层面,这实际上让我更加不满,也就是有很多次我们推出或希望推出某些功能,然后Apple就会说,不,你不能推出这功能。 这真的很糟糕。 问题是,这样的世界是否会在AI领域复现,就像你会有一小部分拥有封闭模型的公司,它们控制API,因此将能够告诉你可以构建什么。 我可以说,对我们来说,自己构建一个模型以避免处于那种位置是值得的。 我不希望那些其他公司告诉我们可以构建什么,而且我认为从开源的角度来看,很多开发人员也不希望那些公司告诉他们可以构建什么。这就是我坚定支持开源的原因之一,我认为未来AI的集中化可能像其广泛传播一样具有潜在危险。 我发现很多人都在思考,如果我们能实现这种技术,那么让它广泛传播是否不利。 我认为另一种可能也很糟糕的情况是,如果一个机构掌握了一种强大的AI远超其他所有人的,这同样是非常糟糕的。在我看来,一个理想的世界应该是这样的:AI技术被广泛而均衡地应用,随着时间推移逐步增强其健康性。在这样的世界里,各种系统能够相互制衡,这种平衡的状态比一个高度集中化的世界要健康得多。 虽然风险无处不在,但我觉得有一个风险我想人们我并没有听到太多人提及。 **Dwarkesh Patel**:举例来说,一个价值100亿美元的模型,如果经过评估是完全安全的,你们会选择开源吗? **Mark Zuckerberg**:我的答案是,只要这个模型对我们有所帮助,那我们就会开源。 **Dwarkesh Patel**: 那如果这个模型是用100亿美元的研发经费研发出来的,然后现在要开源呢? **Mark Zuckerberg**: 我们一直以来都有开源软件的传统,但是我们并不会开源我们的产品。 比如说,我们并不会将Instagram的代码开源,但我们会开源许多底层的基础设施。我们历史上最大的一个项目可能就是开放计算项目。在这个项目中,我们将我们所有的服务器的设计网络交换机和数据中心的设计开源了,这对我们来说非常有帮助。 因为很多人可以设计服务器,但现在,大家普遍都采用了我们的设计,这就意味着整个供应链都围绕我们的设计展开,规 模变大,对所有人来说都变得更便宜,为我们节省了数十亿美元。 这真是太棒了,对吧? 因此,我认为开源有多种方式可以对我们有所帮助。 一种就是,如果有人能够找出更便宜的运行模型的方法,我们将花费数十亿甚至上千亿美元,在所有这些模型上,所以如果我们能做的更有效率,那我们就可以节省数十亿甚至上百亿美元,这可能本身就非常有价值。 **Dwarkesh Patel**: 关于开源,我很想知道你是否认为像PyTorch、React、Open Compute这样的开源项目,对世界的影响是否已经超过了Meta在社交媒体方面的作用。 **Mark Zuckerberg**: 因为我曾经和使用这些服务的人交谈过,他们觉得这是有可能的,因为互联网的很大一部分都在运行这些项目。这是一个有趣的问题,我认为几乎有一半的世界人口都在使用我们的产品,这是一个真实的点,所以我觉得这很难超越。 但不管怎样,我还是认为开源是一种新的、非常強大的建设方式。 来源:

宝玉

74,721 просмотров • 2 лет назад

想和大伙聊聊,在 AI 时代我是如何深入学习一个技术领域的。 之前没有 AI 之前更多是看书、翻这个领域有名的国内外人的所有博客,然后摘抄记录到笔记本,这种速度挺慢,但是很有学习的乐趣,比如当时学习 WebGL 就是这种感觉,可能学懂一个东西差不多要半年空闲时间,慢但快乐。 现在有了 AI 之后,其实我很讨厌网上那种3分钟教你看完百年孤独,也讨厌一切短剧和倍速看电视剧的方式,更多还是挑好的看,吃好一点。 不过最近写你不知道的 Claude Code 和 Agent 系列,除了自己懂的部分外,其实还有大量不太清楚的领域,好在之前收藏了不少文章,刚好借助这一块清库存,全部搞懂输出出去,一直认为,很多时候,不在于看了多少东西,听了多少东西,输入了多少东西,其实用处不大,更加看重你输出了多少东西,这个才是你自己的。 然后我上上周启动了一个深坑挑战自己,研究大模型的训练流程,确保非专业的人也听得懂,探索了2周,刚好这个经验可以分享给大伙,当然成文也差不多好了,最近会发出。 我会把这个学习过程当做写代码一样的组织,第一步收集高质量的资料,比如与之相关的近几年的精品论文,各大模型厂商发布的关键模型的博客,X上模型负责人发表的一些文章,以及斯坦福等高校的近两年关于这一块的课程学习,还有经典的手搓一个大模型的代码仓库等等,这些都是我的一个资料来源过程,我会借助工具自动化全部下载、转md、清洗,梳理,弄好结构化分门别类到我这次研究的仓库。 然后对于自己看得懂的内容就全部看一遍,把不好的删掉,好的留下,对于看不懂的内容,直接借助 Claude 帮我的理解,更复杂一点的直接翻译成中文去阅读,对于代码本地可以跑的就跑起来,不能跑的那种就去看结构,总之会有一个大概的认识和知晓技术原理,这个阶段可以去掉原有一半可能没有用的内容。 到了这个阶段,其实你对这个领域有一个大概的认知了,就可以给这篇文章开始写一个大纲,以及大纲应该结合的来源内容,这里均可以用markdown很多表达,你要讲什么,或者说你想讲什么更想让读者知道,一定一定,文章是写给你给给看的人看的,需要知晓对方的认知水平,和汇报其实差不多。 然后接下来就是苦力活加之前内容的复习过程,和大学时候考试前复习很像,把每一章的内容填充完整,这样下来,你会得到一篇非常长而且有点啰嗦的文章。 这个时候AI就可以帮太忙,你可以让他帮你不改变你原有的内容意思你的语气的情况下,帮我去掉无用的啰嗦内容,以及连贯不到位的内容,或者是这一块缺少的内容,还需要补充什么知识的地方,借助AI继续去完善补充,这里又可以学到很多原来遗漏的东西。 最后整理好以后,可以继续自己读一遍,而非让AI读一遍,这里AI只是工具,千万不要把你的脑袋被AI代替了,这就没有啥意思来,自己读的过程中可以对文章继续修改调优,这里和写代码又非常像了,自测那种感觉,修复问题修问题,最后读了2遍以后,基本感觉完美了,然后就可以发出来给大伙看看。 有小伙伴肯定是担心自己写的东西没有人看,就不太喜欢发出来,或者说就不写了,其实只要你的内容有意义,自然就有读者,而非是你偷懒的理由。 花10min写完这个碎碎念,结束,欢迎交流你是如何学习一个新领域的,下面视频就是我后面要发的那篇你不知道的大模型训练文章的学习仓库,挺有意思,就录了一个视频给大伙看看我的工业化学习方式。

Tw93

108,180 просмотров • 3 месяцев назад

高人,你这个帖子让我整整琢磨了两天!本来想写个长文,但是太多头绪也不知道从何写起。总的来说是我这段时间上推的原因,总感觉自己的开发缺了很重要的认知;也是我这段时间除了自己硬件修复工作之外,还必须要去看text-to-CAD 的原因。 我为啥这段时间上推,就是心情不好。话多,我心情好的时候是不说话的,哪有这个功夫,可以一直干活。 很多行业,甚至是大部分AI需要落地的严肃场景,就是缺 IR, Verifier; 后续的TD和Platform Config必须建立在前面已经推导完成的前提下。AI写程序为什么那么厉害,就是因为IR-Platform Config这条链条是顺畅的。 我们看一下我这个视频。Zoo(text-to-CAD)就是创造了KCL这个IR, 集合你说的Specs/Impl 于一体,Specs是代码前面那一段。后面的Impl与verfier, 比如一些constraint是混在一起的。 这个版就做的非常好,就是我在你的提示下,自己把specs IR写好了。直接导入fusion我加了螺纹就是一个完整的可打印件。 我们要做任何一个行业的“如码" as code, 恐怕都逃不过这个阶段。 法律,医疗,CAD, circuit。 全都需要IR。 否则AI只是提供方案,不能提供方案验证,没有统一的IR,简直就是语言机——只会说!例如 Text-to-CAD 中,模型可以生成 KCL;但如果没有几何检查、约束检查, 这个图都画不出来的。 Transformer 本质上是概率预测器:P(next token | previous tokens) 代码非常成功是因为:代码行业拥有世界上最成熟的 IR 和 Verifier。 现在各行各业IR缺失,才是这一轮AI基本感觉漂浮在语言宇宙的原因。比如医疗。医疗算不算全世界标准最多的领域之一? 医疗已经有 FHIR、DICOM、SNOMED 这些标准,但是这些标准大多数解决的是数据交换(Interoperability),而不是医学推理(Clinical Reasoning)。 如果真的要靠AI医学推理,需要耗费十几年的时间,真正把IR做出来,形成统一标准。 高人,给跪了。

Susan STEM

25,228 просмотров • 12 дней назад

哥哥们你们太卷了,卷不过你们了,掉了30多个名额了哦!哭死了!哎!!! ——— 说实话,我一开始也是被 ZK 那一套讲法讲烦的。 什么数学优雅、终极信任、密码学圣杯,听多了真的会走神。 直到我在看 Inference Labs 的时候,脑子里突然冒出一个很不体面的画面: 这玩意儿怎么这么像拆熟食的? 传统 AI 给我的感觉,就像买一整块封装好的肉。 看起来油亮,切面也不错, 但你永远不知道里面有没有掺点别的。 你只能选择信,或者不用。 Inference Labs 干的事反而很“笨”: 它不让你信整块, 而是把 AI 推理一刀一刀拆开。 你不需要接受“这个模型很强”这种宏大叙事, 你只需要确认一件小事: 这一刀,是不是真的这么切的。 说实话,这个点戳到我了。 DSperse 那套分布式验证,说白了就是在帮人偷懒。 不是让所有人去理解整个模型, 而是让验证这件事本身变轻。 我不用背“我要为整个 AI 结果负责”的心理包袱, 我只关心我现在用到的这一小段推理, 有没有被乱来。 这在很多现实场景里太重要了。 医生、风控、合规, 没人有精力啃完整头猪。 更让我有好感的是,他们连“怎么验”都顺手简化了。 我是真的讨厌管理私钥。 不是不懂,是不想。 每次验证之前先来一套仪式感, 本身就已经在劝退人了。 和 Self Chain 的无密钥方案, 第一次看到的时候我心里是松了一口气的那种感觉: 哦,终于不是为难普通人了。 验证 AI,本来就不该比点外卖还复杂。 ⸻ 所以后来我发现, Inference Labs 干的事,其实挺不浪漫的。 它不讲终极信任, 也不喊改变世界, 只是很务实地把信任拆碎、摊平、递到你手里。 你想验,就验这一小块。 你不想理解,也没关系。 未来如果 AI 真开始翻车, 那些没法被拆、没法被验的模型, 大概真的会被永久挂在链上当反例。 我现在已经不太关心 “这是不是真正的 ZK 巅峰设计”了。 我更在意的是: 当我真的要用 AI 的那一刻,它有没有为我考虑过。 这一点上,Inference Labs 至少让我愿意继续看下去。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 MemeMax ⚡️ 🐬TermMax

27,155 просмотров • 6 месяцев назад