
美研芒格君
@Kay2289123 • 33,311 subscribers
来自硅谷的投研团队 成员来自斯坦福、沃顿商学院 懂技术的投资者,懂投资的工程师 致力于让模型更聪明、更快、更便宜
Videos

最近 Muse 很火,我也在想:有没有可能,让我们已经在用的任意的AI,也拥有像 Muse 一样操作电脑的能力? 因此我周末捣鼓了开源一个skill。一句话来讲,使用它可以让任何AI 接到电脑上的 Computer Use,让它能看屏幕、点按钮、输入文字,直接操作 App 顺着这个方向,可以尝试的事情就很多了:找餐馆、查机票、购物比价,或者整理社交媒体素材。以前需要自己在几个 App 之间来回切换,现在可以试着用一句话把任务交给你已经订阅了的AI。(Kimi, 豆包 Gemini, Codex, Claude 等等) 开源链接 使用方式 把这个 GitHub 链接直接给到 AI,让它帮忙安装 在 demo 里,我演示了如何安装,并以 Claude Code 为例,操作我的浏览器,帮我给餐馆定位 我更感兴趣的是背后的成本空间。 这个 skill 复用了本机已安装的 ChatGPT/Codex Computer Use 组件,由你选择的模型理解任务、决定下一步怎么做。项目脚本本身不调用 OpenAI 推理 API,因此,不会消耗 OpenAI 的 Token,但前提是你要安装了 Codex 我自己也更愿意让操作发生在自己的电脑上,继续用自己的 App 和登录状态。此外所有的支付信息、付款记录全部留在本地,解决合规、隐私的顾虑 先开源出来,给大家玩玩。我很想看看,当更多 AI 能直接操作电脑之后,大家会拿它做出什么有意思的东西 如果是你,你最想让它接手电脑上的哪件事?如果你用起来觉得还挺有意思的,欢迎提交 PR,也欢迎点点 star 后续我们也会用仓库把我们的投研 harness 陆续开源出来
美研芒格君16,262 次观看 • 5 天前

我在AI 训练和推理这行干了很多年,最近越来越觉得,机会正在往两个方向转移 为了让所有人都能理解这个趋势,我拆解了一家Harvey的 AI 律师公司,他们用开源模型在特定领域 GLM 击败了 Fable5 和 GPT-5.6,我认为是个趋势 本来写了一篇长文来科普,后来觉得字数太多,于是 做了一个教学 Skill 工具,把写好的稿子变成一个音频同步的视频 如果你想转行,我很推荐两个方向 > 一个是后训练,也就是拿一个已经很聪明的模型,在明确的任务、工具和成本约束下,再针对这条生产线加练一遍 > 另一个是AI 推理,其实两者不分家 , 最后自己读一遍都觉得,这么多公式和缩写,谁会看完呢?我自己文字读多了都觉得累。所以干脆换个办法,把它做成了一个不到十分钟的小视频,一边讲,一边在白板上把图画出来。视频放在下面 视频里我按一堂课的顺序讲了下面这些 1. 为什么通用模型在一条具体生产线上不是最优,后训练到底在修什么 2. 开放权重和闭源的区别 3. 监督微调和 GRPO 各管什么,GSPO/GRPO/LoRA 的应用差异 4. 在垂直领域,开源模型 overall 是如何击败闭源模型的? 这个视频是我自己搭的一个小工具做出来的,逐字稿进去,配音和白板动画自动出来,讲到哪句画到哪步。工具还在打磨,做顺手了再拿出来细说。
美研芒格君37,900 次观看 • 24 天前
没有更多内容可加载