
Michael Guo
@Michaelzsguo • 9,022 subscribers
Building AI agents and AI-native orgs. Demystifying AI in practice. EN/中文 (Selected build notes, experiments, and practical tips at the website link.)
Videos

从 Oracle 拿到“一台”免费的 VPS 以后,我手里可用的计算机一下子增加到了 5 台: MacBook Pro MacBook Air Raspberry Pi 5 Dell XPS(Omarchy) Oracle VPS 每台计算机上都运行着 Agent。怎么把这些 Agent 集中管理起来,还能让它们彼此协作?当然是用 Herdr。 一般的 Herdr 主要管理本机 Agent,但我的这套设置还可以通过 SSH 管理远程 Agent: herdr --remote 我的 Herdr 跑在 MacBook Pro 上: 左上角是 Claude Code,作为主控。 右上角是新加入的 Oracle VPS,上面运行 Codex,主要负责 GitHub Repo。 左下角是 Raspberry Pi 上的 Codex,负责管理 OpenClaw 和 Hermes。 右下角最有意思:它连接的是 Omarchy 上运行的另一个 Herdr 里的主 Agent Codex。而这个 Codex 自己又负责监管 Omarchy 上的 Pi Agent,后者运行千问 coding 模型。 所以现在已经有点像一套分布式 Agent 组织了:一台电脑上的 Agent,可以管理另一台电脑上的 Agent,甚至继续往下监管下一层 Agent。
Michael Guo159,373 görüntüleme • 1 ay önce

如果你正在使用 Herdr,应该立即升级到最新版本。 前段时间我分享过,如何利用 Herdr 分布式管理 4 台机器上的多个 Agent。当时的办法,是用:herdr --remote 通过 SSH,把远程机器上的 Agent 接进 Herdr 统一管理。 现在 Herdr 0.9 有了更直接的做法。新版增加了 Machines 功能,只需要运行一个命令: herdr machine add 就可以在同一个 Herdr 里看到所有电脑,以及每台机器上正在运行的 Agent。不管是本机、Oracle VPS、Raspberry Pi,还是运行 Omarchy 的旧电脑,选中机器之后,就可以直接进入上面的 Agent。 我现在连 Omarchy 上同时运行的三个 Agent,也可以从这里直接访问。以前的设置,只能一个一个地连。 对我这种多机器、多 Agent 的工作方式来说,Herdr 已经越来越像一套分布式 Agent 控制台了。而且因为 Agent 已经是我们操作电脑的主要方式,能够集中控制 Agent,某种程度上也就等于在一个地方同时控制所有电脑。对这种工作流来说,比 KVM 方便多了。 以前很多人说 Herdr 只是 tmux 的仿制品。到了这一版,Herdr 才真正开始体现它 Agent-first 的优势。怪不得越来越多人喜欢用 Herdr。 视频里简单演示一下。
Michael Guo100,672 görüntüleme • 19 gün önce

Jeff Dean 离开了 Google。 在工作 27 年后,他决定创立自己的公司。而站在他身边的合伙人,不是别人,正是与他共事多年的老伙计 Sanjay Ghemawat。 这对曾被称为 Google 唯二两位 Senior Fellow 的工程师,这一次一起走出了 Google。 如果不了解他们的故事,这看起来只是今天又一条 AI 人才离职创业的新闻。 但看完这个视频,你会觉得,这件事几乎是命中注定。 Jeff 和 Sanjay 在 DEC 的研究实验室相识,1999 年又先后加入刚刚成立不久的 Google。 他们有一种非常特别的 pair programming 方式:两个人坐在同一台电脑前,一个人写代码,另一个人读和思考,然后交换位置。没有明确的领地,不需要证明谁更聪明,ego 这个词几乎不存在于他们之间。 此后二十多年,他们写出了 Google File System、MapReduce、Bigtable、Spanner 等一系列底层系统。Google 才能从几百台廉价服务器,长成服务全球数十亿人的基础设施。今天云计算、大数据和分布式系统里的很多理念,都沿着他们铺下的路发展来的。 现代互联网之所以成为今天的样子,有一部分要归于这两个安静写代码的人,以及他们之间几十年没有裂过缝的信任。 这个视频也收集了大量珍贵的 Google 早期影像:堆满 CRT 显示器的办公室、用廉价机器拼起来的服务器集群、杂乱的早期机房、年轻时的 Larry Page 和 Sergey Brin,以及 Jeff、Sanjay 和 MapReduce 等系统最初的论文与架构图。 如今 Jeff Dean 离开工作了 27 年的 Google,要去做一家用机器学习推动科学发现的新公司Discovery Loop。 兜兜转转,和他一起出发的人,还是 Sanjay。
Michael Guo204,602 görüntüleme • 1 ay önce

今年菲尔兹奖获得者里除了两位华裔数学家,另一位会说中文的是美国数学家 John Pardon,中文名白杰文。他还参加过 2010 年的国际大专辩论赛。 这哥们中文还真不错, 还带儿音。
Michael Guo219,506 görüntüleme • 2 ay önce

在 xAI 的 Grok Bot Galaxy 现场,Lauren Tan 做了一次很真实的 dogfooding。 她打开 Cursor,直接用自己开发的 P-Stack 和 /poteto-mode,把一个还很模糊的游戏想法,在 20 分钟内做成了可以实际试玩的 Prototype。这段直播很适合用来理解她平时到底是怎么用 /poteto-mode 来开发软件的。 P-Stack 是 Lauren 把自己日常使用的工程方法打包成的一组coding agent skills。/poteto-mode 则是入口:它会先判断当前任务属于哪一种 playbook,再调用对应的 skills 和 工程原理。
Michael Guo32,263 görüntüleme • 11 gün önce

DHH 在 Lex Fridman 播客里,用 12 分钟完整展示了自己现在的 Agentic Engineering 设置和流程。 从 tmux 到 Herdr,再到 GL.iNet Comet KVM + Tailscale 管理多台 Linux mini PC。他在 4–5 台机器上同时跑大约 16 个 agent sessions。Herdr 负责追踪状态,agent 完成任务或需要决策时,就提醒他回来处理。他还是老习惯用Neovim 但不再主要用来写代码,而是浏览项目、查看上下文、review agent 的输出。 有意思的是,DHH 讲完这一整套,最后还是说:别叫 Agentic Engineering 了,还是叫 programming 吧。
Michael Guo51,006 görüntüleme • 1 ay önce

这是Google DeepMind 新掌门人 Koray Kavukcuoglu 接管团队后的首次访谈。如果以前不太熟悉 Koray,看完这 27 分钟,大概就能理解,为什么Google会选他来领导世界上最大的 AI 实验室之一。 在访谈中, Logan 提到的一个小故事:当年 Google 收购 DeepMind,做技术尽调时,Jeff Dean 会拿着代码库里各个角落的问题找 Koray。因为所有代码他都 review 过,问到哪里,他都能解释。 他年轻时在 Yann LeCun 的实验室做研究,后来成为 DeepMind 第一位深度学习研究员,组建了深度学习团队。那时研究团队只有十来个人,大家决定找一个足够有挑战的任务一起攻,最后选了 Atari 游戏,也就有了后来的 DQN。今天我们熟悉的深度学习+强化学习训练智能体,他是从早期就亲手参与其中的人。 这集访谈也谈到 Google 今天的处境,他的回答也相当直接。Google 到底还追不追 frontier?他先承认,当前模型的质量确实略落后于最前沿。但目标没有变,研究方向怎么选、资源如何排序,都是为了回到前沿。 还有一个很有意思的问题:如果有一根魔杖,可以直接给模型增加任何能力,他最想要什么?他的答案很简单:让模型更聪明。更聪明以后,很多事情都会做得更好、更自然。 加了中文字幕,值得花 27 分钟看看。
Michael Guo42,453 görüntüleme • 25 gün önce

When Hong Wang won the Fields Medal, everyone talked about the honor: her age, her journey, the history she had made. But the most interesting question was barely discussed: What did she actually solve? It begins with a needle. Turn it until it has pointed in every possible direction. How little space can that movement occupy? Almost none, strangely. And yet, that tiny set may still carry the full complexity of three-dimensional space. This is the Kakeya conjecture. It sounds like a puzzle, but it resisted mathematicians for more than a century and sits at the heart of how mathematics understands waves and their concentration—the same world of ideas behind MRI reconstruction, image compression, sound and quantum physics. In 2025, Hong Wang and Joshua Zahl finally solved the three-dimensional case. This video starts with that simple needle and slowly reveals the mathematics behind the medal. We celebrated the person. This is a chance to understand the work.
Michael Guo85,998 görüntüleme • 2 ay önce

两年多前,Google 联合创始人 Sergey Brin 也曾站在 AGI House,承认 Google 在大模型上落后了,并说要追赶回来。 后来的结果大家都看到了:Gemini 一路追上来,半年前 Gemini 3 发布时,Google 至少在很多维度重新回到了第一梯队。 但六个月后,局面又变了。 这一次,仍然战斗在一线的 Sergey 再次回到 AGI House,做了一场新的 Q&A:他怎么看 AGI 和超级智能,怎么看 Transformer、世界模型和 AI for Science,Google 为什么现在重仓 coding agent,他和 Demis、Corey 在 Gemini 上到底怎么分工,以及他是否还相信 Google 能再追上来。 下面划重点: Google 重新把 coding 放到最高优先级之一。 Sergey 承认,他们可能更早就该深度关注 coding。现在 Google 已经非常专注于这个方向。 他对 Gemini 仍然有信心,但也承认竞争对手在 coding 上进步很快。 他提到,某些模型在长时间、深度 coding 任务上表现很好;而 Gemini Flash 的优势在于速度,适合交互式快速迭代。 他认为 AGI 的关键不只是“会回答问题”,而是能自我改进。 他个人更倾向于把 AGI 理解为一种能够改进自己的 AI,而不是单纯“什么人类任务都能做”。 世界模型很重要,尤其是如果 AI 要进入物理世界。 如果 AI 要做人类能做的事,就必须理解世界、预测行动后果,并和现实世界互动,这会延伸到机器人、多模态和视频模型。 Transformer 可能还没到头。 他认为 Transformer 已经从文本扩展到图像、视频等场景,而且不断演化。类似 Transformer 的架构,有可能继续走向 AGI。 他在 Google 内部的角色更像“推动者”而不是正式负责人。 Corey、Demis 等人负责组织和交付,Sergey 则不断追问团队有没有漏掉重要方向、有没有低估某些优先级。 他对“AI 会取代人类意义”没那么悲观。 他用国际象棋和围棋举例:机器超过人类后,人类并没有停止下棋,反而借助 AI 变得更强。 整体听下来,你能看到 Google 内部现在的真实焦虑和重心:AGI、自我改进、coding agent、世界模型,以及用 AI 来构建下一代 AI。 (中文字幕视频)
Michael Guo92,976 görüntüleme • 2 ay önce

有了 Herdr 以后,不仅可以很方便地集中管理所有计算机上的 Agent,也可以直接通过手机远程管理这一整套 Agent。 一种办法是 Tailscale + Termius。通过 Termius 登录 MacBook Pro,运行 herdr 命令,就可以直接在手机上控制 Herdr 里的所有 Agent。 更有意思的是,我甚至不需要直接操作 Herdr。 只要在 Claude Code App 里 remote 到 Herdr 的主 Agent,就可以间接控制其他所有 Agent。这个主 Agent 就像我的眼睛和手,可以命令其他 Agent 做事,也可以把它们的结果汇总反馈给我。 这样我在手机上直接用 App 的图形界面,就能控制整套分布式 Agent,而不需要在 Termius 的 CLI 里费劲调出键盘敲命令。
Michael Guo34,031 görüntüleme • 1 ay önce

硅谷的Party真不少。不是吃喝玩乐的party, 是技术碰撞分享的聚会。 这不, Andrej Karpathy在另一场小型聚会上分享了他这几年和Agent的经验。 Karpathy 主要讲了四点: 1. 2016 年 OpenAI 做 agent 太早了 当时他们试图用强化学习做能操作电脑、点网页、完成任务的 agent,项目叫 World of Bits。但技术栈不成熟,基本只能靠 RL 去“撞 reward”,所以效果不好。 2. 当时正确路线是先做语言模型 他认为后来事实证明,先放下 agent,转去构建 language model 是对的。今天 agent 重新变热,是因为底层工具已经完全不同:现在不是靠 RL 硬训,而是靠语言模型、工具调用、记忆、规划等能力组合。 3. Agent 很容易 demo,但很难产品化 他提醒大家不要被 demo 迷惑。自动驾驶、VR 都是类似例子:想象很容易,做 demo 也容易,但真正做成可靠产品可能需要十年。Agent 也是这样,适合长期投入,不适合短期幻想。 4. Agent 需要借鉴人类认知结构 他提到可以重新从神经科学找灵感,比如海马体对应记忆和检索,前额叶对应规划和反思,丘脑/基底节可能对应多模块协调。语言模型只是其中一部分,真正的 agent 需要一整套认知工具。 最后他的鼓励是:现在做 agent 的创业者和 hacker,可能真的站在能力边界上。大模型训练这块大实验室已经摸得很清楚,但 agent 还很新,很多东西还没被系统探索完。
Michael Guo76,259 görüntüleme • 2 ay önce

当 AI 和世界还没有今天这么喧闹的时候,一个名叫 Andrej Karpathy 的年轻人,戴着那时还很时髦的 Google Glass,骑着自行车,从他上学的斯坦福,去他实习的 Google,一边骑,一边录了一段 vlog。 视频拍于 2013 年。那时他还是斯坦福博士生,在 Google 实习,做的项目是 deep learning:搭神经网络,让它理解图片和视频。拍摄工具是 Google Glass。他还自己给它写了应用,出门就戴着。他最喜欢的游戏是玩魔方,其实是他休息的方式。 斯坦福 计算机系的走廊,是 Larry Page 和 Sergey Brin 当年读博时走过的同一条。第一台 Google 服务器,也曾在这栋楼的地下室运行过。 Palo Alto 的路,到今天还是他当年记录的那个样子,破得很稳定。加州人有钱,但就是不用来修路。该咋地咋地。 到了 Google,园区还是那种这家公司刚刚长出来的感觉:餐厅、共享自行车、来参观的游客,还有一头恐龙雕塑。那时的 Google 还在三驾马车(Eric Schmidt带着两个founder)年代,除了 Google Glass,还在做 Google 气球和自动驾驶。 那个年代好像已经很远了。 当年连 Andrej 都要辛苦搭起来的神经网络,现在应该已经很容易了吧。 如果你对那个年代的斯坦福、Google 和 Palo Alto 好奇,这条视频是一个稀有的窗口。
Michael Guo71,947 görüntüleme • 2 ay önce