
小墨同学
@xiaomovps • 11,188 subscribers
🚀 Pi 深度玩家 | 实操+分享 🧠 AI Spark 联合创始人|企业 + AI 🌐 Pi 蓝皮书的作者 | https://t.co/oE2EonxTkj 联系合作 wx:lucky_bobe
Shorts
Videos

Pi和DeepSeek Harness对比,Token消耗差距惊人🔥 结果很有意思:DeepSeek Harness Token 消耗直接是 PI 的 12.5 倍 昨天晚上 DeepSeek harness 发布了 GUI 版本,我就很好奇他们两个的 token 消耗和缓存占比,就用了三个题目去做测试 完整的测试记录: 1、订单数据提取:Harness 9,091 / Pi 669,相差 13.6 倍 2、按截止时间选择任务:Harness 约 9.3K / Pi 907,相差 约 10.3 倍 3、修复代码并运行测试:Harness 51,027 / Pi 3,956,相差 12.9 倍 三项合计:Harness 约 69,418 / Pi 5,532,约为 12.5 倍。 不仅仅只看 token 消耗,更要看测试的速度和结果,两个 Agent 测试下来的结果都是一致的,速度上甚至 PI 还占上风 所以我就很好奇 相差 12.5 倍的 token 消耗,到底用在哪里了? 后面我会去拆解对应 Agent 的上下文,看一下在同样缓存和正确结果的方向上,为什么差距会这么大?
小墨同学51,662 Aufrufe • vor 7 Tagen

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:
小墨同学34,654 Aufrufe • vor 10 Tagen

Jev 都拿来研究代码,我就不一样,直接拿来选女朋友🔥 我直接做了一个女友选择器,毕竟美女谁不喜欢! 主要是接入 DeepSeek 去做多模态的识别,把对应图片内容组装好 通过 Jev 去打分 Jev 整体的表现非常不错打分又快又好,测试了一下 60 张美女图片直接 10 秒内搞定,主要限制还是在 DeepSeek 接口上 如果配置上本地多模的接口 输出和打分将会非常恐怖 刚刚好 JEV 的特长就是:判断、选择和打分 可以输入自己对女友的喜好,喜欢什么类型都可以做选择 其实还可以再深挖一部分,比如加上身高、体重、年龄等其他特征,那筛选起来就更美丽了
小墨同学20,654 Aufrufe • vor 14 Tagen

你有没有遇到过这种情况:有个好项目? 或者写了篇好文章,想做成视频让更多人看到,却因为不会剪辑,不知道从哪下手? 这次我找了个好搭档——Pexo Pexo,一款 AI 视频创作工具。 跟它聊聊你想做什么视频,它就能帮你生成;哪里不满意,接着说,它就能继续改。 它是给我们提供了一个新的尝试性做法,我们可以把已经整理好的知识,也就是文章或者是解题思路,然后可以根据一个具体的例子,然后自己去确定一下画风,让他去给我们做出视频。 Pexo 提供的 Mark to Fix 如果你是和我一样第一次使用,你也会感觉到非常的惊艳,在内容修改的时候非常的方便,直接可以圈出画面中的位置再说明修改要求。 1、主要可以选择对应的元素 然后过 直接让模型帮你修改 用简单的对话方式就可以完成 2、不满意的地方随时都可以调整,时间线和画面内容也可以动态修改 3、背景音乐和素材图片到整个视频的合成都是通过对话方式完成的 对于我们这一些创作者来说,视频更容易传播,以及更容易让人去接受。因为长篇的文字反而不是那么的很让人能够沉迷地看进去。当然文字和视频搭配起来会更好一些。 这个体验的入口: 我也给大家争取到了官方福利,使用邀请码MMHC5S,可以领取100积分,限前50名,有需要的可以去试试
小墨同学13,853 Aufrufe • vor 10 Tagen

学 Pi 别收藏文档了,看完这个视频,比收藏十篇教程都有用。 这次我直接制作好视频,那你完整的了解PI Agent 这个系统: 1、模型负责理解和判断 2、上下文告诉它项目背景和规则 3、工具负责读取、修改和运行 4、会话保存整个工作过程 5、Skill 和 Extension 增加新能力 6、RPC、SDK 等方式把它接进其他流程 你提出任务,模型作出决定,工具执行操作,结果再回到模型——这才是 Pi 真正的工作循环。 Pi 的优势不是默认功能有多豪华,而是核心足够轻,大脑、工具和规则都能自己选择。 先理解这套结构,再去装插件、写 Skill、做自动化。否则装得越多,越不知道 Pi 到底强在哪里。 两分钟,把 Pi 的完整构成一次讲清楚。👇
小墨同学30,709 Aufrufe • vor 1 Monat

Pi 用久了,接模型这件事越来越麻烦。 每家模型平台都有自己的账号和 Key,余额散在几个地方。想把同一个任务换个模型再跑一遍,又要重新配置、充值和查账。模型接得越多,配置也越乱。 这次我把 ZenMux 接进 Pi,只维护一个 provider 和一把 Key。 GPT-6 Astra 上线后,我直接在 Pi 里选择 openai/gpt-6-astra,然后做了几个测试测试模型的真实性。 1、模型名称,看看是不是真的GPT-6 2、模型的写作能力,看看最新模型在写作上的提升 3、修改一个代码里面的Bug,测试真实的能力 以后想用同一个任务对比其他模型,直接在 Pi 里切换模型即可。实际 token 和花费也能放在同一处看,省掉了到处找 Key、查余额的麻烦。 GPT-6 Astra 面向复杂 agent 工作流。这次我主要看它能不能把跨文件任务做完整,以及输出里有多少内容可以直接使用。官推提到它通常会减少输出 token,录屏里的实际数字会更有参考价值。 ZenMux 本场还有 7 天限时充值活动。 充 $50 得 $70 充 $100 得 $150 每个账号限兑一次 原本就准备跑 API 的,可以趁这次多留一点测试额度。 GPT-6 Astra
小墨同学20,221 Aufrufe • vor 23 Tagen

Pi Agent 的 Sub-agent 我一直在用,最近我又拿 Apodex 1.1 跑了一轮多 Agent 搜索。 它处理资料对比的方式,和普通 Deep Research 不太一样。 Pi Agent 本身没有内置 Sub-agent,需要通过插件扩展。你可以让 scout 搜资料,researcher 整理信息,再交给 reviewer 检查。每个角色使用什么模型、开放哪些工具和权限,都能自己配置。 这种方式很灵活,适合喜欢自己搭 Agent 工作流的人。 这次我给 Apodex 1.1 的任务,是核对 Pi Agent、Codex CLI、Claude Code 和 FrontierAgent 的多 Agent 能力。 这些工具更新都很快。同一项功能可能在旧文档里没有,最新版本已经加入,也可能只是插件支持,最后却被写成官方内置。 所以我从一开始就限制了资料范围,只接受官方文档、GitHub 仓库和版本更新记录。 Apodex 会根据问题拆分搜索路线。多个 Agent 分头查不同工具,阶段结果持续汇总到同一个任务中,最后再集中比较。 我这次想看的,是它能不能把一个资料多、版本杂的任务持续做完,并把每条结论的来源留下来。 最终表格会单独区分官方内置和插件实现。不同官方页面出现冲突时,它会列出各自的来源和更新时间。官方没有明确说明的地方直接标成未知,不会为了填满表格补一个答案。 交付结果还会经过 Statement Review。关键结论与生成过程分开检查,遇到证据不足、引用不匹配或资料冲突时,会留下对应的检查记录。 两种多 Agent 的使用方向也很清楚。 Pi Agent 适合自己组建团队。角色、模型和权限都能深度调整。 Apodex 更适合多路搜索,把分散的资料放到一起比较,再交付一份可以继续核查的结果。 如果你经常需要确认某项能力究竟是官方支持、插件提供,还是目前没有明确资料,这种工作方式会比较实用。 FrontierAgent 是开源的单机 Agent harness,支持 ReAct 和 Agent Team。macOS、Linux 可以一条命令运行,无需强制预装 Docker。觉得有用可以去 GitHub 点个 Star。 Apodex 1.1 mini 是开放权重的 35B 模型,可以本地部署,也能搭配 FrontierAgent 使用。 Apodex 1.1 在线工作台已经上线。注册新用户有 credits,可以上传自己的文档、数据或表格跑一次。API 平台目前免费两周。
小墨同学27,831 Aufrufe • vor 1 Monat

Pi虽然核心简单,但是组合在一起一点也不简单。 可以打造成自己的工作台,非常的完美 可以通过 Extension API,很多原本固定的东西都可以自己改,所以完全可以把 Pi 慢慢做成自己的 AI 工作台: 1、做一套常驻状态栏 模型、Thinking、Token、Context、Git 分支这些信息直接放在底部,当前状态一眼就能看到。 2、挂一个 Todo / Task 面板 把当前目标、已完成步骤、下一步任务留在界面里,跑长任务的时候不用反复问 Pi 现在做到哪了。 3、把 Context 做成可视化 System Prompt、Skill、Tool 分别占了多少,上下文还剩多少,什么时候该 Compact,都可以直接看到。 4、再配合 pi-cc-extensions 补阅读体验 Tool Call 折叠、Rich Diff、Markdown、Mermaid、长输出这些一起处理,Pi 默认比较素的阅读体验基本就补齐了。 最有 Pi 味道的是,这些东西不用等官方慢慢加。 你甚至可以直接让 Pi 帮你写 Extension,改完 /reload,马上继续用。 我现在越来越喜欢这种感觉: 不是去找一个功能最全的 Coding Agent,而是拿一个足够简单的 Pi,慢慢改成自己的工作环境。
小墨同学18,185 Aufrufe • vor 26 Tagen

兄弟们,最近这个开源项目有点猛 🔥 OpenShip —— 把 Vercel + Supabase + Resend 打包成一套的自托管神器 核心亮点直接上: 1. 一键 Git 推送部署,零停机 + 一键回滚 2. 内置完整邮件服务器(无限域名/邮箱,不用再交 Resend/Postmark) 3. 一键拉起 Postgres / Redis / Mongo / Qdrant 等常用服务 4. 原生支持多环境(Dev / Staging / Prod) 5. 自带 MCP,AI Agent 可以直接帮你管部署和日志 6. 还提供桌面端客户端,体验比纯 Web 更丝滑 跑在你自己的 VPS 上,成本可控,无厂商锁定。 适合已经在自建、或者被云服务账单搞烦的人。 项目地址和演示视频我放评论区了,感兴趣的可以先 Star 再试。 有人已经在用了吗?效果怎么样?
小墨同学18,205 Aufrufe • vor 2 Monaten