Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

deepseek-harness重磅开源,采用了一切皆插件的架构,也就是中国版的openclaw,体验了下可以称之为私有化的workbuddy。 场景侧冲击:有了deepseek-harness之后,企业域的私有化code、cowork基本用这个就可以了,直接会冲击workbuddy之类的市场。 之前DeepSeek Harness内测招募,本质是一次开源 Agent 生态大摸底,把全球 Agent 基础设施的家底扫了一遍后,预计后续版本应该会在开放生态上做一些事情。 dsh看点不在"又一个 Claude Code",有3个看点: 1️⃣ 一切皆插件 模型、工具、skill、会话、沙箱、存储、主循环、调度,连 UI 都是插件,配置里全都可换,不动源码。四种运行模式里最有意思的是 Minimal——只留一个 bash 和一个文件编辑器,摆明了是给模型做裸机 benchmark 的。 2️⃣ 每一次运行都可回放 系统提示、推理过程、工具调用与结果、子 agent 调度、所有 context 注入,全部进 append-only 的 session log,resume / fork / search / replay 都跑在同一条事件流上。 3️⃣ 最狠的是内核 dsh 跑在 Cordis 上,它把插件系统拆成两个正交维度:时间可组合性:卸载一个组件时副作用能完整回滚(每个 context 变换都带一个逆,运行时来追踪);空间可组合性:依赖可声明、且 context 一变就反向通知组件。还给了一套动态组合的演算,证明这个性质能从单个组件传导到整个系统。...

37,767 görüntüleme • 9 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

15 张数据图帮你了解 DeepSeek Harness 昨天 DeepSeek Harness 发布,于是就想着让 Codex 分析一下,找到了一个很好的角度,就是从一些数据上向大家介绍这个产品。 确实也发现了一些很有意思的东西: 插件系统与 Koishi 高度相似: 他们主打的插件系统与 Koishi 的插件平台相似度高达 75%。大概率是整个平台都挪过来了,不知道是不是他们的核心开发者入职了。 大量使用 AI 开发: Codex 命名的主干 PR 达到了 21.2%,分支信息中提到 Codex 的比例有 28.2%。 猜测他们肯定用了 Claude Code 开发,只是删掉了一些 Claude 的痕迹。 参考了大量外部 Agent 项目: 提到最多的外部项目是 Pi,第二多的是 Codex,之后是 Claude Code。甚至直接引用了一些 Pi 的 TypeScript 文件。 高效的代码产出: 整个产品在 GitHub 上有记录的是 65 天,总共的代码产出量是 84 万行,有一万多个 commit,非常高效。 交互入口的演变: 他们曾经押注 TUI,后来改成 Web UI 和 TUI 的双入口,再之后整个删除了所有的 TUI,只留下了 Web UI。 开发与工程规范: 整个项目的测试代码比生产代码多很多,基本上达到了 1:1。 全仓库的 Markdown 文档也非常多,说明他们是基于文档去控制 Harness 开发的。他们有完整的工具和科学模型 schema 共 52 个,但最后只留下了一个,目的是为了减少上下文占用。 社区热度与生态:从昨天发布到现在 20 小时,GitHub 已经涨到了 8 万多的 star,非常快。插件体系标签(DSH plugin)已经有 1425 个项目,但有很多并不是真正的插件,看来有不少蹭热度的。 精选清单收录了 211 个仓库,主要补充的是工具、UI 和运行的一些基础设施,甚至一上来就出现了插件市场和插件管理的插件。 学术论文: 他们顺便发了一篇 88 页的论文,其中 57% 都在做一些形式化的理论推导和展示。论文主要讨论的是插件的热插拔和系统稳定性问题。

歸藏(guizang.ai)

16,428 görüntüleme • 9 gün önce

花了几天把 Grok Bot 测完了,整体感受是它把人类白领的工作接管了,相当于24小时不停歇的云端人类白领: 你建一个 bot,系统给它分配一台云端电脑:这台机器上有真实的浏览器、文件系统和终端。你把活派给它,它自己登录你现有的工具,一步步做完,你合上笔记本它还在跑。 一开始我对它期望挺高的,用完后还是蛮失望的:测试之前感觉它是一个AI员工,测试完更感觉Grok Bot 是 RPA 的重做版,是chatgpt work、claude cowork的阉割版,唯一的差异就是提供了一个可显示的云端电脑。 1、先说好的一面 Grok Bot 核心是让它像白领一样操作屏幕,这对于国内各家都没有统一接口的时候,很多场景非常有意义,比如公司的一个 SaaS系统就算没有开放 API,AI员工照样能进去干活。 还有一个有意思的功能是teach a task:不写流程,人把这件事做一遍给它看,它录下来变成可复用的自动化。然后设置 routine 可以定点跑,比如每天早上七点出简报、也可以被事件触发、比如 Slack 来了新消息回复,你在一个 bot 上连过 Gmail 或者 GitHub,其他 bot 直接共用这个连接。 写自动化的门槛,就这样从会写代码的人,降到了会干这件事的人。 2、当然也有不好的一面 不能选模型:派哪个模型干哪个活由系统自己决定,界面上没有开关,个人用户无所谓,团队要做成本核算或者合规审计就很难受。 账单也糙:用量按周结算,超出部分按原始 token 成本计费,目前还没有花费上限。发布那周有人专门买了 Cursor Ultra 去测,后台仪表盘显示零用量,app 里却显示已经用掉 48%。 稳定性同样是 beta 水平,不同网站上的表现差距明显,复杂的多步骤指令会被理解错,说明grok的能力还有待提升。 目前Grok Bot 更像一个白领里的搬运工,比如从各种网站或后台之间搬运数据和内容,它挺合适的。 不过grok带来的影响是,AI 员工这个形态的底层单位已经清楚了:一个身份,一台机器,一组账号权限,一份持续的记忆。剩下的问题是这套东西归谁,xAI 的方案要求你把公司账号的钥匙交给一朵美国云,绝大多数中国企业或注重隐私的估计不会干,未来国内相信也会出来类似的产品。 #grok #grokbot

AIGCLINK

22,323 görüntüleme • 6 gün önce

两个人不见面,不聊骚,不涉黄,不约会,不聊色的情况下,一个男的一个女的能聊多久? 我长期观察 Kindred Labs ,有了一个清晰的判断。 它真正想解决的不是 AI 像不像人,也不是 IP 会不会火,而是一个更底层的问题,IP 在数字世界里,第一次拥有完整生命周期的数据主权。 现在大多数 IP 的命运都很相似。 被创作 被传播 被消费 被平台吃掉数据。 用户的情绪 行为 偏好 和记忆,全都留在平台,IP 本身却什么都带不走。 Kindred Labs 的核心改变在于,它把 IP 从一次性内容,变成一个持续运行的系统。 这个系统不是靠曝光驱动,而是靠关系驱动。 SATO 只是第一个被完整跑通的样本。 真正重要的不是它是蚂蚁,而是它作为一个可持续存在的 AI 实体,每天在和用户产生可记录 可学习 可累积的数据关系。 这点非常关键。 因为一旦 IP 拥有了长期连续的数据轨迹,它就不再只是形象,而是具备了状态 演化 和历史。 这在传统 IP 体系里是不存在的。 从技术角度看,Kindred 在做的是三件事的叠加。 第1️⃣:IP 的行为层被模块化,所有互动不再是一次性调用,而是状态更新。 第2️⃣:用户关系被本地化,IP 不依赖平台推荐生存,而是存在于用户设备。 第3️⃣:数据权属被重新定义,IP 的成长轨迹是可验证 可迁移的。 这三件事组合起来,本质上是在为 IP 构建一个类似账户系统的存在形式。 不是账号,不是 NFT,而是一个可以持续运行的智能体。 这也是为什么我不把 Kindred 看成 AI 产品公司。 它更像是在搭建一个IP 的操作系统。 未来每一个进入 Kindred 的 IP,本质上都是在接入同一套运行环境。 从这个角度看,SATO 的经济设计反而只是外层。 真正的价值在于,Kindred 已经证明了一件事。 IP 可以不依赖平台流量,也可以持续存在并扩展关系。 这对内容产业意味着什么。 意味着未来 IP 的估值不再只看曝光,而会开始看留存 看互动深度 看生命周期长度。 而这些指标,只有在 Kindred 这种系统里才成立。 很多人把 Kindred 和其他 AI 项目放在一起对比,其实是错位的。 它不是在比模型能力,而是在重写 IP 的存在方式。 从长期建设的角度,我更关心的是下一步。 当更多 IP 进入这套系统,IP 之间是否会产生协作。 用户是否会开始把时间分配给不同智能体。 以及这些关系是否会反过来形成新的价值网络。 如果这些成立,Kindred 就不是一个爆款项目。 而是一条新的数字文明基础设施。 这也是我持续关注它的原因。 Kindred Labs #kindred #KAITO

比克大魔王

568,906 görüntüleme • 7 ay önce

凭啥说中国🇨🇳未来是美国🇺🇸唯一对手?你把一颗螺丝、一个零件、一个驱动程序拆开看,它什么都不是。但中国人擅长的不是某一个点,而是把所有点“组装成系统”的能力。上世纪90年代,美国搞去工业化,把制造业往外甩,老美资本家兴奋地下注:我们掌握设计、技术和规则,低端的制造就让“中国工厂”搞定。没人意识到,这不是工厂的外包,这是工业文明主动放弃了自己的“系统底盘”。风险?独家解读⬇️ 什么是底盘。美国🇺🇸它丢掉的是整个“Industrial Commons”—设计、试产、测试、修正、工艺优化……整条从实验室到量产的链条。 你可以限制光刻机、顶尖芯片,但你无法消灭中国的“体系构建能力”。然后中国开始补短板,搞芯片,搞AI,搞软件算法。最可怕的不是它追上了,而是它把这些东西也系统化了。 算法 + 工厂;数据 + 封装;大模型 + 自动化流水线。你可以断它的卡脖子技术,但你断不了它的体系构建能力。这个世界上现在只有一个国家,能把工业体系“整体打包开战”——就是中国。 这不是那种“靠卷”堆出来的,而是有深层文化机制支持的能力。能干,听话,聪明,擅长协作、执行和大工程落地。这不是一种能力,是一种建立在儒家文明结构。 所以说,特朗普不是疯子,他只是看懂了这件事。他知道,中国不是偷走了几个岗位,是在悄悄拼装一个能打仗的产业链闭环。 而这正是美国最怕的事:一个有软件有算法、后面硬件有工厂、有指挥系统、还能一体化推进的国家。 但故事还没结束。 中国🇨🇳真正的对手,其实不是美国🇺🇸。是自己。 因为历史上所有系统性最强、执行力最强的国家,最终往往都败在“刚性太强,转弯太慢”。 它会赢在系统,也可能毁在系统。摧毁一个像中国这样的国家,不需要敌人,只需要它自己不断加速、不留缓冲。

Tigris 会讲课教授是好老师

164,394 görüntüleme • 1 yıl önce

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 görüntüleme • 3 ay önce

我想很多人都有这个困扰:之前经常需要在Codex和Claude Code之间来回切换,现在又加上了最近爆火的DeepSeek Harness。 但是每次来回切换、或者想尝尝DSH的鲜的时候,我都得把背景重新讲一遍,确实挺烦的~ 最近在GitHub上发现的一个开源项目 memmy-agent,把 Codex、DeepSeek Harness、Claude Code接了进去,直接解决了困扰我很久的跨Agent 记忆的问题。 我用它做的事情很简单:把分散在不同 Agent 里的历史,沉淀到同一份个人上下文里,默认 Local-first,让它们都能调用。 我把它分别接入 Codex、DeepSeek Harness、Claude Code 之后,我做了一个信号中继站小游戏。 我先在Codex 写完基础玩法,然后对话里说一句话: 第一次失败时,给玩家一次翻盘机会,别直接结束游戏。 但这句话我故意不写入代码、README 或者是本地记忆文件。 然后新开 DeepSeek Harness,它从 Memmy 直接读出了这条决定,非常丝滑。 再新开 Claude Code,它读代码前先复述了规则,再按这个方向把后续功能补完。 代码只能告诉下一个 Agent 项目做到哪,但那些留在对话里的决策,才影响着项目接下来往哪走。 以后,Agent 要记住的,不只是代码,还有你前面已经决定的决策和经验。 Memmy 不仅帮我解决了Agent记忆的问题,还让这些经验不再独属于某一个 Agent,而是只属于你。 Switch agents, not context。 Memmy 支持桌面端、CLI、API、MCP 和 Skills多种方式,可以直接接着执行任务。 如果你也经常在多个 Agent 之间切换,可以拿自己的项目试一下。 项目GitHub:

木马人

58,681 görüntüleme • 4 gün önce