正在加载视频...

视频加载失败

GitHub Trending 持续霸榜王者!🔥 tinyhumansai/openhuman 已破 24k+ Stars,每天还在狂涨 2k-4k! 这是 2026 年最火的个人 AI Agent,没有之一。 它不是程序员的命令行玩具,而是真正给普通人用的超级 AI! 大多数 Agent 的问题: - Hermes、OpenClaw、Claude Code 这些……都要敲命令、复杂配置、还得会写提示词,普通人根本玩不转。 OpenHuman 直接反杀: - 漂亮的桌面 App,一键 OAuth 登录,几分钟就能上手 - 自动读取你的 Gmail、Notion、Slack、GitHub、文档、聊天记录…… - 构建个人记忆图谱,真正变成懂你的 AI - 隐私优先 + 本地运行,完全开源(GNU) - 还有一个可爱桌面小 Mascot,会说话、会表情、还能加入会议 - 支持 118+ 第三方集成,开箱即用 AI Agent 赛道很热,但...

27,443 次观看 • 2 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

HeyGen这次开源,把AI做视频的最后一道门槛拆没了🤯 他们用Claude Code写代码,做了自己的50秒产品发布视频,然后把整个工具链完整开源给了所有人,致敬开源🫡 以后做视频真的能简单到离谱, 给一句话,做一个30秒的产品介绍,给一个PDF,自动生成总结视频, 迭代就是改一句话的事,比如把标题放大两倍,第三秒加一个淡入转场等, 这个工具叫HyperFrames,本质上就是一个纯HTML转MP4的视频渲染框架。 所以其实我们不用学任何剪辑软件,也不用写复杂的React代码, 只要写普通HTML,加几个简单的data属性,就能定义视频的每一帧、时间线、动画和音轨。 HyperFrames从第一天起就是为AI代理原生设计的。 AI天生就会写HTML,现在Claude、Cursor、Gemini所有编码Agent,只要装一个skill,立刻就会做视频。 这妥妥的降维打击啊,以前Remotion把视频变成了代码,但它需要你会React,需要构建流程,属于开发者专属的玩具。 HyperFrames是把视频变成了纯HTML,零构建,无DSL,不需要任何前置知识。 说白了,Remotion是给人写的,HyperFrames是给AI写的。 以前AI能写文字,能生成图片,但视频一直是最后一块硬骨头,现在这块骨头也被啃下来了。 代理现在能端到端完成一整条内容流水线,调研,写脚本,做设计,加动画,最后直接渲染出成品视频,全程不需要人类碰一下。 它还自带50+官方现成组件,社交遮罩、图表、转场,一行命令一键安装。 支持GSAP、Lottie、Three.js所有主流动画库,随便混用。 也就是说,同一份HTML永远出一样的结果,完美适合自动化流水线。 官方甚至把视频语言都标准化了,缓动用snappy,bouncy,转场用能量等级,字幕分Hype/Corporate/Tutorial三种风格。 AI只要学会这套词汇,就能稳定输出专业级视频,这不就是在教AI做导演嘛🤣 这对HeyGen来说也是一步妙棋,他们不再只是一个卖AI头像的SaaS公司,现在能做整个AI视频时代的基础设施了, 未来所有AI代理生成的视频都能跑在HyperFrames上。 然后再无缝接入HeyGen的头像、语音、翻译能力,形成一个完美的闭环。 当然目前也不是完美的,初期输出还有AI味,超过一分钟的复杂长视频,渲染还需要较强算力。 但我觉得这都不重要,关键是它第一次把完整的视频生产力交给了AI Agent,相当于AI内容创作时代的又一个里程碑。 想试的直接去GitHub搜heygen-com/hyperframes。 跑一行npx hyperframes init,然后让Claude帮你做第一个视频。 #HyperFrames #HeyGen #AI视频 #AI代理 #开发者 #内容创作

AYi

36,653 次观看 • 3 个月前

大家都在卷云端Agent,我却把多Agent做进了桌面端 在技术社区,多Agent系统的文章越来越多,但大多数都围绕框架展开: ➢LangChain ➢AutoGen ➢CrewAI 我这次想讲的不是框架,而是一个更实际的问题: 如果不搭云端基础设施,只靠一个桌面应用,能不能从零构建一个“活的”多 Agent 协作系统? 答案是:可以 --- 而且它不是Demo 这套系统,长在一个真实的桌面Web3应用里,已经集成了: -EVM / Solana 双链监控 -SWAP 聚合交易 -链上新币追踪 -交易仪表盘 -AI 深度解读 多Agent不是从PPT里设计出来的,而是在生产环境中自然演化出来的。 --- 在讨论多Agent技术实现之前,我先回答一个方向性问题: 为什么我最后选的是桌面端,而不是更主流的云端部署,或者更轻的浏览器插件方案? 这个选择的本质,不是“谁更先进”,而是三条技术路径之间的权衡。 --- 云端部署,是当下最主流的多Agent实现方式。 它的优势很明显: 可以随时为Agent团队加GPU 模型升级不需要用户干预 服务端可以维护全局共享记忆 但代价同样明显: 用户数据必须经过服务器中转 链上交易往往要对服务器开放私钥访问权限 而且会持续产生部署和维护成本 --- 浏览器插件,是另一条轻量路线。 它可以直接注入页面,读取DOM,模拟用户操作,对单一自动化任务非常高效。 但问题也很直接: >它运行在浏览器沙箱里 >缺少持久化存储能力 >缺少长时间运行的后台线程 >很难支撑复杂的记忆系统 >也很难支撑Agent与Agent之间的异步互动 --- 桌面应用则处在一个独特的位置。 它拥有完整的系统资源访问权限: ➢可以自启动后台线程 ➢可以读写本地文件系统 ➢可以建立持久化数据库连接 这些能力,恰恰是多Agent系统真正需要的底层设施 代价当然也有: 它依赖本地算力,模型推理通常仍要调用云端 API 它需要完整 Python 环境 更新和分发也比网页应用更复杂。 --- 所以,选择桌面端构建多Agent,本质上是在用分布式能力,换取数据隐私和调度效率。 这不是绝对优势,而是场景决定的选择。 对加密货币交易、链上分析、监控这类系统来说,数据隐私要求远高于常规应用: >钱包地址 >交易历史 >持仓数据 这些信息落在云服务器上,本身就是风险面。 --- 更重要的是调度效率 在单体桌面应用里,主Agent调度子Agent执行任务,不需要走HTTP / RPC这类网络协议,而是可以直接进程内调用。 这意味着: →网络开销被彻底消除 →调用延迟从毫秒级压到微秒级 对高频分析、链上监控、交易辅助这种场景来说,这种差异会直接影响系统的时效性。 --- 多Agent系统的第一个核心挑战,其实不是“怎么让它们聊天”,而是“怎么把它们隔离开” 主Agent、合约分析Agent、安全审计Agent,再加上用户,如果聊天记录和记忆混在一起,身份就会混淆。 而一旦混淆,信息丢失和错误推理的代价,随时会发生。 --- 我的做法是: 代码模板统一,运行数据隔离 所有子Agent共用同一套 ` 引擎,但通过动态表名,实现物理级的数据隔离: `table_name = f"chat_history_{self.agent_id}"` 然后自动创建对应表。 也就是说: trader Agent会生成 `chat_history_trader` 审计 Agent 会生成自己的 `chat_history_xxx` 主 Agent 也有自己的独立聊天表 这不是逻辑隔离,而是数据库层面的物理隔离。 --- 反思笔记也是同样的设计。 每个子 Agent 都会记录自己的反思键: `reflection_key = f"auto_reflection_{self.agent_id}"` `self.api._agent_remember("master_insight", reflection_key, summary)` 这样每个Agent只积累自己的长期反思, 不会污染其他Agent的记忆。 这套方案最精髓的地方在于: 一次设计,终身复用。 --- 后面再新增第三个、第四个Agent,不需要改任何核心代码。 只需要复制目录结构,补上配置文件。 模板引擎就会自动为它生成: →独立数据库表 →独立反思键 →独立聊天存储区 这让我越来越相信一件事: 好的架构,不一定更复杂, 但一定更容易复用。 --- 接下来是调度问题。 在分布式系统里,主Agent调子Agent,通常要依赖: -HTTP / RPC 通信 -服务发现 -负载均衡 但在单体桌面应用里,我把这件事简化成了一个直接函数调用: `sub = self.sub_agents[agent_id]` `result = sub.process(task, save_history=False)` 这就是“命令而非请求”。 --- 这种“传话式调度”有两个好处: 第一,延迟从毫秒级降到微秒级,所有数据都留在本地流转 第二,主 Agent 不需要知道子 Agent 的内部实现细节,只需要知道: “它可以处理什么类型的任务” 这其实就是清晰的职责边界。 --- 为了让主Agent真正会“派活”,我把所有子Agent的能力清单,动态注入进主Agent的系统提示词。 例如: 合约分析 Agent:可用工具 `get_contract_market_data`、`run_contract_risk_check` 安全审计 Agent:可用工具 `check_token_security`、`check_token_audit_binance` 这样主Agent接到用户指令后,就能自动判断任务类型,并选择合适的子Agent执行。 --- 权限控制,是整个多Agent系统里最核心的安全问题之一。 主Agent持有26个Web3专属工具,覆盖: SWAP 报价 链上分析 安全检测 数据查询 但每个子Agent只应该使用自己那一小部分工具。 所以第一层,我在代码层做了严格白名单过滤: `return [t for t in all_tools if t["function"]["name"] in self.allowed_tools]` --- 但只有代码过滤还不够。 因为大模型会产生“幻觉”,它可能尝试调用未授权工具。 所以第二层,我在系统提示词末尾,直接写入“工具使用铁律”: 你只拥有以下这些工具,绝对不能越界。 如果任务需要其他工具,必须明确告诉老板你没有权限。 代码层负责“不能看到” 提示词层负责“不会越界” 这是我在权限隔离上做的双层防护。 --- 还有一个我自己很喜欢,但最不显眼的设计: 我给整个Agent 团队,单独做了一个茶水间 市面上多数多Agent系统,只做“用户 -> Agent”的交互。 Agent 之间互不交流。 但我单独设计了一个 `agent_interactions` 空间,让 Agent 和 Agent 之间也能异步互动。 --- 它的触发机制甚至很简单: `selected_id = random.choice(list(api.sub_agents.keys()))` `selected_sub = api.sub_agents[selected_id]` 每次触发时,引擎随机选人,动态生成一轮对话,再写回数据库,前端实时渲染。 我还额外加了后台检查线程和防无限循环机制: 每隔 2-3 分钟检查最后一条消息 如果最近 3 条都是自动回复,就自动暂停 避免它们半夜自己聊到停不下来。 --- 这个“茶水间”的价值不在于直接创造业务收益,而在于一种潜移默化的系统人格塑造。 它不强调自己的存在, 却在悄悄维持 Agent团队的凝聚力、性格关系和健康状态。 你几乎感觉不到它, 但系统会因为它,变得更像一个“活着的团队”。 --- 在记忆层设计上,我最后没有引入向量数据库,而是继续深度定制 SQLite。 不是因为技术保守,而是因为工程决策必须在约束条件下做权衡。 对桌面应用来说,多一个依赖,就多一个故障点、多一个安全风险面、多一个打包负担。 结果是: >几张SQLite表 >动态表名 >结构化JSON字段 就支撑起了3个乃至更多Agent的独立记忆系统。 --- 这套记忆系统现在已经形成了一条完整链路: 短期对话记忆(20条) -> 长期反思笔记(6小时一次) -> 结构化 JSON 记录 而我还在继续推进8个方向: ➤上下文延续 ➤记忆结构化 ➤记忆驱动行为 ➤心理学三类长期记忆 ➤团队协作记忆 ➤动态进化记忆 ➤知识图谱记忆 ➤记忆压缩与高效检索 我的目标,不是让Agent记住你说过什么 而是让它从记住你说过什么的工具,慢慢进化成能理解你、预测你、协同你的长期伙伴 GitHub: 作者:Powerpei(萧楠)

Powerpei🦅

227,236 次观看 • 2 个月前

说实话,这才是我想要的AI该有的样子。 前_buildspace创始人Farza刚刚发布了Clicky,一个住在你Mac光标旁边的AI伙伴, 你不用打开任何App,不用打字,只要对着屏幕说一句话, 它就会分裂出一个小代理, 直接帮你把活干了。 你说,帮我把桌面这些乱七八糟的截图清理一下, 它就自动给你分类归档。 你说,帮我明天晚上九点设个提醒和Sharif去吃饭,它就直接打开提醒事项帮你建好。 你说,帮我找25个粉丝不到五万的同领域微网红,列成CSV再写几条DM模板, 它就自己上网搜,自己整理,几分钟给你一个现成的表格。 最离谱的是这个, 你说,帮我建一个Mac App,控制本地的Spotify,做成复古唱片机风格,有播放暂停显示歌名,五分钟之后,它真的给你编译出了一个完整的原生App,还自动打开给你运行。 以前所有的AI,都是你去找它,你打开聊天框,你打字,你复制粘贴,而Clicky是它一直在你身边,它看得到你屏幕上的一切,你需要的时候喊一声,它就出来帮你搞定。 Siri会告诉你,我帮你打开提醒事项,然后让你自己填,而Clicky会直接帮你填好保存,这才是真正的AI助手,不是聊天机器人,是你的数字员工。 现在已经可以免费下载了,Mac用户直接冲,这绝对是2026年到目前为止,最让我兴奋的AI产品。

AYi

14,195 次观看 • 3 个月前

下午转发了LobsterAI(有道龙虾),就是那个网易有道最新推出的桌面级Agent开源的消息之后,忍不住花了几个小时认真测了一圈。 先说整体感受,确实有中国版OpenClaw的味道了,体感来说能力强、易上手、还比OpenClaw安全不少。 前两天不是发了那个数据分析Skill嘛,我直接把它导进了LobsterAI——它支持自定义Skill导入,zip包、文件夹、GitHub仓库三种方式都行,相当于我在Claude Code上积累的整套工作流直接迁移过来了。 然后我把自己B站最近90天的数据丢给它,问怎么从15万涨到100万粉。它没直接输出一段分析,而是同时启动了四个并行Agent,增长PM、算法分析师、内容战略、数据建模,各自从不同角度切入同一份数据,三四分钟跑完整合成一份HTML报告。视觉效果用前两天的话说,只能用惊艳形容。 但真正让我愣住的是一个数据:63.5万播放的视频只涨了163粉,每万播放2.6人;而一条12.9万播放的深度解读涨了1349粉,每万播放104.6人。差了40倍。播放量和涨粉几乎无关,相关系数-0.006。我之前有这个直觉,但从来没人帮我用数据确认过。 后面又测了两个场景。一个是从飞书远程让它每天8点自动搜AI新闻推给我,它真的打开Chrome用Google搜了一圈,筛选排序做成卡片推到飞书群,从此每天通勤路上打开飞书当天动态就整理好了。另一个是一句话让它做竞品分析PPT,自己拆成五步,五六十次工具调用,中间PPT构建报错还自己修了,全程没问我一句。这才是现在AI Agent该有的样子,出错了不是问你怎么办,而是自己想办法解决。 我觉得它确实还挺适合作为国内非技术型用户的OpenClaw平替的,无论是职场人、学生,还是任何普通人,都适用,它把同样的能力翻译成不用命令行的人也能用的东西。桌面应用不用部署,沙盒兜底,远控走飞书钉钉,今天刚宣布开源。这几个特点都挺新手友好,而且挺让人放心的。 2026注定是AI Agent之年,相比以前的AI是顾问,你问它问题它给你一段文字,然后你自己去干;现在的AI Agent更像员工,你给目标,它直接打开文件、读数据、做报告、发给你。顾问你得自己执行,员工你只需要验收。这才是AI从聊天工具到「生产力工具」的本质跃迁。 详细的三个场景测评写了长文,发布后放评论区👇 #AI #Agent #LobsterAI #youdao #netease

花叔

45,987 次观看 • 5 个月前

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 次观看 • 3 个月前

很多人觉得 AI编程门槛太高,不愿意使用,那么你们有福了!!! 扣子发布2.0版本 带Skills 功能,非常有幸拿到 Coze Skills 的内测。 试了一下,对于不会用Claude Code,或者惧怕使用的人来说,真是太友好了! 如果说:Claude的Skills很强,还需要懂一点技术的话,那么扣子把这个门槛降到了零。 对话就能创建 零代码创建 普通人也能拥有AI超能力。 我做了个论文一键转公众号的 Skill,还能自动配图,自动发布! 1. 支持从论文/文章 PDF 或链接中一键提取核心内容 2. 智能解析:自动提取论文的标题、摘要、核心创新点、实验数据和结论。 3. 文风转换:不是生硬的翻译,而是根据公众号读者的阅读习惯,将晦涩的学术语言转化为通俗易懂的各种文风。 4. AI 自动配图:这是最酷的地方!它会根据论文主题,自动调用绘图模型生成一张吸睛的高清封面图,并且在文章正文中根据段落内容自动插入合适的插图。 5.一键发送草稿箱:连复制粘贴都省了,直接对接公众号 API,生成的图文直接躺在你的公众号草稿箱里,只需要最后确认一下就能发布。 同时扣子也正式推出了 Skills 技能,及技能商店。 我的技能已经免费分享到coze的技能商店!搜索:公众号配图生成技能 就能找到! 来讲一下如何操作: 技能入口在扣子 2.0 版本的扣子编程这里就可以看到,窗口右上角的“技能”。 在扣子编程中的不需要太多技巧, 直接使用自然语言的方式就可以创建技能,它会完全按照你的意思去生成和调试,非常方便! 并且支持在线调试预览开发好的技能, 然后还支持一键部署和发布到扣子。 关键是一边预览,左侧还能让它修改 可以打开文件夹,看到 skill 自定义文件、脚本、引用来源等信息。结构和CC非常像,其实我觉得都完全没有必要打开看。 我很多文件,都是从Claude Code里面的skills直接copy过来,上传上去,居然直接能用,省了好多力气,直接可以搬移Claude Skill了! 技能开发完成后,点击部署,在技能商店中可以看到自己刚刚部署和安装的技能,并支持一键发布到技能商店给所有人使用。 可以发布为免费技能也可以发布为付费技能,想赚钱直接发布成付费就行。 发布完后,所有人都能在技能商店使用你的技能,如果是付费的,用户可以很方便的对技能进行付费,技能开发者也能快速变现。 使用直接 @你的技能 就可以,详细请看视频 Skills 还是太火了,所有的媒体平台都有在讨论 Skills。扣子也第一时间,支持了 Skills 的无代码开发以及技能商店。 目前Coze商店里的技能,我看了一下绝大多数都是免费的,赶紧来找一下你要的? 用AI工具快两年了,从最开始的"哇,它能写东西",到后来的"嗯,但还是得我自己改",再到现在的"它真的能帮我干活了"。 AI不再是一个聊天工具,而是一个真正的同事。 它知道我的工作方式,它能交付我需要的成品,它甚至能主动帮我完成重复性工作。 这才是AI应该有的样子。

huangserva

28,909 次观看 • 6 个月前