AIGCLINK's banner
AIGCLINK's profile picture

AIGCLINK

@aigclink37,146 subscribers

致力于让每个想拥抱AI的人都能找到适合自己的AI产品,助力企业定制AIGC应用

Shorts

阿里最新放出来了一款全新端到端角色图像动画框架:Wan-Animate-2,实时驱动角色,延迟极低 Wan-Animate-2的一大核心是实时交互,直接解锁直播主播、交互式数字人场景 首先,Teacher forcing+错误缓冲+Self-Forcing蒸馏+逐块反向传播三阶段训练,这套组合拳把延迟压到了实时,把从几分钟生成一段视频变成实时流式生成 其次是端到端不需要中间运动提取,之前的方法先提取骨骼/关键点再驱动,提取一错角色就崩 再就是驱动视频的拍摄角度和输出视角可以分开 以前驱动视频是从什么角度拍的,生成的视频就只能是什么角度,想让角色换个机位做不到,或者需要额外复杂的相机控制流程 现在直接打字就能改变输出视频的机位,动作和视角完全解耦 从效果上看,复杂动作、精细表情和物理合理性上复制的还可以,支持单人到多人、多人到多人、跨身份的动作迁移 #图像驱动动画视频 #虚拟人 #虚拟主播 #WanAnimate2

阿里最新放出来了一款全新端到端角色图像动画框架:Wan-Animate-2,实时驱动角色,延迟极低 Wan-Animate-2的一大核心是实时交互,直接解锁直播主播、交互式数字人场景 首先,Teacher forcing+错误缓冲+Self-Forcing蒸馏+逐块反向传播三阶段训练,这套组合拳把延迟压到了实时,把从几分钟生成一段视频变成实时流式生成 其次是端到端不需要中间运动提取,之前的方法先提取骨骼/关键点再驱动,提取一错角色就崩 再就是驱动视频的拍摄角度和输出视角可以分开 以前驱动视频是从什么角度拍的,生成的视频就只能是什么角度,想让角色换个机位做不到,或者需要额外复杂的相机控制流程 现在直接打字就能改变输出视频的机位,动作和视角完全解耦 从效果上看,复杂动作、精细表情和物理合理性上复制的还可以,支持单人到多人、多人到多人、跨身份的动作迁移 #图像驱动动画视频 #虚拟人 #虚拟主播 #WanAnimate2

35,513 views

谷歌的升级版医疗模型出来了,开源了:MedGemma 1.5,可离线运行 MedGemma 1.5在上一代基础上,增加了对3D CT、MRI扫描,以及全切片病理图像的支持 能分析胸片时间序列,这对疾病进展监测比较有用;还能解剖定位,在X光片中识别特定的解剖结构 能从医疗实验室报告中提取结构化数据,这对于整合患者信息、辅助决策很方便 另外,配套还发了一款医疗ASR:MedASR 专为医疗场景微调的语音识别模型,胸片口述词错误率 5.2%,比Whisper-large-v3降低了58% #AI医疗 #MedGemma #MedASR

谷歌的升级版医疗模型出来了,开源了:MedGemma 1.5,可离线运行 MedGemma 1.5在上一代基础上,增加了对3D CT、MRI扫描,以及全切片病理图像的支持 能分析胸片时间序列,这对疾病进展监测比较有用;还能解剖定位,在X光片中识别特定的解剖结构 能从医疗实验室报告中提取结构化数据,这对于整合患者信息、辅助决策很方便 另外,配套还发了一款医疗ASR:MedASR 专为医疗场景微调的语音识别模型,胸片口述词错误率 5.2%,比Whisper-large-v3降低了58% #AI医疗 #MedGemma #MedASR

147,253 views

阿里昨晚放出了最新款TTS:Qwen3-TTS,秒级克隆、一句话设计新音色、实时流式输出,0.6B 可跨语种多语,中文克隆后直接说英日韩德法俄西葡意+ 四川话、北京话等方言,音色不变 Dual-Track双轨架构,输入1个字就能出首包音频,端到端延迟97 ms,可以做直播、实时翻译、AI客服了 用它做有声书,可以一人分饰多角,情绪、方言全有了 有1.7B和0.6B两个尺寸,1.7B性能最优,具备控制能力,0.6B均衡性能与效率 #tts #Qwen3TTS

阿里昨晚放出了最新款TTS:Qwen3-TTS,秒级克隆、一句话设计新音色、实时流式输出,0.6B 可跨语种多语,中文克隆后直接说英日韩德法俄西葡意+ 四川话、北京话等方言,音色不变 Dual-Track双轨架构,输入1个字就能出首包音频,端到端延迟97 ms,可以做直播、实时翻译、AI客服了 用它做有声书,可以一人分饰多角,情绪、方言全有了 有1.7B和0.6B两个尺寸,1.7B性能最优,具备控制能力,0.6B均衡性能与效率 #tts #Qwen3TTS

125,016 views

清华最新的开源项目,OpenMAIC:AI多智能体互动课堂,给定任何主题或文档,AI自动生成完整的互动课程 有趣的是,里面有AI老师和AI同学,类似真实的虚拟教室,不止有AI老师讲课,还有AI同学陪学 集成了OpenClaw,可以直接在飞书、Slack、Telegram里生成课堂 给定主题一键生成课堂内容,包括幻灯片讲义、测验、HTML交互式模拟、项目制学习(PBL) 课堂中的AI老师和AI同学可以 语音讲解 在白板上画图、写公式 主动发起讨论或点名让学生发言 进行圆桌辩论 OpenMAIC相当于一个AI原生的教育基础设施,从慕课看视频时代升级到了和AI 一起上课的虚拟课堂时代 #AI虚拟课堂 #OpenMAIC

清华最新的开源项目,OpenMAIC:AI多智能体互动课堂,给定任何主题或文档,AI自动生成完整的互动课程 有趣的是,里面有AI老师和AI同学,类似真实的虚拟教室,不止有AI老师讲课,还有AI同学陪学 集成了OpenClaw,可以直接在飞书、Slack、Telegram里生成课堂 给定主题一键生成课堂内容,包括幻灯片讲义、测验、HTML交互式模拟、项目制学习(PBL) 课堂中的AI老师和AI同学可以 语音讲解 在白板上画图、写公式 主动发起讨论或点名让学生发言 进行圆桌辩论 OpenMAIC相当于一个AI原生的教育基础设施,从慕课看视频时代升级到了和AI 一起上课的虚拟课堂时代 #AI虚拟课堂 #OpenMAIC

41,079 views

一款主动式AI渗透测试工具:shannon,给它源码+测试网址,它自动把网站黑一遍,然后告诉你它咋黑的 在无提示有源码的XBOW基准中成功率96.15% 开发vibe-coding天天上线,Shannon也可以让每次发版都能“一键红队” 它用Claude跑侦察、并行漏洞分析、攻击、写报告,全程零人工,能打出SQL注入、XSS、SSRF、越权等20+真实漏洞并给出可直接复制的PoC 注意它会真的改数据、注册用户,千万别在生产环境跑 Lite版开源AGPL-3.0 #shannon #AI黑客

一款主动式AI渗透测试工具:shannon,给它源码+测试网址,它自动把网站黑一遍,然后告诉你它咋黑的 在无提示有源码的XBOW基准中成功率96.15% 开发vibe-coding天天上线,Shannon也可以让每次发版都能“一键红队” 它用Claude跑侦察、并行漏洞分析、攻击、写报告,全程零人工,能打出SQL注入、XSS、SSRF、越权等20+真实漏洞并给出可直接复制的PoC 注意它会真的改数据、注册用户,千万别在生产环境跑 Lite版开源AGPL-3.0 #shannon #AI黑客

50,659 views

这个工具火了,可以用自然语言一键生成安卓和iOS App,Emergent刚上的新功能 以前可以用vibecoding做网页,现在直接出Android / iOS 安装包,比如“帮我做个记账App”即可 另外还上了一个Emergent Pro模式,Agent能力更强,能处理错误、动态调整计划,内置Linux 虚拟机,可访问互联网 网友反馈Emergent的一键生成体验比较好,输入需求即可获得完整应用,从规划到编程、测试、调试和部署,端到端自动化 #AIagent #Emergent #APP生成工具

这个工具火了,可以用自然语言一键生成安卓和iOS App,Emergent刚上的新功能 以前可以用vibecoding做网页,现在直接出Android / iOS 安装包,比如“帮我做个记账App”即可 另外还上了一个Emergent Pro模式,Agent能力更强,能处理错误、动态调整计划,内置Linux 虚拟机,可访问互联网 网友反馈Emergent的一键生成体验比较好,输入需求即可获得完整应用,从规划到编程、测试、调试和部署,端到端自动化 #AIagent #Emergent #APP生成工具

64,446 views

字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

22,776 views

一款5分钟即上线企业级AI应用的平台:Zion(国外版Momen),比coze、dify更强大 Zion是首个将AI Agent、前端、后端、数据库整合的AI应用构建托管平台,支持agent构建、托管,发布为小程序、网站、saas服务等 (重点是支持支付配置、登录注册都给封装好了,直接发布就可以提供agent收费服务,国外版叫Momen,国内版叫Zion) zion: Momen: youtube: #Zion #Momen #AIagent

一款5分钟即上线企业级AI应用的平台:Zion(国外版Momen),比coze、dify更强大 Zion是首个将AI Agent、前端、后端、数据库整合的AI应用构建托管平台,支持agent构建、托管,发布为小程序、网站、saas服务等 (重点是支持支付配置、登录注册都给封装好了,直接发布就可以提供agent收费服务,国外版叫Momen,国内版叫Zion) zion: Momen: youtube: #Zion #Momen #AIagent

77,190 views

阿里刚刚开源了TTS:Fun-CosyVoice3 0.5B,zero-shot音色克隆,可本地部署 还开源了款ASR【Fun-ASR-Nano 0.8B】,Fun-ASR的轻量化版本,推理成本更低,可以本地及定制化微调 另外,Fun-CosyVoice3模型做了升级,首包延迟比之前降低了50%,WER降低了56.4%,复杂场景字符错误率降低了26% 支持9种通用语言、18种中文方言、9种情感控制,可以跨语种音色复刻,比如说,用一段普通话录音可生成粤语、日语、英语等 支持双向流式合成,“输入即发声”,这个适用于语音助手、直播配音、无障碍阅读等等实时场景 Fun-ASR也升级了,噪声场景下准确率到了93%,新增歌词与说唱识别能力,支持31种语言自由混说无需预先指定语种 覆盖7大方言和26种地方口音,流式识别模型的首字延迟降低到了160ms #TTS #ASR

阿里刚刚开源了TTS:Fun-CosyVoice3 0.5B,zero-shot音色克隆,可本地部署 还开源了款ASR【Fun-ASR-Nano 0.8B】,Fun-ASR的轻量化版本,推理成本更低,可以本地及定制化微调 另外,Fun-CosyVoice3模型做了升级,首包延迟比之前降低了50%,WER降低了56.4%,复杂场景字符错误率降低了26% 支持9种通用语言、18种中文方言、9种情感控制,可以跨语种音色复刻,比如说,用一段普通话录音可生成粤语、日语、英语等 支持双向流式合成,“输入即发声”,这个适用于语音助手、直播配音、无障碍阅读等等实时场景 Fun-ASR也升级了,噪声场景下准确率到了93%,新增歌词与说唱识别能力,支持31种语言自由混说无需预先指定语种 覆盖7大方言和26种地方口音,流式识别模型的首字延迟降低到了160ms #TTS #ASR

35,508 views

牛,30.5K星,收集了包括Cursor、Manus、Devin、Windsurf等在内的AI工具系统提示词库 库里提供了6500+行、9个工具的系统提示词参考,包括开源和闭源的,可以了解不同AI工具的设计思路,用来学习研究 v0、Manus、Cursor、Same、Lovable、Devin、Replit Agent、Windsurf Agent以及VSCode Agent 这9个 Cursor的提示词强调了代码修改的安全性、可用性以及工具使用规范,来约束AI减少幻觉;Manus也有200多行 #提示词 #AI编程助手 #Cursor #Manus

牛,30.5K星,收集了包括Cursor、Manus、Devin、Windsurf等在内的AI工具系统提示词库 库里提供了6500+行、9个工具的系统提示词参考,包括开源和闭源的,可以了解不同AI工具的设计思路,用来学习研究 v0、Manus、Cursor、Same、Lovable、Devin、Replit Agent、Windsurf Agent以及VSCode Agent 这9个 Cursor的提示词强调了代码修改的安全性、可用性以及工具使用规范,来约束AI减少幻觉;Manus也有200多行 #提示词 #AI编程助手 #Cursor #Manus

39,982 views

英伟达版的“Banana”,英伟达开源了一款物理级图像编辑模型:ChronoEdit-14B,静态图+一句话,4秒生成一张符合物理的图像 ChronoEdit具备“时间观念”和“物理常识”,它能理解动作,比如说“推倒”、“拿起”这种动作,可以根据它学到的物理常识,画出这个动作发生后,世界应该变成什么样子 8 步扩散完成一次图像编辑,在H100上约4秒一张图 从效果看,预测动作发生结果的能力比较强,改变姿势后,人物、服装、背景风格的一致性也保持的比较好,光影、反射效果处理的也比较符合逻辑 可以用在游戏制作、电影特效、机器人训练等场景上 #ChronoEdit #AI图像编辑

英伟达版的“Banana”,英伟达开源了一款物理级图像编辑模型:ChronoEdit-14B,静态图+一句话,4秒生成一张符合物理的图像 ChronoEdit具备“时间观念”和“物理常识”,它能理解动作,比如说“推倒”、“拿起”这种动作,可以根据它学到的物理常识,画出这个动作发生后,世界应该变成什么样子 8 步扩散完成一次图像编辑,在H100上约4秒一张图 从效果看,预测动作发生结果的能力比较强,改变姿势后,人物、服装、背景风格的一致性也保持的比较好,光影、反射效果处理的也比较符合逻辑 可以用在游戏制作、电影特效、机器人训练等场景上 #ChronoEdit #AI图像编辑

26,876 views

让OpenClaw越用越聪明的自动学习系统:MetaClaw,即插即用,实时从对话中学习 和AI聊天,MetaClaw会在后台自动总结对话经验,提炼成技能注入后续对话,无需额外操作 相当于是在LLM和OpenClaw 之间架一个代理层,每轮对话自动注入最相关的技能指令,即时提升表现 每次对话结束后,会自动总结提炼新技能,技能库随着使用增长 全异步架构,服务、评分、训练解耦,AI正常响应的同时后台处理 支持两种模式,轻量技能模式无需GPU,RL模式可在Tinker云端训练并热更新权重 #MetaClaw #RL #AI助手训练 #openclaw

让OpenClaw越用越聪明的自动学习系统:MetaClaw,即插即用,实时从对话中学习 和AI聊天,MetaClaw会在后台自动总结对话经验,提炼成技能注入后续对话,无需额外操作 相当于是在LLM和OpenClaw 之间架一个代理层,每轮对话自动注入最相关的技能指令,即时提升表现 每次对话结束后,会自动总结提炼新技能,技能库随着使用增长 全异步架构,服务、评分、训练解耦,AI正常响应的同时后台处理 支持两种模式,轻量技能模式无需GPU,RL模式可在Tinker云端训练并热更新权重 #MetaClaw #RL #AI助手训练 #openclaw

15,650 views

集截屏、OCR、搜索、翻译、贴图、屏幕翻译、以图搜图、滚动截屏、录屏于一身的工具:eSearch OCR后可调用翻译,跨平台支持 github:

集截屏、OCR、搜索、翻译、贴图、屏幕翻译、以图搜图、滚动截屏、录屏于一身的工具:eSearch OCR后可调用翻译,跨平台支持 github:

40,099 views

酷,浙大、vivo最新出的一款视频虚拟试衣模型:MagicTryOn,服装的时空一致性、稳定性、服装细节都保持的不错,效果可以直接用于电商广告了 支持图像试穿、视频试穿,以及自定义试穿 擅长在比如跳舞这种人体大幅度运动,和复杂场景中试穿 具备泛化能力,可以在玩偶上进行虚拟试衣 其用扩散Transformer取代U-Net架构,来提升模型的表达能力;结合全自注意力机制联合建模视频的时空一致性,确保试衣效果在时间和空间维度上自然流畅 #虚拟试穿 #MagicTryOn #tryon #AI穿衣

酷,浙大、vivo最新出的一款视频虚拟试衣模型:MagicTryOn,服装的时空一致性、稳定性、服装细节都保持的不错,效果可以直接用于电商广告了 支持图像试穿、视频试穿,以及自定义试穿 擅长在比如跳舞这种人体大幅度运动,和复杂场景中试穿 具备泛化能力,可以在玩偶上进行虚拟试衣 其用扩散Transformer取代U-Net架构,来提升模型的表达能力;结合全自注意力机制联合建模视频的时空一致性,确保试衣效果在时间和空间维度上自然流畅 #虚拟试穿 #MagicTryOn #tryon #AI穿衣

28,402 views

一个不错的个人知识库项目:Supermemory,可以保存网络信息,比如网页、推特、笔记等内容,然后基于这些内容进行AI搜索 开源的,比X的书签搜索好用 特点: 1、ChatGPT for Bookmarks: 支持将网页、推特帖子等保存到 Supermemory,使用其内置的 AI 功能进行搜索、提问 2、知识画布:以二维画布的形式组织信息,方便理解和关联 3、写作助手:支持基于保存的数据进行AI写作 4、集成:支持 Telegram 和 Twitter 等平台的集成 github: 网站: #个人知识库 #AI搜索 #Supermemory #知识库

一个不错的个人知识库项目:Supermemory,可以保存网络信息,比如网页、推特、笔记等内容,然后基于这些内容进行AI搜索 开源的,比X的书签搜索好用 特点: 1、ChatGPT for Bookmarks: 支持将网页、推特帖子等保存到 Supermemory,使用其内置的 AI 功能进行搜索、提问 2、知识画布:以二维画布的形式组织信息,方便理解和关联 3、写作助手:支持基于保存的数据进行AI写作 4、集成:支持 Telegram 和 Twitter 等平台的集成 github: 网站: #个人知识库 #AI搜索 #Supermemory #知识库

39,062 views

一个轻量级的数字人项目:MiniMates,支持语音和表情两种驱动模式,可在普通电脑上实时运行 one-shot单图驱动,最低只需要一张图片 可以说话、眨眼、转头、做表情等 支持实时交互,实时摄像头表情捕捉、实时头部跟踪、实时语音对话 github: #数字人 #AI虚拟人

一个轻量级的数字人项目:MiniMates,支持语音和表情两种驱动模式,可在普通电脑上实时运行 one-shot单图驱动,最低只需要一张图片 可以说话、眨眼、转头、做表情等 支持实时交互,实时摄像头表情捕捉、实时头部跟踪、实时语音对话 github: #数字人 #AI虚拟人

35,360 views

这数字人效果看起来也太真实了 这是一个叫Tavus的产品,整合了视觉、语音和情感智能,让虚拟人拥有情感表达、情感理解能力 由三个核心模型组成 1、Phoenix-3 实时全脸渲染模型,能生成复杂的微表情和情绪,包括眉毛、脸庞、眼睛等,可以实时调整表情 2、Raven-0 能持续处理视觉上下文,读取情绪,理解情绪变化,并智能回应 3、Sparrow-0 用来控制对话的节奏,判断什么时候该说、什么时候该听,响应速度快 #数字人 #虚拟人 #AI数字人 #Tavus

这数字人效果看起来也太真实了 这是一个叫Tavus的产品,整合了视觉、语音和情感智能,让虚拟人拥有情感表达、情感理解能力 由三个核心模型组成 1、Phoenix-3 实时全脸渲染模型,能生成复杂的微表情和情绪,包括眉毛、脸庞、眼睛等,可以实时调整表情 2、Raven-0 能持续处理视觉上下文,读取情绪,理解情绪变化,并智能回应 3、Sparrow-0 用来控制对话的节奏,判断什么时候该说、什么时候该听,响应速度快 #数字人 #虚拟人 #AI数字人 #Tavus

28,779 views

Videos

aigclink's profile picture

deepseek-harness重磅开源,采用了一切皆插件的架构,也就是中国版的openclaw,体验了下可以称之为私有化的workbuddy。 场景侧冲击:有了deepseek-harness之后,企业域的私有化code、cowork基本用这个就可以了,直接会冲击workbuddy之类的市场。 之前DeepSeek Harness内测招募,本质是一次开源 Agent 生态大摸底,把全球 Agent 基础设施的家底扫了一遍后,预计后续版本应该会在开放生态上做一些事情。 dsh看点不在"又一个 Claude Code",有3个看点: 1️⃣ 一切皆插件 模型、工具、skill、会话、沙箱、存储、主循环、调度,连 UI 都是插件,配置里全都可换,不动源码。四种运行模式里最有意思的是 Minimal——只留一个 bash 和一个文件编辑器,摆明了是给模型做裸机 benchmark 的。 2️⃣ 每一次运行都可回放 系统提示、推理过程、工具调用与结果、子 agent 调度、所有 context 注入,全部进 append-only 的 session log,resume / fork / search / replay 都跑在同一条事件流上。 3️⃣ 最狠的是内核 dsh 跑在 Cordis 上,它把插件系统拆成两个正交维度:时间可组合性:卸载一个组件时副作用能完整回滚(每个 context 变换都带一个逆,运行时来追踪);空间可组合性:依赖可声明、且 context 一变就反向通知组件。还给了一套动态组合的演算,证明这个性质能从单个组件传导到整个系统。 总的来说,这次deepseek-harness最大的特点是极致的可替换性,也就是用最小的基础来承载,然后其他都是可插拔的插头。 #DeepSeek #harness #Cordis #编程范式 #北大 #开源

AIGCLINK

37,767 views • 21 days ago

aigclink's profile picture

花了几天把 Grok Bot 测完了,整体感受是它把人类白领的工作接管了,相当于24小时不停歇的云端人类白领: 你建一个 bot,系统给它分配一台云端电脑:这台机器上有真实的浏览器、文件系统和终端。你把活派给它,它自己登录你现有的工具,一步步做完,你合上笔记本它还在跑。 一开始我对它期望挺高的,用完后还是蛮失望的:测试之前感觉它是一个AI员工,测试完更感觉Grok Bot 是 RPA 的重做版,是chatgpt work、claude cowork的阉割版,唯一的差异就是提供了一个可显示的云端电脑。 1、先说好的一面 Grok Bot 核心是让它像白领一样操作屏幕,这对于国内各家都没有统一接口的时候,很多场景非常有意义,比如公司的一个 SaaS系统就算没有开放 API,AI员工照样能进去干活。 还有一个有意思的功能是teach a task:不写流程,人把这件事做一遍给它看,它录下来变成可复用的自动化。然后设置 routine 可以定点跑,比如每天早上七点出简报、也可以被事件触发、比如 Slack 来了新消息回复,你在一个 bot 上连过 Gmail 或者 GitHub,其他 bot 直接共用这个连接。 写自动化的门槛,就这样从会写代码的人,降到了会干这件事的人。 2、当然也有不好的一面 不能选模型:派哪个模型干哪个活由系统自己决定,界面上没有开关,个人用户无所谓,团队要做成本核算或者合规审计就很难受。 账单也糙:用量按周结算,超出部分按原始 token 成本计费,目前还没有花费上限。发布那周有人专门买了 Cursor Ultra 去测,后台仪表盘显示零用量,app 里却显示已经用掉 48%。 稳定性同样是 beta 水平,不同网站上的表现差距明显,复杂的多步骤指令会被理解错,说明grok的能力还有待提升。 目前Grok Bot 更像一个白领里的搬运工,比如从各种网站或后台之间搬运数据和内容,它挺合适的。 不过grok带来的影响是,AI 员工这个形态的底层单位已经清楚了:一个身份,一台机器,一组账号权限,一份持续的记忆。剩下的问题是这套东西归谁,xAI 的方案要求你把公司账号的钥匙交给一朵美国云,绝大多数中国企业或注重隐私的估计不会干,未来国内相信也会出来类似的产品。 #grok #grokbot

AIGCLINK

24,446 views • 17 days ago

aigclink's profile picture

阿里高德团队刚刚也开源了一个关于长程Agent任务的工具:LongHorizon-Harness,解决的是Agent自己判断自己的进展,错误会滚雪球的问题 它通过把任务状态管理从执行过程中分离出来,解决传统单一会话模式中的错误累积和上下文腐烂问题 一句未经核实的声明和事实长得一模一样,Agent没法区分,一旦一个错误前提进入了记录,后面每一步都建立在这个错误上,那么目标漂移、重复尝试、提前放弃,都是同一个根因 LongHorizon-Harness核心方案是MEA循环,它把一次长程任务拆成三个角色,Manage、Execute、Audit(管理、执行、审计) 循环,各干各的互不干扰 三个角色可以分别配置不同模型,比如Manager用轻量模型,Executor用强模型 关键机制:只有审计者能更新任务状态,且必须基于对环境的独立验证,审计报告是跨轮次的唯一记忆 效果上,使用相同模型(Qwen 3.7-Plus)和相同执行后端,仅替换框架后: WeaveBench,通过率从51.8%提升至 80.7%(+28.9) OSWorld 2.0,完成率从2.8%提升至8.3%(3倍) Terminal-Bench 2.1,成功率从69.7%提升至77.2%(+7.5),token消耗减少24% Qwen 3.7-Plus配LongHorizon-Harness的一些指标甚至超过了Claude Opus 4.7裸跑Claude Code 同时支持GUI桌面操作和CLI命令行,一个任务可以在浏览器、终端、桌面软件之间无缝切换 #LongHorizonHarness #Harness #长程agent

AIGCLINK

23,437 views • 1 month ago