Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

阿里刚刚放出了其GUI Agent第三代框架:Mobile-Agent-v3,在10+GUI基准测试中取得了SOTA性能 在AndroidWorld上达到73.3,在OSWorld上达到37.7 Mobile-Agent-v3是一款基于GUI-Owl的跨平台多智能体框架,GUI-Owl也同时被开源,这是一款多模态跨平台GUI虚拟层模型 GUI-Owl作为GUI自动化基础模型,具备GUI感知、落地、端到端操作能力 可以理解GUI界面布局、元素,把指令转化为具体的屏幕坐标和操作,完成完整的GUI操作流程 Mobile-Agent-v3利用GUI-Owl能力与GUI交互,具备任务分解、规划以及进度管理、异常处理和反射能力、关键信息记录能力 比如,完成特定目标制定行动计划,跟踪任务执行进度,反馈调整行动。具备关键信息记录能力,支持跨应用任务 #MobileAgentv3 #GUIAgent #AIagent

16,734 Aufrufe • vor 11 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

阿里刚刚放出了其首个千问具身智能体通用模型:Qwen-Robot ,也开始搞具身智能了! Qwen-Robot由三个模型组成机器人的手+脚+大脑,三个模型可以独立用,也可以组合用 比如,用它可以组成一个既能动手端盘子,又能走路送餐,还能预判端着热汤拐弯儿会不会洒的服务机器人 Qwen-RobotManip: 其采用80维统一动作表征,把不同机器人的动作翻译成同一种通用语言,并基于摄像头画面的相对位置操作,不再依赖繁琐的绝对坐标计算,解决了换个机械臂、换个场景数据不通用的情况 Qwen-RobotNav: 核心思路是把视觉分配策略本身参数化,而非固定,具体解法是把记多少、怎么记变成可调参数,根据任务类型自动配置,不同任务按需配置,比如目标追踪只关注最近几帧省算力,指令跟随保留长程上下文不迷路 因为记忆策略参数化了,一套权重即统一五类导航任务 在双层智能体系统(上层规划器+Qwen-RobotNav)中,EXPRESS-Bench提升15.4%,导航步数减少了77% 通用接口设计,其他上层AI可以直接调用它的导航能力,无需再为每个任务单独训练一个导航模型,原生支持多种智能体框架 Qwen-RobotWorld:相当于机器人的想象力 基于对物理规律的理解,可推理和模拟下一时间点的合理动作和状态;能生成视频数据用于训练,缓解训练数据不足问题;可以在执行前推演未来动作轨迹,使操作更精准 Qwen-Robot相当于是一套模块化的具身智能系统,把导航、操作、世界预测三个专业的能力解耦又协同,让通用模型像调用软件工具一样,调用物理世界的行动能力 #QwenRobot #robot #具身智能

AIGCLINK

11,106 Aufrufe • vor 1 Monat

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

16,313 Aufrufe • vor 19 Stunden