Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

UI-TARS:字节跳动开源一种能够自我学习的GUI Agent 它能模拟人类操作手机和电脑并完成任务 并具备高级的感知、推理和交互能力 与传统依赖模块化框架或手工提示优化的系统不同,UI-TARS采用端到端架构,依赖纯视觉输入,实现了对复杂任务的全面自动化。 UI-TARS 的特点: - 看得懂界面:能理解界面上的按钮、输入框等元素,还能精准找到它们的位置。 - 多平台通用:不管是手机、电脑还是网页,UI-TARS 都能轻松适应。 - 高级推理能力:支持复杂任务的分解与多步决策,能自己规划步骤,遇到问题会反思并修正错误。 - 不断学习:通过反思和在线采集更多任务数据,它可以不断优化和适应新的任务场景,变得越来越聪明。

46,108 Aufrufe • vor 1 Jahr •via X (Twitter)

8 Kommentare

Profilbild von 小互
小互vor 1 Jahr

在10多个GUI代理基准测试中达到最先进水平(SOTA)。 在复杂的动态交互场景中,其性能优于主流模型(如GPT-4o和Claude Computer Use)。 由于 不依赖手动设计规则和模块化框架,适应性和泛化能力更强。 重复性任务:如表单填写、批量处理等任务中,显著提升效率。 复杂交互场景:如在线预订、数据录入等多步骤流程,UI-TARS展现卓越适应能力。 跨平台自动化:支持在网页、桌面和移动端上的统一操作。

Profilbild von 小互
小互vor 1 Jahr

字节还顺便提供了在桌面和网页端运行 UI-TARS 的开发框架。 可以体验:UI-TARS-desktop:

Profilbild von 小互
小互vor 1 Jahr

UI-TARS详细介绍:

Profilbild von 小互
小互vor 1 Jahr

更多更全场景演示视频 ↓

Profilbild von UserInterface
UserInterfacevor 2 Jahren

Unveiling the Future of Prompt Engineering for Better AI Interactions #tech

Profilbild von Midscene AI
Midscene AIvor 1 Jahr

下面网页视频的操作来自 Midscene ,欢迎👏关注我们~

Profilbild von Le Blue
Le Bluevor 1 Jahr

怎么那么多字节的ai产品,豆包marscode、coze、trae..

Profilbild von 小互
小互vor 1 Jahr

他们是赛马模式,自己人都搞不清有多少个项目在同时进行,而且互相不知道对方在干什么!效率非常高!🤣

Ähnliche Videos

阿里刚刚放出了其首个千问具身智能体通用模型:Qwen-Robot ,也开始搞具身智能了! Qwen-Robot由三个模型组成机器人的手+脚+大脑,三个模型可以独立用,也可以组合用 比如,用它可以组成一个既能动手端盘子,又能走路送餐,还能预判端着热汤拐弯儿会不会洒的服务机器人 Qwen-RobotManip: 其采用80维统一动作表征,把不同机器人的动作翻译成同一种通用语言,并基于摄像头画面的相对位置操作,不再依赖繁琐的绝对坐标计算,解决了换个机械臂、换个场景数据不通用的情况 Qwen-RobotNav: 核心思路是把视觉分配策略本身参数化,而非固定,具体解法是把记多少、怎么记变成可调参数,根据任务类型自动配置,不同任务按需配置,比如目标追踪只关注最近几帧省算力,指令跟随保留长程上下文不迷路 因为记忆策略参数化了,一套权重即统一五类导航任务 在双层智能体系统(上层规划器+Qwen-RobotNav)中,EXPRESS-Bench提升15.4%,导航步数减少了77% 通用接口设计,其他上层AI可以直接调用它的导航能力,无需再为每个任务单独训练一个导航模型,原生支持多种智能体框架 Qwen-RobotWorld:相当于机器人的想象力 基于对物理规律的理解,可推理和模拟下一时间点的合理动作和状态;能生成视频数据用于训练,缓解训练数据不足问题;可以在执行前推演未来动作轨迹,使操作更精准 Qwen-Robot相当于是一套模块化的具身智能系统,把导航、操作、世界预测三个专业的能力解耦又协同,让通用模型像调用软件工具一样,调用物理世界的行动能力 #QwenRobot #robot #具身智能

AIGCLINK

11,106 Aufrufe • vor 2 Monaten

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,017 Aufrufe • vor 17 Tagen