Loading video...

Video Failed to Load

Go Home

又一个Phone Use开源项目:android-action-kernel,让AI直接动手操作原生Android应用,单次调用成本降低95%、延迟<1秒 它主路径不用视觉模型,而是利用Android系统原生的Accessibility API,拿到界面XML树,包括按钮文字、坐标、是否可点状态等,直接获取屏幕语义信息给LLM决策 省掉截图-OCR-视觉模型的高成本,每次操作$0.01,便宜了95%;延迟从3-5秒缩短到<1秒,快了5倍;准确性提升至99%+ 项目来自 #phoneuse #AndroidUse #手机AI

149,924 views • 7 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,197 views • 1 month ago

阿里刚刚放出了其首个千问具身智能体通用模型:Qwen-Robot ,也开始搞具身智能了! Qwen-Robot由三个模型组成机器人的手+脚+大脑,三个模型可以独立用,也可以组合用 比如,用它可以组成一个既能动手端盘子,又能走路送餐,还能预判端着热汤拐弯儿会不会洒的服务机器人 Qwen-RobotManip: 其采用80维统一动作表征,把不同机器人的动作翻译成同一种通用语言,并基于摄像头画面的相对位置操作,不再依赖繁琐的绝对坐标计算,解决了换个机械臂、换个场景数据不通用的情况 Qwen-RobotNav: 核心思路是把视觉分配策略本身参数化,而非固定,具体解法是把记多少、怎么记变成可调参数,根据任务类型自动配置,不同任务按需配置,比如目标追踪只关注最近几帧省算力,指令跟随保留长程上下文不迷路 因为记忆策略参数化了,一套权重即统一五类导航任务 在双层智能体系统(上层规划器+Qwen-RobotNav)中,EXPRESS-Bench提升15.4%,导航步数减少了77% 通用接口设计,其他上层AI可以直接调用它的导航能力,无需再为每个任务单独训练一个导航模型,原生支持多种智能体框架 Qwen-RobotWorld:相当于机器人的想象力 基于对物理规律的理解,可推理和模拟下一时间点的合理动作和状态;能生成视频数据用于训练,缓解训练数据不足问题;可以在执行前推演未来动作轨迹,使操作更精准 Qwen-Robot相当于是一套模块化的具身智能系统,把导航、操作、世界预测三个专业的能力解耦又协同,让通用模型像调用软件工具一样,调用物理世界的行动能力 #QwenRobot #robot #具身智能

AIGCLINK

11,106 views • 1 month ago

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 views • 8 months ago

拒绝AI订阅费,本地免费方案来了。 狙击手给大家分享永久免费,不调用付费API,并且完全跑在本的一款专业开源生产图片短视频以及3D模型的工具! 它是GPT、MJ、Runway 全平替本地免费方案 每月 GPT 会员、Midjourney 订阅、视频 API 扣费堆起来大几十刀,多开账号批量做内容成本直接爆炸 额度卡死、超时限流、敏感素材不敢上传云端,每生成一下都在烧钱。 ComfyUI V8 整合包,本地永久零费用,彻底告别付费 API 订阅 ✅ 全程本地运行,不调用任何付费接口,一次下载无限生成 ✅ 文生图 + 图生短视频双功能拉满,配图、动态宣传片 、室内设计、AI短剧等等全部都能胜任。 ✅ 解压一键启动,不用写代码配环境,Win/Mac、30/40/50 系显卡通吃 ✅ 预装 278 套成品工作流、模型、Lora,拖入模板改提示词直接出片 安装只需要 3 步: 下载完整压缩包(自带所有资源) 解压到英文路径(不要有中文) 双击启动,浏览器自动打开界面 你能得到什么: 永久免费的文生图能力,质量不输 Midjourney 本地图生视频,2-5 秒短视频一键生成 278 套现成工作流,不用自己连任何节点 无限生成次数,想做多少做多少 完全离线运行,数据 100% 在自己电脑上 再也不用看任何 AI 平台的脸色我现在每天用它生成 100 + 张配图和 20 + 条短视频成本为 0,效率提升 10 倍以上。

DeFi狙击手 | Ai🕊️

54,998 views • 1 month ago