Loading video...

Video Failed to Load

Go Home

TinyFish:独立开发者必备的Web Agent API Web Agent是什么概念? 相当于你同时雇了一批大学生,按你的文字要求上网点点点访问网页,找到你要的内容,然后按统一的格式把内容汇总起来。 Web Agent不是搜索,搜索只能获取搜索引擎返回的数据,不能一层层点击页面获取到深层的内容;Web Agent也不是Browser use,Browser use同时只能执行一个任务,Web Agent可以大规模并行任务。 Web Agent能做什么? · 从多个电商网站查找商品价格、库存 · 查询酒店、餐厅是否营业、可预约时间 · 自动化网页测试 下图是搜索、Browser use和Web Agent的能力对比,视频是Web Agent运行流程演示,实际调用API时是并行任务、响应速度快的多

60,741 views • 6 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

我在MIT看到的Agent 新范式 今天在麻省理工学院的EmTech大会上,看到了一个让我重新思考整个AI agent领域的演示。 演示方是TinyFish,一家相当低调的公司。创始团队里有两位华人,获得了ICONIQ领投的近3.5亿元人民币融资,但在今天之前从未公开展示过他们的核心产品。 而他们正在做的事情,已经在为Google和DoorDash运行超过千万级别的web agent操作... 不是实验室demo,是真实的生产环境。 TinyFish产品能让 AI 能够像人类一样自动操作网页、完成企业级任务... 它可以在没有 API 的情况下,让 AI 自动跨网站读取、理解、操作网页,执行业务流程、采集数据、提交信息、监控变化。 从抓数据、比价格、做填表、查库存,到合规审查与动态定价,都能完成... 可以在几千个网站间实时操作、执行任务。 也就是可以以同时运行一千个ChatGPT Atlas ,然后不间断的,同样的答案运行一千万次... 一个被所有人忽视的事实 TinyFish的CEO Sudheesh在演示中分享了一个震撼的洞察: 现在市面上所有的AI agent,都只能操作5%的网络。 不是因为开发者技术不行,而是因为所有人都在基于搜索引擎构建agent。 而搜索这个范式,早就失效了。 搜索是怎么失效的? 我们来看一个最简单的例子:Amazon。 Amazon的每个产品页面都被Google完整索引,完全可以爬取。这是搜索引擎最理想的场景。 但当你在Amazon搜索"笔记本电脑"时会发生什么? 你会看到上万个结果。赞助商品、虚假评论、AI生成的描述铺天盖地。你翻了几页就放弃了,最后随便点一个"看起来还行"的,结账走人。 这不是Amazon的问题。这是搜索范式本身的问题:当数据量太大时,排名就失效了。 Google成功地索引了数百万Amazon页面,但这并没有让搜索变得更有用。Amazon自己建了搜索引擎,也没有解决问题。 网络变得太大了。即使是已经被索引的那部分,排名也已经无法工作。 搜索假设你想"找到"某样东西。但如果你需要"检查所有"东西呢?比较所有供应商?验证每一个选项?** 这时候,整个范式就崩溃了。 那剩下的95%呢? 更糟糕的是,刚才说的还只是那5%被索引的网络。 剩下95%的网络藏在哪里? - 需要登录的供应商门户 - 有身份验证的医疗系统 - 只能通过表单提交访问的政府数据库 - 需要多步骤导航的竞争情报 搜索引擎根本接触不到这些。不是技术问题,是架构问题。你无法爬取需要交互才能访问的内容。 所以我们面临两个问题: 1. 被索引的5%网络因为太大而失效 2. 95%的重要数据根本没被索引 两个问题的根源都一样:搜索这个范式假设人类会手动评估结果。当你需要全面的情报而不是排名选项时,它就失效了。 为什么现有方案都解决不了 你可能会想:RAG呢?更好的embedding呢?Browser agents 呢? 它们都解决不了 因为它们都继承了搜索的核心局限:假设你想"找到"某样东西,而不是"检查所有"东西。 当一个采购团队需要检查200个供应商门户的竞争定价时,排名帮不了你。 当制药公司需要在数千个研究站点匹配临床试验的患者资格时,检索帮不了你。 这不是"这项工作很繁琐我们想自动化"的问题。这是"这种分析在我们需要的规模上根本不可能完成"的问题。 从可读Web到可执行Web Sudheesh解释了他们的解决方案: 不是更好的搜索,而是操作性基础设施。 TinyFish构建的系统可以: - 登录认证系统 - 导航多步骤工作流 - 提取结构化数据 - 同时运行数十万个并行会话 这就是从"可读Web"到"可执行Web"的转变。 浏览器代理(比如OpenAI的Atlas)帮助个人更快地导航网站:一次一个会话,一个浏览器。 TinyFish 的 Mino: 👉 就像一个“AI工厂”,让公司自己创建、部署和管理这些“网页机器人(Web Agents)”。 Mino可在基础设施规模上运行数十万个并行会话,在需要人类团队数周时间完成的复杂工作流中保持准确性。 这不是自行车和摩托车的区别。这是自行车和货运网络的区别。 规模化的证明 这不是理论 TinyFish已经在为ClassPass、Google、DoorDash等公司每月运行3000万次操作。 ClassPass的例子很典型:他们需要聚合数万家健身工作室的课程。大部分工作室没有API,只有手动更新的预订网站。课程安排每天变化,价格因时间、地点和等级而异。 传统方法全部失败: - 人工录入:无法规模化,数据永远过时 - 爬虫:网站一改版就崩溃 - API对接:长尾永远不会开发集成 使用TinyFish后,他们的场馆覆盖率增加了3-4倍,成本降低了50%。 更具体的实际落地案例: 🏨 Google Hotels 日本许多酒店使用老旧系统,无法接入 Google 聚合平台 TinyFish 的代理能自动获取这些酒店的库存与价格; 无需 IT 改造,让 Google Hotels 实现实时更新。 实现 99% 的实时覆盖率 更新频率提升 20 倍 运行量超过 每月 1,000 万+ 操作 🛵 DoorDash 为每个城市部署 AI 代理,自动抓取竞争网站菜单、价格、促销 每小时更新、自动去重与异常检测; 与 DoorDash 内部数据系统自动对接。 每月收集数百万个定价变量; 用于动态调整价格、优化市场响应; 自动化 95% 市场数据采集; 提高预测模型精度 30%; 大幅降低人工调研成本(原来每月人工工时 1200+ 小时)。 这意味着什么 搜索在过去25年里运行得很好,因为网络足够小,人类可以手动评估排名结果。 现在网络太大了。即使是被索引的部分也变得无法管理。而95%的网络从来没被索引过。 接下来的范式不是更好的搜索或更智能的排名。而是能够在整个网络上导航、推理和提取的操作性基础设施:公开的和私密的,被索引的和未被索引的。 Agent功能的发展速度远超预期。短短36个月,我们就从"AI起草邮件"发展到了"AI运行完整工作流"。 TinyFish可能在企业规模的实际落地上已经领先了。 他们正在向开发者开放这个基础设施。如果你在构建需要大规模可靠性的agent产品,这可能是一个值得关注的早期信号。

小互

43,186 views • 10 months ago

昨天看很多人转发Apodex 1.1 一个专门面向深度研究而打造的 Agent 专门解决那种"没有现成答案、需要大量调研才能搞定"的硬问题 好奇测试了下,跑了俩任务,一下午都没跑完😅 执行时间是真长 这玩意能你只要给它个目标,它就能能长时间运行、失败后能自动修复,还能自己验证交付结果是否准确 它在接到任务后,主 Agent 拆解成各种子问题,异步派发给专业化的子 Agent执行,每个子 Agent 有自己独立的上下文、提示词和工具集。 子 Agent 的报告汇入共享报告池,编排器异步读取,不会被最慢的那个卡住。单任务最高可调度 150 个子 Agent 解决的是什么问题呢? 过去: 一次提问,一段回答,一份报告。 衡量标准通常是: 答案对不对 知识覆盖够不够 引用多不多 报告写得是否完整 Apodex 想提出的新的要求: 一项从输入到交付的完整任务,衡量标准变成: 是否理解目标 是否能操作真实文件 是否能调用代码和工具 是否能维护长任务状态 遇到变化能否局部调整 执行失败能否自行恢复 最终结论是否可以核查 因此,它真正挑战的是当前 Deep Research 的产品形态: 搜集资料和生成报告,只覆盖了复杂任务的一部分。 真正的专业任务还需要读文件、清洗数据、选择方法、执行代码、处理异常、核查结论。 所以特别适合:科研人员、分析师、专业用户

小互

13,825 views • 14 days ago

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

50,830 views • 28 days ago

一个放在桌面上或者户外的 AI Agent 控制小方盒:用语音、按键、小屏,去控制电脑/远程服务器、调用所有工具、执行任务 在做这个产品的时候有做过调研,现在市面上大都是纯对话的语音AI Hermes Studio 小方盒 可以做什么 ? (视频演示) 1. 控制电脑 /远程服务器 小方盒本身是 ESP32,但它可以作为入口,把指令交给 Hermes Studio 在电脑 /远程服务器 上执行。 (它就是Hermes Agent) 可以做: 打开/关闭本地应用或网页 在电脑/远程服务器 上运行命令 读取、搜索、整理本地文件 上传文件给 Agent 分析 下载 Agent 生成的文件 控制浏览器访问网页、查资料、填表、抓取信息 调用本地 Coding Agent,让它改代码、跑测试、生成项目 查看运行日志、任务状态、错误信息 用语音触发“帮我总结这个文件夹”“打开今天的任务”“跑一下测试” 2. 调用工具 (生产力有待研究) Hermes Studio 的核心优势是 Agent 工具链。小方盒可以作为物理触发器,让 Agent 调用工具。 文件工具:浏览文件、搜索文件、读取内容、上传下载、重命名、复制、移动、删除。 终端工具:执行 shell 命令、启动服务、查看进程、跑脚本、拉代码、跑测试。 浏览器工具:打开网页、搜索资料、读取网页内容、自动化页面操作。 代码工具:启动 Codex / Claude Code 等 coding-agent 会话,做代码修改、调试、检查。 MCP 工具:接入外部系统,比如数据库、知识库、Notion、GitHub、邮件、企业内部 API、智能家居等。 语音工具:STT 语音转文本,TTS 回复朗读,多种 TTS Provider。 自动化工具:定时任务、周期汇报、监控任务、Kanban 工作项。 多平台工具:Telegram、Discord、Slack、WhatsApp、Matrix、飞书、微信、企业微信等渠道。 一句话:小方盒不是自己完成所有任务,而是唤醒 Hermes Studio 里的工具系统。 产品功能: 语音唤醒桌面 Agent 实体按键触发 本地文件读取、搜索与整理 电脑/远程服务器命令执行与任务自动化 浏览器自动化与网页信息获取 Coding Agent 启动 MCP 工具扩展,连接外部服务 多模型、多 Profile 切换 多平台消息接入 TTS/STT 语音输入输出 Nous Research witcheer Teknium 🪽 Hermes community never disappoints! 👀

libapi

31,786 views • 2 months ago

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 views • 3 months ago