Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Google 推出 Gemini 2.5 Computer Use 模型 今年早些时候,Google 就宣布了将通过 Gemini API 为开发者带来直接操控电脑界面的 AI 能力。今天,Google 正式推出了 Gemini 2.5 Computer Use模型(Gemini 2.5 Computer Use model)。 这个专门的模型基于 Gemini 2.5 Pro 强大的视觉理解与推理能力构建,可以让 AI 智能体像人类一样,直接点击、滚动、输入文字,实现与网页或应用的交互。这一技术在多个网页和移动端界面的任务基准测试中,表现超越了当前领先的同类产品,而且反应速度更快。 开发者们现在就可以通过 Gemini API,在 Google AI Studio 和 Vertex AI 中提前体验。

66,158 Aufrufe • vor 10 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

两年多前,Google 联合创始人 Sergey Brin 也曾站在 AGI House,承认 Google 在大模型上落后了,并说要追赶回来。 后来的结果大家都看到了:Gemini 一路追上来,半年前 Gemini 3 发布时,Google 至少在很多维度重新回到了第一梯队。 但六个月后,局面又变了。 这一次,仍然战斗在一线的 Sergey 再次回到 AGI House,做了一场新的 Q&A:他怎么看 AGI 和超级智能,怎么看 Transformer、世界模型和 AI for Science,Google 为什么现在重仓 coding agent,他和 Demis、Corey 在 Gemini 上到底怎么分工,以及他是否还相信 Google 能再追上来。 下面划重点: Google 重新把 coding 放到最高优先级之一。 Sergey 承认,他们可能更早就该深度关注 coding。现在 Google 已经非常专注于这个方向。 他对 Gemini 仍然有信心,但也承认竞争对手在 coding 上进步很快。 他提到,某些模型在长时间、深度 coding 任务上表现很好;而 Gemini Flash 的优势在于速度,适合交互式快速迭代。 他认为 AGI 的关键不只是“会回答问题”,而是能自我改进。 他个人更倾向于把 AGI 理解为一种能够改进自己的 AI,而不是单纯“什么人类任务都能做”。 世界模型很重要,尤其是如果 AI 要进入物理世界。 如果 AI 要做人类能做的事,就必须理解世界、预测行动后果,并和现实世界互动,这会延伸到机器人、多模态和视频模型。 Transformer 可能还没到头。 他认为 Transformer 已经从文本扩展到图像、视频等场景,而且不断演化。类似 Transformer 的架构,有可能继续走向 AGI。 他在 Google 内部的角色更像“推动者”而不是正式负责人。 Corey、Demis 等人负责组织和交付,Sergey 则不断追问团队有没有漏掉重要方向、有没有低估某些优先级。 他对“AI 会取代人类意义”没那么悲观。 他用国际象棋和围棋举例:机器超过人类后,人类并没有停止下棋,反而借助 AI 变得更强。 整体听下来,你能看到 Google 内部现在的真实焦虑和重心:AGI、自我改进、coding agent、世界模型,以及用 AI 来构建下一代 AI。 (中文字幕视频)

Michael Guo

84,597 Aufrufe • vor 1 Monat