Gemini 1.5 Flash 模型新增计算机使用能力,推理与工具调用效率再升级

Google DeepMind·26 天前

谷歌旗下 AI 研究机构 DeepMind 近日宣布,为其轻量级模型 Gemini 1.5 Flash 新增了一项关键功能——计算机使用能力。该功能使模型能够理解计算机屏幕上的信息(如图像、文本、界面元素),并模拟人类操作,执行点击、键入、滚动等指令。

这意味着 Gemini 1.5 Flash 现在可以处理涉及多步骤、跨应用的任务,例如根据电子邮件内容更新电子表格、按照网页指南完成软件设置,或依据设计稿生成前端代码。DeepMind 表示,此能力通过增强模型的推理和工具调用效率,旨在解决复杂任务中常见的逻辑断裂问题。

目前,这项功能已通过 Gemini API 向开发者和企业用户开放。官方指出,计算机使用能力尤其适用于自动化工作流、辅助操作教学及软件测试等场景,有望进一步提升 AI 代理的实用性与交互深度。

GeminiGoogle DeepMindAI 代理多模态模型自动化

原文来源:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/

相关阅读

Google Vids 两大更新:AI 视频创作与个人数字人登场
谷歌DeepMind推出AI模式新功能:应用直连搜索,提升交互效率
Google DeepMind 与 Isomorphic Labs 联手推进生物韧性研究
DeepMind新研究:揭秘扩散模型的创造力之源
谷歌图片25周年:回顾视觉搜索里程碑,展望AI图像创作新体验

← 返回