Gemini 1.5 Flash 模型新增计算机使用能力,推理与工具调用效率再升级
谷歌旗下 AI 研究机构 DeepMind 近日宣布,为其轻量级模型 Gemini 1.5 Flash 新增了一项关键功能——计算机使用能力。该功能使模型能够理解计算机屏幕上的信息(如图像、文本、界面元素),并模拟人类操作,执行点击、键入、滚动等指令。
这意味着 Gemini 1.5 Flash 现在可以处理涉及多步骤、跨应用的任务,例如根据电子邮件内容更新电子表格、按照网页指南完成软件设置,或依据设计稿生成前端代码。DeepMind 表示,此能力通过增强模型的推理和工具调用效率,旨在解决复杂任务中常见的逻辑断裂问题。
目前,这项功能已通过 Gemini API 向开发者和企业用户开放。官方指出,计算机使用能力尤其适用于自动化工作流、辅助操作教学及软件测试等场景,有望进一步提升 AI 代理的实用性与交互深度。
原文来源:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/