Gemini 推出智能视频理解功能,AI 能自主分析视频内容

Google DeepMind·1 天前

Google DeepMind 近日宣布,为 Gemini 模型引入了智能视频理解功能。这一新能力使 Gemini 能够主动观察视频中的动态场景,理解人物动作、物体变化及事件发展,并进行多步推理。例如,AI 可以分析一段烹饪视频,识别食材处理步骤,并回答“厨师在第三步加入了什么调料?”之类的问题。该技术基于多模态架构,结合了视觉感知与语言推理,不仅能描述画面,还能推断意图、预测后续动作。目前该功能已面向部分开发者开放测试,未来或应用于视频内容检索、智能监控、交互式教育等领域。DeepMind 强调,这项进展是迈向通用视频智能的重要一步,但当前仍存在对复杂场景、长视频理解有限的挑战。

GeminiGoogle DeepMind视频理解多模态AI智能体

原文来源:https://deepmind.google/blog/introducing-agentic-video-in-gemini/

相关阅读

谷歌DeepMind推出Gemini 3.8 Flash系列模型,新增网络安全特化版本
谷歌DeepMind发布主动式网络防御方案,助力政企应对网络威胁
谷歌DeepMind推出“顺风计划”,为政府与企业提供主动式网络防御
谷歌发布2026年8月AI进展:聚焦前沿模型与生态创新
DeepMind 发布全球甲烷排放地图:AI 助力气候监测

← 返回