Gemini 推出智能视频理解功能,AI 能自主分析视频内容
Google DeepMind 近日宣布,为 Gemini 模型引入了智能视频理解功能。这一新能力使 Gemini 能够主动观察视频中的动态场景,理解人物动作、物体变化及事件发展,并进行多步推理。例如,AI 可以分析一段烹饪视频,识别食材处理步骤,并回答“厨师在第三步加入了什么调料?”之类的问题。该技术基于多模态架构,结合了视觉感知与语言推理,不仅能描述画面,还能推断意图、预测后续动作。目前该功能已面向部分开发者开放测试,未来或应用于视频内容检索、智能监控、交互式教育等领域。DeepMind 强调,这项进展是迈向通用视频智能的重要一步,但当前仍存在对复杂场景、长视频理解有限的挑战。
原文来源:https://deepmind.google/blog/introducing-agentic-video-in-gemini/