AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
视频理解
4 篇相关内容
相关话题
Google DeepMind
多模态AI
Gemini
智能体
记忆系统
实体识别
arXiv研究
机器人
多机协作
任务规划
多模态大模型
长视频问答
Gemini 推出智能视频理解功能,AI 能自主分析视频内容
Google DeepMind 发布 Gemini 的智能视频理解能力,让 AI 能像人类一样主动观察、推理并回答关于视频内容的问题。
G
Google DeepMind
·
1 天前
Gemini
Google DeepMind
视频理解
多模态AI
G
ViSAGE框架:构建自校正记忆系统,提升长视频理解能力
研究人员提出ViSAGE多模态记忆框架,通过跨模态实体绑定和双向记忆优化技术,显著提升长视频理解任务中的实体一致性与推理准确性。
a
arXiv
·
31 天前
多模态AI
视频理解
记忆系统
实体识别
a
Gemini Robotics ER 2 发布:以视频理解与多机协作赋能机器人智能
Google DeepMind 推出 Gemini Robotics ER 2,该系统通过增强视频理解、任务编排与多机器人协作能力,帮助机器人更好地推理、协作并解决现实世界任务。
G
Google DeepMind
·
34 天前
机器人
多机协作
视频理解
任务规划
G
ReMem框架:无需训练即可实现长视频问答,自适应时序粒度选择关键帧
研究人员提出ReMem框架,通过双级记忆增强机制自适应选择关键帧,显著提升多模态大模型在长视频问答任务中的零样本性能。
a
arXiv
·
36 天前
视频理解
多模态大模型
长视频问答
关键帧选择
a