Gemini Omni与Gemini 3.5实战演示:九大场景展现多模态AI实力

Google DeepMind·28 天前

在近日举办的Google I/O 2026开发者大会上,DeepMind团队正式展示了新一代多模态AI模型Gemini Omni与Gemini 3.5的系列能力演示。九段精心制作的视频从不同维度呈现了模型的实际应用场景,涵盖视觉推理、音频理解、代码生成、跨语言交互等复杂任务。

演示显示,Gemini Omni在无缝整合文本、图像、语音和视频信息方面表现突出,能够实时解析多通道输入并生成连贯回应。而Gemini 3.5则展示了在专业领域的深度推理能力,例如协助科研人员分析实验数据、为开发者提供全栈编程建议等。

值得注意的是,这些演示并非实验室环境下的理想化案例,而是模拟真实用户需求设计的交互场景。例如其中一段视频显示,用户仅通过语音和手势描述,模型便能理解家居改造意图并生成3D布局方案;另一段则演示了模型如何通过分析医疗影像与病历文本,辅助医生进行初步诊断评估。

DeepMind强调,此次展示的模型版本已在负责任AI框架下进行了多轮安全校准,在提升能力的同时确保输出结果的可靠性与可控性。团队表示将继续推进多模态AI技术的边界,让人工智能更自然、更高效地融入人类工作与生活场景。

Gemini多模态AIGoogle DeepMindAI演示Google I/O

原文来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-3-5-videos/

相关阅读

Google Vids 两大更新:AI 视频创作与个人数字人登场
谷歌DeepMind推出AI模式新功能:应用直连搜索,提升交互效率
Google DeepMind 与 Isomorphic Labs 联手推进生物韧性研究
DeepMind新研究:揭秘扩散模型的创造力之源
谷歌图片25周年:回顾视觉搜索里程碑,展望AI图像创作新体验

← 返回