AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多模态AI
19 篇相关内容
相关话题
内容安全
视频生成
AIGC
模型可解释性
xAI
AI模型
知识图谱
扩散模型
大语言模型
Transformer
可解释AI
视觉语言模型
MGDT:多模态知识图谱补全新框架,引入MLLM引导的扩散Transformer
研究人员提出MGDT框架,通过MLLM引导的扩散Transformer与关系自适应专家混合机制,显著提升多模态知识图谱补全性能。该框架采用先对齐后扩散的范式,在三个基准数据集上表现优于现有方法。
a
arXiv
·
1 天前
知识图谱
多模态AI
扩散模型
大语言模型
a
多角度推理框架MAR-12:精准识别并解释有害幽默表情包
研究人员提出MAR-12框架,通过12个结构化视角分析表情包中的幽默与有害内容,在检测准确性和解释性上均超越现有方法。
a
arXiv
·
1 天前
多模态AI
内容安全
可解释AI
视觉语言模型
a
科研文档跨版本比对新突破:布局感知与结构推理实现多元素精准差异分析
研究人员提出一种布局感知的异构元素感知框架,用于科学文档的跨版本比对,能同时处理文本、表格、公式和图形等多种元素,在真实期刊生产校对数据上表现优异。
a
arXiv
·
4 天前
文档处理
多模态AI
学术出版
PDF解析
a
RxBrain:首个融合语言推理与视觉想象的具身认知基础模型
研究人员提出Hy-Embodied-RxBrain模型,通过统一的多模态架构实现语言推理与视觉想象的联合规划,为具身认知基础模型研究开辟新路径。
a
arXiv
·
4 天前
具身认知
多模态AI
基础模型
机器人规划
a
月之暗面发布Kimi K3:2.8万亿参数、百万上下文原生多模态大模型
月之暗面正式发布Kimi K3大模型,具备2.8万亿参数、百万上下文窗口及原生多模态能力,并宣布将于2026年7月27日前开源模型权重。
月
月之暗面 Kimi
·
4 天前
大模型
月之暗面
开源模型
多模态AI
月
Google Vids 两大更新:AI 视频创作与个人数字人登场
Google Vids 推出 Gemini Omni 与个人数字人两大功能,大幅简化视频制作流程,让用户轻松创作、编辑并成为视频主角。
G
Google DeepMind
·
4 天前
视频生成
多模态AI
Google
数字人
G
实时句子级手语翻译系统新突破:Raspberry Pi实现低延迟交互
研究人员提出首个面向实时部署的句子级手语翻译系统,通过优化计算架构将响应延迟降低27%,在Raspberry Pi上实现摄像头捕捉、本地显示与语音输出的完整交互链。
a
arXiv
·
8 天前
手语翻译
实时系统
边缘计算
多模态AI
a
无需训练!多模态文档问答证据溯源新方法,精度匹敌GPT-5.4
研究人员提出MultAttnAttrib方法,无需额外训练即可为多模态长文档问答系统生成精确证据溯源,同时发布首个专门评估多模态溯源的基准数据集。
a
arXiv
·
18 天前
多模态AI
问答系统
模型可解释性
注意力机制
a
多图组合暗藏风险:当无害图片叠加产生有害语义
研究者发现社交媒体中多图组合可能产生隐性毒性,并提出新数据集与检测模型MiShield,有效识别单图无害但组合有害的内容。
a
arXiv
·
19 天前
内容安全
多模态AI
社交媒体
数据集
a
知识型视觉问答基准测试的缺陷识别与修复
研究发现现有知识型视觉问答基准测试存在系统性缺陷,导致模型能力被高估。团队提出审计修复方案并构建增强数据集,推动更可靠的评估方法。
a
arXiv
·
19 天前
视觉问答
基准测试
评估方法
多模态AI
a
手语模型能听懂“语音”吗?研究发现AI具备初步音系感知能力
最新研究揭示,手语识别模型展现出对抽象音系特征的敏感性,其中姿态模型擅长区分手形,像素模型更易捕捉位置变化,但现有训练范式仍受限于架构本身的归纳偏好。
a
arXiv
·
21 天前
手语识别
音系感知
多模态AI
模型可解释性
a
NaviGen:让AI读懂你的行为,生成更懂你的个性化内容
研究者提出NaviGen模型,通过分析用户历史行为自动生成精准的视觉内容创作指令,解决传统AIGC需要用户详细描述视觉细节的痛点。
a
arXiv
·
27 天前
个性化生成
多模态AI
用户行为建模
指令生成
a
xAI与Gopuff合作,打造多模态个性化购物助手
xAI宣布与即时配送平台Gopuff合作,利用聊天、语音和图像模型构建个性化购物助手,提升用户体验。
x
xAI
·
27 天前
xAI
Gopuff
多模态AI
购物助手
x
Grok Voice 发布:以超低价实现类人语音交互
xAI 推出 Grok Voice 语音模型,宣称在语音交互的节奏、音色和情感表达上达到类人水平,且价格仅为竞争对手的一小部分。
x
xAI
·
27 天前
快讯
语音模型
xAI
AI产品发布
多模态AI
x
智能体巧用Hugging Face Spaces,链式调用构建3D巴黎画廊
Hugging Face社区展示了一项创新实践:一个AI智能体通过串联两个Spaces应用,成功构建出交互式3D巴黎虚拟画廊。
H
Hugging Face
·
27 天前
AI智能体
Hugging Face
3D生成
多模态AI
H
通义千问发布视觉推理模型QVQ-Max,实现图像视频内容分析与推理
阿里云通义千问团队正式发布视觉推理模型QVQ-Max,该模型不仅能理解图像视频内容,还能进行信息分析与推理,在数学、编程、艺术创作等多个领域展现能力。
通
通义千问 Qwen
·
28 天前
通义千问
视觉推理模型
多模态AI
阿里云
通
谷歌I/O 2026全景盘点:百项AI创新集中亮相
谷歌DeepMind在年度开发者大会上集中展示了上百项人工智能领域的最新进展,涵盖模型发布、产品更新与技术演示。
G
Google DeepMind
·
28 天前
谷歌DeepMind
I/O大会
AI模型
开发者工具
G
Gemini Omni与Gemini 3.5实战演示:九大场景展现多模态AI实力
谷歌在I/O 2026大会上发布Gemini Omni与Gemini 3.5系列模型,通过九段演示视频直观展现其在跨模态理解、实时交互与复杂任务处理方面的突破性能力。
G
Google DeepMind
·
28 天前
Gemini
多模态AI
Google DeepMind
AI演示
G
阿里视频生成模型HappyHorse 1.1发布,五大维度全面升级
阿里巴巴发布视频生成模型HappyHorse 1.1版本,在生成质量、分辨率、运动一致性、文本对齐和效率五大维度实现全面升级。
通
通义千问 Qwen
·
29 天前
视频生成
阿里巴巴
AI模型
HappyHorse
通