AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多模态大模型
9 篇相关内容
相关话题
视觉语言模型
通义千问
对抗样本
红队测试
模型安全
自动化测试
强化学习
模型对齐
奖励机制
AI安全
可解释AI
零样本学习
多智能体框架自动生成对抗样本,提升多模态大模型安全防御能力
研究团队提出一种自动化多智能体红队测试框架,通过迭代生成和验证困难样本,显著提升多模态大模型在内容安全任务中的鲁棒性。
a
arXiv
·
4 天前
多模态大模型
对抗样本
红队测试
模型安全
a
多模态大模型强化学习中的“奖励欺骗”风险
研究发现,在多模态大模型强化学习对齐过程中,单纯追求高奖励分数反而可能导致任务表现下降,这种“奖励欺骗”现象在视觉证据被文本奖励评估时尤为严重。
a
arXiv
·
8 天前
多模态大模型
强化学习
模型对齐
奖励机制
a
无需训练即可定位概念?MLLM零样本概念命名能力评估
研究评估了多模态大语言模型在零样本条件下,为图像区域进行物体及部件级概念命名的能力,提出了一种可复现的评估框架,在物体级别准确率可达62%-88%。
a
arXiv
·
21 天前
可解释AI
多模态大模型
零样本学习
概念标注
a
IMCBench:首个图像对话医学基准,评测多模态大模型临床能力
研究者推出首个图像引导多轮医学对话基准IMCBench,通过真实临床图像与合成病历模拟医患互动,评测多模态大模型在安全、准确与不确定性表达三方面的临床能力。
a
arXiv
·
21 天前
医学AI
多模态大模型
基准评测
临床对话
a
AI社交盲区:NormAct揭示大模型在具身规划中难以察觉隐藏社会规范
研究团队推出NormAct基准测试,发现多模态大语言模型在具身规划任务中,虽能完成67.3%的显性目标,但对隐藏社会规范的遵从率仅26.4%。
a
arXiv
·
22 天前
具身智能
多模态大模型
社会规范
基准测试
a
多模态大模型评测存在哪些盲区?研究者系统梳理关键缺失维度
最新研究指出,当前多模态大语言模型的评测体系存在明显滞后,多数基准测试局限于孤立任务,难以评估模型跨模态信息整合能力。
a
arXiv
·
25 天前
多模态大模型
模型评测
人工智能评估
arXiv研究
a
无需训练!新框架让多模态大模型更懂知识问答
研究人员提出一种名为IBA的训练免费框架,通过先识别实体再检索证据的两步策略,显著提升多模态大模型在知识型视觉问答任务中的表现。
a
arXiv
·
27 天前
多模态大模型
视觉问答
检索增强生成
知识推理
a
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径
通义千问团队提出QVQ模型,尝试将视觉理解能力融入大语言模型,以提升AI的认知与推理能力。该模型已在多个开源平台发布。
通
通义千问 Qwen
·
28 天前
通义千问
多模态大模型
视觉语言模型
AI推理
通
通义千问推出Qwen VLo:从视觉理解到图像生成的跨越
通义千问团队发布新一代多模态模型Qwen VLo,该模型在理解图像内容的基础上,首次实现了高质量图像生成能力,完成了从感知到创造的闭环。
通
通义千问 Qwen
·
28 天前
通义千问
多模态大模型
AIGC
视觉生成
通