AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
视觉语言模型
11 篇相关内容
相关话题
通义千问
模型评估
多模态大模型
开源模型
多模态模型
多模态AI
内容安全
可解释AI
社交媒体分析
多轮对话
稳定性测试
大模型
多角度推理框架MAR-12:精准识别并解释有害幽默表情包
研究人员提出MAR-12框架,通过12个结构化视角分析表情包中的幽默与有害内容,在检测准确性和解释性上均超越现有方法。
a
arXiv
·
21 小时前
多模态AI
内容安全
可解释AI
视觉语言模型
a
多轮对话压力测试:视觉语言模型在反复追问下的稳定性评估
研究者提出‘持续提示’评估框架,发现主流视觉语言模型在用户反复质疑或否定时会出现答案不稳定现象,正确回答可能被推翻,错误回答反而被修正。
a
arXiv
·
3 天前
视觉语言模型
模型评估
多轮对话
稳定性测试
a
测试时缩放技术对小规模视觉语言模型在多语言视觉选择题上的效果分析
研究发现测试时缩放技术对小规模开源视觉语言模型在多语言视觉选择题基准上的提升效果,关键在于推理链的完整性和可解析性,而非复杂的搜索或验证机制。
a
arXiv
·
7 天前
视觉语言模型
测试时缩放
多模态推理
模型评估
a
CLIP模型选择性去偏新方法:奖励门控测试时适应
研究人员提出RG-TTA框架,通过强化学习在测试时根据输入敏感性选择性应用去偏处理,在降低社会偏见的同时提升模型零样本性能。
a
arXiv
·
18 天前
CLIP
模型去偏
公平性AI
视觉语言模型
a
仿生记忆系统革新视觉语言模型测试时自适应
受大脑互补记忆系统启发,研究人员提出ComMem框架,通过模拟海马体与新皮质的协作机制,显著提升视觉语言模型在动态环境中的自适应能力。
a
arXiv
·
20 天前
视觉语言模型
测试时自适应
记忆系统
多模态学习
a
IMCBench:首个图像对话医学基准,评测多模态大模型临床能力
研究者推出首个图像引导多轮医学对话基准IMCBench,通过真实临床图像与合成病历模拟医患互动,评测多模态大模型在安全、准确与不确定性表达三方面的临床能力。
a
arXiv
·
20 天前
医学AI
多模态大模型
基准评测
临床对话
a
HIL-ResRL:一小时真机强化学习微调,成功率超95%的视觉语言模型外挂方案
研究人员提出HIL-ResRL框架,通过人类交互式学习与残差强化学习结合,仅需一小时真机微调即可让视觉语言模型在复杂任务中成功率突破95%。
a
arXiv
·
26 天前
强化学习
视觉语言模型
机器人操作
模型微调
a
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径
通义千问团队提出QVQ模型,尝试将视觉理解能力融入大语言模型,以提升AI的认知与推理能力。该模型已在多个开源平台发布。
通
通义千问 Qwen
·
28 天前
通义千问
多模态大模型
视觉语言模型
AI推理
通
通义千问发布Qwen2.5-VL多模态模型,视觉理解能力大幅提升
阿里云通义千问团队正式推出新一代视觉语言模型Qwen2.5-VL,在视觉理解能力上实现显著突破,提供3B、7B、72B三种规格的开源版本。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
视觉语言模型
开源模型
通
通义千问发布Qwen2.5-VL-32B:更智能、更轻量的视觉语言模型
阿里云通义千问团队在Qwen2.5-VL系列基础上,通过强化学习优化并开源了32B参数的视觉语言模型Qwen2.5-VL-32B-Instruct。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
视觉语言模型
开源AI
通
LaViSA:首个视觉语言模型结构歧义评测基准发布
研究团队推出LaViSA基准,专门评估视觉语言模型利用视觉场景解决句子结构歧义的能力,实验发现现有模型在部分歧义类型和视觉语义细微差异上仍存在局限。
a
arXiv
·
31 天前
视觉语言模型
结构歧义
评测基准
多模态理解
a