双智能体架构亮相QANTA 2026挑战赛:任务专用推理策略刷新多模态问答纪录

arXiv·8 天前

在即将举行的ICML 2026高效多模态问答研讨会上,QANTA 2026共享挑战赛迎来创新解决方案。该赛事要求系统在现实效率约束下,通过逐步揭示的文本和配图回答金字塔式问题。挑战包含两个独立任务:需要把握答题时机的“抢答题”,以及强调准确答案选择与人类采纳度的“附加题”。

研究团队为此设计了任务专用的双智能体架构。抢答智能体采用GPT-4o-mini级模型,通过置信度校准答题机制和领域专用数值推理策略,有效降低了因孤立定量线索导致的过度自信预测。附加题智能体则使用GPT-4o级模型,结合线索感知推理、结构化关系推理和多模态证据整合技术,显著提升了精确答案选择能力。

区别于传统检索流水线或模型集成方法,该方案专注于在纯托管环境中优化推理策略与置信度校准。最终系统以0.402的总分刷新排行榜纪录,其中抢答题得分0.238,附加题效应得分0.164。研究表明,轻量级的任务专用推理策略能在资源受限的多模态问答基准测试中实现强劲性能,为高效AI系统设计提供了新思路。

多模态问答GPT-4置信度校准任务专用架构ICML

原文来源:https://arxiv.org/abs/2607.09623

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回