双智能体架构亮相QANTA 2026挑战赛:任务专用推理策略刷新多模态问答纪录
在即将举行的ICML 2026高效多模态问答研讨会上,QANTA 2026共享挑战赛迎来创新解决方案。该赛事要求系统在现实效率约束下,通过逐步揭示的文本和配图回答金字塔式问题。挑战包含两个独立任务:需要把握答题时机的“抢答题”,以及强调准确答案选择与人类采纳度的“附加题”。
研究团队为此设计了任务专用的双智能体架构。抢答智能体采用GPT-4o-mini级模型,通过置信度校准答题机制和领域专用数值推理策略,有效降低了因孤立定量线索导致的过度自信预测。附加题智能体则使用GPT-4o级模型,结合线索感知推理、结构化关系推理和多模态证据整合技术,显著提升了精确答案选择能力。
区别于传统检索流水线或模型集成方法,该方案专注于在纯托管环境中优化推理策略与置信度校准。最终系统以0.402的总分刷新排行榜纪录,其中抢答题得分0.238,附加题效应得分0.164。研究表明,轻量级的任务专用推理策略能在资源受限的多模态问答基准测试中实现强劲性能,为高效AI系统设计提供了新思路。