AI助手新挑战:如何与用户“对齐”模糊任务意图?
最新研究揭示,当前语言模型面临一个被忽视的关键挑战:如何与用户对齐模糊任务意图。传统评测主要关注模型对明确指定任务的执行能力,但现实场景中用户需求往往不完整、探索性或自相矛盾,需要AI先理解真实意图再执行。
研究团队将这一“任务对齐”问题形式化为部分可观测马尔可夫决策过程(POMDP),模型需从碎片化的用户意图中推断潜在任务。通过在购物、编程和专业工作三大场景的测试发现:虽然模型在任务明确时表现良好,但在面对模糊请求时,现有模型普遍存在过早行动、交互低效、无法澄清歧义等问题。
数据显示,在任务不明确情况下,当前模型仅能恢复用户真实意图的22-32%,而人类参与者在相同设置下达到48%。实验表明,监督微调和强化学习能提升任务对齐能力,但模型仍落后于人类通过交互化解不确定性的水平。
这项研究警示,当前AI系统仍缺乏实现可靠自主代理所需的关键交互能力,为下一代智能助手的发展指明了重要改进方向。