AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多轮对话
4 篇相关内容
相关话题
对话系统
自然语言处理
人机交互
arXiv
视觉语言模型
模型评估
稳定性测试
大模型
大语言模型
评估基准
贝叶斯推理
认知不确定性
多轮对话研究新视角:将“对话对象识别”从离散标签转向连续层级
一项研究挑战了传统多轮对话中“对话对象识别”的离散分类范式,提出将其视为连续现象,并通过实验证明连续层级模型能更准确地预测发言权转移及听众行为。
a
arXiv
·
1 天前
对话系统
多轮对话
自然语言处理
人机交互
a
多轮对话压力测试:视觉语言模型在反复追问下的稳定性评估
研究者提出‘持续提示’评估框架,发现主流视觉语言模型在用户反复质疑或否定时会出现答案不稳定现象,正确回答可能被推翻,错误回答反而被修正。
a
arXiv
·
4 天前
视觉语言模型
模型评估
多轮对话
稳定性测试
a
BayesBench:多轮证据累积下评估大语言模型信念轨迹的新基准
研究者提出BayesBench基准,首次系统评估大语言模型在多轮对话中能否像理性贝叶斯推理者那样更新信念。研究发现模型规模提升有助于潜在变量推断,但推断能力不一定能转化为理性的下游预测。
a
arXiv
·
20 天前
大语言模型
评估基准
贝叶斯推理
多轮对话
a
ATOD:多轮自主智能体训练新方法,融合蒸馏与强化学习优势
研究者提出ATOD混合训练算法,通过退火调度机制结合策略蒸馏与强化学习,显著提升小模型智能体在长程交互任务中的性能表现。
a
arXiv
·
22 天前
模型训练
强化学习
知识蒸馏
自主智能体
a