AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
可靠性评估
2 篇相关内容
相关话题
AI智能体
上下文工程
大语言模型
AI安全
自动评分
教育AI
自然语言处理
测量理论
AI智能体不会单独失败:上下文环境先出问题
研究发现AI智能体的失败往往源于上下文环境质量不足,而非模型本身。研究者开发了可测量上下文工程质量的评估框架,为提升智能体可靠性提供新方法。
a
arXiv
·
4 天前
AI智能体
上下文工程
可靠性评估
大语言模型
a
评估自动作文评分可靠性:新框架揭示不同文本条件下的评分差异
研究者提出条件概化理论框架,用于评估自动作文评分系统在不同文本复杂度条件下的可靠性差异,发现高熵文本需要更多评分条件才能保证准确性。
a
arXiv
·
6 天前
自动评分
教育AI
可靠性评估
自然语言处理
a