AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
自动评分
3 篇相关内容
相关话题
大语言模型
教育AI
可靠性评估
自然语言处理
测量理论
阿拉伯语方言
文化评估
NLP研究
教育科技
GCSE
arXiv
评估自动作文评分可靠性:新框架揭示不同文本条件下的评分差异
研究者提出条件概化理论框架,用于评估自动作文评分系统在不同文本复杂度条件下的可靠性差异,发现高熵文本需要更多评分条件才能保证准确性。
a
arXiv
·
6 天前
自动评分
教育AI
可靠性评估
自然语言处理
a
阿拉伯语文化知识评估新框架:前沿大模型在方言理解上表现如何?
研究者提出跨评估框架,用人类专家标注数据测试前沿大模型在埃及和伊拉克阿拉伯语方言上的文化与社会语言学知识。结果显示,文化推理任务仍是自动评估的主要难点。
a
arXiv
·
19 天前
大语言模型
阿拉伯语方言
文化评估
自动评分
a
大语言模型在英国 GCSE 模拟考试评分中表现优异,甚至超越人类考官
一项基于 32,534 份真实 GCSE 模拟考试学生答卷的研究发现,现成的大语言模型在评分上与考官共识高度一致,部分模型表现甚至优于考官间的相互一致性。
a
arXiv
·
26 天前
大语言模型
教育科技
自动评分
GCSE
a