评估自动作文评分可靠性:新框架揭示不同文本条件下的评分差异

arXiv·6 天前

传统自动评分系统的可靠性评估通常基于整体数据,可能掩盖不同文本条件下的性能差异。arXiv最新研究提出条件概化理论框架,专门分析评分配置在不同响应条件下的非均匀可靠性。该框架将评分模型架构和评分头选择视为可接受的测量条件集合,而非偶然建模选择。研究比较了理论设计与有限评分池的实证配置扫描,通过熵定义的响应分层分析可靠性变化。在限时二语写作自动评分实验中,整体可靠性较高(Φ≈0.76),但在不同熵值文本层中呈现梯度变化:高熵文本层可靠性从0.88降至0.84,表明需要更多交叉评分条件才能保证准确性。该框架为评估AI辅助评分系统的条件依赖性提供了可移植工作流程,特别适用于教育测量和自动评分领域。

自动评分教育AI可靠性评估自然语言处理测量理论

原文来源:https://arxiv.org/abs/2607.11981

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回