评估自动作文评分可靠性:新框架揭示不同文本条件下的评分差异
传统自动评分系统的可靠性评估通常基于整体数据,可能掩盖不同文本条件下的性能差异。arXiv最新研究提出条件概化理论框架,专门分析评分配置在不同响应条件下的非均匀可靠性。该框架将评分模型架构和评分头选择视为可接受的测量条件集合,而非偶然建模选择。研究比较了理论设计与有限评分池的实证配置扫描,通过熵定义的响应分层分析可靠性变化。在限时二语写作自动评分实验中,整体可靠性较高(Φ≈0.76),但在不同熵值文本层中呈现梯度变化:高熵文本层可靠性从0.88降至0.84,表明需要更多交叉评分条件才能保证准确性。该框架为评估AI辅助评分系统的条件依赖性提供了可移植工作流程,特别适用于教育测量和自动评分领域。