SEFORA论文发布:首个真实课堂写作反馈数据集与LLM评估框架
近日,arXiv平台发布了一项关于大语言模型在教育领域应用的重要研究。该研究团队针对写作教学中反馈生成这一核心需求,推出了SEFORA数据集——这是目前首个公开收录真实大学课堂中教师批注与学生多稿修订过程的语料库。
SEFORA数据集覆盖多种大学写作体裁,不仅包含作业提示、评分标准和最终分数,更重要的是记录了教师在实际教学中给出的8,240条具体批注,以及学生根据反馈进行的564次草稿修订。这一数据为研究教育场景下的反馈生成提供了宝贵资源。
为解决生成反馈的质量评估难题,研究团队同时提出了UniMatch评估框架。该框架采用基于参考的评估方法:首先将反馈分割为独立单元,然后根据教师批注标准评估语义对应性,最后通过最优匹配计算可解释的精确率、召回率和F1分数。
令人关注的是,研究团队在74种实验配置(涵盖多种大模型)中发现,所有模型在生成写作反馈方面的表现均未超过0.4 F1分数。UniMatch分析显示,模型难以准确识别教师会优先关注的反馈点,且随着生成内容增多,模型性能反而下降。这一发现对当前教育科技领域过度依赖大模型生成反馈的做法提出了重要警示。