半监督思维链学习:利用未标注问题构建推理监督信号
思维链推理已成为激发大语言模型潜在推理能力的有效方法,但现有研究多将其作为推理阶段的提示工具,很少将生成的推理轨迹重新用作半监督学习信号。近日,研究团队在arXiv发表论文《Revisiting Chain-of-Thought Reasoning under Limited Supervision》,提出“半监督思维链学习”概念及Semi-CoT框架。该框架创新性地利用未标注问题构建伪推理监督:首先为每个未标注问题采样多个伪思维链,然后计算答案级语义熵,最终筛选低熵推理链作为可靠的伪思维链示范。这种方法将思维链的自我训练视角从推理时优化扩展至半监督伪监督学习。在AQuA、SVAMP、GSM8K和MultiArith数据集上的实验表明,熵门控机制能有效筛选高精度伪思维链,伪答案精度达91.36%至100%。虽然SVAMP和GSM8K任务获得小幅提升,但AQuA出现负迁移现象,MultiArith则接近性能天花板。这些结果揭示:未标注问题可提供可靠的伪推理信号,但其有效利用仍需更强的示范选择机制或学生模型训练策略。