合成数据如何更有效?揭秘固定源合成与源扩展的差异
在人工智能领域,合成数据已成为提升模型性能的关键手段,但其扩展方式常被混为一谈。最新研究首次明确区分了合成数据扩展的两条路径:源扩展(SE)通过增加种子材料或生成器来扩大数据源,而固定源合成(FSS)则保持数据源不变,仅增加生成预算。以往研究往往在数据增长时同步扩展源,导致两者效果混淆,FSS的作用长期未被充分探索。
为厘清FSS的影响,研究团队设计实验:固定种子问题池和教师模型,仅通过拒绝采样调整每个问题的回答生成预算。基于修正的缩放定律,团队推导出FSS的理论形式,其核心在于重复采样如何覆盖固定数据源。实证结果显示,该形式在低预算下拟合后,能准确预测所有评估的教师-学生模型在最高预算下的表现。
对比发现,在总样本预算相同的情况下,小预算时SE与FSS效果相近;但大预算下,增加种子问题比将预算用于生成更多回答更具优势。然而,在FSS框架内,无论是从现有种子生成额外问题,还是改变合成协议,均未超越普通拒绝采样在同等预算下的效果。这表明FSS是一条有界的扩展轴,但为合成协议的比较提供了高度可控的实验环境。研究团队将公开代码与数据,以推动相关领域深入探索。