B站开源Index-1.9B小语言模型系列,1.9B参数性能媲美数倍规模竞品
Bilibili近日在arXiv上发布了Index-1.9B系列开源小语言模型技术报告。该系列包含四个不同定位的模型:Index-1.9B-Base作为基础模型,拥有19亿非嵌入参数,在2.8万亿以中英文为主的语料上进行预训练;Index-1.9B-Pure是严格控制版本,从训练语料中严格过滤了所有类似指令的数据;Index-1.9B-Chat通过监督微调和直接偏好优化从基础模型对齐而来;Index-1.9B-Character则在对话模型基础上增加了检索增强生成功能,支持少样本角色扮演定制。
在技术实现上,研究团队采用了Warmup-Stable-Decay学习率调度策略,在衰减阶段大幅提高精选数据的浓度,同时使用Norm-Head输出层来稳定大学习率下的训练过程。在涵盖考试、推理、数学和代码的标准基准测试套件中,Index-1.9B-Base取得了64.92的平均分,性能与数倍于其规模的开源模型相当甚至更优。
报告还详细记录了关于模型深度、学习率大小与调度、学习率衰减与数据质量的相互作用,以及在预训练中包含指令数据的影响等控制性研究。值得注意的是,研究团队观察到了在恒定学习率阶段中期基准测试性能出现无法解释的激增现象。所有模型及相关评估代码已在GitHub开源发布。