德英双语开源混合专家模型Soofi S发布,30B参数仅激活3B
近日,研究团队在arXiv上发布了Soofi S 30B-A3B模型,这是一款专为德语和英语设计的开源混合专家基础模型。该模型采用创新的Mamba-Transformer混合架构,总参数量达300亿,但每个token仅激活30亿参数,大幅提升了推理效率。
Soofi S在约27万亿token的数据集上进行预训练,其中德语数据被特意加重。在英语和德语基准测试中,其综合表现与140亿至270亿参数的稠密模型相当,并在17个开源基础模型中取得了两种语言的最佳代码生成成绩。与欧洲其他主权模型相比,Soofi S在所有基线测试中均表现优异,甚至超越了某些激活参数更大的模型。
在完全开源模型中,Soofi S的英语和德语评估得分最高,超越了Olmo 3 32B和Apertus 70B等知名模型。该模型完全基于德国工业AI云开发,这是由德国电信在慕尼黑运营的主权高性能计算基础设施。
Soofi S将以高度宽松的开源许可发布,包括模型权重、中间检查点、完整数据来源记录、超参数设置以及训练评估代码。在符合许可证要求的前提下,数据构建工具也将以宽松许可开放,商业许可数据则会提供详细的统计信息和混合比例说明。