德英双语开源混合专家模型Soofi S发布,30B参数仅激活3B

arXiv·8 天前

近日,研究团队在arXiv上发布了Soofi S 30B-A3B模型,这是一款专为德语和英语设计的开源混合专家基础模型。该模型采用创新的Mamba-Transformer混合架构,总参数量达300亿,但每个token仅激活30亿参数,大幅提升了推理效率。

Soofi S在约27万亿token的数据集上进行预训练,其中德语数据被特意加重。在英语和德语基准测试中,其综合表现与140亿至270亿参数的稠密模型相当,并在17个开源基础模型中取得了两种语言的最佳代码生成成绩。与欧洲其他主权模型相比,Soofi S在所有基线测试中均表现优异,甚至超越了某些激活参数更大的模型。

在完全开源模型中,Soofi S的英语和德语评估得分最高,超越了Olmo 3 32B和Apertus 70B等知名模型。该模型完全基于德国工业AI云开发,这是由德国电信在慕尼黑运营的主权高性能计算基础设施。

Soofi S将以高度宽松的开源许可发布,包括模型权重、中间检查点、完整数据来源记录、超参数设置以及训练评估代码。在符合许可证要求的前提下,数据构建工具也将以宽松许可开放,商业许可数据则会提供详细的统计信息和混合比例说明。

基础模型混合专家多语言模型开源AI德国AI

原文来源:https://arxiv.org/abs/2607.09424

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回