Wiola架构发布:全新小语言模型设计,五大创新组件突破传统

arXiv·18 天前

近日,研究团队在arXiv上发布了名为Wiola的全新小语言模型架构。该架构从第一性原理出发设计,与GPT、LLaMA、Mistral等现有模型家族无任何结构传承关系,实现了完全原创的设计理念。

Wiola架构包含五大创新技术组件:第一,螺旋旋转位置编码,将词元位置嵌入三维螺旋流形,融合绝对、相对和层级位置信号;第二,门控跨层注意力机制,使每个解码层能通过软注意力访问前两层的压缩摘要,增强层间连贯性;第三,自适应词元合并技术,在网络中间层动态合并语义冗余的相邻词元,降低注意力复杂度而不损失信息;第四,双流前馈网络,用两个并行流替代传统MLP,通过学习门控融合;第五,改进的WiolaRMSNorm归一化,引入维度偏移向量防止表示坍缩。

研究团队提供了完整的数学推导、架构框图、复杂度分析,并与GPT-2、LLaMA-2、Mistral等模型进行了系统对比。Wiola已发布120M、360M、700M和1.5B四个参数规模版本,完全兼容HuggingFace Transformers生态系统,所有22个架构单元测试均已通过验证。

小语言模型模型架构自然语言处理开源模型AI研究

原文来源:https://arxiv.org/abs/2607.01394

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回