DeepSeek发布实验模型V3.2-Exp,引入稀疏注意力机制提升长文本效率

DeepSeek官方近日发布了最新的实验性模型DeepSeek-V3.2-Exp。该模型基于V3.1-Terminus架构开发,首次引入了DeepSeek稀疏注意力机制(DSA),旨在优化长文本场景下的训练和推理效率。据官方介绍,DSA技术能够在不牺牲性能的前提下,大幅降低计算资源消耗,为处理超长上下文任务提供更优解决方案。

目前,DeepSeek-V3.2-Exp已在官方App、网页端及API平台同步上线。值得关注的是,伴随新模型发布,DeepSeek同时宣布API调用价格下调超过50%,进一步降低了开发者和企业的使用门槛。这一举措有望推动更多AI应用落地,加速大模型技术的商业化进程。

此次更新体现了DeepSeek在模型效率优化和成本控制方面的持续探索,为行业提供了新的技术参考。

大模型DeepSeek稀疏注意力API降价实验模型

原文来源:https://x.com/deepseek_ai/status/1972604768309871061

相关阅读

深度求索预告开源周:下周将开源5个AGI探索项目
DeepSeek开源FlashMLA解码内核,专为Hopper GPU优化
DeepSeek开源MoE通信库DeepEP,专为高效训练与推理设计
DeepSeek开源周第三弹:推出高性能FP8计算库DeepGEMM
DeepSeek API平台推出非高峰时段折扣,R1模型最高享75%优惠

← 返回