AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
性能优化
6 篇相关内容
相关话题
开源
AI框架
自进化系统
上海AI Lab
机器学习
GLM-5
模型推理
智谱AI
工程实践
月之暗面
注意力机制
Kimi
无需更换模型,性能提升104%!上海AI Lab实现Harness自进化能力
上海人工智能实验室最新研究让Harness框架具备自我进化能力,在不更换核心模型的情况下实现性能显著提升。
上
上海AI Lab
·
2 天前
AI框架
自进化系统
性能优化
上海AI Lab
上
GLM-5大规模服务调试经验:从罕见故障到性能提升132%
智谱GLM团队分享GLM-5大规模服务调试经验,通过解决乱码输出、重复生成、KV缓存竞态等问题,并引入LayerSplit技术,实现推理吞吐量提升最高132%。
智
智谱 GLM
·
25 天前
GLM-5
模型推理
性能优化
智谱AI
智
月之暗面开源FlashKDA:基于CUTLASS的高性能Delta Attention内核
月之暗面宣布开源FlashKDA,这是其基于CUTLASS的高性能Kimi Delta Attention内核实现,在H20平台上相比flash-linear-attention基线实现了1.72倍至2.22倍的预填充速度提升。
月
月之暗面 Kimi
·
27 天前
月之暗面
注意力机制
开源
性能优化
月
DeepSeek-V3/R1推理系统技术揭秘:单节点吞吐量达7.3万token/秒
DeepSeek在开源周第六日公开V3/R1推理系统架构,通过跨节点批量扩展等技术实现高性能推理,单H800节点输入输出吞吐量分别达7.37万和1.48万token/秒。
D
DeepSeek 深度求索
·
27 天前
DeepSeek
推理系统
大模型
开源
D
Parcae:稳定循环模型,以更少参数实现更强性能
Together AI推出稳定循环语言模型Parcae,仅用770M参数即可达到1.3B Transformer模型性能,并首次提出循环扩展定律。
T
Together AI
·
27 天前
模型架构
参数效率
循环神经网络
性能优化
T
PyTorch性能剖析进阶:从nn.Linear到融合MLP的优化之路
PyTorch官方发布性能剖析系列第二篇,深入探讨如何通过融合多层感知机(MLP)中的线性层与激活函数,显著提升模型运行效率。
H
Hugging Face
·
27 天前
PyTorch
性能优化
机器学习框架
模型加速
H