AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型架构
9 篇相关内容
相关话题
自然语言处理
arXiv
推理能力
大语言模型
AI研究
有害内容检测
级联模型
Transformer
MoE
大模型
AI for Science
上海AI Lab
分层检测:级联模型与联合模型在有害语言识别中的量化对比
研究团队通过控制实验对比了级联分解与联合多任务建模两种范式在分层有害语言检测中的表现,发现级联架构在准确率上具有优势,但需要付出更高的参数成本和推理延迟代价。
a
arXiv
·
5 小时前
自然语言处理
有害内容检测
模型架构
级联模型
a
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
研究者提出Loopie系列模型,通过创新的循环Transformer架构与专家混合设计,在同等计算预算下显著超越传统Transformer基线,并在国际数学与物理奥赛中展现金牌级推理能力。
a
arXiv
·
1 天前
Transformer
MoE
模型架构
推理能力
a
上海AI Lab发布科学智能体新基座,397B参数追平万亿模型性能
上海人工智能实验室在WAIC 2026上发布新一代科学智能体基座,采用非Transformer架构‘Mobius’,以3970亿参数实现与万亿级模型相当的科学推理能力。
上
上海AI Lab
·
3 天前
大模型
AI for Science
上海AI Lab
模型架构
上
语言模型如何区分角色信念与现实?新研究揭示「信念-现实分离」机制
最新研究发现语言模型通过「共享值槽+路由选择」的双重机制,在计算层面实现角色信念与客观现实的分离。该机制在多个模型架构中表现一致,为理解模型心智理论能力提供新视角。
a
arXiv
·
6 天前
语言模型
心智理论
计算机制
信念推理
a
思维脚手架如何影响AI决策?GPT架构差异导致干预效果相反
最新研究发现,结构化思维干预对大型语言模型战略推理能力的影响高度依赖模型架构,GPT标准版与推理优化版对同一干预措施呈现相反反应。
a
arXiv
·
7 天前
大语言模型
推理能力
GPT
AI决策
a
Wiola架构发布:全新小语言模型设计,五大创新组件突破传统
研究人员提出完全原创的小语言模型架构Wiola,包含螺旋位置编码、跨层注意力等五大创新组件,已发布四个参数规模版本并兼容HuggingFace生态。
a
arXiv
·
18 天前
小语言模型
模型架构
自然语言处理
开源模型
a
自进化AI代理新架构:SEA实现实时验证的安全演进
研究者提出SEA架构,通过冻结基础模型与版本化封装,让AI代理在严格验证机制下实现安全自进化。实验显示该架构能有效利用基础模型能力,防止性能退化。
a
arXiv
·
19 天前
自进化代理
AI安全
模型架构
实时验证
a
Parcae:稳定循环模型,以更少参数实现更强性能
Together AI推出稳定循环语言模型Parcae,仅用770M参数即可达到1.3B Transformer模型性能,并首次提出循环扩展定律。
T
Together AI
·
27 天前
模型架构
参数效率
循环神经网络
性能优化
T
通义千问Qwen2.5-Max发布:探索超大规模MoE模型智能边界
通义千问团队正式推出Qwen2.5-Max模型,聚焦超大规模混合专家模型的智能提升路径,为行业提供新的技术探索方向。
通
通义千问 Qwen
·
28 天前
通义千问
MoE模型
大语言模型
模型架构
通