AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
Transformer
17 篇相关内容
相关话题
机器学习
arXiv
大语言模型
语言模型
认知科学
混合专家模型
路由机制
上下文建模
稀疏训练
语言评估
AI公平性
教育科技
多层级上下文建模提升MoE专家选择一致性
研究人员提出MCF-MOE框架,通过融合跨层语义聚合与局部词元交互信息,解决混合专家模型中路由决策不一致问题,显著提升语言建模与理解性能。
a
arXiv
·
5 小时前
混合专家模型
Transformer
路由机制
上下文建模
a
AI评分系统防作弊新突破:自动检测并抑制语言评估中的“捷径依赖”
研究人员提出一种新型训练准则,可有效降低AI语言评分系统对特定输入特征的过度依赖,防止考生通过利用系统漏洞而非提升真实语言能力来获取高分。
a
arXiv
·
1 天前
语言评估
AI公平性
机器学习
Transformer
a
前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
研究发现即使是最先进的大语言模型也难以精确复制输入文本,原因在于Transformer的位置编码机制存在缺陷。研究者提出2D-RoPE方法,将文本视为二维网格,显著提升了模型的复制能力。
a
arXiv
·
1 天前
大语言模型
Transformer
位置编码
模型能力评估
a
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
研究者提出Loopie系列模型,通过创新的循环Transformer架构与专家混合设计,在同等计算预算下显著超越传统Transformer基线,并在国际数学与物理奥赛中展现金牌级推理能力。
a
arXiv
·
1 天前
Transformer
MoE
模型架构
推理能力
a
MGDT:多模态知识图谱补全新框架,引入MLLM引导的扩散Transformer
研究人员提出MGDT框架,通过MLLM引导的扩散Transformer与关系自适应专家混合机制,显著提升多模态知识图谱补全性能。该框架采用先对齐后扩散的范式,在三个基准数据集上表现优于现有方法。
a
arXiv
·
1 天前
知识图谱
多模态AI
扩散模型
大语言模型
a
交通预测新发现:提取全局空间信息,未必需要Transformer
一项新研究对交通预测模型中提取全局空间信息的必要性提出质疑,通过对比实验发现,简单的全局聚合算子与复杂的注意力机制效果相当,但计算复杂度显著降低。
a
arXiv
·
6 天前
交通预测
空间注意力
Transformer
计算复杂度
a
语言模型如何统一处理多种心理空间?研究发现共享路由机制
最新研究发现,Transformer语言模型采用统一机制处理现实、假设、信念等不同心理空间,通过可复用的值槽和可操纵的路由器实现跨空间信息管理。
a
arXiv
·
7 天前
语言模型
心理空间
Transformer
语义理解
a
任务条件化合成数据生成算法TCSDG:提升农业预测任务中机器学习性能
研究人员提出一种任务条件化合成数据生成算法TCSDG,通过结合贝叶斯网络与表格基础模型,生成高质量合成数据,显著提升农业产量预测与作物分类任务的机器学习性能。
a
arXiv
·
7 天前
合成数据生成
农业AI
机器学习
表格数据
a
Transformer专用芯片获10亿美元订单,获AI巨头投资
一款专为Transformer架构设计的AI芯片已成功流片,并获得卡帕西、李飞飞、辛顿等AI领域权威人士的投资,同时签下价值10亿美元的大额订单。
量
量子位
·
20 天前
AI芯片
Transformer
硬件投资
大模型
量
当Transformer学会'不可能'语言时,它究竟掌握了什么?
研究发现,Transformer语言模型在处理理论上人类无法习得的'不可能'语言时,表现出语法敏感度逐渐下降,但在生成高质量长句方面存在显著缺陷,这为解释这类语言在人类语言中未被证实提供了新视角。
a
arXiv
·
20 天前
Transformer
语言模型
语法敏感度
生成能力
a
Transformer助力无人机空管系统安全测试,漏洞发现效率提升8倍
研究者提出基于Transformer的强化学习框架,用于发现无人机空管系统的安全隐患。在700小时仿真测试中,该方法比专家指导测试的漏洞发现效率提升8倍。
a
arXiv
·
20 天前
Transformer
强化学习
无人机交通管理
安全测试
a
大模型如何学会“读心”?研究揭示情境建模与心智化能力的发展轨迹
最新研究发现,大语言模型的心智推理能力(如理解他人信念)依赖于模型规模与训练量,且在预训练后期才显著出现。研究同时发现,模型对情境的基本事实建模能力先于心智化能力形成,但两类表征均存在脆弱性。
a
arXiv
·
21 天前
大语言模型
心智理论
认知发展
模型评估
a
DiScoFormer:单Transformer同时处理密度与评分,跨分布通用
研究人员提出DiScoFormer模型,通过单一Transformer架构同时学习概率密度和评分函数,实现跨多种分布的灵活建模。
H
Hugging Face
·
21 天前
Transformer
概率建模
生成模型
机器学习
H
Transformer语言模型如何学习统计规律?研究发现:从抽象到具体
一项新研究采用发展心理学视角,追踪Transformer语言模型在训练过程中的内部表征变化,发现模型先学习最抽象的全局统计模式,再逐步掌握局部依赖关系。
a
arXiv
·
22 天前
Transformer
语言模型
统计学习
认知科学
a
NVIDIA NeMo AutoModel:加速Transformer模型微调,简化大模型部署流程
NVIDIA推出NeMo AutoModel工具,旨在通过自动化配置与优化,大幅加速Transformer架构模型的微调过程,降低大模型应用门槛。
H
Hugging Face
·
26 天前
Transformer
NVIDIA
模型微调
自动化工具
H
语言模型能否成为神经网络电路的“自动解释员”?
研究团队探索语言模型代理在神经网络电路解释任务中的潜力,提出HyVE代理解释框架,并在半合成电路基准测试中验证其有效性。
a
arXiv
·
27 天前
机制可解释性
语言模型代理
神经网络电路
Transformer
a
Transformer模型在古兰经语音识别中的性能对比研究
研究团队系统评估了Wav2Vec2.0、HuBERT和XLS-R等预训练Transformer模型在古兰经语音识别任务中的表现,在超过870小时的专业与用户诵读数据上微调后,最佳配置将词错误率降至0.08。
a
arXiv
·
31 天前
语音识别
Transformer
古兰经
Wav2Vec2
a