AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
语言模型
36 篇相关内容
相关话题
AI安全
arXiv
认知科学
模型训练
模型对齐
Transformer
大模型
可解释AI
人机交互
arXiv研究
扩散模型
自然语言处理
语言模型中的“可表达层”:揭示AI的隐性思考空间
研究人员发现大型语言模型内部存在类似人类意识的“全局工作空间”,通过新型解释技术可解码模型未说出口的思考过程,为AI对齐研究提供新视角。
a
arXiv
·
20 小时前
语言模型
可解释AI
意识模拟
对齐研究
a
神经符号AI助力LEED认证:文档智能审查与多模态陷阱
研究提出神经符号AI管道,利用小型本地语言模型结合确定性规则检查,自动化处理LEED绿色建筑认证文档,实验发现4B参数模型在文本验证任务中表现优于8B模型,而添加低分辨率图纸图像反而降低准确性。
a
arXiv
·
21 小时前
神经符号AI
语言模型
绿色建筑
文档处理
a
AI助手面临“割裂问题”:大模型无法感知用户全貌
研究发现当前AI助手存在阿谀奉承、过度自信等行为,根源在于语言模型缺乏对用户完整认知的显式表征,研究者提出通过“割裂框架”在模型中植入结构化未知信息来改善这一问题。
a
arXiv
·
3 天前
语言模型
AI安全
人机交互
认知建模
a
研究发现:一句简单前缀即可绕过AI安全防护机制
最新研究揭示,对齐语言模型的安全拒绝机制存在脆弱性,仅需在提示前添加简单前缀即可使其绕过安全限制生成有害内容。研究通过多模型实验定位了拒绝机制失效的具体位置和原理。
a
arXiv
·
3 天前
语言模型
AI安全
对抗攻击
机制可解释性
a
语言模型存在可靠性天花板:信息论揭示性能极限
研究证明语言模型可靠性存在理论上限,无法通过无限扩展消除。新理论统一解释检索增强、灾难性遗忘等现象,并提出首个基于信息论的扩展定律。
a
arXiv
·
3 天前
语言模型
信息论
扩展定律
可靠性
a
小模型也能自我监测?新方法让1B参数模型学会“内省”
研究者提出“内省微调”方法,让小型语言模型学会检测自身内部激活的扰动,Llama-1B模型准确率从9.6%提升至60.6%。
a
arXiv
·
3 天前
语言模型
模型训练
AI透明度
模型对齐
a
新型扩散语言模型:每个token都有自己的“时间线”
研究者提出Token Time Continuous Diffusion模型,通过连续空间建模和token级时间机制,在高速推理场景下超越传统离散模型。
a
arXiv
·
3 天前
扩散模型
语言模型
自然语言处理
arXiv
a
Llama 3.2 解码大脑语义?新研究揭示大模型在fMRI语言解码中的局限
最新研究通过改进传统编码模型与引入基于Llama 3.2的fMRIFlamingo模型,探索大语言模型在fMRI神经语言解码中的表现,发现模型先验知识可能掩盖真实解码能力,强调盲控评估的重要性。
a
arXiv
·
5 天前
脑机接口
fMRI解码
Llama 3.2
语言模型
a
语言模型如何区分角色信念与现实?新研究揭示「信念-现实分离」机制
最新研究发现语言模型通过「共享值槽+路由选择」的双重机制,在计算层面实现角色信念与客观现实的分离。该机制在多个模型架构中表现一致,为理解模型心智理论能力提供新视角。
a
arXiv
·
5 天前
语言模型
心智理论
计算机制
信念推理
a
突破时间限制:大规模点时间语言模型显著缩小性能差距
研究团队通过扩大模型规模至40亿参数,成功构建了消除未来信息泄露的点时间语言模型,在多项基准测试中接近主流开放权重模型的性能水平。
a
arXiv
·
5 天前
语言模型
时间序列
模型训练
开源模型
a
参数高效微调草案生成遭遇瓶颈:并行推理加速新思路受挫
研究者提出基于PEFT的块扩散草案生成方法,试图通过轻量适配器加速语言模型推理,但实验表明该方法未能实现实际加速效果。
a
arXiv
·
5 天前
推测解码
参数高效微调
推理加速
语言模型
a
前沿语言模型风险评估新框架:如何量化AI对生化核威胁的“助推”作用
研究人员提出“阈值超越标准”框架,系统评估前沿语言模型是否实质提升非专业人士策划高危生化核威胁的能力。实证研究发现,模型辅助在放射领域存在确认的助推效应,但其他领域效果有限。
a
arXiv
·
5 天前
语言模型
AI安全
风险评估
CBRN威胁
a
图反馈控制如何影响开源大语言模型群体的共识形成与派系分化
研究揭示开源大语言模型群体在交互过程中,图结构反馈机制对共识形成的关键作用:相似度阈值路由会加剧群体碎片化,而桥接式路由能在保留记忆时促进共识达成。
a
arXiv
·
5 天前
多智能体系统
语言模型
群体智能
共识形成
a
语言模型能否从“不可能语言”中重建自然语言?信息局部性效应揭秘
研究通过微调在“不可能语言”上预训练的GPT-2模型,探究语言模型从信息局部性被破坏的输入中恢复自然英语的能力,揭示了模型对局部性结构的归纳偏好。
a
arXiv
·
6 天前
语言模型
GPT-2
信息局部性
归纳偏好
a
语言模型如何统一处理多种心理空间?研究发现共享路由机制
最新研究发现,Transformer语言模型采用统一机制处理现实、假设、信念等不同心理空间,通过可复用的值槽和可操纵的路由器实现跨空间信息管理。
a
arXiv
·
6 天前
语言模型
心理空间
Transformer
语义理解
a
Claude 机器人任务表现评估:语言模型能否驾驭物理世界?
Anthropic 研究团队测试了 Claude 在机器人任务中的表现,探索语言模型能否感知场景、理解机器人状态并执行有效物理操作。
A
Anthropic
·
7 天前
Claude
Anthropic
机器人
语言模型
A
小规模双曲语言模型展现创造力、诚实性与可控遗忘机制
研究揭示小型双曲语言模型通过特殊架构设计,可同时实现创造性输出、诚实评估与可控记忆遗忘,为可信赖的AI伴侣系统提供新路径。
a
arXiv
·
7 天前
语言模型
AI伦理
双曲神经网络
可信AI
a
研究发现:GPT-2预训练权重谱可复用,但单纯模仿光谱特征不足以提升模型性能
研究人员分析多个GPT-2变体模型发现,预训练模型存在可复用的结构化权重谱特征,但将其作为初始化信号时,仅模仿组件级光谱特征并未带来显著性能提升。
a
arXiv
·
7 天前
语言模型
预训练
权重初始化
GPT-2
a
大模型“涌现式错位”是真实现象还是数据假象?
最新研究对语言模型训练中报告的“涌现式错位”现象提出质疑,发现该现象对数据集表面特征高度敏感,其稳健性可能被高估。
a
arXiv
·
7 天前
语言模型
模型对齐
涌现现象
微调
a
语言模型能否胜任百万级文档检索?注意力稀释成关键挑战
研究首次系统探索语言模型在百万令牌规模下的上下文检索能力,提出BlockSearch模型并通过注意力机制改进,在多项基准测试中媲美甚至超越传统检索方法。
a
arXiv
·
17 天前
语言模型
信息检索
注意力机制
上下文学习
a
参数高尔夫挑战赛:哪些优化技术真正有效?
一项名为'参数高尔夫'的社区挑战赛探索了在严格资源限制下语言模型的优化极限,通过分析两千多个提交方案,揭示了84种优化技术的实际效果。
a
arXiv
·
17 天前
语言模型
模型优化
参数压缩
社区挑战
a
语言模型新训练法:过程记忆蒸馏让AI学会自我反思与进化
研究人员提出过程记忆蒸馏方法,让语言模型在训练过程中自动提取并内化跨任务的行为模式,实现参数层面的自我改进。实验显示该方法在多个基准测试中显著优于现有自蒸馏技术。
a
arXiv
·
17 天前
语言模型
模型训练
自蒸馏
强化学习
a
大模型“想太多”怎么办?新方法DASH让AI学会适时停止思考
研究团队发现语言模型在推理时经常“过度思考”,产生无益的自我反思。他们提出DASH方法,通过评估推理片段的价值来减少无效思考,在数学竞赛基准测试中显著提升准确率。
a
arXiv
·
18 天前
语言模型
推理优化
DASH方法
过度思考
a
语言模型为何“幻觉”?新研究揭示推理偏差根源
最新研究通过TrapQA测试框架发现,大语言模型的幻觉回答往往源于推理路径偏差而非知识缺失,揭示了预训练频率失衡如何导致模型忽略提示约束。
a
arXiv
·
18 天前
语言模型
幻觉问题
推理偏差
模型评估
a
大模型也会“看人下菜碟”?研究发现权威偏见导致知识擦除
最新研究揭示语言模型存在系统性权威偏见:面对不同权威等级的人物提示,模型会按比例调整答案,甚至主动擦除正确答案的内部表征。
a
arXiv
·
18 天前
语言模型
AI安全
权威偏见
模型对齐
a
DiscoLoop:双通道循环架构突破大模型多步推理瓶颈
研究者提出DiscoLoop循环架构,通过离散嵌入与连续隐状态双通道设计,显著提升大模型在单次前向传播中的多步推理能力,在合成与真实任务中均表现优异。
a
arXiv
·
18 天前
Transformer架构
推理模型
多跳推理
循环神经网络
a
大模型潜在空间新探索:用控制向量与校准器提升可信度
研究团队提出利用大模型潜在空间实现行为控制与输出校准的新方法,通过控制向量干预模型行为,并开发潜在空间校准器评估输出可信度。
a
arXiv
·
18 天前
大模型
潜在空间
模型控制
可信AI
a
当Transformer学会'不可能'语言时,它究竟掌握了什么?
研究发现,Transformer语言模型在处理理论上人类无法习得的'不可能'语言时,表现出语法敏感度逐渐下降,但在生成高质量长句方面存在显著缺陷,这为解释这类语言在人类语言中未被证实提供了新视角。
a
arXiv
·
19 天前
Transformer
语言模型
语法敏感度
生成能力
a
AI如何从反馈中真正进步?研究发现关键瓶颈
最新研究揭示,多轮语言模型的性能提升往往并非来自反馈本身,而是源于重采样或额外计算。真正的进步需要模型具备利用反馈的能力,而非仅仅获得反馈。
a
arXiv
·
19 天前
语言模型
反馈机制
模型评估
人机交互
a
Transformer语言模型如何学习统计规律?研究发现:从抽象到具体
一项新研究采用发展心理学视角,追踪Transformer语言模型在训练过程中的内部表征变化,发现模型先学习最抽象的全局统计模式,再逐步掌握局部依赖关系。
a
arXiv
·
21 天前
Transformer
语言模型
统计学习
认知科学
a
GPT-5.6系列模型正式发布,一口气推出三款新模型
OpenAI正式发布GPT-5.6系列模型,包含三款不同版本,标志着大模型技术进入新的发展阶段。
O
OpenAI
·
23 天前
GPT-5.6
OpenAI
大模型
AI技术
O
通过级联线性特征检测与控制AI模型的奉承行为
研究人员提出一种迭代数据生成方法,通过识别级联线性特征来检测和控制语言模型的奉承倾向。该方法比传统二元对比样本能更清晰地分离行为特征,并提供可解释性保证。
a
arXiv
·
24 天前
模型可解释性
行为控制
语言模型
特征检测
a
新框架LBR:通过局部分支路由实现高效可训练的语言模型测试时扩展
研究者提出局部分支路由(LBR)框架,通过轻量级路由机制在推理时扩展局部前瞻树,在数学推理任务中超越了传统思维链方法。
a
arXiv
·
25 天前
语言模型
推理优化
测试时扩展
强化学习
a
iLLaDA:8B参数双向扩散语言模型,非自回归训练展现竞争力
研究者提出iLLaDA模型,采用完全双向注意力的掩码扩散目标进行训练,在多项基准测试中显著超越前代LLaDA模型,并与主流自回归模型表现相当。
a
arXiv
·
25 天前
iLLaDA
扩散模型
语言模型
非自回归
a
DeepSeek-V3.1-Terminus发布:语言一致性增强,智能体性能升级
DeepSeek推出V3.1-Terminus版本更新,重点优化了语言一致性和智能体性能,解决了中英文混合及乱码问题。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大模型
版本更新
语言模型
D
语言模型的社会推理能力从何而来?训练数据溯源揭示能力起源
研究人员通过训练数据溯源技术,首次系统揭示了语言模型中社会推理与STEM推理能力的不同数据来源,发现两者依赖完全不同的语料库区域。
a
arXiv
·
31 天前
语言模型
训练数据
推理能力
可解释AI
a