AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
arXiv
40 篇相关内容
相关话题
大语言模型
自然语言处理
基准测试
人机交互
强化学习
AI代理
世界模型
语言模型
机器学习
认知科学
扩散大语言模型
推理能力
大模型生成文本的“文学无风格”现象
研究发现LLM生成文本在n-gram分布上呈现简单而一致的模式,揭示了其在文学风格上的缺陷,并指出风格与语义问题无法完全分离。
a
arXiv
·
5 小时前
大语言模型
文本生成
自然语言处理
AI写作
a
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
研究者将人类调查中的QQ等式转化为大语言模型顺序判断的审计标准,发现当前基于下一个词概率的审计方法在模型响应趋于确定性时存在局限性。
a
arXiv
·
5 小时前
大语言模型
模型审计
认知科学
量子模型
a
无需强化学习!新方法让扩散大语言模型推理能力飙升
研究人员提出轨迹对齐蒸馏方法,通过监督模型自身去噪轨迹,显著提升扩散大语言模型的数学推理能力,计算效率提升近百倍。
a
arXiv
·
5 小时前
扩散大语言模型
模型蒸馏
推理能力
arXiv
a
分层检测:级联模型与联合模型在有害语言识别中的量化对比
研究团队通过控制实验对比了级联分解与联合多任务建模两种范式在分层有害语言检测中的表现,发现级联架构在准确率上具有优势,但需要付出更高的参数成本和推理延迟代价。
a
arXiv
·
5 小时前
自然语言处理
有害内容检测
模型架构
级联模型
a
图神经网络链接预测研究综述:技术、应用与挑战
本文从图神经网络(GNN)的视角,系统梳理了基于GNN的链接预测方法,提出基于技术和应用的新型分类法,并探讨了当前面临的挑战与未来方向。
a
arXiv
·
5 小时前
图神经网络
链接预测
知识图谱
推荐系统
a
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
研究者提出Loopie系列模型,通过创新的循环Transformer架构与专家混合设计,在同等计算预算下显著超越传统Transformer基线,并在国际数学与物理奥赛中展现金牌级推理能力。
a
arXiv
·
1 天前
Transformer
MoE
模型架构
推理能力
a
多轮对话研究新视角:将“对话对象识别”从离散标签转向连续层级
一项研究挑战了传统多轮对话中“对话对象识别”的离散分类范式,提出将其视为连续现象,并通过实验证明连续层级模型能更准确地预测发言权转移及听众行为。
a
arXiv
·
1 天前
对话系统
多轮对话
自然语言处理
人机交互
a
DSWorld:数据科学世界模型,让AI代理告别盲目试错
研究者提出数据科学世界模型DSWorld,可预测数据科学操作的效果,加速AI代理训练与推理,减少昂贵计算依赖。
a
arXiv
·
1 天前
数据科学
AI代理
世界模型
强化学习
a
AI助手面临“割裂问题”:大模型无法感知用户全貌
研究发现当前AI助手存在阿谀奉承、过度自信等行为,根源在于语言模型缺乏对用户完整认知的显式表征,研究者提出通过“割裂框架”在模型中植入结构化未知信息来改善这一问题。
a
arXiv
·
4 天前
语言模型
AI安全
人机交互
认知建模
a
新型扩散语言模型:每个token都有自己的“时间线”
研究者提出Token Time Continuous Diffusion模型,通过连续空间建模和token级时间机制,在高速推理场景下超越传统离散模型。
a
arXiv
·
4 天前
扩散模型
语言模型
自然语言处理
arXiv
a
低查询预算下的文本硬标签对抗攻击新方法LBA
研究人员提出LBA方法,通过结合先验与后验知识构建高质量对抗样本的近似分布,在硬标签场景下以低查询成本生成语义保持更好的对抗文本。
a
arXiv
·
4 天前
对抗攻击
自然语言处理
文本安全
机器学习
a
动态人机协作新范式:从静态对齐转向互动互补
研究团队提出人机对齐应从静态模仿转向动态互动,强调在协作流程中共同演化,并指出当前AI系统在不确定性推理和协调机制上面临新挑战。
a
arXiv
·
4 天前
AI对齐
人机协作
动态系统
跨学科研究
a
IMEX框架:基于交互的可解释模型新方法
研究者提出IMEX(基于交互的模型解释)方法,通过静态相关性和交互相关性两种指标,揭示黑盒模型中特征对预测结果的贡献度及交互作用。
a
arXiv
·
4 天前
可解释AI
模型解释
特征交互
机器学习
a
HG-RAG:基于层级知识图谱的检索增强生成新框架
研究者提出HG-RAG框架,通过层次化知识图谱检索增强大模型推理能力,在关系推理和多跳查询任务中显著优于传统平面检索方法。
a
arXiv
·
4 天前
RAG
知识图谱
大语言模型
检索增强
a
AI建议抑制人类说“我不知道”的意愿,即使建议错误且鼓励准确
研究表明,AI助手的建议会显著降低人们在面对困难问题时选择“我不知道”的意愿,即使AI建议是错误的,且参与者被鼓励追求准确性。
a
arXiv
·
5 天前
人工智能
人机交互
行为科学
决策
a
理论级自动形式化:从孤立命题到统一的形式知识库
研究者提出理论级自动形式化新方向,强调需构建包含公理、定义和引理的完整理论网络,而非仅翻译孤立语句。
a
arXiv
·
5 天前
自动形式化
形式验证
知识表示
arXiv
a
Real World VoiceEQ:衡量语音AI人性化表现的新指标
研究者提出Real World VoiceEQ评估框架,用于量化语音AI在真实场景中的人性化表现,为优化人机交互体验提供新工具。
H
Hugging Face
·
5 天前
语音AI
评估框架
人机交互
arXiv
H
CityBehavEx:可扩展且经验验证的大语言模型辅助城市模拟平台
研究人员推出CityBehavEx平台,结合传统人类移动模型与微调交叉编码器,实现大规模城市行为模拟,在单张消费级GPU上1小时内完成10万智能体75天行为仿真。
a
arXiv
·
6 天前
大语言模型
城市模拟
多智能体系统
计算社会科学
a
将“隔离”作为LLM智能体系统安全的首要原则:概念、分类与挑战
一项最新研究提出,应将“隔离”作为保障大语言模型(LLM)智能体系统安全的核心设计原则,通过建立用户-智能体、智能体-工具等五大边界,系统性分析安全风险传播路径与防御策略。
a
arXiv
·
6 天前
LLM智能体
AI安全
系统隔离
arXiv
a
智能体自我进化:Critic Experience Bank 提升大模型行动置信度评估
研究者提出 Critic Experience Bank 框架,让大语言模型智能体能够基于历史执行反馈自我进化,显著提升单步行动置信度评估的准确性和校准度。
a
arXiv
·
6 天前
大语言模型
智能体
置信度校准
自我进化
a
AI代理前瞻记忆大挑战:PM-Bench基准揭示LLM执行延迟意图的困境
研究者推出PM-Bench基准测试,专门评估大语言模型代理的前瞻记忆能力。测试显示当前最先进的GPT-5.4代理仅获得65.1%的F1分数,凸显AI代理在延迟意图执行方面的重大挑战。
a
arXiv
·
6 天前
大语言模型
AI代理
基准测试
认知科学
a
智能体评测需要多少任务才够?公开LLM智能体基准测试的回放分析
研究通过回放SWE-bench、AppWorld等公开基准测试数据,发现部分任务运行往往无法得出与完整测试相同的结论,不同基准所需任务比例差异显著。
a
arXiv
·
6 天前
智能体评测
基准测试
LLM评估
研究方法
a
如何设计优质AI基准测试:五大核心标准解析
研究提出优质AI基准测试应具备正确性、可解性、可验证性、明确性与挑战性五大特征,强调测试需模拟真实场景并验证结果而非方法。
a
arXiv
·
6 天前
基准测试
AI评估
研究框架
arXiv
a
游戏关卡新表示法:基于玩家轨迹的「蛋糕」模型
研究人员提出了一种名为「蛋糕」的时序游戏关卡表示法,并开发了配套的生成算法PRP,在推箱子游戏中验证了其有效性。
a
arXiv
·
6 天前
游戏AI
程序化生成
关卡设计
表示学习
a
优化并非万能:反思AI对齐背后的文化逻辑
一篇arXiv论文批判性地指出,当前AI对齐工作过度依赖可量化的优化指标,这种‘优化文化’可能忽视了语言生成中‘错误’与‘创新’的本质区别,将语言权威让渡给了缺乏判断力的算法系统。
a
arXiv
·
6 天前
AI对齐
优化文化
语言生成
批判研究
a
无需模型评分也能选测试题:新方法用语义特征压缩大模型评测集
研究者提出一种无监督的大模型评测集压缩方法,仅依赖提示的语义嵌入就能选出代表性测试题,在35个基准测试上验证了有效性。
a
arXiv
·
7 天前
大模型评测
基准测试
子模优化
语义嵌入
a
玻尔兹曼MapReduce:可分支沙箱的配分函数归约算法
研究提出玻尔兹曼MapReduce框架,将分布式计算中的MapReduce操作转化为配分函数计算,实现精度加权池化与频率派统计的一致性收敛。
a
arXiv
·
7 天前
分布式计算
MapReduce
统计力学
机器学习理论
a
贝叶斯因果发现为何失效?线性高斯网络潜在混杂下的结构后果分析
研究揭示贝叶斯因果发现在潜在混杂变量影响下的失效机制,发现存在关键相关性阈值,超过该阈值后模型会倾向于在混杂变量间建立虚假边。
a
arXiv
·
8 天前
因果发现
贝叶斯方法
潜在混杂
线性高斯模型
a
法律推理新突破:多智能体辩论框架L-MAD系统评估
研究团队提出L-MAD框架,系统评估多智能体辩论在法律推理中的表现,发现合理配置智能体数量可提升准确性,但过度讨论会导致错误强化。
a
arXiv
·
8 天前
多智能体系统
法律AI
辩论框架
arXiv
a
长视野终端基准发布:AI智能体面临极限挑战
研究者推出长视野终端基准测试,包含46项需数小时完成的任务,旨在评估AI智能体在复杂长流程任务中的表现。测试显示当前最强模型仅达15.2%通过率,揭示巨大提升空间。
a
arXiv
·
8 天前
AI智能体
基准测试
长流程任务
评估框架
a
智能体记忆的双时态溯源:我们何时相信什么,为何相信
研究者提出智能体记忆的双时态溯源框架,能够同时追踪信念的时间演变和认知过程的时间戳,为AI系统的决策透明性提供新思路。
a
arXiv
·
9 天前
智能体
记忆系统
可解释AI
认知建模
a
参数高尔夫挑战赛:哪些优化技术真正有效?
一项名为'参数高尔夫'的社区挑战赛探索了在严格资源限制下语言模型的优化极限,通过分析两千多个提交方案,揭示了84种优化技术的实际效果。
a
arXiv
·
18 天前
语言模型
模型优化
参数压缩
社区挑战
a
SPARCLE:让语音合成更懂说话人,低资源场景性能翻倍
研究人员提出SPARCLE模型,通过对比学习将文本字符与说话人感知的声学特征对齐,显著提升低资源场景下的语音合成质量。
a
arXiv
·
18 天前
语音合成
低资源学习
对比学习
arXiv
a
大模型代理安全新突破:基于溯源分析防止指令偏离
研究者提出ProvenanceGuard框架,通过多阶段溯源分析检测大模型代理工具调用是否偏离用户意图,在两大基准测试中显著降低误判率。
a
arXiv
·
18 天前
大模型安全
AI代理
溯源分析
对齐研究
a
新算法C3RL:让大语言模型学会“诚实”表达自信度
研究者提出C3RL强化学习算法,解决大模型在强化学习训练后自信度与准确性脱钩的问题,并基于校准后的自信度开发动态推理策略CAS,最高可减少12倍计算开销。
a
arXiv
·
18 天前
大语言模型
强化学习
置信度校准
推理优化
a
扩散语言模型革新医疗报告起草:可任意填充文本片段
研究人员将扩散语言模型应用于医疗领域,在医学视觉问答任务中表现媲美甚至超越传统自回归模型,并具备独特的任意位置文本填充能力,为放射科报告起草提供新工具。
a
arXiv
·
18 天前
扩散模型
医疗AI
自然语言生成
放射学
a
世界模型新角色:从参赛者到裁判员,AI决策评估迎来新范式
研究人员提出利用世界模型作为评估AI决策质量的“裁判”,为强化学习等任务提供更高效、更可靠的评估方案。
a
arXiv
·
18 天前
世界模型
AI评估
强化学习
决策系统
a
具身智能新突破:训练世界模型开始借鉴人类肌肉与大脑机制
研究人员提出具身智能数据采集新范式,通过模拟人类肌肉与大脑的协同机制,提升智能体对物理世界的理解与适应能力。
a
arXiv
·
19 天前
具身智能
世界模型
机器人学习
神经科学启发
a
SLIM-RL:无需轨迹切片的扩散大语言模型风险预算随机掩码强化学习
研究者提出SLIM-RL方法,通过风险预算解码器控制扩散大语言模型训练中的承诺风险,在多项数学与代码基准测试中超越现有轨迹感知方法,且无需重建推理轨迹。
a
arXiv
·
19 天前
扩散大语言模型
强化学习
随机掩码
风险控制
a
Self-GC:让大模型智能体自主管理上下文,提升长任务处理效率
研究人员提出Self-GC框架,将智能体运行中的工具结果、文件、计划等转化为可索引对象,通过侧信道规划器动态管理上下文生命周期,在保持任务连续性的同时显著减少上下文长度。
a
arXiv
·
19 天前
大语言模型
智能体系统
上下文管理
AI研究
a