AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
强化学习
40 篇相关内容
相关话题
世界模型
可解释AI
arXiv
大语言模型
人机交互
模型训练
多智能体系统
医疗AI
元学习
AI安全
对话系统
推理可解释性
DSWorld:数据科学世界模型,让AI代理告别盲目试错
研究者提出数据科学世界模型DSWorld,可预测数据科学操作的效果,加速AI代理训练与推理,减少昂贵计算依赖。
a
arXiv
·
21 小时前
数据科学
AI代理
世界模型
强化学习
a
让强化学习“说人话”:新方法将黑盒策略转化为可执行的Prolog逻辑程序
研究人员提出一种新方法,可将深度强化学习的黑盒策略转化为人类可读、逻辑引擎可执行的Prolog程序,同时提供理论性能保证,在多个任务中实现接近原策略的性能。
a
arXiv
·
21 小时前
可解释AI
强化学习
Prolog
规则提取
a
ToolAnchor:用反事实锚点打破AI工具使用惯性,提升智能体适应新工具能力
研究团队发现大语言模型智能体在工具集扩展时存在‘行为惯性’问题,并提出ToolAnchor框架,通过注入反事实锚点上下文来激活被抑制的能力,显著提升智能体对新工具的适应效率。
a
arXiv
·
3 天前
大语言模型
智能体
工具使用
强化学习
a
AI医疗新突破:大语言模型让胰岛素泵控制器“开口说话”
研究人员开发出LLM-T1D系统,将强化学习的精准控制与大语言模型的自然解释能力相结合,为1型糖尿病患者打造出既高效又透明的智能胰岛素泵控制器。
a
arXiv
·
3 天前
医疗AI
大语言模型
糖尿病管理
可解释AI
a
无人机集群搜救新架构:三层次智能学习系统
研究人员提出一种创新的三层次分层学习架构,专为执行搜救任务的自主无人机集群设计。该架构整合了三种不同性质的学习机制,通过22个架构合约提供六类形式化保证。
a
arXiv
·
3 天前
无人机集群
分层学习
强化学习
搜救系统
a
新研究:用逻辑编程量化强化学习策略的可解释性
研究者提出一套基于归纳逻辑编程的客观指标,用于量化强化学习策略的可解释性,为安全关键和人机协作场景提供更透明的决策依据。
a
arXiv
·
4 天前
强化学习
可解释AI
归纳逻辑编程
策略可解释性
a
UrbanAgent:多智能体协同推理框架革新城市区域画像
研究者提出UrbanAgent框架,将城市区域画像任务转化为推理驱动的多智能体协作问题,通过工具增强的证据检索机制显著提升预测精度与泛化能力。
a
arXiv
·
4 天前
多智能体系统
城市计算
推理框架
强化学习
a
LAPO:多轮搜索推理中自生成过程奖励的新方法
研究人员提出LAPO方法,通过后向单轮归因技术为多轮搜索推理生成过程监督奖励,无需额外奖励模型即可评估中间步骤贡献。
a
arXiv
·
4 天前
强化学习
搜索推理
过程监督
归因方法
a
DROPJ:通过人类偏好与解释训练安全智能体行为
研究者提出DROPJ方法,通过人类在模拟环境中的偏好选择和理由说明,训练出更安全可靠的智能体策略,无需预设奖励函数即可在未知动态环境中实现安全部署。
a
arXiv
·
4 天前
安全AI
强化学习
人机交互
世界模型
a
世界模型赋能视觉语言智能体,原力灵机发布DW0.5,虚拟世界训练效率大幅提升
原力灵机发布DW0.5,通过世界模型在虚拟环境中训练视觉语言智能体,显著降低对真实世界数据的需求。
原
原力灵机
·
4 天前
世界模型
强化学习
视觉语言智能体
机器人学习
原
智能温室强化学习新框架:校准优先的奖励审计方法
研究人员提出一种校准优先的奖励审计框架,可将温室强化学习控制中的标量奖励分解为多个可追踪的环境调控组件,使种植者能够清晰了解AI策略何时加热、通风或调节湿度。
a
arXiv
·
5 天前
强化学习
智能农业
温室控制
奖励函数
a
环境动态变化下的上下文强化学习研究综述
本文系统梳理了非平稳环境中上下文强化学习的最新进展,探讨智能体如何在参数固定的情况下,通过上下文推断动态变化的决策规则。
a
arXiv
·
5 天前
强化学习
上下文学习
非平稳环境
元学习
a
EvoCUA-1.5:多轮计算机使用智能体在线强化学习新框架
EvoCUA-1.5将计算机使用智能体从离线经验学习扩展到在线强化学习,通过创新算法解决多轮交互中的观察管理、稀疏奖励等挑战,在OSWorld-Verified基准上取得63.2%的成功率。
a
arXiv
·
6 天前
强化学习
计算机使用智能体
多轮交互
在线学习
a
多模态大模型强化学习中的“奖励欺骗”风险
研究发现,在多模态大模型强化学习对齐过程中,单纯追求高奖励分数反而可能导致任务表现下降,这种“奖励欺骗”现象在视觉证据被文本奖励评估时尤为严重。
a
arXiv
·
7 天前
多模态大模型
强化学习
模型对齐
奖励机制
a
AI 重塑《我的世界》世界生成,创造力再进化
最新 AI 技术能够自动生成《我的世界》游戏世界,展现出前所未有的创造力和适应性,为游戏开发与内容生成带来新突破。
T
Two Minute Papers
·
8 天前
AI 生成内容
游戏 AI
我的世界
创造性 AI
T
对话策略选择框架DiPS:让AI在紧急劝说场景中更懂人心
研究者提出DiPS框架,通过强化学习动态选择劝说策略,在火灾疏散等高风险场景中显著提升AI的劝说成功率。
a
arXiv
·
17 天前
对话系统
强化学习
紧急救援
个性化劝说
a
FaithMed框架:让医疗大模型学会“循证推理”
研究人员提出FaithMed框架,通过强化学习结合临床评估标准,让医疗大模型在推理过程中更可靠地使用证据,提升医疗决策的透明度和准确性。
a
arXiv
·
17 天前
医疗大模型
循证医学
强化学习
AI医疗
a
新算法C3RL:让大语言模型学会“诚实”表达自信度
研究者提出C3RL强化学习算法,解决大模型在强化学习训练后自信度与准确性脱钩的问题,并基于校准后的自信度开发动态推理策略CAS,最高可减少12倍计算开销。
a
arXiv
·
17 天前
大语言模型
强化学习
置信度校准
推理优化
a
PASE框架:用神经符号世界模型验证LLM生成的云故障恢复计划
研究者提出PASE框架,将LLM作为核心计划合成引擎生成结构化恢复计划,并通过神经符号世界模型验证可行性,实验显示可减少40%以上系统恢复时间。
a
arXiv
·
17 天前
LLM
云故障恢复
神经符号AI
自主系统
a
OPINE-World:通过本体错误优先探索构建程序化世界模型
OPINE-World 提出一种基于 LLM 的智能体,能够通过交互在线学习以对象为中心的程序化世界模型,并在 ARC-AGI-3 基准测试中展现出高效的任务适应能力。
a
arXiv
·
17 天前
世界模型
程序合成
强化学习
LLM 智能体
a
语言模型新训练法:过程记忆蒸馏让AI学会自我反思与进化
研究人员提出过程记忆蒸馏方法,让语言模型在训练过程中自动提取并内化跨任务的行为模式,实现参数层面的自我改进。实验显示该方法在多个基准测试中显著优于现有自蒸馏技术。
a
arXiv
·
17 天前
语言模型
模型训练
自蒸馏
强化学习
a
医疗AI代理的临床反馈困境:RL在FHIR环境中的诊断与突破
研究发现,在临床FHIR环境中应用强化学习面临两大结构障碍:能力天花板与格式知识壁垒,导致纯RL效果显著落后于规则微调。
a
arXiv
·
17 天前
医疗AI
强化学习
FHIR标准
临床决策
a
超越下一词预测:RLVR方法在Atlassian工具调用智能体上的概念验证
研究团队提出RLVR方法,通过强化学习与可验证奖励机制,显著提升小型语言模型在企业API工作流中的工具调用准确率,在Jira和Confluence模拟环境中实现从0.35到接近1.00的性能跃升。
a
arXiv
·
17 天前
强化学习
工具调用
企业API
Qwen模型
a
世界模型新角色:从参赛者到裁判员,AI决策评估迎来新范式
研究人员提出利用世界模型作为评估AI决策质量的“裁判”,为强化学习等任务提供更高效、更可靠的评估方案。
a
arXiv
·
17 天前
世界模型
AI评估
强化学习
决策系统
a
自演进智能体新突破:AReaL 2.0开源,强化学习基础设施再升级
研究人员开源AReaL 2.0框架,旨在为自演进智能体提供强化学习基础设施,推动智能体生态持续进化。
a
arXiv
·
18 天前
强化学习
自演进智能体
开源框架
AI基础设施
a
任务状态表征:让移动端GUI智能体告别“健忘症”
研究人员提出了一种无需训练的任务状态表征框架,通过显式分离任务状态与屏幕观察,显著提升了移动端GUI智能体在长程任务中的执行成功率。
a
arXiv
·
18 天前
GUI智能体
任务规划
人机交互
移动自动化
a
SLIM-RL:无需轨迹切片的扩散大语言模型风险预算随机掩码强化学习
研究者提出SLIM-RL方法,通过风险预算解码器控制扩散大语言模型训练中的承诺风险,在多项数学与代码基准测试中超越现有轨迹感知方法,且无需重建推理轨迹。
a
arXiv
·
18 天前
扩散大语言模型
强化学习
随机掩码
风险控制
a
图原生强化学习新突破:通过概念重组实现可追溯的科学假设生成
研究人员提出Graph-PRefLexOR模型,利用图原生强化学习方法,在材料科学等领域实现可追溯的多步骤推理与假设生成,显著提升推理透明度与语义多样性。
a
arXiv
·
18 天前
强化学习
图神经网络
科学发现
可解释AI
a
AI智能体也能被“教练”指导?新框架让游戏角色实时响应风格指令
研究人员提出一种可教练智能体框架,结合强化学习与风格控制技术,让AI在完成核心任务的同时,能实时响应用户对执行风格的调整指令。该技术已在《地平线:西之绝境》《GT赛车》及人形机器人测试中验证效果。
a
arXiv
·
18 天前
强化学习
交互式AI
游戏AI
智能体控制
a
幻灯片个性化新突破:SPIRE框架通过结构降噪学习设计意图
研究者提出将页面级幻灯片个性化建模为逆向规划问题,并开发SPIRE框架,通过结构降噪和多智能体强化学习实现无需预设模板的个性化设计。
a
arXiv
·
18 天前
AI设计
幻灯片生成
强化学习
个性化算法
a
双向信息不对称下的AI监督博弈:当人类与AI各有秘密
研究者在上下文赌博机框架下提出一种双向信息不对称的AI监督博弈模型,揭示当人类与AI各自掌握私有信息时可能产生的监督失效区域,并分析动态学习如何缓解这一问题。
a
arXiv
·
18 天前
人机协作
博弈论
AI安全
强化学习
a
Transformer助力无人机空管系统安全测试,漏洞发现效率提升8倍
研究者提出基于Transformer的强化学习框架,用于发现无人机空管系统的安全隐患。在700小时仿真测试中,该方法比专家指导测试的漏洞发现效率提升8倍。
a
arXiv
·
19 天前
Transformer
强化学习
无人机交通管理
安全测试
a
三阶段基础模型:AI驱动的个性化投资组合管理,兼顾税务优化
研究人员提出一种三阶段深度强化学习系统,用于个性化投资组合管理,首次将时间序列基础模型应用于投资组合强化学习,并引入税务意识等六种投资目标,通过轻量级模块实现用户行为驱动的个性化适配。
a
arXiv
·
19 天前
强化学习
投资组合管理
时间序列模型
个性化AI
a
BV-Blend:融合历史基线,解决无评论家强化学习稳定性难题
研究者提出BV-Blend框架,通过加权融合即时奖励统计与历史集群奖励信息,显著提升了无评论家强化学习在可验证奖励任务中的训练稳定性与性能。
a
arXiv
·
20 天前
强化学习
大模型对齐
PPO
奖励设计
a
LLM智能体遭遇“记忆更新鸿沟”:长期对话中事实更迭成难题
研究发现大型语言模型智能体在多轮对话中难以更新已变更的事实,导致依赖过时信息。研究者创建训练环境Supersede,通过强化学习成功提升模型的事实更新能力。
a
arXiv
·
21 天前
LLM智能体
记忆更新
强化学习
对话系统
a
协作强化学习新范式:让AI推理更易被人类理解
研究者提出Tandem强化学习新方法,让强模型在推理时兼顾弱模型的可读性,为解决大模型推理晦涩难题提供新思路。
a
arXiv
·
21 天前
强化学习
大语言模型
人机协作
推理可解释性
a
ATOD:多轮自主智能体训练新方法,融合蒸馏与强化学习优势
研究者提出ATOD混合训练算法,通过退火调度机制结合策略蒸馏与强化学习,显著提升小模型智能体在长程交互任务中的性能表现。
a
arXiv
·
21 天前
模型训练
强化学习
知识蒸馏
自主智能体
a
图世界模型中的长程推演误差如何产生与抑制?
研究团队提出图世界模型(GWM)的统一分析框架,揭示图结构演化与局部预测误差传播的关联机制,并设计误差感知训练策略以提升长程规划稳定性。
a
arXiv
·
21 天前
图神经网络
世界模型
强化学习
多智能体系统
a
情感识别新突破:快慢思维协同推理框架MER-R1,让AI更懂情绪
研究发现,显式推理未必提升多模态情感识别准确率,快思维直接作答常优于慢思维深思熟虑。MER-R1框架通过强化学习融合二者优势,实现精准率与召回率的协同优化。
a
arXiv
·
21 天前
多模态情感识别
推理优化
强化学习
大语言模型
a
超越“下一步预测”:面向决策的智能体自主世界建模新方法
研究团队提出Agent-Authored World Modeling(AAWM)新框架,让智能体根据自身决策需求构建训练目标,而非被动预测环境反馈,实验证明该方法在多个环境中优于传统观测预测模型。
a
arXiv
·
25 天前
世界建模
LLM智能体
决策优化
强化学习
a