AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI代理
15 篇相关内容
相关话题
大语言模型
arXiv
数据科学
强化学习
基准测试
世界模型
工作流生成
知识推理
ComfyUI
自动化
学术研究
贝叶斯网络
DSWorld:数据科学世界模型,让AI代理告别盲目试错
研究者提出数据科学世界模型DSWorld,可预测数据科学操作的效果,加速AI代理训练与推理,减少昂贵计算依赖。
a
arXiv
·
1 天前
数据科学
AI代理
世界模型
强化学习
a
知识驱动型AI代理:让工作流生成更智能
研究者提出知识中心框架,通过知识反转、注入与推理,显著提升ComfyUI等工作流生成系统的结构连贯性与执行成功率。
a
arXiv
·
1 天前
工作流生成
知识推理
ComfyUI
AI代理
a
CIPHER:数据科学AI代理新框架,解耦探索与选择提升任务表现
研究人员提出CIPHER框架,通过生成多个初始状态并并行执行,显著提升数据科学AI代理在复杂任务中的表现,在基准测试中超越现有方法。
a
arXiv
·
4 天前
AI代理
数据科学
大语言模型
自动化
a
AI代理构建贝叶斯网络:用虚拟调查法支持运营决策
研究者提出利用大语言模型构建贝叶斯网络的新方法,通过AI代理模拟专家意见,结合修剪均值规则降低噪声,为不确定性决策提供支持。
a
arXiv
·
4 天前
贝叶斯网络
大语言模型
决策支持
概率建模
a
甲骨文发布企业级AI代理记忆系统,长程任务效率提升10倍
甲骨文研究团队提出基于Oracle数据库的智能代理记忆系统,通过分层架构实现跨会话状态保持,在长程任务中达到93.8%准确率的同时减少90%以上token消耗。
a
arXiv
·
5 天前
AI代理
企业级AI
记忆系统
甲骨文
a
AI代理前瞻记忆大挑战:PM-Bench基准揭示LLM执行延迟意图的困境
研究者推出PM-Bench基准测试,专门评估大语言模型代理的前瞻记忆能力。测试显示当前最先进的GPT-5.4代理仅获得65.1%的F1分数,凸显AI代理在延迟意图执行方面的重大挑战。
a
arXiv
·
6 天前
大语言模型
AI代理
基准测试
认知科学
a
AI代理“工具进化”真的有效吗?新研究质疑现有评估方法
最新研究重新审视了大语言模型代理自动工具进化的评估方法,发现现有评估协议存在根本性缺陷,可能导致结果夸大。
a
arXiv
·
6 天前
大语言模型
AI代理
评估方法
工具进化
a
搜索API如何影响AI代理决策:相同准确率下的证据差异
研究发现不同搜索API虽然能为AI代理提供相近的答案准确率,但在证据呈现方式上存在显著差异,直接影响代理的检索策略和资源消耗。
a
arXiv
·
7 天前
AI代理
搜索API
信息检索
大模型
a
大模型代理安全新突破:基于溯源分析防止指令偏离
研究者提出ProvenanceGuard框架,通过多阶段溯源分析检测大模型代理工具调用是否偏离用户意图,在两大基准测试中显著降低误判率。
a
arXiv
·
18 天前
大模型安全
AI代理
溯源分析
对齐研究
a
Janus:用户参与式AI代理权限管理实验平台发布
研究人员推出Janus实验平台,专门用于探索用户参与式AI代理权限管理设计,研究表明用户参与能显著提升隐私安全,但需平衡认知负担与权限疲劳问题。
a
arXiv
·
18 天前
AI代理
权限管理
人机协作
隐私安全
a
企业级NL2SQL新突破:语义层中介代理实现跨数据库自然语言查询
研究人员提出一种基于语义层中介的NL2SQL代理系统,通过中间表示层解耦语义意图与物理SQL执行,在异构企业数据库上实现94.15%的执行准确率。
a
arXiv
·
20 天前
NL2SQL
语义层
企业数据库
自然语言处理
a
AgentBound:为自主AI代理提供可验证的行为治理框架
研究人员提出AgentBound框架,通过三重权威评估机制和加密可验证的治理凭证,为自主AI代理提供运行时行为监督,将治理从依赖信任转变为可独立验证的过程。
a
arXiv
·
20 天前
AI代理
行为治理
可验证性
安全框架
a
Moumantai:开源自托管AI代理应用平台,跨设备运行
Moumantai是一个开源的自托管AI代理应用平台,允许用户在任何设备上部署和运行基于代理的应用程序。
M
Moumantai
·
23 天前
AI代理
自托管
开源平台
跨设备
M
LemonHarness:为长期任务AI代理打造可控执行边界框架
研究者提出LemonHarness框架,通过建立明确的工作空间边界、结构化工具接口和时间感知执行机制,显著提升大语言模型代理在长期复杂任务中的稳定性和准确性。
a
arXiv
·
27 天前
AI代理
大语言模型
任务执行框架
工作空间管理
a
AI 代理调试新工具:基于RLM的本地轨迹调试器问世
开发者社区出现一款基于强化学习模型的本地调试工具,专门用于可视化分析AI代理的执行轨迹,帮助开发者更直观地诊断代理行为。
独
独立开发者
·
27 天前
快讯
调试工具
AI代理
强化学习
开源工具
独