AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
智能体
40 篇相关内容
相关话题
大语言模型
大模型
开源模型
AI安全
AI基础设施
人机交互
WAIC
Hugging Face
基准测试
DeepSeek
强化学习
工具调用
RAIL Guard:为LLM智能体构建闭环式AI安全护栏
斯坦福团队提出RAIL Guard闭环式负责任AI管道,通过评估-重写-再评估循环自动修复LLM不安全输出,相比传统拦截重试机制将修复成功率从49.1%提升至96.9%。
a
arXiv
·
5 小时前
AI安全
大语言模型
智能体
负责任AI
a
掩码扩散语言模型:基于文本的世界模型在智能体强化学习中的突破
研究提出掩码扩散语言模型作为文本世界模型,通过双向去噪机制克服自回归模型的局限,在智能体强化学习中实现更优的环境模拟与任务执行能力。
a
arXiv
·
5 小时前
强化学习
世界模型
扩散模型
智能体
a
AI基建新趋势:多家模型厂商布局Agentic Infra技术
多家AI模型厂商开始采用统一的Agentic Infra架构,这被视为构建通用人工智能的重要技术基础。
量
量子位
·
22 小时前
大模型
AI基础设施
智能体
技术趋势
量
开源通信平台Hail.so v0.15发布:为AI智能体与人类提供一体化电话、短信和邮件服务
开源通信平台Hail.so发布0.15版本,为AI智能体和人类用户提供统一的电话、短信和电子邮件通信解决方案。
H
Hail.so
·
23 小时前
开源平台
AI通信
智能体
人机交互
H
智能体可控性研究:从固定流程到反思型AI的信息提取效能对比
研究团队通过学术论文数据集提取任务,系统比较了固定工作流与反思型智能体在信息提取中的行为差异,揭示了智能体机制如何影响系统表现与可控性。
a
arXiv
·
1 天前
大语言模型
智能体
信息提取
反思机制
a
医疗AI新突破:Cura 1T模型实现诊疗全流程智能辅助
研究人员推出医疗专用大语言模型Cura 1T,通过人类监督的自进化训练机制,在患者咨询、临床推理、交互诊断和电子病历处理等医疗场景展现卓越性能。
a
arXiv
·
1 天前
医疗AI
大语言模型
临床决策支持
自进化学习
a
普渡机器人WAIC发布“一脑多形”战略,PuduFM+PuduAgent双轮驱动
在WAIC大会上,普渡机器人正式发布顶层战略“一脑多形”,通过PuduFM大模型与PuduAgent智能体平台在不同机器人本体上持续落地,构建统一大脑、多样形态的机器人生态体系。
普
普渡机器人
·
2 天前
服务机器人
大模型
智能体
WAIC
普
新指标登场:如何科学衡量大模型工具调用效率?
研究人员提出“工具效率”与“边际工具效用”两项新指标,为评估大语言模型工具调用性能提供量化标准,助力构建更精简高效的工具套件。
a
arXiv
·
4 天前
大语言模型
工具调用
评估指标
智能体
a
ToolAnchor:用反事实锚点打破AI工具使用惯性,提升智能体适应新工具能力
研究团队发现大语言模型智能体在工具集扩展时存在‘行为惯性’问题,并提出ToolAnchor框架,通过注入反事实锚点上下文来激活被抑制的能力,显著提升智能体对新工具的适应效率。
a
arXiv
·
4 天前
大语言模型
智能体
工具使用
强化学习
a
百度“搭子”获WAIC 2026“镇馆之宝”称号,智能体全家桶即将集中展示
百度推出的AI智能体“搭子”在世界人工智能大会2026评选中荣获“镇馆之宝”奖项,其智能体产品矩阵也将于近期集中亮相。
百
百度
·
4 天前
智能体
百度
WAIC
AI应用
百
大语言模型工具切换能力测试:当可靠工具暗中改变时
研究团队借用心理学“集合转换”概念,测试LLM智能体在会话中可靠工具暗中改变时的适应能力。发现智能体倾向于固守少数工具,且工具集的呈现方式会显著影响其决策动态。
a
arXiv
·
5 天前
大语言模型
智能体
工具使用
认知心理学
a
Hugging Face 分享构建 Shippy 智能体的实战经验
Hugging Face 团队通过开发 Shippy 智能体项目,总结了构建实用 AI 代理的关键经验与挑战。
H
Hugging Face
·
5 天前
智能体
Hugging Face
AI工程
自动化
H
STEPX Neo手机获2026 WAIC“镇馆之宝”称号,大模型原生智能体开启AI交互新范式
STEPX Neo手机在2026世界人工智能大会上被评为“镇馆之宝”,其大模型原生智能体设计重新定义了人机交互方式。
量
量子位
·
6 天前
大模型
智能体
人机交互
WAIC
量
LakeQuest基准:三大领域数据湖问答系统面临真实挑战
研究人员推出LakeQuest基准测试,包含近万个人工验证的问答对,覆盖AI/ML、零售银行和生物医学三大领域,揭示现代问答系统在真实数据湖环境中的关键缺陷。
a
arXiv
·
6 天前
数据湖
问答系统
基准测试
RAG
a
智能体自我进化:Critic Experience Bank 提升大模型行动置信度评估
研究者提出 Critic Experience Bank 框架,让大语言模型智能体能够基于历史执行反馈自我进化,显著提升单步行动置信度评估的准确性和校准度。
a
arXiv
·
6 天前
大语言模型
智能体
置信度校准
自我进化
a
阶跃星辰发布智能体操作系统,印奇称未来操作系统将跨端运行
阶跃星辰董事长印奇表示,未来的操作系统将实现跨端运行,并宣布公司正式入局智能体操作系统领域。
阶
阶跃星辰
·
6 天前
操作系统
智能体
阶跃星辰
人工智能
阶
智能体时代:企业如何高效管理AI投资
OpenAI分享智能体时代企业AI投资管理策略,强调以每美元有效产出为核心,提升效率并扩展高价值工作流。
O
OpenAI
·
6 天前
AI投资
智能体
企业应用
效率优化
O
分布式智能体系统新范式:信念复制取代比特复制
研究团队提出认知状态复制(ESR)新框架,针对自主智能体分布式系统中传统状态机复制的局限性,主张通过语义一致性而非比特级一致性实现系统可靠性。
a
arXiv
·
7 天前
分布式系统
智能体
状态复制
语义一致性
a
中国团队推出Agent专用搜索工具,登顶Product Hunt榜单
一款针对AI智能体优化的专用搜索工具近日在Product Hunt平台登顶,由中国团队开发,旨在提升搜索准确性并降低Token消耗。
量
量子位
·
7 天前
AI工具
智能体
搜索优化
中国团队
量
浪潮信息发布液冷整机柜与超节点,单柜可承载4万智能体
浪潮信息同时推出CPU原生液冷整机柜和多模融合超节点,单柜可支持4万智能体运行,并探索大模型协同推理能力。
浪
浪潮信息
·
7 天前
AI基础设施
液冷技术
智能体
大模型协同
浪
数学解题新突破:ProofCouncil大模型智能体攻克开放性问题
研究人员推出ProofCouncil大模型智能体,采用作者-评审架构解决开放数学问题,在FirstProof挑战赛中表现最佳,成功解决6/10问题。
a
arXiv
·
8 天前
大语言模型
数学推理
智能体
开源工具
a
智能体记忆的双时态溯源:我们何时相信什么,为何相信
研究者提出智能体记忆的双时态溯源框架,能够同时追踪信念的时间演变和认知过程的时间戳,为AI系统的决策透明性提供新思路。
a
arXiv
·
9 天前
智能体
记忆系统
可解释AI
认知建模
a
PHREEQC-MCQ-200:科学模拟器智能体工具增强能力诊断基准发布
研究人员推出PHREEQC-MCQ-200基准测试,专门评估大语言模型智能体在水文地球化学模拟中的工具使用能力,揭示工具接入并非总能提升性能的科学诊断价值。
a
arXiv
·
19 天前
大语言模型
科学计算
基准测试
工具增强
a
智能体应助用户构建偏好,而非仅被动询问
研究指出,传统智能体常预设用户是专家,已有明确偏好,但现实中用户常因缺乏领域知识而无法准确表达需求。研究提出新框架CoPref,强调智能体应通过对话帮助用户构建偏好,而非仅通过提问来获取偏好。
a
arXiv
·
20 天前
人机交互
智能体
推荐系统
用户偏好
a
Anthropic发布Claude Sonnet 5:迄今最具自主能力的智能体模型
Anthropic推出Claude Sonnet 5模型,在编程和日常专业工作中展现顶级智能水平,标志着其智能体能力的重要突破。
A
Anthropic
·
20 天前
快讯
Claude
Anthropic
大语言模型
智能体
A
智能体安全新视角:行动对齐,而非单纯拒绝
研究表明,将聊天机器人时代‘拒绝不安全输入’的安全策略直接套用于AI智能体场景存在根本性错误,智能体安全的核心应是‘行动对齐’与‘最小权限’的外部执行。
a
arXiv
·
21 天前
AI安全
大语言模型
智能体
对齐研究
a
AI智能体也需“免疫系统”:研究者提出原生防御新架构
针对AI智能体在运行中易受记忆投毒、工具链操控等攻击的威胁,研究者提出首个仿生内源性防御架构——智能体原生免疫系统(ANIS),将防御机制嵌入智能体认知循环。
a
arXiv
·
22 天前
AI安全
智能体
防御架构
免疫系统
a
智谱发布GLM-5.2大模型:开源权重、百万上下文,专攻编程与智能体任务
智谱AI正式推出GLM-5.2系列大模型,在编程与智能体任务上实现显著提升,并开放MIT许可的模型权重。该系列提供两种推理级别,其中GLM-5.2(max)追求性能极限,GLM-5.2(high)则在性能与token效率间取得平衡。
智
智谱 GLM
·
26 天前
智谱GLM
大模型
开源模型
编程增强
智
检索指标会误导?长程工具使用智能体中政策信号的真实测量
研究发现,在长程工具使用智能体评估中,传统精确匹配检索召回率可能低估下游政策效用,实际分类性能差距远小于指标暗示。
a
arXiv
·
27 天前
检索系统
评估指标
智能体
Qwen
a
DeepSeek-V3.1发布:迈向智能体时代的第一步,引入混合推理模式
深度求索发布DeepSeek-V3.1模型,首次引入Think与Non-Think混合推理模式,标志着向智能体时代迈出重要一步。新模型在推理速度和智能体任务能力上均有显著提升。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大语言模型
智能体
推理优化
D
DeepSeek-V3.1-Terminus发布:语言一致性增强,智能体性能升级
DeepSeek推出V3.1-Terminus版本更新,重点优化了语言一致性和智能体性能,解决了中英文混合及乱码问题。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大模型
版本更新
语言模型
D
DeepSeek发布V3.2系列推理优先模型,专为智能体设计
DeepSeek正式推出V3.2和V3.2-Speciale两款推理优先模型,专为智能体应用构建,其中V3.2已在多平台上线。
D
DeepSeek 深度求索
·
27 天前
快讯
DeepSeek
大语言模型
智能体
推理模型
D
洛斯阿拉莫斯实验室采用NVIDIA Vera CPU,开启科学AI智能体新纪元
洛斯阿拉莫斯国家实验室将部署搭载NVIDIA Vera CPU的新型超级计算机,通过智能体AI加速科学发现进程。
N
NVIDIA AI
·
27 天前
NVIDIA
超级计算
科学AI
智能体
N
Together AI 首发上线 NVIDIA Nemotron 3 Nano Omni:全能多模态推理模型
Together AI 在发布首日即上线 NVIDIA Nemotron 3 Nano Omni 模型,这是一个面向大规模智能体工作负载设计的统一开源模型,可跨视频、图像、音频和文本进行推理。
T
Together AI
·
27 天前
多模态模型
NVIDIA
Together AI
开源模型
T
企业AI规模化落地关键:从大模型转向智能体逻辑
Hugging Face指出,企业AI应用需超越单纯的大模型部署,转向可扩展的智能体逻辑架构,才能真正实现规模化落地。
H
Hugging Face
·
27 天前
智能体
企业AI
Hugging Face
AI工程化
H
开源模型工具调用能力大考:你的Agent够“智能体”吗?
Hugging Face发布新基准测试,帮助开发者评估开源模型在自定义工具调用与智能体任务中的实际表现。
H
Hugging Face
·
27 天前
开源模型
智能体
基准测试
工具调用
H
DeepMind推出ReasoningBank:让AI智能体从经验中学习推理
Google DeepMind发布新研究项目ReasoningBank,旨在让AI智能体通过积累和复用经验来提升复杂推理能力。
G
Google DeepMind
·
27 天前
AI推理
经验学习
Google DeepMind
智能体
G
通义千问发布Qwen3-Coder:专为智能体编程设计的新一代代码模型
通义千问团队正式推出Qwen3-Coder系列代码模型,其中旗舰版本Qwen3-Coder-480B-A35B-Instruct在智能体编程、浏览器操作及工具使用等任务上达到开源模型新高度。
通
通义千问 Qwen
·
28 天前
通义千问
代码模型
AI编程
智能体
通
谷歌I/O 2026前瞻:智能体化Gemini时代即将开启
谷歌在I/O大会上预告了Gemini向智能体化方向的发展,旨在通过AI助手帮助用户更高效地完成任务。
G
Google DeepMind
·
28 天前
Gemini
谷歌
智能体
AI助手
G
Gemini 3.5 发布:专为执行复杂智能工作流而生
Google DeepMind 正式推出 Gemini 3.5,该模型核心定位为帮助用户执行复杂的、具备自主行动能力的智能工作流。
G
Google DeepMind
·
28 天前
快讯
Gemini
Google DeepMind
智能体
大模型
G