AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
大语言模型
40 篇相关内容
相关话题
arXiv研究
智能体
医疗AI
AI代理
Transformer
可解释AI
模型评估
信息提取
AI智能体
推理优化
知识推理
知识图谱
Hugging Face 推出 Cosmos 3 Edge:边缘设备上的高效AI推理新方案
Hugging Face 正式发布 Cosmos 3 Edge,这是一款专为边缘计算场景优化的AI推理框架,旨在在资源受限的设备上高效运行大语言模型。
H
Hugging Face
·
9 小时前
Hugging Face
边缘计算
推理框架
大语言模型
H
前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
研究发现即使是最先进的大语言模型也难以精确复制输入文本,原因在于Transformer的位置编码机制存在缺陷。研究者提出2D-RoPE方法,将文本视为二维网格,显著提升了模型的复制能力。
a
arXiv
·
20 小时前
大语言模型
Transformer
位置编码
模型能力评估
a
AI在商业案例分析中表现如何?新基准揭示前沿模型已接近专家水平
研究人员推出BusinessCaseBench基准,评估大语言模型在复杂商业案例分析中的表现。结果显示前沿AI模型已能高质量完成跨学科商业案例分析任务,且性能在两年内显著提升。
a
arXiv
·
20 小时前
大语言模型
AI基准测试
商业分析
案例教学
a
贝叶斯提示优化新框架:BayesPO通过并行调温梯度引导提升LLM性能
研究人员提出BayesPO框架,将提示优化转化为贝叶斯后验采样问题,通过梯度引导的离散MCMC方法优化大语言模型提示,在多项任务中实现性能提升。
a
arXiv
·
20 小时前
提示优化
贝叶斯方法
大语言模型
MCMC采样
a
从“看似合理”到“真正有用”:大语言模型自我解释的实用价值探讨
研究指出大语言模型生成的自我解释虽看似合理,但未必反映真实推理过程,建议评估标准应从可信度扩展到实用性,以支持实际决策。
a
arXiv
·
20 小时前
大语言模型
可解释AI
模型评估
人工智能伦理
a
DECODEM:大模型如何从公司章程中自动提取治理信息?
研究者推出DECODEM基准数据集,评估大语言模型从公司组织文件中自动提取治理条款的能力,结果显示前沿模型能以高准确率完成这项复杂任务。
a
arXiv
·
20 小时前
大语言模型
法律科技
信息提取
公司治理
a
基于MLIR的LLM编译新方法:提升大模型在AI加速器上的部署效率
研究人员提出一种基于MLIR(多级中间表示)的大语言模型编译方法,通过分层抽象和分阶段编译,有效解决模型在专用硬件上部署时的表示与调度难题。
a
arXiv
·
20 小时前
大语言模型
编译器
MLIR
硬件部署
a
大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
研究团队提出前瞻性假设发现(PHD)任务,评估大语言模型在证据不完整、结论未定时自主构建可检验假设空间的能力。新基准 HypoArena 涵盖 988 个科学分析案例,实验显示不同模型在该任务上存在明显能力分层。
a
arXiv
·
20 小时前
大语言模型
评估基准
假设发现
科学研究
a
SkillCorpus:首个开源技能生态系统整合框架,为AI智能体提供标准化能力库
研究人员推出SkillCorpus框架,通过多阶段筛选将82万项AI智能体技能整合为9.6万项标准化技能,并建立质量评估与任务匹配机制,在多项基准测试中显著提升智能体性能。
a
arXiv
·
20 小时前
大语言模型
AI智能体
技能库
开源生态
a
EpiNarrate:基于智能体框架生成流行病学场景的可靠叙述报告
研究团队提出EpiNarrate框架,通过分离结构化数值推理与自然语言生成,自动生成基于流行病学预测的公共健康报告,提升报告的事实准确性与模式覆盖范围。
a
arXiv
·
20 小时前
大语言模型
公共卫生
自动化报告
智能体框架
a
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
20 小时前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a
大语言模型化身临床预测多面手,统一处理文本与结构化数据
研究人员提出将电子病历中所有模态的患者数据统一转化为自然语言序列,仅通过微调预训练大语言模型即可实现跨模态临床预测,无需为不同任务设计专门的融合架构。
a
arXiv
·
20 小时前
大语言模型
多模态学习
临床预测
电子健康记录
a
知识驱动型AI代理:让工作流生成更智能
研究者提出知识中心框架,通过知识反转、注入与推理,显著提升ComfyUI等工作流生成系统的结构连贯性与执行成功率。
a
arXiv
·
21 小时前
工作流生成
知识推理
ComfyUI
AI代理
a
NeurOWL:大模型驱动的神经符号框架,破解不完整本体推理难题
研究者提出NeurOWL框架,结合大语言模型与本体嵌入技术,为不完整的OWL本体提供语义推理支持,实现验证与溯因的联合处理。
a
arXiv
·
21 小时前
大语言模型
知识推理
本体论
神经符号AI
a
智能体可控性研究:从固定流程到反思型AI的信息提取效能对比
研究团队通过学术论文数据集提取任务,系统比较了固定工作流与反思型智能体在信息提取中的行为差异,揭示了智能体机制如何影响系统表现与可控性。
a
arXiv
·
21 小时前
大语言模型
智能体
信息提取
反思机制
a
MGDT:多模态知识图谱补全新框架,引入MLLM引导的扩散Transformer
研究人员提出MGDT框架,通过MLLM引导的扩散Transformer与关系自适应专家混合机制,显著提升多模态知识图谱补全性能。该框架采用先对齐后扩散的范式,在三个基准数据集上表现优于现有方法。
a
arXiv
·
21 小时前
知识图谱
多模态AI
扩散模型
大语言模型
a
医疗AI新突破:Cura 1T模型实现诊疗全流程智能辅助
研究人员推出医疗专用大语言模型Cura 1T,通过人类监督的自进化训练机制,在患者咨询、临床推理、交互诊断和电子病历处理等医疗场景展现卓越性能。
a
arXiv
·
21 小时前
医疗AI
大语言模型
临床决策支持
自进化学习
a
因果审计框架:通过目标感知因果链构建实现可解释的图推理
研究者提出一种显式可审计的因果推理框架,通过目标感知因果图构建策略,提升大模型在干预性问答中的推理透明度和鲁棒性。
a
arXiv
·
21 小时前
因果推理
大语言模型
可解释AI
图神经网络
a
GraphDx:知识增强多智能体框架,实现成本可控的序列诊断
研究者提出GraphDx框架,通过构建医学诊断知识图谱与多智能体协作,在提升诊断准确率的同时显著降低检测成本,为自动化临床诊断提供经济可靠的解决方案。
a
arXiv
·
21 小时前
医疗AI
大语言模型
多智能体
知识图谱
a
智谱GLM-5-Turbo模型全面开放,面向所有编程计划用户
智谱AI宣布其GLM-5-Turbo模型现已面向所有GLM Coding Plan用户开放使用,为开发者提供更强大的代码生成与编程辅助能力。
智
智谱 GLM
·
1 天前
快讯
智谱GLM
大语言模型
代码生成
开发者工具
智
Kimi K3用户热情超预期,算力告急暂停新订阅
月之暗面Kimi K3模型发布后需求激增,算力接近极限,官方宣布暂停新订阅并优先保障现有用户。
月
月之暗面 Kimi
·
1 天前
快讯
月之暗面
Kimi
大语言模型
算力
月
黎曼动力发布Rienmann-1.0模型,AI初创公司需警惕模型安全风险
AI初创公司黎曼动力正式发布Rienmann-1.0模型,此前有报道称GPT-5.6存在自动删除文件的安全隐患,引发行业对AI模型安全性的关注。
黎
黎曼动力
·
1 天前
大语言模型
AI安全
黎曼动力
模型发布
黎
Grok 4.3正式上线API,号称迄今最快最智能模型
马斯克旗下xAI公司宣布Grok 4.3模型已在API平台上线,该模型在多项基准测试中表现优异,并支持100万token上下文窗口。
x
xAI
·
2 天前
快讯
大语言模型
xAI
API发布
模型评测
x
多头部潜在控制:为LLM智能体决策提供统一接口
研究人员提出多头部潜在控制方法,通过读取冻结大模型的隐藏状态轨迹来生成部署时的控制信号,显著提升多模型系统的质量-成本平衡,在路由执行中可将大模型使用率降低最高90.7%。
a
arXiv
·
3 天前
大语言模型
智能体决策
模型路由
潜在控制
a
概念链:用自然文本隐式操控大模型推理路径
研究发现大语言模型的推理存在脆弱性,可通过生成看似普通的“概念链”段落进行隐式操控,在不直接提及答案的情况下系统性地改变模型预测偏好。
a
arXiv
·
3 天前
大语言模型
推理脆弱性
对抗攻击
模型安全
a
多智能体大模型协作中的语义信息压缩现象
研究发现多智能体大模型系统在处理复杂任务时,中间环节会显著压缩语义信息,影响下游决策准确性。
a
arXiv
·
3 天前
大语言模型
多智能体系统
语义压缩
AI协作
a
大模型研究创意生成新策略:预算化子集精炼提升执行可行性
研究提出预算化子集精炼方法,通过选择性优化部分候选创意而非均匀分配计算资源,显著提升大模型生成研究创意的多样性和执行可行性,在10种研究创意生成环境中验证了其有效性。
a
arXiv
·
3 天前
大语言模型
研究创意生成
计算资源分配
多样性优化
a
提示工程“简单”反而更强?研究揭示LLM评估中的“简洁性悖论”
一项大规模实证研究发现,在多项选择题问答任务中,简单的基线提示法往往优于复杂的推理提示技术,挑战了“越复杂越好”的普遍假设。
a
arXiv
·
3 天前
大语言模型
提示工程
模型评估
多项选择题问答
a
新指标登场:如何科学衡量大模型工具调用效率?
研究人员提出“工具效率”与“边际工具效用”两项新指标,为评估大语言模型工具调用性能提供量化标准,助力构建更精简高效的工具套件。
a
arXiv
·
3 天前
大语言模型
工具调用
评估指标
智能体
a
Polestar:解决扩散大模型推理效率瓶颈,无需训练实现性能突破
研究者提出Polestar框架,通过监测表征漂移现象,同时优化KV缓存与解码并行化,在数学与代码任务上实现最高3.7倍吞吐量提升。
a
arXiv
·
3 天前
扩散模型
推理优化
KV缓存
并行解码
a
自动进化提示词指南:让AI更懂你的真实意图
研究人员提出AGOPS方法,能自动生成任务特定的提示词优化指南,帮助用户写出更明确的指令,显著提升大语言模型在数学推理、医疗问答等任务中的表现。
a
arXiv
·
3 天前
大语言模型
提示词工程
AGOPS
任务优化
a
大模型隐式通信:文本传输的局限与潜在通道探索
研究揭示大语言模型在文本通信中存在信息损失,通过稀疏自编码器分析发现文本序列化会破坏88%的特征表达,而潜在通道在跨语言概念任务中表现相当但未超越文本通道。
a
arXiv
·
3 天前
大语言模型
多智能体系统
潜在通信
特征分析
a
自动驾驶测试新突破:Chat2Scenic迭代式RAG框架高效生成合规场景脚本
慕尼黑工业大学团队提出首个基于迭代检索增强生成的自动驾驶场景生成框架Chat2Scenic,通过聊天机器人界面支持交互式场景优化,在编译成功率上显著超越现有方法。
a
arXiv
·
3 天前
自动驾驶
场景生成
检索增强生成
仿真测试
a
CIPHER:数据科学AI代理新框架,解耦探索与选择提升任务表现
研究人员提出CIPHER框架,通过生成多个初始状态并并行执行,显著提升数据科学AI代理在复杂任务中的表现,在基准测试中超越现有方法。
a
arXiv
·
3 天前
AI代理
数据科学
大语言模型
自动化
a
新研究揭示大模型行为与训练数据的关联:追踪下一个词的分布
研究者通过分析大语言模型输出分布与训练数据中经验下一个词分布的一致性,发现模型规模越大、训练计算量越多,其输出与训练数据的统计模式越接近,但仍存在显著差异的输入序列。
a
arXiv
·
3 天前
大语言模型
训练数据
可解释性
经验分布
a
AI智能体不会单独失败:上下文环境先出问题
研究发现AI智能体的失败往往源于上下文环境质量不足,而非模型本身。研究者开发了可测量上下文工程质量的评估框架,为提升智能体可靠性提供新方法。
a
arXiv
·
3 天前
AI智能体
上下文工程
可靠性评估
大语言模型
a
AI问答引擎如何影响全球冲突信息环境:幻觉与信息战的新挑战
最新研究揭示,AI大模型在回答冲突相关问题时,信息记录越匮乏,幻觉与错误率越高,且易受生成引擎优化技术操纵,对全球冲突信息环境构成新威胁。
a
arXiv
·
3 天前
大语言模型
信息战
AI幻觉
生成引擎优化
a
LLM生成代码世界模型:验证准确不等于游戏制胜
研究发现,大语言模型生成的代码世界模型即使通过采样验证达到高准确率,仍可能在游戏中系统性失败,因为模型遗漏的关键规则虽罕见但至关重要。
a
arXiv
·
3 天前
大语言模型
代码世界模型
游戏AI
规划系统
a
ToolAnchor:用反事实锚点打破AI工具使用惯性,提升智能体适应新工具能力
研究团队发现大语言模型智能体在工具集扩展时存在‘行为惯性’问题,并提出ToolAnchor框架,通过注入反事实锚点上下文来激活被抑制的能力,显著提升智能体对新工具的适应效率。
a
arXiv
·
3 天前
大语言模型
智能体
工具使用
强化学习
a
AI代理构建贝叶斯网络:用虚拟调查法支持运营决策
研究者提出利用大语言模型构建贝叶斯网络的新方法,通过AI代理模拟专家意见,结合修剪均值规则降低噪声,为不确定性决策提供支持。
a
arXiv
·
3 天前
贝叶斯网络
大语言模型
决策支持
概率建模
a