AI360
资讯
首页
专栏
快讯
应用中心
API 平台
a
arXiv
媒体
该来源的全部资讯
595 篇内容 · 最近更新 20 小时前
AI评分系统防作弊新突破:自动检测并抑制语言评估中的“捷径依赖”
研究人员提出一种新型训练准则,可有效降低AI语言评分系统对特定输入特征的过度依赖,防止考生通过利用系统漏洞而非提升真实语言能力来获取高分。
a
arXiv
·
20 小时前
语言评估
AI公平性
机器学习
Transformer
a
前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
研究发现即使是最先进的大语言模型也难以精确复制输入文本,原因在于Transformer的位置编码机制存在缺陷。研究者提出2D-RoPE方法,将文本视为二维网格,显著提升了模型的复制能力。
a
arXiv
·
20 小时前
大语言模型
Transformer
位置编码
模型能力评估
a
AI在商业案例分析中表现如何?新基准揭示前沿模型已接近专家水平
研究人员推出BusinessCaseBench基准,评估大语言模型在复杂商业案例分析中的表现。结果显示前沿AI模型已能高质量完成跨学科商业案例分析任务,且性能在两年内显著提升。
a
arXiv
·
20 小时前
大语言模型
AI基准测试
商业分析
案例教学
a
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
研究者提出Loopie系列模型,通过创新的循环Transformer架构与专家混合设计,在同等计算预算下显著超越传统Transformer基线,并在国际数学与物理奥赛中展现金牌级推理能力。
a
arXiv
·
20 小时前
Transformer
MoE
模型架构
推理能力
a
对话状态追踪新突破:BERT助力零样本跨领域适应
研究人员提出基于BERT的对话状态追踪框架,实现零样本跨领域泛化,显著提升多任务对话系统扩展性。
a
arXiv
·
20 小时前
对话状态追踪
BERT
零样本学习
多领域对话
a
贝叶斯提示优化新框架:BayesPO通过并行调温梯度引导提升LLM性能
研究人员提出BayesPO框架,将提示优化转化为贝叶斯后验采样问题,通过梯度引导的离散MCMC方法优化大语言模型提示,在多项任务中实现性能提升。
a
arXiv
·
20 小时前
提示优化
贝叶斯方法
大语言模型
MCMC采样
a
从“看似合理”到“真正有用”:大语言模型自我解释的实用价值探讨
研究指出大语言模型生成的自我解释虽看似合理,但未必反映真实推理过程,建议评估标准应从可信度扩展到实用性,以支持实际决策。
a
arXiv
·
20 小时前
大语言模型
可解释AI
模型评估
人工智能伦理
a
双向诱导机制揭秘:掩码扩散语言模型如何实现上下文学习
最新研究揭示了扩散语言模型通过双向注意力机制实现上下文学习,其内部电路能同时利用前后文信息进行文本生成,与自回归模型形成鲜明对比。
a
arXiv
·
20 小时前
扩散语言模型
上下文学习
注意力机制
模型可解释性
a
DECODEM:大模型如何从公司章程中自动提取治理信息?
研究者推出DECODEM基准数据集,评估大语言模型从公司组织文件中自动提取治理条款的能力,结果显示前沿模型能以高准确率完成这项复杂任务。
a
arXiv
·
20 小时前
大语言模型
法律科技
信息提取
公司治理
a
语义结构能解释多少人工标注差异?NLI任务中的群体效应与个体上限
研究通过ChaosNLI数据集分析形式语义结构对自然语言推理标注差异的解释力,发现其对标注分歧的影响有限,无法有效识别高争议样本。
a
arXiv
·
20 小时前
自然语言推理
标注差异
语义分析
ChaosNLI
a
基于MLIR的LLM编译新方法:提升大模型在AI加速器上的部署效率
研究人员提出一种基于MLIR(多级中间表示)的大语言模型编译方法,通过分层抽象和分阶段编译,有效解决模型在专用硬件上部署时的表示与调度难题。
a
arXiv
·
20 小时前
大语言模型
编译器
MLIR
硬件部署
a
多语言与语码混合场景下,毒性信号可靠性需“看情况”
研究发现,现有毒性检测工具在多语言、语码混合、音译及俚语场景下可靠性存疑。研究者提出ToxGate方法,将外部信号作为条件证据处理,显著提升了高风险内容的识别效果。
a
arXiv
·
20 小时前
内容审核
多语言NLP
毒性检测
语码混合
a
语义关联度能更好预测自然语言理解时的脑活动
研究发现,在自然语言理解过程中,词语与上下文的语义关联度比词语本身的意外性更能可靠地预测大脑fMRI BOLD信号的变化。
a
arXiv
·
20 小时前
自然语言理解
fMRI
语义关联
计算模型
a
阿拉伯语隐喻理解新突破:CAMMAR框架实现文化感知的多层语义表示
研究者提出CAMMAR框架,通过嵌套式嵌入空间分离阿拉伯语中的词汇、文化和隐喻信息,有效解决了传统语言模型中的“语义模糊”问题,并在隐喻检测任务中取得显著效果。
a
arXiv
·
20 小时前
阿拉伯语NLP
隐喻理解
文化感知AI
语义表示
a
GPT辅助摘要提升长文自动评分效率,教育评估迎来新方案
研究团队提出生成式AI辅助摘要框架,通过GPT模型压缩长文内容,在保持评分可靠性的同时解决传统自动作文评分系统的输入长度限制问题。
a
arXiv
·
20 小时前
GPT-5
自动作文评分
教育科技
文本摘要
a
大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
研究团队提出前瞻性假设发现(PHD)任务,评估大语言模型在证据不完整、结论未定时自主构建可检验假设空间的能力。新基准 HypoArena 涵盖 988 个科学分析案例,实验显示不同模型在该任务上存在明显能力分层。
a
arXiv
·
20 小时前
大语言模型
评估基准
假设发现
科学研究
a
推理模型瘦身新法:BIRD让大模型学会“少说多思”
研究者提出BIRD自推理蒸馏方法,通过两阶段训练让大模型在保持准确率的同时大幅压缩推理步骤,在数学基准测试中实现效率与精度的双提升。
a
arXiv
·
20 小时前
模型压缩
推理优化
自蒸馏
Qwen
a
扩散语言模型解码新突破:自适应多步前瞻框架AdaLook
研究人员提出自适应多步前瞻解码框架AdaLook,通过动态调整前瞻深度和分支扩展,显著提升扩散语言模型的解码效率与质量平衡。
a
arXiv
·
20 小时前
扩散语言模型
文本生成
解码优化
自适应算法
a
多轮对话研究新视角:将“对话对象识别”从离散标签转向连续层级
一项研究挑战了传统多轮对话中“对话对象识别”的离散分类范式,提出将其视为连续现象,并通过实验证明连续层级模型能更准确地预测发言权转移及听众行为。
a
arXiv
·
20 小时前
对话系统
多轮对话
自然语言处理
人机交互
a
SkillCorpus:首个开源技能生态系统整合框架,为AI智能体提供标准化能力库
研究人员推出SkillCorpus框架,通过多阶段筛选将82万项AI智能体技能整合为9.6万项标准化技能,并建立质量评估与任务匹配机制,在多项基准测试中显著提升智能体性能。
a
arXiv
·
20 小时前
大语言模型
AI智能体
技能库
开源生态
a
EpiNarrate:基于智能体框架生成流行病学场景的可靠叙述报告
研究团队提出EpiNarrate框架,通过分离结构化数值推理与自然语言生成,自动生成基于流行病学预测的公共健康报告,提升报告的事实准确性与模式覆盖范围。
a
arXiv
·
20 小时前
大语言模型
公共卫生
自动化报告
智能体框架
a
VarRate:无需训练即可实现KV缓存变速率压缩,提升长上下文LLM推理效率
研究人员提出VarRate,一种无需训练的KV缓存压缩方法,通过为每个token分配可变低秩预算,在保持所有token信息的同时显著减少内存占用。
a
arXiv
·
20 小时前
大语言模型
KV缓存压缩
长上下文处理
推理优化
a
语言模型中的“可表达层”:揭示AI的隐性思考空间
研究人员发现大型语言模型内部存在类似人类意识的“全局工作空间”,通过新型解释技术可解码模型未说出口的思考过程,为AI对齐研究提供新视角。
a
arXiv
·
20 小时前
语言模型
可解释AI
意识模拟
对齐研究
a
大语言模型化身临床预测多面手,统一处理文本与结构化数据
研究人员提出将电子病历中所有模态的患者数据统一转化为自然语言序列,仅通过微调预训练大语言模型即可实现跨模态临床预测,无需为不同任务设计专门的融合架构。
a
arXiv
·
20 小时前
大语言模型
多模态学习
临床预测
电子健康记录
a
AI安全标准亟待统一:前沿公司能力阈值差异显著
研究发现前沿AI公司发布的能力安全阈值存在显著差异,导致第三方难以验证和比较。研究人员提出跨三大风险领域的统一阈值制定方法,以防范安全标准“逐底竞争”。
a
arXiv
·
21 小时前
AI安全
能力阈值
风险治理
行业标准
a
SciForge:面向科学发现的多模态AI工作台,让科研流程可审计、可协作
研究人员推出SciForge,这是一款专为科学研究设计的AI原生多模态工作台,旨在将论文、代码、数据、图表等异构科研对象整合为可审计、可追溯的研究状态,并通过模块化服务支持搜索、解析、工作流执行、绘图与写作等任务。
a
arXiv
·
21 小时前
科研AI
多模态系统
工作流引擎
可审计研究
a
破解AI信任困局:独立认证能否成为可信AI的“验金石”?
研究指出当前AI市场存在“信任鸿沟”,企业投入的负责任AI实践难以转化为外部可信信号。学者提出应建立以结果为导向的独立认证体系,将可信度转化为可衡量、可比较的市场竞争力。
a
arXiv
·
21 小时前
AI治理
可信AI
认证体系
负责任AI
a
ODRL策略评估器获形式化实现,提升AI治理与数据空间互操作性
研究人员基于ODRL语义模型,首次开发出具有透明形式语义的ODRL策略评估器,支持所有规则类型,解决了当前标准缺乏数学形式语义导致的互操作性问题。
a
arXiv
·
21 小时前
ODRL
AI治理
数据空间
策略评估
a
DSWorld:数据科学世界模型,让AI代理告别盲目试错
研究者提出数据科学世界模型DSWorld,可预测数据科学操作的效果,加速AI代理训练与推理,减少昂贵计算依赖。
a
arXiv
·
21 小时前
数据科学
AI代理
世界模型
强化学习
a
知识驱动型AI代理:让工作流生成更智能
研究者提出知识中心框架,通过知识反转、注入与推理,显著提升ComfyUI等工作流生成系统的结构连贯性与执行成功率。
a
arXiv
·
21 小时前
工作流生成
知识推理
ComfyUI
AI代理
a
AgentFAIR:多智能体协作框架,评估地理空间数据的FAIR合规性
研究者提出AgentFAIR框架,利用13个LLM评估器对地理空间数据的可发现、可访问、可互操作和可重用性进行自动化评估,显著提升了评估一致性。
a
arXiv
·
21 小时前
多智能体系统
FAIR原则
地理空间数据
LLM评估
a
NeurOWL:大模型驱动的神经符号框架,破解不完整本体推理难题
研究者提出NeurOWL框架,结合大语言模型与本体嵌入技术,为不完整的OWL本体提供语义推理支持,实现验证与溯因的联合处理。
a
arXiv
·
21 小时前
大语言模型
知识推理
本体论
神经符号AI
a
智能体可控性研究:从固定流程到反思型AI的信息提取效能对比
研究团队通过学术论文数据集提取任务,系统比较了固定工作流与反思型智能体在信息提取中的行为差异,揭示了智能体机制如何影响系统表现与可控性。
a
arXiv
·
21 小时前
大语言模型
智能体
信息提取
反思机制
a
S1-Omni:首个统一多模态科学推理模型问世,多项任务超越GPT-5.5
研究人员推出S1-Omni模型,首次将科学理解、预测与生成能力整合于统一框架,在60多个科学基准测试中表现优异,多数任务超越GPT-5.5和Gemini-3.1-Pro。
a
arXiv
·
21 小时前
AI4S
多模态模型
科学计算
蛋白质预测
a
神经符号AI助力LEED认证:文档智能审查与多模态陷阱
研究提出神经符号AI管道,利用小型本地语言模型结合确定性规则检查,自动化处理LEED绿色建筑认证文档,实验发现4B参数模型在文本验证任务中表现优于8B模型,而添加低分辨率图纸图像反而降低准确性。
a
arXiv
·
21 小时前
神经符号AI
语言模型
绿色建筑
文档处理
a
MGDT:多模态知识图谱补全新框架,引入MLLM引导的扩散Transformer
研究人员提出MGDT框架,通过MLLM引导的扩散Transformer与关系自适应专家混合机制,显著提升多模态知识图谱补全性能。该框架采用先对齐后扩散的范式,在三个基准数据集上表现优于现有方法。
a
arXiv
·
21 小时前
知识图谱
多模态AI
扩散模型
大语言模型
a
逻辑与优化如何联手打造更透明的规则型AI
最新研究指出,逻辑与优化技术的结合能为规则型人工智能提供强大支持,逻辑负责编码规则与推理,优化则为高效计算提供技术支撑,这一组合尤其有助于提升AI系统的透明度与可解释性。
a
arXiv
·
21 小时前
规则型AI
可解释AI
逻辑推理
优化算法
a
让强化学习“说人话”:新方法将黑盒策略转化为可执行的Prolog逻辑程序
研究人员提出一种新方法,可将深度强化学习的黑盒策略转化为人类可读、逻辑引擎可执行的Prolog程序,同时提供理论性能保证,在多个任务中实现接近原策略的性能。
a
arXiv
·
21 小时前
可解释AI
强化学习
Prolog
规则提取
a
多角度推理框架MAR-12:精准识别并解释有害幽默表情包
研究人员提出MAR-12框架,通过12个结构化视角分析表情包中的幽默与有害内容,在检测准确性和解释性上均超越现有方法。
a
arXiv
·
21 小时前
多模态AI
内容安全
可解释AI
视觉语言模型
a
代码智能体如何攻克ARC-AGI难题?关键组件效能深度解析
最新研究通过四组嵌套式Codex智能体实验,系统拆解了可执行世界建模、计划简化和精确回放验证三大组件在ARC-AGI-3任务中的实际贡献。验证显示完整验证方案表现最佳,但资源消耗显著增加。
a
arXiv
·
21 小时前
代码生成智能体
ARC-AGI
可执行世界建模
程序验证
a