AI360
资讯
首页
专栏
快讯
应用中心
API 平台
AI 资讯
一手 AI 新闻 · 论文 · 模型动态,AI 辅助整理,优质优先
G
Google DeepMind
126
O
OpenAI
117
H
Hugging Face
63
N
NVIDIA AI
55
A
Anthropic
49
T
Together AI
34
x
xAI
31
月
月之暗面 Kimi
28
M
Mistral AI
26
D
DeepSeek 深度求索
26
通
通义千问 Qwen
26
智
智谱 GLM
20
全部专栏 →
提升大语言模型规划能力:符号反馈驱动的迭代自优化框架
研究者提出一种符号反馈驱动的迭代自优化框架,通过自然语言提示映射逻辑符号,结合符号验证器识别错误并生成修正指令,显著提升大语言模型在长期规划任务中的可行性与正确性。
a
arXiv
·
66 天前
大语言模型
规划能力
符号推理
自我优化
a
新框架LBR:通过局部分支路由实现高效可训练的语言模型测试时扩展
研究者提出局部分支路由(LBR)框架,通过轻量级路由机制在推理时扩展局部前瞻树,在数学推理任务中超越了传统思维链方法。
a
arXiv
·
70 天前
语言模型
推理优化
测试时扩展
强化学习
a
Anthropic发布新研究:如何减少AI代理行为中的“目标错位”问题
Anthropic发布最新研究成果,探讨了在训练AI助手Claude过程中,如何有效减少“代理行为错位”这一核心挑战,旨在提升AI与人类意图的一致性。
A
Anthropic
·
71 天前
AI对齐
Anthropic
Claude
大模型安全
A
Mistral AI 推出德语专用 AI 模型,助力德语区数字化转型
法国 AI 公司 Mistral AI 宣布推出针对德语优化的 AI 模型,旨在为德语区企业和开发者提供更精准的语言支持。
M
Mistral AI
·
72 天前
Mistral AI
多语言模型
德语AI
本地化
M
C³PO基准揭示多模态模型推理缺陷:注意力过度集中于文本
研究人员提出C³PO基准,发现当前多模态大模型存在严重的模态偏见问题,在跨模态推理中过度依赖文本信息,导致面对矛盾证据时表现脆弱。
a
arXiv
·
27 天前
多模态大模型
基准测试
跨模态推理
注意力机制
a
电商运营长期连贯性新基准:MerchantBench 揭示大模型与人类差距
研究者推出 MerchantBench 基准,用于评估大语言模型智能体在电商运营中的长期连贯决策能力,实验显示当前最优模型仅达到人类平均最终净资产的 27.3%。
a
arXiv
·
31 天前
大语言模型
智能体
电商
基准测试
a
GPT-5.6发布:前沿智能与极致效率的融合突破
OpenAI推出GPT-5.6模型,在保持前沿智能水平的同时显著提升计算效率,实现单位成本下更高效的人工智能服务。
O
OpenAI
·
35 天前
GPT-5.6
OpenAI
模型优化
AI效率
O
月之暗面开源 Kimi K3 模型权重及技术报告,2.8T MoE 模型支持原生视觉与百万上下文
月之暗面宣布开源其最强模型 Kimi K3 的权重及技术文档,该模型为 2.8T MoE 架构,具备原生视觉理解能力与 100 万 token 上下文窗口。
月
月之暗面 Kimi
·
37 天前
大模型
模型开源
月之暗面
MoE
月
谷歌DeepMind推出Gemini三款新模型:3.6 Flash、3.5 Flash-Lite与3.5 Flash Cyber
谷歌DeepMind正式发布三款全新Gemini模型,包括性能更强的3.6 Flash以及轻量化版本3.5 Flash-Lite和网络安全专用版3.5 Flash Cyber。
G
Google DeepMind
·
43 天前
Gemini
Google DeepMind
大语言模型
AI模型
G
DeepSeek-V4预览版正式开源,开启百万上下文高性价比时代
深度求索正式发布DeepSeek-V4预览版并开源,推出Pro和Flash两个版本,均支持百万上下文长度,性能媲美顶尖闭源模型。
D
DeepSeek 深度求索
·
71 天前
大模型
开源
DeepSeek
AI研究
D
NVIDIA Blackwell横扫MLPerf训练6.0基准测试,创下最快、最大、最强纪录
NVIDIA Blackwell平台在MLPerf训练6.0基准测试中全面领先,在大型语言模型训练任务中展现出卓越的性能与扩展能力。
N
NVIDIA AI
·
71 天前
NVIDIA
Blackwell
MLPerf
AI训练
N
大模型幻觉雪球效应:多智能体流水线中错误如何层层放大
研究发现多智能体LLM流水线存在结构性缺陷:早期注入的幻觉会像滚雪球一样层层放大,从原始事实演变为计算、叙述乃至最终结论,检测难度逐级剧增。
a
arXiv
·
16 天前
大模型幻觉
多智能体系统
错误传播
模型验证
a
最新动态
为你的代码助手赋予专属记忆能力
56 分钟前
陈大年复出投身AI领域,首秀模型性能接近DeepSeek万亿级旗舰
1 小时前
3D场景生成迎来突破:单图生成场景技术获顶会最佳论文
1 小时前
多场景通吃!石智航AWE3.7展现惊人泛化能力
6 小时前
AI智能体如何重塑人类群体的共识形成机制
6 小时前
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
6 小时前
无需预设长度!PILL方法显著提升扩散语言模型填充效率
6 小时前
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
6 小时前
热门专栏
a
arXiv
1956
量
量子位
169
G
Google DeepMind
126
O
OpenAI
117
H
Hugging Face
63
N
NVIDIA AI
55
A
Anthropic
49
T
Together AI
34