AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
科学研究
4 篇相关内容
相关话题
OpenAI
人工智能
大语言模型
评估基准
假设发现
AI能力评估
基准测试
基因组学
AI评估
计算发现
Google DeepMind
机器学习
大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
研究团队提出前瞻性假设发现(PHD)任务,评估大语言模型在证据不完整、结论未定时自主构建可检验假设空间的能力。新基准 HypoArena 涵盖 988 个科学分析案例,实验显示不同模型在该任务上存在明显能力分层。
a
arXiv
·
1 天前
大语言模型
评估基准
假设发现
科学研究
a
OpenAI推出GeneBench-Pro:专为基因组学与生物学设计的AI性能基准测试
OpenAI发布GeneBench-Pro基准测试,旨在评估AI在基因组学、生物学及科学研究中使用复杂真实数据集的表现。
O
OpenAI
·
20 天前
基准测试
OpenAI
基因组学
AI评估
O
DeepMind推出ERA:从《自然》论文到计算发现的新催化剂
Google DeepMind发布Empirical Research Assistance(ERA),旨在将学术研究成果转化为加速计算发现的实用工具。
G
Google DeepMind
·
26 天前
人工智能
计算发现
Google DeepMind
科学研究
G
天体物理学家用Codex模拟黑洞,验证爱因斯坦广义相对论
天体物理学家陈志宽利用OpenAI Codex构建黑洞模拟系统,帮助科学家研究极端物理现象并验证广义相对论。
O
OpenAI
·
28 天前
OpenAI
Codex
人工智能
科学研究
O