AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
评估框架
9 篇相关内容
相关话题
大语言模型
AI智能体
arXiv
开源工具
技能库
开源生态
语音AI
人机交互
用户体验
复合AI系统
实验设计
大模型应用
SkillCorpus:首个开源技能生态系统整合框架,为AI智能体提供标准化能力库
研究人员推出SkillCorpus框架,通过多阶段筛选将82万项AI智能体技能整合为9.6万项标准化技能,并建立质量评估与任务匹配机制,在多项基准测试中显著提升智能体性能。
a
arXiv
·
1 天前
大语言模型
AI智能体
技能库
开源生态
a
Real World VoiceEQ:衡量语音AI人性化表现的新指标
研究者提出Real World VoiceEQ评估框架,用于量化语音AI在真实场景中的人性化表现,为优化人机交互体验提供新工具。
H
Hugging Face
·
5 天前
语音AI
评估框架
人机交互
arXiv
H
CAFE:开源平台助力复合AI系统评估,揭示组件性能影响
研究者推出CAFE开源平台,通过实验设计方法系统评估复合AI系统,帮助用户识别影响答案质量的关键组件及其交互作用。
a
arXiv
·
7 天前
评估框架
复合AI系统
开源工具
实验设计
a
长视野终端基准发布:AI智能体面临极限挑战
研究者推出长视野终端基准测试,包含46项需数小时完成的任务,旨在评估AI智能体在复杂长流程任务中的表现。测试显示当前最强模型仅达15.2%通过率,揭示巨大提升空间。
a
arXiv
·
8 天前
AI智能体
基准测试
长流程任务
评估框架
a
超越困惑度:大语言模型测试时训练中部署记忆声明的行为评估框架
研究团队提出针对大语言模型测试时训练(TTT)中部署记忆声明的新评估框架,强调传统代理指标不足以验证实际部署能力,需通过行为证据进行校准。
a
arXiv
·
19 天前
大语言模型
测试时训练
评估框架
记忆机制
a
SEFORA论文发布:首个真实课堂写作反馈数据集与LLM评估框架
研究者发布SEFORA数据集,包含564份学生论文草稿和8240条教师批注,并推出UniMatch评估框架,揭示当前大模型在生成写作反馈时与教师实际批注存在显著差距。
a
arXiv
·
19 天前
教育AI
大语言模型
数据集
评估框架
a
新框架让AI心理支持更靠谱:TheraJudge评估器+TheraAgent多角色系统
研究人员提出两阶段框架,先训练能评估心理支持质量的AI法官,再构建多角色系统将评估信号转化为针对性改进,显著提升AI心理支持的安全性与共情能力。
a
arXiv
·
20 天前
心理健康AI
大语言模型对齐
多智能体系统
评估框架
a
大模型思维表征四大公理:揭示基准测试掩盖的深层缺陷
研究者提出评估大模型潜在思维表征的四大公理框架,发现当前模型均无法同时满足所有公理要求,揭示基准测试精度掩盖的表征缺陷。
a
arXiv
·
22 天前
大语言模型
思维表征
评估框架
推理能力
a
DeepMind推出ConvApparel:突破用户模拟器的真实感瓶颈
谷歌DeepMind发布ConvApparel框架,旨在量化并弥合用户模拟器与现实交互之间的真实感差距,为对话系统训练提供更可靠的评估基准。
G
Google DeepMind
·
26 天前
用户模拟器
对话系统
生成式AI
评估框架
G