AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
智能体评估
2 篇相关内容
相关话题
多语言AI
东南亚语言
本地化AI
基准测试
持续学习
文本游戏
人工智能测试
长程规划
SEATauBench:首个面向东南亚语言的AI智能体评估基准发布
研究团队推出SEATauBench基准,专门用于评估AI智能体在东南亚五种语言(中文、越南语、泰语、印尼语、菲律宾语)中的工具使用与任务执行能力,填补了该领域多语言评估的空白。
a
arXiv
·
21 天前
多语言AI
智能体评估
东南亚语言
本地化AI
a
AgentOdyssey:为测试时持续学习智能体打造的开放式长程文本游戏生成框架
研究者提出AgentOdyssey评估框架,通过程序化生成包含丰富实体、世界动态和长程任务的开放式文本游戏,以全面检验智能体在测试阶段的持续学习能力。实验揭示了当前智能体在知识获取、记忆、探索等关键能力上的显著局限。
a
arXiv
·
26 天前
智能体评估
持续学习
文本游戏
人工智能测试
a