SEATauBench:首个面向东南亚语言的AI智能体评估基准发布
随着东南亚地区人工智能技术的快速发展,区域语言环境下的智能体能力评估成为构建本土化AI系统的关键挑战。近日,研究团队在arXiv发布了SEATauBench基准框架,这是首个专注于东南亚主权AI的智能体评估工具。该基准基于TauBench框架,适配了中文、越南语、泰语、印尼语和菲律宾语五种语言,通过渐进式本地化设置评估智能体在不同语言环境下的表现。
研究设计了三个层次的本地化场景:仅改变对话语言、本地化工具规范、以及完全本地化的任务领域。通过对近期三个主流模型的测试发现,当仅改变对话语言时,英语智能体的能力迁移效果尚可;但随着任务上下文本地化程度的加深,智能体的执行质量和鲁棒性显著下降,在完全领域适应场景中性能损失最大。
这项研究揭示了仅依赖英语评估无法准确衡量智能体在东南亚语言中的实际能力。SEATauBench不仅提供了诊断性基准,还构建了可复用的多语言适配流程,为语言多样化地区开发可靠的多语言智能体提供了重要工具。所有数据和代码已在GitHub开源,为东南亚地区AI的本土化发展提供了重要参考。