AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
NLP研究
2 篇相关内容
相关话题
大语言模型
阿拉伯语方言
文化评估
自动评分
模型评估
AI评测
算法偏差
阿拉伯语文化知识评估新框架:前沿大模型在方言理解上表现如何?
研究者提出跨评估框架,用人类专家标注数据测试前沿大模型在埃及和伊拉克阿拉伯语方言上的文化与社会语言学知识。结果显示,文化推理任务仍是自动评估的主要难点。
a
arXiv
·
19 天前
大语言模型
阿拉伯语方言
文化评估
自动评分
a
大规模评估揭示:LLM评委存在系统性偏差,当前验证方法存疑
最新研究对21个LLM评委模型进行系统性评估,发现当前依赖精确匹配的验证方法普遍高估模型判别能力,同时揭示评委模型存在显著的位置偏差与一致性矛盾。
a
arXiv
·
32 天前
大语言模型
模型评估
AI评测
算法偏差
a