AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
大模型评测
5 篇相关内容
相关话题
基准测试
多语言NLP
低资源语言
基准数据集
跨语言迁移
子模优化
语义嵌入
arXiv
提示工程
格式敏感度
结构化输出
行为科学
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
研究者推出首个系统性吉尔吉斯语大模型评测基准KyrgyzLLM-Bench,包含原生数据集与翻译任务,评估26个开源与闭源模型在零样本和少样本下的表现。
a
arXiv
·
5 小时前
大模型评测
多语言NLP
低资源语言
基准数据集
a
无需模型评分也能选测试题:新方法用语义特征压缩大模型评测集
研究者提出一种无监督的大模型评测集压缩方法,仅依赖提示的语义嵌入就能选出代表性测试题,在35个基准测试上验证了有效性。
a
arXiv
·
7 天前
大模型评测
基准测试
子模优化
语义嵌入
a
提示词格式敏感度:大模型评测中格式包装对准确率的影响
研究发现,评测大模型时仅改变提示词的格式包装,就可能导致准确率大幅波动,甚至改变排行榜结论。研究人员提出格式敏感度指数与解析敏感度指数,量化这一影响。
a
arXiv
·
7 天前
大模型评测
提示工程
格式敏感度
基准测试
a
行为科学AI评测基准BehaviorBench发布,揭示大模型在行为预测中的能力差异
研究人员推出首个系统性评测大模型在行为科学任务表现的基准BehaviorBench,发现通用大模型在个体预测上表现优异,而基于行为数据微调的专用模型在群体分布对齐方面更具优势。
a
arXiv
·
27 天前
行为科学
大模型评测
AI基准
行为预测
a
Kimi K2.6登顶OpenRouter周榜,开发者生态获认可
月之暗面旗下Kimi智能助手最新版本K2.6在OpenRouter周度大模型排行榜中位列第一,官方感谢开发者支持并承诺持续优化产品。
月
月之暗面 Kimi
·
27 天前
快讯
Kimi
月之暗面
大模型评测
OpenRouter
月