AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多语言NLP
7 篇相关内容
相关话题
跨语言迁移
大模型评测
低资源语言
基准数据集
内容审核
毒性检测
语码混合
AI安全
假新闻检测
数据集偏差
XLM-RoBERTa
迁移学习
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
研究者推出首个系统性吉尔吉斯语大模型评测基准KyrgyzLLM-Bench,包含原生数据集与翻译任务,评估26个开源与闭源模型在零样本和少样本下的表现。
a
arXiv
·
5 小时前
大模型评测
多语言NLP
低资源语言
基准数据集
a
多语言与语码混合场景下,毒性信号可靠性需“看情况”
研究发现,现有毒性检测工具在多语言、语码混合、音译及俚语场景下可靠性存疑。研究者提出ToxGate方法,将外部信号作为条件证据处理,显著提升了高风险内容的识别效果。
a
arXiv
·
1 天前
内容审核
多语言NLP
毒性检测
语码混合
a
乌尔都语假新闻检测研究揭示数据集长度陷阱:跨数据集泛化能力严重失衡
最新研究首次系统评估乌尔都语假新闻检测模型的跨数据集泛化能力,发现数据集间存在严重不对称性,模型在反向测试中准确率暴跌至接近零,根源在于数据集中假新闻与真新闻的平均长度存在3.4倍差异导致的捷径学习。
a
arXiv
·
4 天前
假新闻检测
多语言NLP
数据集偏差
XLM-RoBERTa
a
土耳其语与阿拉伯语仇恨言论检测研究:多维度分析模型发布
研究者针对土耳其语和阿拉伯语构建了涵盖难民、民族冲突等主题的仇恨言论数据集,并开发了基于BERT的多维度检测模型,以应对网络仇恨内容治理挑战。
a
arXiv
·
19 天前
仇恨言论检测
多语言NLP
BERT模型
内容安全
a
算法如何让世界杯门将一夜成名:从5万到820万粉丝的多语言叙事分析
一项研究通过多语言语料分析,揭示了世界杯门将沃齐尼亚在赛后粉丝激增背后的算法叙事机制,展示了不同语言如何塑造独特的传播框架。
a
arXiv
·
31 天前
计算话语分析
多语言NLP
社交媒体算法
世界杯
a
跨语言迁移研究新发现:任务对齐比语言亲缘关系更重要
最新研究通过在多语种大模型上的实验表明,跨语言迁移效果主要取决于任务格式对齐程度,而非语言之间的亲缘关系。
a
arXiv
·
31 天前
跨语言迁移
大语言模型
零样本学习
多语言NLP
a
TOTEN:基于知识本体的巴西葡萄牙语物理量及技术符号分词框架
研究团队提出TOTEN框架,通过知识本体取代传统统计分词方法,实现对物理量、数字、单位等工程实体的结构化识别,在巴西葡萄牙语技术文本中展现出显著性能优势。
a
arXiv
·
31 天前
自然语言处理
知识本体
技术文本处理
多语言NLP
a