AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
低资源语言
9 篇相关内容
相关话题
大模型评测
多语言NLP
基准数据集
跨语言迁移
法律NLP
多语言数据集
孟加拉国
文本挖掘
教育科技
自然语言处理
游戏化学习
生成式AI
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
研究者推出首个系统性吉尔吉斯语大模型评测基准KyrgyzLLM-Bench,包含原生数据集与翻译任务,评估26个开源与闭源模型在零样本和少样本下的表现。
a
arXiv
·
9 小时前
大模型评测
多语言NLP
低资源语言
基准数据集
a
BLAD数据集发布:覆盖1799-2025年孟加拉国多语言法律文本
研究人员推出孟加拉国法律法案数据集(BLAD),包含1484部跨越两个多世纪的法律文本,支持英语、孟加拉语及混合语言分析,填补南亚低资源民法司法管辖区法律NLP资源空白。
a
arXiv
·
9 小时前
法律NLP
多语言数据集
孟加拉国
文本挖掘
a
游戏化学习乌兹别克语:结合UzWordnet与生成式AI的创新教育系统
研究者提出一套结合UzWordnet词典与生成式AI的游戏化教育系统架构,通过四款教育游戏帮助学习者练习乌兹别克语,同时利用游戏动态持续完善词典资源。
a
arXiv
·
4 天前
教育科技
自然语言处理
游戏化学习
低资源语言
a
混合持续学习助力低资源澳大利亚原住民语言识别
针对澳大利亚原住民语言数据稀缺问题,研究者提出两种混合持续学习方法,有效提升语言识别性能并缓解灾难性遗忘。
a
arXiv
·
6 天前
持续学习
语言识别
低资源语言
澳大利亚原住民语言
a
语言相似性助力极低资源语音识别:Warlpiri 语言研究
本研究探讨了语言相似性如何提升极低资源场景下的跨语言语音识别性能,通过结合声学和语言学特征,为澳大利亚原住民语言 Warlpiri 筛选出最有效的源语言。
a
arXiv
·
7 天前
语音识别
低资源语言
迁移学习
语言相似性
a
LV-ROVER:多流Tesseract投票提升马耳他语段落OCR性能
研究团队针对马耳他语OCR训练数据稀缺的问题,开发了合成训练流程与五流Tesseract集成系统,在段落级识别任务中将字符错误率降低44%。
a
arXiv
·
19 天前
OCR
低资源语言
Tesseract
多模型集成
a
孟加拉语事件检测:编码器与解码器模型在噪声文本中的鲁棒性较量
研究团队构建首个孟加拉语新闻事件检测基准,系统评估编码器与解码器模型在噪声文本中的表现差异,发现解码器模型在噪声环境下更具鲁棒性。
a
arXiv
·
20 天前
事件检测
孟加拉语NLP
模型鲁棒性
噪声文本处理
a
低资源多模态翻译:尼泊尔语语音驱动情感化手语虚拟人生成
研究者提出NEST-V1框架,可将尼泊尔语语音输入转化为带有情感状态的手语虚拟人动画,为低资源语言的手语情感表达提供技术验证。
a
arXiv
·
25 天前
多模态翻译
手语生成
低资源语言
情感计算
a
QuechuaTok研究:黏着语分词器评估需引入形态边界准确率
针对低资源黏着语克丘亚语,研究人员提出QuechuaTok基准测试,发现传统分词评估指标在黏着语中存在局限,形态边界准确率成为关键评估维度。
a
arXiv
·
27 天前
分词技术
低资源语言
克丘亚语
NLP评估
a