孟加拉语事件检测:编码器与解码器模型在噪声文本中的鲁棒性较量
事件检测系统通常基于干净文本进行评估,但其对真实世界噪声的鲁棒性研究不足,尤其是在孟加拉语等低资源语言中。研究团队提出了一项创新研究,构建了首个通用的孟加拉语新闻事件本体,并创建了包含9,979个标注句子的基准数据集,涵盖40种事件子类型。数据集包含三类文本:干净新闻文本、真实世界自动语音识别转录文本以及拼写错误文本。
研究系统评估了两种架构的模型表现:微调的编码器模型(包括BanglaBERT和XLM-R)与指令调优的解码器大语言模型(Llama 3和Gemma 3)。结果显示明显的架构权衡:编码器模型在干净文本上表现更优,但在噪声环境下性能显著下降;而解码器大语言模型展现出更强的鲁棒性,特别是在事件触发词被破坏的情况下。
进一步研究发现,在指令调优过程中嵌入标注指南可以在噪声文本上建立更高的性能基线,但在不同噪声条件下减少性能下降的效果不一致。模型缩放持续提升解码器大语言模型的鲁棒性,而同时在干净和噪声数据上进行训练则成为一种有效的正则化策略,特别有利于编码器架构,显著缩小了鲁棒性差距。这项研究为低资源语言的事件检测系统设计提供了重要见解,强调了在真实世界应用中考虑文本噪声的重要性。