情感分析预处理技术排序研究:分词最关键,拼写纠正影响最小

arXiv·27 天前

在社交媒体情感分析领域,预处理技术对机器学习模型的性能至关重要。arXiv最新研究首次系统性地探讨了不同预处理技术的实施顺序对模型效果的影响。研究发现,当考虑执行顺序时,分词技术对模型性能的提升最为显著,而拼写纠正的影响相对最小。研究还揭示了词干提取和停用词去除两种技术可以互换使用,但在去除停用词时保留否定词能获得更好的分析效果。经过实验验证,最优的预处理流程顺序为:首先进行分词,接着进行文本清洗,然后实施词干提取,最后去除停用词。这项研究为从业者提供了一套系统化的预处理方案,能够显著提升情感分析模型的输出质量,同时避免了传统方法中耗时的预处理探索阶段。该成果特别适用于Twitter等社交媒体平台的情感分析任务,有助于更准确地监测公众对产品的意见和分析社会政治运动趋势。

情感分析自然语言处理预处理技术机器学习社交媒体分析

原文来源:https://arxiv.org/abs/2606.24055

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回