TOTEN:基于知识本体的巴西葡萄牙语物理量及技术符号分词框架

arXiv·31 天前

字节对编码(BPE)等统计分词方法虽然能有效压缩词汇表,但在处理结构化技术实体时存在语义盲区,常将物理量、数字、单位和符号表达式割裂为缺乏语义连贯性的子词。针对这一问题,研究团队在arXiv发表论文,提出名为TOTEN的知识本体分词框架。该框架摒弃统计推导,转而采用基于工程实体本体(OEE)的声明式分类方法。

TOTEN由三个核心组件构成:本体库负责收集实体类型、结构原则、组合关系及可保持的不变量;分类函数将原始文本映射为类型化区域;实例化器族则生成自描述的结构化表示。框架通过与三个外部知识源(Pint用于量纲分析、Unicode字符数据库处理字形特征、RSLP分析葡萄牙语形态)的确定性耦合实现鲁棒性。

研究团队使用内部物理验证基准数据集EngQuant(800例)和四个巴西葡萄牙语外部语料库(1771个有效案例)进行评估,验证了四个构造可验证属性:本体原子性、量纲等价性、字形鲁棒性和数值重构能力。在与八个先进基线的对比中,TOTEN在所有对比中均实现单位本体原子性,在外部语料库上的数值重构分数达0.775-0.904,显著优于最佳基线Quantulum3的0.627-0.703;在EngQuant数据集上更以0.780远超基线的0.340。统计检验显示差异显著,内部与外部排名的斯皮尔曼相关性证实了控制基准的并发效度。量纲等价性评估表明,系统与所继承的Pint知识源保持统计一致性。

自然语言处理知识本体技术文本处理多语言NLP工程语言学

原文来源:https://arxiv.org/abs/2606.19626

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回