MiqraBERT:基于回归的希伯来圣经平行文本检测模型

arXiv·33 天前

希伯来圣经中存在大量文本复用现象,但传统计算方法主要依赖词汇重叠,难以识别经过转述、词汇替换或句法重构的平行文本。为解决这一问题,研究团队开发了MiqraBERT模型。该模型基于现代希伯来语编码器AlephBERT进行Sentence-BERT架构的微调,专门用于圣经希伯来语的经文级语义相似度计算。训练数据集包含1650个标注的经文对,其中825个正样本来自《历代志》对照材料及诗歌平行结构研究,另825个为随机采样的负样本。通过余弦相似度回归训练,模型学习到的嵌入空间能够使平行经文聚集、非相关经文分离。评估采用基于分布的度量方法,包括Wasserstein距离和重叠系数,在十个随机种子下进行测试。结果显示,MiqraBERT将分布分离度提升至基线模型的2.7倍,模糊重叠区域从约24%降至6%。在叙事类对照平行文本中,模型召回率@10达到87.1%;但诗歌类平行文本检测仍具挑战性,召回率低于9%。这种体裁依赖性表明模型目前主要适用于叙事文本的复用检测。该模型已在Hugging Face平台开源发布。

自然语言处理圣经研究语义相似度Sentence-BERT文本复用检测

原文来源:https://arxiv.org/abs/2606.19638

相关阅读

推理过程为何会出错?新方法让大模型自我纠偏
英伟达Nemotron 3.5语音识别模型成功适配三种肯尼亚语言
HPD-Parsing:文档解析新范式,实现并行解码提速3倍
印度法律问答AI系统AILQA发布,RAG框架显著提升答案质量
CASE框架:因果对齐与结构约束提升大模型思维链可信度

← 返回