MiqraBERT:基于回归的希伯来圣经平行文本检测模型
希伯来圣经中存在大量文本复用现象,但传统计算方法主要依赖词汇重叠,难以识别经过转述、词汇替换或句法重构的平行文本。为解决这一问题,研究团队开发了MiqraBERT模型。该模型基于现代希伯来语编码器AlephBERT进行Sentence-BERT架构的微调,专门用于圣经希伯来语的经文级语义相似度计算。训练数据集包含1650个标注的经文对,其中825个正样本来自《历代志》对照材料及诗歌平行结构研究,另825个为随机采样的负样本。通过余弦相似度回归训练,模型学习到的嵌入空间能够使平行经文聚集、非相关经文分离。评估采用基于分布的度量方法,包括Wasserstein距离和重叠系数,在十个随机种子下进行测试。结果显示,MiqraBERT将分布分离度提升至基线模型的2.7倍,模糊重叠区域从约24%降至6%。在叙事类对照平行文本中,模型召回率@10达到87.1%;但诗歌类平行文本检测仍具挑战性,召回率低于9%。这种体裁依赖性表明模型目前主要适用于叙事文本的复用检测。该模型已在Hugging Face平台开源发布。