从唐诗中识别诗人籍贯:计算语言学揭示唐代地域语言指纹
一项最新研究利用计算语言学方法,对《全唐诗》中357位诗人的作品进行了系统性分析。研究团队将每位诗人的全部作品进行汇总,并通过中国历代人物传记资料库(CBDB)关联其籍贯所在的唐代“道”级行政区划,构建了诗人级别的语料库。研究将籍贯预测构建为多分类问题,采用字符n-gram TF-IDF结合意象、季节、典故等可解释特征,发现经典模型与神经网络模型能准确预测诗人的南北地域归属(准确率0.69,显著高于0.53的基线水平),并在更细致的“道”级预测上也表现出高于随机水平的能力。
研究揭示了三个重要发现:首先,不同“道”之间的语言距离与地理距离呈正相关(Mantel r=0.40),表明诗歌语言存在距离衰减效应;其次,地域信号随时间变化——盛唐时期南北区分度接近随机水平,而晚唐时期最强,这与帝国鼎盛时期宫廷驱动的语言同质化及后期区域分化趋势一致;第三,模型的错误预测具有历史意义——初唐时期所有误判都是将南方诗人识别为北方,反映了北方宫廷用语在当时的主导地位。
值得注意的是,研究还发现当使用古文BERT(GuwenBERT)等预训练模型处理整个语料库时,其表现仅与简单的TF-IDF方法相当,结合两者也未能提升性能,表明字符n-gram已能有效捕捉地域语言特征。这项研究展示了可解释机器学习作为文学史研究假设生成工具的潜力,为数字人文研究提供了新视角。