DECODEM:大模型如何从公司章程中自动提取治理信息?

arXiv·1 天前

在实证法律与公司治理研究中,将非结构化的公司章程、细则等文本转化为结构化变量,传统上依赖人工标注,成本高昂且难以规模化。近日,研究人员在arXiv上发布论文,提出了DECODEM基准数据集,旨在系统评估大语言模型从公司组织文件中自动提取治理条款的性能。

该研究构建了包含随机抽样的公司章程与细则及其高质量人工标注的数据集,涵盖实证研究中常见的多项治理条款。研究团队测试了多种基于大语言模型的提取流程,比较了不同提示设计、任务分解和文档处理策略的效果。任务本质上是一系列文档级别的二分类问题,每个治理变量对应一个分类任务。

结果显示,对于多数治理条款,自动化提取已达到很高的准确率,中位性能接近各种方法的上限。不过,不同变量的表现存在系统性差异,少数条款导致了大部分剩余错误。研究还发现,更复杂的提示策略和级联流程虽然不一定能持续提升前沿模型的性能,但在某些场景下能显著缩小前沿模型与效率导向模型之间的差距,表明流程设计可以在一定程度上弥补模型能力的不足。

这项工作通过提供标准化基准和对提取方法的系统评估,证明了当前前沿模型能够以高准确率从复杂的公司文件中提取具有法律意义的信息,预示着自动化特征提取在构建公司治理数据集方面将扮演重要角色。

大语言模型法律科技信息提取公司治理基准评测

原文来源:https://arxiv.org/abs/2607.15879

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回