因子化假设搜索:解决证据到分类法检索的语义鸿沟
传统大型分类法检索通常假设输入已明确表达目标概念,但在实际应用中,输入常为间接证据(如表格单元格),其语义需结合行列、数据类型和上下文才能理解,形成“检索准备度鸿沟”。研究发现,现有索引方法仅在语义明确时能可靠检索目标,而原始证据往往导致目标排名靠后。
为此,团队提出因子化假设搜索(FHS),该方法在命名语义维度上维护多个部分解释假设,支持结构化查询生成、多假设检索及维度级候选验证。在金融分类标记和CodiEsp临床编码任务中,FHS在非预言机方法中取得了最佳的Recall@1、平均倒数排名和最终准确率。实验表明,用自由文本集成替代因子化假设路径会导致头部排名性能显著下降,而顺序优化相比FHS强大的并行首轮检索并未带来额外增益。
这项工作为处理复杂证据的语义检索提供了新思路,尤其适用于金融、医疗等需要高精度分类的领域。