因子化假设搜索:解决证据到分类法检索的语义鸿沟

arXiv·24 天前

传统大型分类法检索通常假设输入已明确表达目标概念,但在实际应用中,输入常为间接证据(如表格单元格),其语义需结合行列、数据类型和上下文才能理解,形成“检索准备度鸿沟”。研究发现,现有索引方法仅在语义明确时能可靠检索目标,而原始证据往往导致目标排名靠后。

为此,团队提出因子化假设搜索(FHS),该方法在命名语义维度上维护多个部分解释假设,支持结构化查询生成、多假设检索及维度级候选验证。在金融分类标记和CodiEsp临床编码任务中,FHS在非预言机方法中取得了最佳的Recall@1、平均倒数排名和最终准确率。实验表明,用自由文本集成替代因子化假设路径会导致头部排名性能显著下降,而顺序优化相比FHS强大的并行首轮检索并未带来额外增益。

这项工作为处理复杂证据的语义检索提供了新思路,尤其适用于金融、医疗等需要高精度分类的领域。

检索技术语义鸿沟分类法自然语言处理arXiv

原文来源:https://arxiv.org/abs/2608.06614

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回