GradeSQL框架:用结果奖励模型提升文本转SQL推理可靠性

arXiv·20 天前

在文本转SQL等结构化推理任务中,如何提升大语言模型在推理阶段的可靠性是当前重要挑战。传统测试时推理策略如最佳N采样和多数投票依赖执行成功率或输出频率等启发式信号,对候选输出的语义区分能力有限。

近日,研究团队提出将结果奖励模型作为学习型语义评分函数,用于文本转SQL的测试时验证。虽然ORM此前已在测试时扩展和对齐任务中有所探索,但在结构化查询生成领域的应用仍待深入。

研究团队开发了GradeSQL框架,通过自动候选生成和基于执行的标注来训练任务特定的ORM,无需人工标注即可完成验证器训练。该框架将ORM集成到验证驱动的最佳N采样流程中,并在BIRD和Spider基准测试中进行了多组开源大语言模型验证。

实验结果显示,基于ORM的选择策略始终优于基于执行的最佳N采样和多数投票方法,在BIRD基准上提升达4.33%,在Spider基准上提升2.10%。研究还表明,ORM能有效适应更大候选集规模,并在复杂查询上带来更强改进。

这项研究证明,基于ORM的验证为文本转SQL任务提供了一种简单、有效且可扩展的测试时选择策略替代方案。相关代码、数据集和模型均已公开。

文本转SQL大语言模型推理优化GradeSQL结果奖励模型

原文来源:https://arxiv.org/abs/2606.30851

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回