EXPO-SQL:基于执行反馈的细粒度强化学习方法,提升文本转SQL准确率

arXiv·27 天前

在自然语言处理领域,文本转SQL技术让用户能够用日常语言查询数据库,自动生成可执行的SQL语句。当前主流方法多采用基于大语言模型的强化学习,利用执行反馈进行训练。然而现有强化学习方法通常对整个SQL查询给予统一的查询级奖励,未能区分正确与错误的子句,这种粗粒度的奖励设计导致模型学习信号不足。

针对这一问题,研究团队提出了EXPO-SQL方法,通过子句级奖励机制提供细粒度监督。该方法通过分析执行结果(包括错误信息和子句增量执行情况)来识别错误子句,并为每个子句分配相应的奖励信号。这种精细化的反馈机制使模型能够更准确地学习SQL语法结构和语义约束。

在多个主流文本转SQL基准测试上的实验表明,EXPO-SQL方法在性能上显著优于现有的监督微调、提示工程和基于强化学习的方法。该方法通过细粒度的子句级学习,有效提升了SQL查询生成的准确性和鲁棒性,为数据库自然语言接口的实用化提供了新的技术路径。相关代码已在GitHub开源。

文本转SQL强化学习大语言模型自然语言处理数据库查询

原文来源:https://arxiv.org/abs/2606.23693

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回