EXPO-SQL:基于执行反馈的细粒度强化学习方法,提升文本转SQL准确率
在自然语言处理领域,文本转SQL技术让用户能够用日常语言查询数据库,自动生成可执行的SQL语句。当前主流方法多采用基于大语言模型的强化学习,利用执行反馈进行训练。然而现有强化学习方法通常对整个SQL查询给予统一的查询级奖励,未能区分正确与错误的子句,这种粗粒度的奖励设计导致模型学习信号不足。
针对这一问题,研究团队提出了EXPO-SQL方法,通过子句级奖励机制提供细粒度监督。该方法通过分析执行结果(包括错误信息和子句增量执行情况)来识别错误子句,并为每个子句分配相应的奖励信号。这种精细化的反馈机制使模型能够更准确地学习SQL语法结构和语义约束。
在多个主流文本转SQL基准测试上的实验表明,EXPO-SQL方法在性能上显著优于现有的监督微调、提示工程和基于强化学习的方法。该方法通过细粒度的子句级学习,有效提升了SQL查询生成的准确性和鲁棒性,为数据库自然语言接口的实用化提供了新的技术路径。相关代码已在GitHub开源。