1. Text2SQL 的核心链路,用户问题→Schema 选择→SQL 生成→执行→结果解释,各环节的失败模式应如何定位与归因
请描述 Text2SQL 从用户自然语言问题到最终答案的完整核心链路,并说明在 Schema 选择、SQL 生成、执行、结果解释各环节的典型失败模式,以及如何对每个环节的失败进行定位与归因?
- 端到端 Text2SQL 管线的各环节职责
- 各环节失败模式的识别与定位
- 分环节指标与归因方法
Text2SQL 的核心链路通常分为四步:首先是 Schema 选择(Schema Linking),从可用表中挑选相关表与字段,并进行字段消歧;其次是 SQL 生成,由模型基于 Schema 与用户问题产出 SQL;然后是执行,将 SQL 提交到数据库,处理权限、超时与错误;最后是结果解释,把查询结果转成自然语言或图表。各环节的失败模式各不相同:Schema 选择失败表现为选错表、选错字段或漏选字段,导致结果口径错误;SQL 生成失败表现为语法错误、JOIN 条件臆造、聚合口径错误;执行失败表现为超时、权限不足、列不存在;结果解释失败表现为对数值的误读、单位换算错误或趋势判断失误。归因时可通过分段点检与误差归因法:在 Schema 选择后单独检查选中的表与字段是否合理,用解析器对生成 SQL 做语法校验,用执行计划与返回结果核对 SQL 真实性,最后用口径核对验证解释逻辑,从而把失败定位到具体环节。
分环节归因的价值在于把"最终答案错误"这个结果反推为可修复的环节缺陷。实践中可给每个环节打上中间产物(选中的 Schema、生成的 SQL、执行行数、解释文本),并分别记录正确率,从而精确判断是"该 SQL 就该错"还是"SQL 对但解释错"。