通过人机协作数据标注实现Text-to-SQL领域适配

大语言模型(LLM)的人机协作自动机器学习(AutoML)界面软件工程师与开发者AI/ML 研究员与工程师

Text-to-SQL模型将自然语言(NL)问题解析为可执行SQL查询,越来越广泛地应用于现实世界应用。然而,在现实世界中部署此类模型通常需要适配特定应用中使用的高度专业化数据库模式。我们观察到,将现有Text-to-SQL模型应用于新模式时性能急剧下降,主要原因是缺乏用于微调的具体领域数据。此外,新模式缺乏数据也阻碍了我们有效评估模型在新领域的表现。然而,在大多数现实世界应用中,为不断演变的模式持续获取Text-to-SQL数据成本很高。为弥补这一差距,我们提出了SQLsynth,一个人在环的Text-to-SQL数据标注系统。SQLsynth通过人类和大型语言模型之间的结构化工作流程协作,简化了高质量Text-to-SQL数据集的创建。一项将SQLsynth与手动标注和ChatGPT进行比较的受试者内用户研究表明,SQLsynth显著加速了Text-to-SQL数据标注,减轻了认知负担,并生成了更准确、更自然、更多样化的数据集。我们的代码可在 https://github.com/adobe/nl_sql_analyzer 获取。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195804/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712083
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、自动机器学习(AutoML)界面
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文