通过人机协作数据标注实现Text-to-SQL领域适配
作者
Text-to-SQL模型将自然语言(NL)问题解析为可执行SQL查询,越来越广泛地应用于现实世界应用。然而,在现实世界中部署此类模型通常需要适配特定应用中使用的高度专业化数据库模式。我们观察到,将现有Text-to-SQL模型应用于新模式时性能急剧下降,主要原因是缺乏用于微调的具体领域数据。此外,新模式缺乏数据也阻碍了我们有效评估模型在新领域的表现。然而,在大多数现实世界应用中,为不断演变的模式持续获取Text-to-SQL数据成本很高。为弥补这一差距,我们提出了SQLsynth,一个人在环的Text-to-SQL数据标注系统。SQLsynth通过人类和大型语言模型之间的结构化工作流程协作,简化了高质量Text-to-SQL数据集的创建。一项将SQLsynth与手动标注和ChatGPT进行比较的受试者内用户研究表明,SQLsynth显著加速了Text-to-SQL数据标注,减轻了认知负担,并生成了更准确、更自然、更多样化的数据集。我们的代码可在 https://github.com/adobe/nl_sql_analyzer 获取。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何应对文本到SQL模型在新领域数据库模式下性能显著下降的问题?分类: 人机协同标注与示例选择同类问题arrow_forward
- 是否可以通过人机协作的动态注释工具提高文本到SQL数据标注的效率和质量?分类: 人机协同标注与示例选择同类问题arrow_forward
- 如何结合规则生成方法和语言大模型(LLMs)生成多样性和高质量的SQL及自然语言查询数据?分类: 人机协同标注与示例选择同类问题arrow_forward
现实痛点
1- 文本到SQL模型在新领域使用中因数据不足表现不佳。分类: 人机协同标注与示例选择同类问题arrow_forward
- 100%
模型压缩在实践中的应用:来自创建设备端机器学习体验的实践者的经验教训
CHI '24· 大语言模型(LLM)的人机协作 +1
- 100%
InstructPipe: 使用人类指令和大语言模型生成视觉块管道
CHI '25· 大语言模型(LLM)的人机协作 +1
- 100%
基于可绘制时间线的交互式超参数优化
DIS '21· 大语言模型(LLM)的人机协作 +1
- 80%
面向人工智能的低代码工具
IUI '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
模型中的精灵:面向移动应用的人环深度神经网络自动生成
UbiComp '23· 大语言模型(LLM)的人机协作 +2
- 67%
迈向人类导向的机器学习
IUI '19· 大语言模型(LLM)的人机协作 +2
- 67%
CoAutoML:面向机器学习新手的基于LLM的AutoML和测试驱动机器教学用户界面框架
IUI '26· 自动机器学习(AutoML)界面 +2
- 67%
用户界面的终身学习
UIST '23· 大语言模型(LLM)的人机协作 +2
- 60%
在配对编程环境中用代理替代人类的权衡:好的、坏的和丑的
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
大规模可视化深度神经网络示例
CHI '21· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)