《它想让我怎么说》:弥合最终用户程序员与代码生成大型语言模型之间的抽象差距
荣誉提名作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者AI/ML 研究员与工程师
文献标题
“What It Wants Me To Say”: Bridging the Abstraction Gap Between End-User Programmers and Code-Generating Large Language Models
文献信息
- 主题领域:人机交互、自然语言编程、大型语言模型(LLM)应用
- 关键词:自然语言编程,表格数据处理,人机交互,大型语言模型,自然语言界面,抽象匹配
研究背景与问题
- 大型语言模型(LLMs)让用户可以通过自然语言生成代码,但用户很难理解通过普通语言如何有效地描述意图,尤其对于代码生成模型而言需要选择适当的抽象层次。这被称为"抽象匹配"问题。
- 当前的自然语言界面存在挑战,例如用户在尝试生成代码时,描述与模型理解之间存在巨大差异。此外,现有模型对自然语言指令的理解表现经常不稳定,可能会产生含糊或错误的代码。
- 针对表格驱动的数据分析场景,非专业编程用户在语言描述意图来生成Python代码时面临较大困难。
- 研究动机是希望通过设计一种方法,使用户更容易理解如何对模型进行有效“沟通”,从而改善用户体验,提高生产力。
解决方案
- 方法:提出"基于语境的抽象匹配(Grounded Abstraction Matching)"方法,即将用户输入的语言意图映射为系统动作(如代码),然后将生成的代码系统性翻译回可编辑的自然语言(地面化语句),以此帮助用户学习有效使用系统的语言表达方式。
- 创新点:
- 引入地面化对应语句,使用户可以理解代码生成过程。
- 提供了一种系统化、可预测的方式,将用户自然语言与模型操作能力的抽象层次对齐。
- 支持错误恢复和结果检查,增强用户对系统的信任和可控性。
- 实施步骤:
- 设计并实现了两种系统:一个是基于地面化语句支持抽象匹配的系统,另一个是参考现有文献中推荐的非地面化的系统。
- 构建了一个数据分析系统,支持自然语言操作表格数据,使用代码生成模型Codex生成解决方案。
- 使用系统性算法将生成的代码转换成地面化语句。
- 与用户协同迭代,通过实验比较了两种实现方式对用户有效性的影响。
研究成果
- 具体成果:
- 提出了一个创新的“基于语境的抽象匹配”方法,并结合真实的表格分析任务应用于数据分析自然语言编程场景。
- 用户研究验证表明,与非地面化方法相比,地面化方法能帮助用户更好地理解系统操作逻辑,提高错误恢复能力。
- 实验设计了三个真实任务,衡量了不同方法的成功率、错误模式及用户感知。
- 比较优势:
- 使用地面化方法的用户能够更好地看懂反馈,并调整自然语言输入来生成正确的代码。
- 用户能力的提升体现为更强的信任感,并学会使用高效的语言表达方式描述任务意图。
- 实验或评估结果:
- 用户在完成任务时地面化系统表现更优,特别是在用户需要鉴别部分正确的输出以修正错误时。
- 根据NASA TLX和System Usability Scale量表评价指标,用户均报告认知负荷适中,并对系统产生高接受度。
- 在实验任务中,地面化系统能够有效减少一些错误模式,如输入输出错误和逻辑选择偏差。
- 局限性与未来方向:
- 当前实现支持的代码操作范围有限,仅覆盖Pandas库部分功能。未来可以探索更多编程语言API的支持。
- 当前实验在实验室环境中进行,需进一步进行纵向研究和大规模使用场景的适用性验证。
- 地面化语句的优化仍有改进空间,例如可以借助LLM本身生成更精确的解释语句。
总结
本文通过应用“地面化抽象匹配”,成功降低了非专家用户在自然语言编程上的障碍,拓展了生成式AI与用户交互设计的边界。未来研究将进一步探索如何在更复杂的场景中实现这种方法,适应不同语言模型和多样化用户群体的需求。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 用户如何与代码生成的大型语言模型进行有效交流,特别是在选择合适的抽象层次时?分类: LLM代码生成与编程助手同类问题arrow_forward
- 引入“具象化的抽象匹配”方法是否能帮助用户更好地理解代码生成过程并改进错误恢复能力?分类: LLM代码生成与编程助手同类问题arrow_forward
- 在自然语言编程的表格数据分析任务中,如何设计出支持用户表达意图的系统?分类: LLM代码生成与编程助手同类问题arrow_forward
lightbulb
现实痛点
1- 非专业编程用户很难通过自然语言生成准确的代码。分类: LLM代码生成与编程助手同类问题arrow_forward
- 100%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 100%
D-Twins:专为实时无聊干预设计的数字双胞胎
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 100%
接受、拒绝还是修正:人机协作中生产力与信任的度量
IUI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
通过自动生成的图像画廊探索生成对抗网络(GANs)的方法
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 80%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
Ivie:新生成代码的轻量级锚定解释
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
科学组织中知识工作者的生成式AI用途与风险
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
探索空白空间:人机交互数据增强
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580817
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文