为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Why Johnny Can't Prompt: How Non-AI Experts Try (and Fail) to Design LLM Prompts
文献信息
- 主题领域: 人机交互、人工智能、大语言模型 (LLM) 应用设计
- 关键词: 大语言模型,提示工程,非专业用户,设计工具,人机交互,用户研究,教育和培训,用户编程,交互式机器学习,设计挑战
研究背景与问题
- 问题发现与挑战: 预训练大语言模型(LLMs)如 GPT-3 和 ChatGPT 提供了新的用户交互机会,旨在通过 "提示工程" 来优化模型输出。然而,对于非 AI 专家而言,设计有效的提示往往具有挑战性,容易遇到设计的脆弱性、效果不确定及缺乏系统性的挑战。
- 重要性: 随着 LLM 技术广泛应用,提示工程降低了编程门槛,使非专业用户也具备一定的设计能力。这为用户创新提供了新机会,同时也暴露了设计过程中的认知和实践障碍。
- 研究动机与相关工作: 提示工程的新"预训练-提示-预测"范式极大地降低了 NLP 开发的技术门槛,然而当前工具主要服务程序员和 NLP 专家,缺乏面向普通用户的设计支持。已有研究揭示了用户在提示工程中随机试探、缺少指导及对 LLM 能力预期不足等问题,但体系化研究仍然较少。
解决方案
- 方法或解决方案:
- 为了研究用户的直觉性设计行为,创建了一个无代码 LLM 提示设计工具 BotDesigner,该工具支持用户通过自然语言提示创建和迭代设计聊天机器人。
- 通过该设计工具观察非 AI 专家在完成指定任务时的行为和挑战。
- 创新之处:
- 提供了一个允许用户通过纯文本提示迭代生成聊天机器人的开放设计工具。
- 工具支持错误标记、对比多轮对话输出,以及迭代改进。
- 使用设计探针的方法来进行用户研究,从而深度揭示提示工程直觉中存在的障碍。
- 实施步骤与关键技术:
- 工具设计: BotDesigner 提供了会话视图和错误浏览器。用户通过修改提示模板迭代设计聊天机器人,并能系统评估不同模板的效果。
- 研究设计: 招募了 10 位非 AI 专家参与用户行为实验,任务包括测试现有的提示模板并优化该模板,以改善机器人模仿烹饪教程的表现。
- 分析方法: 使用用户思维过程的口述记录,结合问题标签和交互分析,挖掘潜在的设计思维模型和障碍。
研究成果
-
具体成果:
- 用户面对提示设计任务时,大多采用机遇主义的设计方式,集中在局域范围内修正问题,而缺乏系统性的全局测试策略。
- 基于互动或人类社会经验的错误假定(如假设机器人能“理解”指令)对迭代设计过程构成障碍。
- 用户倾向于通过直接说明(如“告诉一个笑话”)而非示例样本来表达设计意图,尽管后者被证实更有效。
- 重复式尝试、提示“结构化”和系统性测试较为稀缺,提示教育和流程引导的需求迫切。
-
与现有解决方案相比的优势:
- 提供了一个支持提示设计系统测试的框架,强调标签化错误和局部以及全局的反复测试迭代。
- 开发了面向非专家的开放式工具,有效揭示非专业用户在技术采用中的难点。
-
实验或评估结果:
- 大部分参与者成功完成了特定的机器人优化任务,但很难实现全面的模型化设计。
- 用户固有的过度泛化倾向和基于人际互动的逻辑框架对设计行为具有深刻影响。
- 工具中例示功能(如"标签错误")在实践中少被高效利用。
-
局限性与未来方向:
- 研究中的参与者主要为高学历专业群体,难以代表一般公众。需进一步扩展到多样性更高的样本中。
- 当前研究主要聚焦聊天机器人设计领域,未来可拓展至非聊天场景(如搜索工具、自动总结等)。
- 构建教育和培训模块,针对提示工程优化用户直觉、弥补设计经验差异。
- 建议探索“无缝设计” vs.“非无缝设计”方式的偏好对用户行为的影响。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 非AI专家在设计LLM(大型语言模型)提示词时会面临哪些具体挑战?分类: LLM 提示工程与编写工具同类问题arrow_forward
- 在没有编程背景的情况下,普通用户如何通过工具进行提示词的迭代优化?分类: LLM 提示工程与编写工具同类问题arrow_forward
- 非专家用户在提示词设计时的思维模式和行为偏好是什么?分类: LLM 提示工程与编写工具同类问题arrow_forward
lightbulb
现实痛点
1- 普通用户难以设计有效提示词与优化LLM输出。分类: LLM 提示工程与编写工具同类问题arrow_forward
- 100%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 100%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 83%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
氛围编程的纠缠——重新定位生成式 AI 编程中意图、作者身份与责任的边界
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
CoExplorer 技术探针:支持视频会议规划和运行意图性的生成式AI驱动自适应界面
DIS '24· 大语言模型(LLM)的人机协作 +2
- 83%
多智能体生成式AI的设计:行业早期采用者的洞察
DIS '25· 大语言模型(LLM)的人机协作 +2
- 83%
基于知识图谱补全的对话式领域知识获取问题选择框架
IUI '21· 对话式聊天机器人 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581388
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文