在人工智能中介沟通中比较句子层面的建议和消息层面的建议
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师
文献标题
Comparing Sentence-Level Suggestions to Message-Level Suggestions in AI-Mediated Communication
文献信息
- 主题领域: 人机交互 (HCI),语言模型应用,AI辅助写作
- 关键词: AI辅助写作, 大语言模型, 信息交流, 政治沟通, GPT-3, 政府职员, 用户体验, 自动化建议, 人类协作, 技术伦理
研究背景与问题
- 发现的挑战: 传统写作辅助系统多侧重单词或短语建议,而当前大语言模型(如 GPT-3)具有生成长文本建议的能力。尽管其在高负荷通信环境中(如立法机构职员回复大量选民咨询邮件)具有潜力,但其对用户体验和结果质量的影响尚未清晰。
- 重要性: 高质量的沟通对于构建信任至关重要,尤其是政治背景中的沟通。而AI自动建议可能提升效率,但也可能削弱选民和官员间的信任。
- 研究动机与相关工作: 现有研究多关注基于语言模型的短语建议,而鲜有涉及完整信息回复草稿的自动生成。这项研究旨在探索句子级和信息级建议在人为主导的沟通中的权衡和适用场景。相关工作包括语言模型伦理、文字生成质量及政治沟通的技术影响。
解决方案
- 提出的解决方案: 开发名为“Dispatch”的在线平台,允许用户分别通过句子级和信息级建议模拟立法机关职员回复选民邮件的场景,并设计实验对比两种建议对用户写作过程的影响。
- 创新之处:
- 使用 GPT-3 分别生成句子级建议(针对邮件特定内容或续写当前草稿)和信息级建议(生成完整回复草稿)。
- 系统化比较两种建议对回复效率、用户满意度、文本质量及写作自主性的影响。
- 实施步骤与关键技术:
- 开发 Dispatch 平台,支持句子级和信息级建议(图像交互展示)。
- 使用 GPT-3 模型(text-davinci-002)生成建议内容。
- 从公开信件中选取内容作为选民邮件样本,并设计实验条件:无建议、句子级建议、信息级建议。
- 招募120名参与者模拟职员角色,完成任务并跟踪其行为,收集任务完成时间、编辑行为、对文本的修改等数据。
研究成果
- 具体成果:
- 信息级建议帮助参与者更快完成任务,平均用时为8.53分钟,远低于句子级建议的15.77分钟和无建议的16.4分钟。
- 信息级建议生成的回复被第三方评价为最有帮助,比句子级建议和完全人工回复更高。
- 句子级建议使参与者在撰写内容时保留更多自主性,最终回复中约49.4%为手动添加,与信息级建议中的24.25%相比明显更高。
- 与现有解决方案相比的优势:
- 信息级建议显著提升效率且能生成自然流畅的回复草稿。
- 句子级建议增强用户创造性和参与感,使其偏向人类主导的沟通过程。
- 实验或评估结果:
- 信息级建议生成的回复在词汇多样性和语法错误率均表现更优:其错误率为0.158/词,显著低于完全人工回复的0.176/词。
- 信息级建议的回复被认为比未经辅助的人工回复更有帮助,即使声明AI介入后也依旧高于句子级建议。
- 局限性与未来方向:
- 句子级建议生成的内容受限于上下文窗口,影响生成质量。
- 在政治沟通情境下,AI使用需谨慎,避免进一步破坏选民与官员间信任。
- 未来研究可以探索多样化推荐选项、更长文本的生成能力,以及对通信目标更个性化的支持。
设计启示
- AI建议的单元选择应根据任务需求灵活调整,不同沟通情境(例如私人生日留言与工作回复)可能需要不同建议形式。
- 提供多个备选建议可提升灵活性,但需避免过度冗余并确保候选建议多样性。
- 应关注模型生成结果质量和定制化能力,例如通过微调生成模式以适应特定语气或长度需求。
- 除文本建议外,可引入其他支持功能,例如帮助用户突出重点、提供主题背景信息或跟踪过往回复。
- 揭示AI协助的参与方式可能影响用户对回复的可信度,需在隐私与透明之间找到平衡点。
总结
这项研究通过实验证明了不同类型建议在AI介导写作中的独特作用,揭示了通信辅助技术如何影响效率、自主性及互动质量。此工作旨在为设计适应具体情境的沟通辅助系统提供经验和启示,并呼吁进一步探索大语言模型在跨领域和多语言场景中的应用潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在AI辅助写作中,句子级建议与消息级建议的效果有何不同?分类: 公众对 AI 的感知与算法责任同类问题arrow_forward
- 哪种建议形式(句子级或消息级)更有助于提高效率、用户满意度和交互质量?分类: 公众对 AI 的感知与算法责任同类问题arrow_forward
- 句子级建议如何在保持用户自主性的同时提供有效支持?分类: 公众对 AI 的感知与算法责任同类问题arrow_forward
lightbulb
现实痛点
1- 政府工作人员回应大量邮件高效性低并容易失去公众信任。分类: 公众对 AI 的感知与算法责任同类问题arrow_forward
- 100%
VAL:使用GPT对话解析进行交互式任务学习
CHI '24· 大语言模型(LLM)的人机协作 +1
- 100%
需要帮助吗?为编程设计主动型AI助手
CHI '25· 大语言模型(LLM)的人机协作 +1
- 80%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
行间阅读:建模AI辅助编程中的用户行为和成本
CHI '24· 大语言模型(LLM)的人机协作 +2
- 80%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 80%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
专业能力的新表现:软件工程师使用AI编码助手评估和展示编码专长
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581351
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文