揭示聊天机器人的治理原则:一项工作台与比较研究
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责算法透明度与可审计性会话代理的人格与拟人化AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
文献标题
Surfacing Governing Principles for Chatbots: A Workbench and Comparative Study
出版信息
- 主题领域: 通过基于原则的工作流对LLM驱动的聊天机器人进行治理和配置。
- 关键词: 聊天机器人治理, 原则编写, LLMs, Trust Mediator, 人工智能对齐, 人机交互, 聊天机器人评估, 原则一致性, 原则具体性, 原则覆盖范围。
背景与问题
- 问题/挑战: 现有的聊天机器人治理工具通常将原则视为孤立的规则,缺乏支持将原则作为一个连贯集合进行推理的功能。这限制了在原则组合时检测冗余、矛盾或行为影响的能力。
- 重要性: 对LLM驱动的聊天机器人的信任依赖于其行为是否由清晰、可操作的原则所治理,这些原则需与组织价值观和用户期望保持一致。解决原则集合治理的空白可以提高聊天机器人的可靠性和可信度。
- 动机与相关工作: 先前在人工智能治理和人机交互领域的研究探讨了原则作为高层次承诺或操作性要求的作用,但这些研究通常未能将原则与逐回合的聊天机器人行为联系起来。像EvalLM这样的工具专注于根据标准评估提示,但不支持多原则协调。本文通过将原则集合视为治理的连贯工件来填补这一空白。
解决方案
- 提出的方法: Trust Mediator (TM),一个用于编写、构建和评估LLM驱动聊天机器人治理原则的工作台。
- 创新点:
- 将原则集合视为连贯的工件,支持整体检查和修订。
- 引入基于LLM的框架,用于基于角色的查询生成、原则提取、冲突检测和原则评估。
- 通过比较有无特定原则的聊天机器人行为,支持原则的迭代优化。
- 对手动和辅助原则编写工作流进行实证比较。
- 流程和关键技术:
- 基于角色的查询建议,用于模拟多样化的用户交互。
- 从用户反馈中提取原则,利用LLM生成候选原则。
- 自动检测原则之间的冲突或重叠。
- 使用定制查询、评分标准和对比聊天机器人响应评估原则。
结果
- 具体发现:
- 手动编写产生了更具体的原则(SI20: 9.36 vs. 7.24, p = 0.037)。
- 辅助编写在认知、情感和组织维度上扩大了覆盖范围(覆盖家庭: 2.8 vs. 1.9, δ = 0.83)。
- 手动条件下的一致性得分略高(CI20: 17.50 vs. 17.16),但未达到统计显著性。
- 两种条件均提高了聊天机器人评估得分,手动编写显示出稍大的改进(1.13 vs. 0.64)。
- 相较基线的优势:
- 辅助编写扩展了所关注问题的范围,尤其是情感保障方面。
- 手动编写促进了操作清晰性并减少了冗余。
- 实验/评估:
- 一项12名参与者(每种条件6人)的组间研究比较了手动和辅助工作流。
- 指标包括原则具体性(SI20)、覆盖范围(家庭)、一致性(CI20)和聊天机器人评估得分。
- 数据来源包括编写的原则、会话日志和主观调查反馈。
- 局限性与未来工作:
- 样本量较小限制了结果的普适性。
- 研究时长(30分钟会话)可能无法反映长期治理工作流。
- 参与者并非所用聊天机器人的服务所有者。
- 未来工作应探索结合手动和辅助编写的分阶段工作流,并在真实世界服务环境中进行测试。
总结
本文介绍了Trust Mediator,一个用于编写和评估LLM驱动聊天机器人治理原则的工作台。研究比较了手动和辅助工作流,发现手动编写促进了原则的具体性和操作清晰性,而辅助编写扩大了覆盖范围并包含更多情感保障。两种方法均改善了聊天机器人的行为,突出了它们的互补优势。研究结果建议采用整合手动和辅助方法的分阶段工作流,强调原则既是操作性要求,也是沟通承诺。未来工作应在更大规模的真实环境中探索这些工作流,以增强聊天机器人的治理能力和可信度。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 75%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 75%
我的聊天机器人是否有议程?理解类人聊天机器人交互中的人类与人工智能主体性
CHI '26· 会话代理的人格与拟人化 +2
- 75%
氛围检查:理解基于 LLM 的对话代理人格与对齐对目标导向任务中用户感知的影响
CHI '26· 会话代理的人格与拟人化 +2
- 67%
谁控制对话?用户对生成式AI(LLM)系统提示的看法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
反应性写作者:与AI协作写作如何改变我们的想法参与方式
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
设计反馈:理解并克服对话智能体中用户反馈障碍
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
人们最关心哪种人工智能?一项关于道德考虑的联合实验
CHI '24· 会话代理的人格与拟人化 +2
- 63%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 60%
“它成为了我的伙伴,但我敢于反对”:UX 评估员与对话式 AI 助手协作的多会话研究
CHI '26· 大语言模型(LLM)的人机协作 +4
- 60%
ORAgent 寓言:推进内容归属的设计与管理
CHI '26· 生成式AI(文本、图像、音乐、视频) +4
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790612
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文