揭示聊天机器人的治理原则:一项工作台与比较研究

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责算法透明度与可审计性会话代理的人格与拟人化AI/ML 研究员与工程师UI/UX 设计师HCI 研究员

文献标题

Surfacing Governing Principles for Chatbots: A Workbench and Comparative Study

出版信息

  • 主题领域: 通过基于原则的工作流对LLM驱动的聊天机器人进行治理和配置。
  • 关键词: 聊天机器人治理, 原则编写, LLMs, Trust Mediator, 人工智能对齐, 人机交互, 聊天机器人评估, 原则一致性, 原则具体性, 原则覆盖范围。

背景与问题

  • 问题/挑战: 现有的聊天机器人治理工具通常将原则视为孤立的规则,缺乏支持将原则作为一个连贯集合进行推理的功能。这限制了在原则组合时检测冗余、矛盾或行为影响的能力。
  • 重要性: 对LLM驱动的聊天机器人的信任依赖于其行为是否由清晰、可操作的原则所治理,这些原则需与组织价值观和用户期望保持一致。解决原则集合治理的空白可以提高聊天机器人的可靠性和可信度。
  • 动机与相关工作: 先前在人工智能治理和人机交互领域的研究探讨了原则作为高层次承诺或操作性要求的作用,但这些研究通常未能将原则与逐回合的聊天机器人行为联系起来。像EvalLM这样的工具专注于根据标准评估提示,但不支持多原则协调。本文通过将原则集合视为治理的连贯工件来填补这一空白。

解决方案

  • 提出的方法: Trust Mediator (TM),一个用于编写、构建和评估LLM驱动聊天机器人治理原则的工作台。
  • 创新点:
    1. 将原则集合视为连贯的工件,支持整体检查和修订。
    2. 引入基于LLM的框架,用于基于角色的查询生成、原则提取、冲突检测和原则评估。
    3. 通过比较有无特定原则的聊天机器人行为,支持原则的迭代优化。
    4. 对手动和辅助原则编写工作流进行实证比较。
  • 流程和关键技术:
    • 基于角色的查询建议,用于模拟多样化的用户交互。
    • 从用户反馈中提取原则,利用LLM生成候选原则。
    • 自动检测原则之间的冲突或重叠。
    • 使用定制查询、评分标准和对比聊天机器人响应评估原则。

结果

  • 具体发现:
    • 手动编写产生了更具体的原则(SI20: 9.36 vs. 7.24, p = 0.037)。
    • 辅助编写在认知、情感和组织维度上扩大了覆盖范围(覆盖家庭: 2.8 vs. 1.9, δ = 0.83)。
    • 手动条件下的一致性得分略高(CI20: 17.50 vs. 17.16),但未达到统计显著性。
    • 两种条件均提高了聊天机器人评估得分,手动编写显示出稍大的改进(1.13 vs. 0.64)。
  • 相较基线的优势:
    • 辅助编写扩展了所关注问题的范围,尤其是情感保障方面。
    • 手动编写促进了操作清晰性并减少了冗余。
  • 实验/评估:
    • 一项12名参与者(每种条件6人)的组间研究比较了手动和辅助工作流。
    • 指标包括原则具体性(SI20)、覆盖范围(家庭)、一致性(CI20)和聊天机器人评估得分。
    • 数据来源包括编写的原则、会话日志和主观调查反馈。
  • 局限性与未来工作:
    • 样本量较小限制了结果的普适性。
    • 研究时长(30分钟会话)可能无法反映长期治理工作流。
    • 参与者并非所用聊天机器人的服务所有者。
    • 未来工作应探索结合手动和辅助编写的分阶段工作流,并在真实世界服务环境中进行测试。

总结

本文介绍了Trust Mediator,一个用于编写和评估LLM驱动聊天机器人治理原则的工作台。研究比较了手动和辅助工作流,发现手动编写促进了原则的具体性和操作清晰性,而辅助编写扩大了覆盖范围并包含更多情感保障。两种方法均改善了聊天机器人的行为,突出了它们的互补优势。研究结果建议采用整合手动和辅助方法的分阶段工作流,强调原则既是操作性要求,也是沟通承诺。未来工作应在更大规模的真实环境中探索这些工作流,以增强聊天机器人的治理能力和可信度。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222360/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790612
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文