AI of Oz:利用人工智能辅助人工Moderator增强人机交互中的Wizard of Oz研究

大语言模型(LLM)的人机协作用户研究方法(访谈、调查、观察)原型设计与用户测试HCI 研究员AI/ML 研究员与工程师

文献标题

AI of Oz: Enhancing Wizard of Oz Studies in HCI with AI Assistance for Human Moderation

出版信息

  • 主题领域: 人机交互(HCI)中基于人工智能辅助的“奥兹巫师”研究框架。
  • 关键词: 奥兹巫师、人机交互、AI调控、大型语言模型、人机代理交互、认知负荷、响应延迟、心理健康、敏感性检测、对话代理。

背景与问题

  • 问题/挑战: 传统的奥兹巫师(WoZ)方法在HCI研究中对人类调控者施加了较高的认知负荷,导致响应延迟,并在处理敏感或复杂交互时面临困难。目前的AI解决方案(如大型语言模型,LLMs)可能生成带有偏见、通用或有害的内容,使得完全自动化不可取。
  • 意义: 改进WoZ方法对于推动HCI研究至关重要,特别是在心理健康等敏感领域,自然且安全的交互至关重要。
  • 动机与相关研究: 之前的研究探索了基于众包和半自动化的WoZ系统,但这些方法面临高延迟、不一致性和运营成本等挑战。近期将LLMs整合到WoZ设置中的研究显示出一定潜力,但缺乏对支持调控者工作流程和决策的关注。

解决方案

  • 提出的方法: AI of Oz,一种AI辅助的WoZ系统,集成了LLMs以支持人类调控者,通过检测敏感输入、生成响应建议以及实时总结对话。
  • 创新点:
    1. 开发了一个模块化的AI辅助WoZ系统,具备检测、响应和总结功能。
    2. 重新定义巫师角色为调控者,而非单纯内容生成者。
    3. 在心理健康背景下实证评估系统对工作流程、认知负荷和决策的影响。
    4. 引入了“人类在环”(HOTL)协作模型,用于可扩展且伦理合规的人机交互研究。
  • 流程与关键技术:
    • 检测模块: 将用户输入分类为不同敏感级别(绿色、黄色、红色),以标记关键消息。
    • 响应模块: 根据对话历史和预定义角色生成上下文相关的回复建议。
    • 总结模块: 提供实时对话摘要,帮助调控者保持对话背景。
    • 系统架构包括一个基于网页的界面,支持实时监控、响应审查和干预功能。

结果

  • 具体发现:
    • 对敏感消息的响应延迟从84.95秒(无AI支持)减少到40.75秒(完全AI支持)。
    • NASA-TLX评分显示,在AI模块激活时,心理工作负荷、努力程度和挫败感显著降低。
    • 信任评分在响应模块激活时显著提高,特别是在能力和仁慈维度上。
    • 技术接受模型(TAM)评分表明,在完全AI条件下,用户对系统的感知有用性、易用性和行为意图更高。
  • 相较基线的优势:
    • 响应模块在减少认知负荷和响应延迟方面始终优于无AI支持的条件。
    • 检测和响应模块的组合实现了最高的可用性和信任评分。
  • 实验/评估:
    • 一项针对20名研究生的被试内实验评估了系统在四种条件下(有/无检测和响应模块)的表现。
    • 评估指标包括响应延迟、NASA-TLX工作负荷评分、信任(HCTS)、可用性(SUS)和技术接受度(TAM)。
    • 角色扮演场景聚焦于心理健康对话,包含脚本化输入和预定义压力级别。
  • 局限性与未来工作:
    • 角色扮演设置可能缺乏现实性;未来研究应涉及真实用户和领域专家。
    • 与其他WoZ系统(如基于众包的方法)的比较有限。
    • 研究重点在GPT-4o;未来工作可探索其他先进LLMs以提升性能。
    • 样本量仅为研究生群体;需要更广泛的研究以提高普适性。

总结

本文提出了AI of Oz,一种利用大型语言模型支持人类调控者的AI辅助奥兹巫师系统。该系统通过实时检测敏感输入、生成上下文相关响应以及总结对话,显著降低了认知负荷和响应延迟。一项针对20名研究者的用户研究表明,在响应模块激活时任务效率、可用性和信任度显著提升。尽管研究重点在心理健康场景,该框架在教育、电子商务及其他需要人机协作的领域具有潜在应用价值。未来工作将解决现实性、可扩展性和模型比较方面的局限性,以优化和扩展系统的适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222411/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791324
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文