AI of Oz:利用人工智能辅助人工Moderator增强人机交互中的Wizard of Oz研究
作者
大语言模型(LLM)的人机协作用户研究方法(访谈、调查、观察)原型设计与用户测试HCI 研究员AI/ML 研究员与工程师
文献标题
AI of Oz: Enhancing Wizard of Oz Studies in HCI with AI Assistance for Human Moderation
出版信息
- 主题领域: 人机交互(HCI)中基于人工智能辅助的“奥兹巫师”研究框架。
- 关键词: 奥兹巫师、人机交互、AI调控、大型语言模型、人机代理交互、认知负荷、响应延迟、心理健康、敏感性检测、对话代理。
背景与问题
- 问题/挑战: 传统的奥兹巫师(WoZ)方法在HCI研究中对人类调控者施加了较高的认知负荷,导致响应延迟,并在处理敏感或复杂交互时面临困难。目前的AI解决方案(如大型语言模型,LLMs)可能生成带有偏见、通用或有害的内容,使得完全自动化不可取。
- 意义: 改进WoZ方法对于推动HCI研究至关重要,特别是在心理健康等敏感领域,自然且安全的交互至关重要。
- 动机与相关研究: 之前的研究探索了基于众包和半自动化的WoZ系统,但这些方法面临高延迟、不一致性和运营成本等挑战。近期将LLMs整合到WoZ设置中的研究显示出一定潜力,但缺乏对支持调控者工作流程和决策的关注。
解决方案
- 提出的方法: AI of Oz,一种AI辅助的WoZ系统,集成了LLMs以支持人类调控者,通过检测敏感输入、生成响应建议以及实时总结对话。
- 创新点:
- 开发了一个模块化的AI辅助WoZ系统,具备检测、响应和总结功能。
- 重新定义巫师角色为调控者,而非单纯内容生成者。
- 在心理健康背景下实证评估系统对工作流程、认知负荷和决策的影响。
- 引入了“人类在环”(HOTL)协作模型,用于可扩展且伦理合规的人机交互研究。
- 流程与关键技术:
- 检测模块: 将用户输入分类为不同敏感级别(绿色、黄色、红色),以标记关键消息。
- 响应模块: 根据对话历史和预定义角色生成上下文相关的回复建议。
- 总结模块: 提供实时对话摘要,帮助调控者保持对话背景。
- 系统架构包括一个基于网页的界面,支持实时监控、响应审查和干预功能。
结果
- 具体发现:
- 对敏感消息的响应延迟从84.95秒(无AI支持)减少到40.75秒(完全AI支持)。
- NASA-TLX评分显示,在AI模块激活时,心理工作负荷、努力程度和挫败感显著降低。
- 信任评分在响应模块激活时显著提高,特别是在能力和仁慈维度上。
- 技术接受模型(TAM)评分表明,在完全AI条件下,用户对系统的感知有用性、易用性和行为意图更高。
- 相较基线的优势:
- 响应模块在减少认知负荷和响应延迟方面始终优于无AI支持的条件。
- 检测和响应模块的组合实现了最高的可用性和信任评分。
- 实验/评估:
- 一项针对20名研究生的被试内实验评估了系统在四种条件下(有/无检测和响应模块)的表现。
- 评估指标包括响应延迟、NASA-TLX工作负荷评分、信任(HCTS)、可用性(SUS)和技术接受度(TAM)。
- 角色扮演场景聚焦于心理健康对话,包含脚本化输入和预定义压力级别。
- 局限性与未来工作:
- 角色扮演设置可能缺乏现实性;未来研究应涉及真实用户和领域专家。
- 与其他WoZ系统(如基于众包的方法)的比较有限。
- 研究重点在GPT-4o;未来工作可探索其他先进LLMs以提升性能。
- 样本量仅为研究生群体;需要更广泛的研究以提高普适性。
总结
本文提出了AI of Oz,一种利用大型语言模型支持人类调控者的AI辅助奥兹巫师系统。该系统通过实时检测敏感输入、生成上下文相关响应以及总结对话,显著降低了认知负荷和响应延迟。一项针对20名研究者的用户研究表明,在响应模块激活时任务效率、可用性和信任度显著提升。尽管研究重点在心理健康场景,该框架在教育、电子商务及其他需要人机协作的领域具有潜在应用价值。未来工作将解决现实性、可扩展性和模型比较方面的局限性,以优化和扩展系统的适用性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
探索巫师之路:人机交互中Oz方法的系统综述
CHI '26· 参与式设计(Participatory Design) +3
- 83%
实验室中评估生成式AI:方法论挑战与指南
IUI '26· 生成式AI(文本、图像、音乐、视频) +3
- 83%
从叙事到数字:利用大语言模型评估调查问卷
IUI '26· 大语言模型(LLM)的人机协作 +2
- 83%
Rationalizer:利用大语言模型支持用户为Likert量表问卷评分提供理由
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
Evalet: 通过功能碎片化评估大型语言模型
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791324
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文