用户何时应该检查?多步骤智能体人工智能任务中确认频率的建模
作者
AI 辅助决策与自动化系统可解释人工智能(XAI)用户研究方法(访谈、调查、观察)AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
文献标题
When Should Users Check? Modeling Confirmation Frequency in Multi-Step Agentic AI Tasks
出版信息
- 主题领域: 优化多步骤AI任务中用户确认的时机。
- 关键词: Agentic AI, 用户确认, 错误处理, 决策理论模型, 人机交互, CDCR模式, 确认调度, 任务效率, 用户监督, 混合主动系统。
背景与问题
- 问题/挑战: 当前的AI代理通常依赖于“最终确认”策略,这种策略容易导致错误级联和高昂的重新执行成本。逐步确认可以避免这些问题,但效率低下。在这两种极端之间找到平衡仍然是一个未解决的挑战。
- 重要性: 长期任务中的错误可能导致显著的时间、金钱和环境成本。高效地安排用户确认可以提高任务的可靠性和用户体验,同时降低这些成本。
- 动机与相关工作: 之前的HCI研究主要关注用户控制和错误恢复,但很少涉及在代理主导的工作流中何时进行干预。可靠性工程提供了关于检查时机的模型,但主要关注经济成本,而非用户体验。本文通过对代理AI任务中的确认时机建模,弥合了这些研究之间的空白。
解决方案
- 提出的方法: 提出一种决策理论模型,用于在多步骤AI任务中安排用户确认,以最小化任务完成时间,同时确保正确性。
- 创新点:
- 从形成性研究中识别出“确认–诊断–修正–重做(CDCR)”模式。
- 开发一个数学模型,根据用户交互成本和代理准确性优化确认时机。
- 通过实证验证表明中间确认减少了任务完成时间,并获得了用户的强烈偏好。
- 将确认调度框架化为用户监督系统中的混合主动设计机会。
- 流程和关键技术:
- 通过8名参与者的形成性研究,识别用户行为模式和偏好。
- 开发一个包含状态空间、动作空间和转移函数的随机决策过程模型。
- 设计一个动态规划算法,用于计算最佳确认检查点。
- 通过一项涉及48名参与者的跨三个任务领域(购物、图像编辑、Overcooked)的组内研究验证模型。
结果
- 具体发现:
- 中间确认将任务完成时间减少了13.54%(平均减少35.84秒)。
- 确认频率因错误位置而异,早期错误的节省最大(约29%)。
- 中间确认将重做时间减少了22%,诊断时间减少了17%。
- 相较基线的优势:
- 强烈的用户偏好:**81%**的参与者更喜欢中间确认而非最终确认。
- 相较于最终确认策略,降低了认知负担并提高了错误检测能力。
- 在模拟中,与基于概率的确认策略相比,表现相当或更优。
- 实验/评估:
- 组内研究涉及48名参与者,涵盖三个任务领域(购物、图像编辑、Overcooked)。
- 在固定执行时间和错误率的模拟环境中,隔离确认频率的影响。
- 定量指标(完成时间、确认、诊断、重做)和定性反馈(用户偏好、感知)。
- 局限性与未来工作:
- 当前模型仅关注时间成本;未来工作可纳入现实成本、安全性和信任校准。
- 参数个性化有限;未来系统可动态适应个体用户行为。
- 需要更好地与用户对任务重要性和难度的感知对齐。
总结
本文提出了一种用于优化多步骤AI任务中用户确认时机的决策理论模型,解决了自主性与控制之间的权衡问题。形成性研究识别了CDCR模式,为模型设计提供了依据。通过48名参与者的验证研究表明,中间确认将任务完成时间减少了13.54%,并获得了用户的强烈偏好(81%)。该模型为增强代理AI系统中的用户监督提供了一种可扩展的解决方案,并有潜力扩展以纳入更广泛的成本因素、安全性和信任动态。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
代理音频主持人与人类在出声思考可用性测试中的对比
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 75%
神经透明性:用于预测模型行为的可解释性接口服务于个性化AI
IUI '26· 可解释人工智能(XAI) +4
- 75%
计算机使用代理用户体验设计空间的映射
IUI '26· 大语言模型(LLM)的人机协作 +4
- 71%
通过设计研究人工智能的可读性
CHI '20· 可解释人工智能(XAI) +2
- 71%
重新审视人类与AI交互的独特设计难度及其原因
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 71%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
整体情绪会影响信任吗?情绪在人与智能体交互背景下对信任的中介效应
DIS '21· 会话代理的人格与拟人化 +2
- 71%
教学-学习交互:智能系统中支持反思性用户主体性的交互设计新概念
DIS '21· 大语言模型(LLM)的人机协作 +2
- 71%
用户如何看待混合主动AI:问题解决中协助的态度研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
整体是否超过其部分?AI解释对互补团队绩效的影响
CHI '21· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790655
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
AI 辅助决策与自动化系统、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文