多代理LLM接口中的意义建构:用户如何解读透明度和可信度线索
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)隐私设计与用户控制UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Sensemaking in Multi-Agent LLM Interfaces: How Users Interpret Transparency and Trustworthiness Cues
出版信息
- 研究领域: 用户对多代理大语言模型(LLM)界面中透明性和可信度的解读。
- 关键词: 多代理系统、透明性、可信度、LLM界面、用户心理模型、认知线索、信任校准、人机交互、设计驱动研究、界面设计。
背景与问题
- 问题与挑战: 当前AI系统中的透明性机制往往无法与用户对生成式LLM输出的解读和交互方式相契合,尤其是在多代理环境中。对于用户如何感知和评估这些系统的透明性和可信度的理解仍然有限。
- 重要性: 理解用户对多代理系统透明性的需求对于设计能够促进适当信任并支持有效决策的界面至关重要。
- 研究动机与相关工作: 之前的研究探讨了经典AI系统中的信任校准以及关于多代理LLM的初步研究,但这些研究较为分散,缺乏对用户如何解读多代理推理和透明性线索的系统性理解。本论文通过聚焦用户心理模型和对多代理透明性的偏好来填补这一空白。
解决方案
- 提出的方法: 采用设计驱动的定性比较结构化观察研究,使用五种多代理LLM界面变体来探索用户对透明性和可信度的感知。
- 创新点:
- 系统性地探索用户如何解读多代理推理和透明性线索。
- 将透明性重新概念化为一种情境敏感的充分性判断,而非简单的“信息量调节器”。
- 识别可见性、可解释性与认知负担之间的设计张力。
- 引入渐进式、按需透明性作为设计策略。
- 研究流程与关键技术:
- 通过文献综述定义多代理透明性的设计空间,识别七个设计维度。
- 开发五种界面变体(V1–V5),实现不同的透明性配置。
- 在实验室中对12名参与者进行面对面研究,采用“边思考边说”协议、卡片分类活动和半结构化访谈。
- 分析用户在两种任务类型(信息检索和逻辑推理)中的界面交互行为。
研究结果
- 具体发现:
- 用户将认知信号(例如分歧、批评、共识)解读为可信度的关键线索。
- 参与者倾向于“适中”的透明性水平,平衡信息价值与认知负担。
- 任务复杂性和用户专业知识影响透明性偏好,简单任务需要较少的可见性。
- 广泛需求渐进式、按需透明性以管理认知工作量。
- 相较基线的优势:
- 具有代理级推理解释的界面(如V3)被认为比不透明设计(如V1)更可信且更有帮助。
- 明确的批评(V4)和辩论(V5)通过展示系统“自我检查”增强了信任。
- 实验与评估:
- 参与者在两种任务(信息检索和推理)中与五种界面变体进行交互。
- 评估包括通过卡片分类活动对透明性、帮助性和可靠性的感知。
- 数据通过主题分析进行处理,以识别用户心理模型和透明性偏好。
- 局限性与未来工作:
- 研究任务是预定义且有限的,限制了对自发使用场景的探索。
- 测试的界面配置仅代表更广泛设计空间的一部分。
- 未来工作应研究代理错误场景中的透明性偏好,并在大规模环境中测试渐进式披露机制。
总结
本研究探讨了用户如何解读多代理LLM界面中的透明性和可信度。通过分析用户与五种界面变体的交互,作者识别了塑造信任感的关键认知线索(例如分歧、批评、共识)。透明性被重新概念化为一种情境敏感的充分性判断,用户倾向于渐进式、按需透明性以平衡认知负担与信息价值。任务复杂性、用户专业知识以及固有信任影响透明性需求。这些发现为设计可信赖、以人为中心的多代理AI系统提供了可操作的见解,并强调了未来对自适应透明性机制的研究需求。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
跨LLM聊天机器人用户报告风险的表征分析
CHI '26· 大语言模型(LLM)的人机协作 +3
- 86%
AI与我的价值观:用户对LLM从休闲对话中提取、体现和解释人类价值观能力的看法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
表征网页浏览 GUI 智能体的非预期后果
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
设计负责任的人工智能:适应UX实践以应对负责任的人工智能挑战
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
注意差异:设计师和标准在用户算法系统透明度方面的设计
CHI '24· 可解释人工智能(XAI) +2
- 71%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
友好而非朋友:大语言模型谄媚性如何影响用户信任
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
LLM中的个人验证效应:积极AI响应虚构预测的有效性、可靠性、个性化与有用性偏见
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
AI 记忆差距:用户误记他们用 AI 或不用 AI 创建的内容
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
将大型语言模型呈现为伙伴会影响人们归因于它们的心智能力
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791157
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、隐私设计与用户控制
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文