角色分配:人机协作决策中大语言模型角色原型研究

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责医生、护士、临床医生精神科医生与心理咨询师AI/ML 研究员与工程师

文献标题

Who Does What? Archetypes of Roles Assigned to LLMs During Human-AI Decision-Making

出版信息

  • 主题领域: 人类与大型语言模型(LLM)在决策互动中的社会技术模式。
  • 关键词: 大型语言模型,人类参与决策,角色原型,社会技术系统,可解释性,认知强迫,群体动态,人工智能角色,人类与人工智能协作。

背景与问题

  • 问题/挑战: 当前对LLM的评估主要集中在静态基准和孤立能力上,忽略了在人类实际决策工作流程中的社会技术动态。
  • 重要性: 理解这些动态对于设计负责任且高效的人类与LLM系统至关重要,尤其是在医疗和金融等高风险领域。
  • 动机与相关研究: 现有研究强调了LLM的幻觉、过度依赖和偏见问题,但缺乏全面的框架来分析LLM如何融入决策过程。本论文基于可解释性、提示工程和社会技术系统的相关研究来填补这些空白。

解决方案

  • 提出的方法: 引入“人类与LLM角色原型”框架——定义人类与LLM在决策中的角色和互动模式的重复性社会技术模式。
  • 创新点:
    1. 通过对113篇决策相关文献的主题分析,开发了17种独特的人类与LLM角色原型分类法。
    2. 在临床诊断案例研究中对角色原型进行了实证评估,比较了其对LLM输出(如准确性、一致性、解释质量)的影响。
    3. 确定了七个关键设计维度,包括决策控制、认知过程和社会定位。
  • 流程与关键技术:
    1. 对113篇文献进行了范围审查以识别角色原型。
    2. 基于角色、互动模式和社会技术因素对角色原型进行了主题分析。
    3. 将角色原型应用于临床决策任务,使用GPT-4o系统性地改变提示以评估其对准确性、一致性和解释质量的影响。
    4. 将研究结果综合为人类与LLM系统的可操作设计指南。

结果

  • 具体发现:
    • 角色承担者模型裁判这样的角色原型表现出不同的准确性(例如,裁判积极: 95%,裁判消极: 87%)。
    • 解释质量因角色原型而异,沟通者的输出可读性更高(Flesch得分: 61.4),而外部解释者的输出可读性较低(Flesch得分: 19.8)。
    • 一致性率取决于角色原型特定的提示,例如参考判断和社会角色(例如,第二意见积极: 60%一致性)。
  • 相较基线的优势:
    • 证明角色原型对决策关键维度(准确性、一致性、解释复杂性)的影响超越了静态基准评估。
    • 突出了角色原型选择中的权衡,例如平衡认知负担与决策控制。
  • 实验/评估:
    • 任务: 从放射学报告中诊断肺栓塞。
    • 数据集: 从INSPECT电子健康记录数据集中抽样的100份报告(50例阳性,50例阴性)。
    • 评估指标: 准确性、敏感性、特异性、ROUGE得分、可读性得分。
    • 模型: 通过Azure Government端点查询的GPT-4o。
  • 局限性与未来工作:
    • 仅限于一个模型(GPT-4o)和单一决策任务。
    • 用于解释质量的自动化指标可能无法完全捕捉人类感知的准确性或实用性。
    • 未来工作应探索更多角色原型、领域以及定性用户研究。

摘要

本文通过对113篇文献的范围审查,提出了17种人类与LLM角色原型分类法,以分析决策中的社会技术互动模式。一项临床案例研究展示了角色原型选择如何影响LLM输出,包括准确性、一致性和解释质量。研究确定了七个关键设计维度,如决策控制和认知过程,这些维度影响了人类与LLM系统的有效性和适用性。这些发现为设计负责任且情境敏感的人类与人工智能决策框架提供了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222977/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791428
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文