迈向人机审议:设计和评估用于AI辅助决策的LLM增强审议AI

荣誉提名
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 发现的挑战

    1. 传统的AI辅助决策系统提供固定建议,用户只能选择接受或拒绝,限制了与AI的互动,尤其在存在分歧时。
    2. 用户对AI建议的依赖可能导致过度信任(over-reliance)或完全忽视(under-reliance),最终影响决策质量。
    3. 当前系统未能充分处理和解决人类与AI在决策理由上的部分一致性和分歧。
  • 重要性

    • 在医疗诊断、投资决策和犯罪司法等关键领域,AI的决策支持已被广泛应用,但其准确性和透明度的不足会带来严重后果。
    • 更好的人机协作可能提升团队决策的整体绩效,也有助于解决现实应用中的伦理和公平性问题。
  • 研究动机与相关工作

    • 研究借鉴了人类审议理论和"权重证据(Weight of Evidence, WoE)"框架,旨在引入AI和用户之间的更深入互动以改进用户的批判性思维与信任。
    • 当前的可解释AI(XAI)主要通过展示模型解释来简化AI决策过程,但对于通过动态讨论和冲突解决提升AI辅助决策的研究仍较少。

解决方案

  • 提出的方法 本文提出了“人机审议(Human-AI Deliberation)”框架,并开发了核心组件“审议型AI(Deliberative AI)”,其基于大语言模型(LLMs)实现动态交互,旨在解决人类与AI观点不一致的问题。

  • 创新点

    1. 支持维度级意见表达和更新:人机双方可以对特定维度(如偏好权重)进行交流、调整,而非仅接受或拒绝AI整体建议。
    2. 鼓励动态与结构化讨论:设计适合人机协作的对话接口,支持相互质疑、证据检验和观点更新。
    3. 整合LLMs与领域模型(Domain-Specific Models, DS Models):借助LLMs实现自然语言交互,而领域模型确保了可靠和精确的信息提供。
  • 实施步骤和技术

    1. 思想表达与对齐:利用领域模型的SHAP解释生成维度特征对决策的权重(Weight of Evidence, WoE)。用户也需明确表示自己在每个维度上的观点。
    2. 人机讨论:系统通过LLMs识别人类意图和对维度的质疑,引导对话,自动调用领域模型提取具体证据(如数据分布、全局相关性)。
    3. 观点更新:借助公式将用户的论点强度与AI的不确定性量化,从而动态调整AI的观点并更主动回应。
    4. 界面设计:开发直观的交互界面支持维度级细化讨论、更新整体决策以及查看摘要。

研究成果

  • 具体成果

    1. 通过在研究任务“研究生录取评估”中的应用,Human-AI Deliberation显著提高了双方协作中的决策准确性。
    2. 比起传统的Explainable AI(XAI),该方法能有效减少对错误AI建议的过度依赖,同时减少因AI不可靠解释而产生的无效行为。
  • 实验表现与优势

    • 实验表明,与传统XAI相比,“审议型AI”提高了参与者决策准确率(准确率从52.4%提升到59.8%)。
    • 减少过度信任(over-reliance):过度信任比例在传统系统中为65%,而该方法降至47%。
    • 任务复杂性未显著增加,同时用户对AI的深度互动和人机协作过程表示肯定。
  • 局限性与未来方向

    1. 情境与任务适用性:本研究任务(研究生录取案例)基于合成数据集,可能与实际高风险决策存在差距。
    2. 体验与满意度:某些用户反馈认为讨论过程冗长,增加了决策负担,需要优化输入模块和对话生成速度。
    3. 对多模态数据任务的适用性:当前研究主要针对表格式数据,未来需探索适用于图像或文本分析任务的扩展方案,例如通过视觉-语言模型。
    4. 道德与透明性:用户对AI观点更新的机制透明性存疑,未来需更明确展现AI调整依据。

总结

本文提出的“人机审议”框架为AI辅助决策提供了一种全新视角,将动态、细化的用户参与和AI交互引入关键领域。在实验中验证了显著提升决策质量的潜力,并初步探索用户对审议型AI的看法。未来研究需进一步扩展任务多样性和优化人机交互效率,以适应更广泛的实际应用场景。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188842/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713423
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文