迈向人机审议:设计和评估用于AI辅助决策的LLM增强审议AI
荣誉提名作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI/ML 研究员与工程师HCI 研究员
研究背景与问题
-
发现的挑战
- 传统的AI辅助决策系统提供固定建议,用户只能选择接受或拒绝,限制了与AI的互动,尤其在存在分歧时。
- 用户对AI建议的依赖可能导致过度信任(over-reliance)或完全忽视(under-reliance),最终影响决策质量。
- 当前系统未能充分处理和解决人类与AI在决策理由上的部分一致性和分歧。
-
重要性
- 在医疗诊断、投资决策和犯罪司法等关键领域,AI的决策支持已被广泛应用,但其准确性和透明度的不足会带来严重后果。
- 更好的人机协作可能提升团队决策的整体绩效,也有助于解决现实应用中的伦理和公平性问题。
-
研究动机与相关工作
- 研究借鉴了人类审议理论和"权重证据(Weight of Evidence, WoE)"框架,旨在引入AI和用户之间的更深入互动以改进用户的批判性思维与信任。
- 当前的可解释AI(XAI)主要通过展示模型解释来简化AI决策过程,但对于通过动态讨论和冲突解决提升AI辅助决策的研究仍较少。
解决方案
-
提出的方法 本文提出了“人机审议(Human-AI Deliberation)”框架,并开发了核心组件“审议型AI(Deliberative AI)”,其基于大语言模型(LLMs)实现动态交互,旨在解决人类与AI观点不一致的问题。
-
创新点
- 支持维度级意见表达和更新:人机双方可以对特定维度(如偏好权重)进行交流、调整,而非仅接受或拒绝AI整体建议。
- 鼓励动态与结构化讨论:设计适合人机协作的对话接口,支持相互质疑、证据检验和观点更新。
- 整合LLMs与领域模型(Domain-Specific Models, DS Models):借助LLMs实现自然语言交互,而领域模型确保了可靠和精确的信息提供。
-
实施步骤和技术
- 思想表达与对齐:利用领域模型的SHAP解释生成维度特征对决策的权重(Weight of Evidence, WoE)。用户也需明确表示自己在每个维度上的观点。
- 人机讨论:系统通过LLMs识别人类意图和对维度的质疑,引导对话,自动调用领域模型提取具体证据(如数据分布、全局相关性)。
- 观点更新:借助公式将用户的论点强度与AI的不确定性量化,从而动态调整AI的观点并更主动回应。
- 界面设计:开发直观的交互界面支持维度级细化讨论、更新整体决策以及查看摘要。
研究成果
-
具体成果
- 通过在研究任务“研究生录取评估”中的应用,Human-AI Deliberation显著提高了双方协作中的决策准确性。
- 比起传统的Explainable AI(XAI),该方法能有效减少对错误AI建议的过度依赖,同时减少因AI不可靠解释而产生的无效行为。
-
实验表现与优势
- 实验表明,与传统XAI相比,“审议型AI”提高了参与者决策准确率(准确率从52.4%提升到59.8%)。
- 减少过度信任(over-reliance):过度信任比例在传统系统中为65%,而该方法降至47%。
- 任务复杂性未显著增加,同时用户对AI的深度互动和人机协作过程表示肯定。
-
局限性与未来方向
- 情境与任务适用性:本研究任务(研究生录取案例)基于合成数据集,可能与实际高风险决策存在差距。
- 体验与满意度:某些用户反馈认为讨论过程冗长,增加了决策负担,需要优化输入模块和对话生成速度。
- 对多模态数据任务的适用性:当前研究主要针对表格式数据,未来需探索适用于图像或文本分析任务的扩展方案,例如通过视觉-语言模型。
- 道德与透明性:用户对AI观点更新的机制透明性存疑,未来需更明确展现AI调整依据。
总结
本文提出的“人机审议”框架为AI辅助决策提供了一种全新视角,将动态、细化的用户参与和AI交互引入关键领域。在实验中验证了显著提升决策质量的潜力,并初步探索用户对审议型AI的看法。未来研究需进一步扩展任务多样性和优化人机交互效率,以适应更广泛的实际应用场景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 传统AI决策支持系统在面对人机观点不一致时是否存在改进的可能?分类: AI 决策支持与依赖行为同类问题arrow_forward
- 如何通过动态讨论和冲突解决的方式,增强人类与AI的决策协作?分类: AI 决策支持与依赖行为同类问题arrow_forward
- 融入大语言模型后的人机协作框架能否降低用户对AI错误建议的过度依赖?分类: AI 决策支持与依赖行为同类问题arrow_forward
lightbulb
现实痛点
1- AI决策系统不能解决人机观点不一致,影响决策质量。分类: AI 决策支持与依赖行为同类问题arrow_forward
- 100%
人类与AI交互中沟通方向性和AI代理差异的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 100%
人工智能知识:通过人类赋能提升人工智能委托
CHI '23· 大语言模型(LLM)的人机协作 +1
- 100%
交互强化学习综述:设计原则与开放挑战
DIS '20· 大语言模型(LLM)的人机协作 +1
- 80%
你使我完整:人类-人工智能团队与互补专长
CHI '22· 大语言模型(LLM)的人机协作 +1
- 80%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
从文本到信任:利用自适应LLM驱动分析增强AI辅助决策
CHI '25· 大语言模型(LLM)的人机协作 +2
- 80%
哪些贡献值得认可?人类与AI共同创作中的归属感认知
CHI '25· 大语言模型(LLM)的人机协作 +2
- 80%
提示词写作中的满足倾向与最大化倾向:人机交互中的特质与任务效应
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713423
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文