可编辑XAI:面向可解释属性的双向人机对齐与协同可编辑解释

可解释人工智能(XAI)AI 辅助决策与自动化系统AI/ML 研究员与工程师HCI 研究员

文献标题

Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes

出版信息

  • 主题领域: 可编辑的基于规则的可解释人工智能(XAI)用于人机对齐。
  • 关键词: 可编辑XAI、人机对齐、CoExplain、决策树、神经符号学习、交互式机器学习、可解释人工智能、用户研究、可解释属性、双向协作。

背景与问题

  • 问题/挑战: 传统的可解释人工智能(XAI)系统提供静态的、只读的解释,限制了用户纠正AI错误或将AI推理与其领域知识对齐的能力。这导致持续的错位并妨碍理解。
  • 重要性: 在医学和金融等高风险领域中,领域知识至关重要,解决这一限制对于提高信任、可用性和对齐性至关重要。
  • 动机与相关工作: 现有XAI研究主要集中在单向通信(如显著性图、事后解释)或交互式解释,但不允许用户修改AI的推理。可编辑XAI旨在通过可编辑的解释实现双向对齐,弥补这一空白。

解决方案

  • 提出的方法: CoExplain是一个用于可编辑XAI的神经符号框架,允许用户阅读、编写和增强基于规则的解释,从而实现人机协作对齐。
  • 创新点:
    1. 可编辑的解释允许用户通过决策树规则直接修改AI推理。
    2. AI辅助用户编写的规则进行增强,包括阈值优化和拓扑重组。
    3. 集成神经符号方法,将决策树与神经网络对齐,实现双向协作。
    4. 提供支持直观规则编辑和AI指导增强的用户界面。
  • 流程与关键技术:
    1. 阅读: 将神经网络预测提炼为可解释的决策树规则。
    2. 编写: 将用户编写的决策树规则解析为神经网络表示。
    3. 增强: AI通过优化阈值和拓扑结构改进用户规则,同时保留用户意图。
    4. 正则化技术确保用户定义规则与AI优化模型之间的对齐。

结果

  • 具体发现:
    • 可编辑的解释显著提高了用户与AI的忠实度(用户理解准确率高达93.9%)。
    • CoExplain将编辑工作量减少了53%,所需操作次数(9次对比14次)和迭代次数(1.59次对比3.62次)显著降低。
    • CoExplain在保持与用户规则对齐的同时,实现了接近最佳的AI性能(预训练数据上的准确率为69.9%)。
  • 相较基线的优势:
    • 可编辑和CoExplain解释在用户理解和对齐方面优于只读解释。
    • CoExplain在对齐和性能之间实现了更好的平衡,与用户规则的对齐度更高且编辑次数更少。
  • 实验/评估:
    • 对43名参与者进行用户研究,涵盖三个任务(成人收入预测、房价预测、心脏病预测)。
    • 评估指标:用户与AI的忠实度、AI准确率、对齐度(树编辑距离)、编辑工作量和用户感知评分。
    • CoExplain在易用性方面获得了高度评价(89.74%的用户接受AI增强)和对齐性。
  • 局限性与未来工作:
    • 当前实现仅限于结构化数据和决策树规则。
    • 未来工作可以扩展可编辑XAI到非结构化数据、更大规模模型以及领域特定表示(如方程式、模块化子模型)。

总结

本文提出了CoExplain,一个用于可编辑XAI的神经符号框架,通过可编辑的决策树解释,帮助用户将AI推理与其领域知识协作对齐。CoExplain支持规则的阅读、编写和增强,利用神经符号方法确保双向对齐。用户研究表明,CoExplain提高了用户理解,减少了编辑工作量,并在保持接近最佳AI性能的同时实现了对齐。这些发现突显了可编辑解释在促进更高效、更有效的人机协作中的潜力,未来工作将致力于将该方法推广到更广泛的领域和数据类型。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223218/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791375
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文