神经透明性:用于预测模型行为的可解释性接口服务于个性化AI

可解释人工智能(XAI)AI 辅助决策与自动化系统算法透明度与可审计性隐私设计与用户控制用户研究方法(访谈、调查、观察)AI/ML 研究员与工程师UI/UX 设计师HCI 研究员

数百万用户现在通过系统提示设计个性化基于LLM的聊天机器人来塑造日常交互,但能力有限,无法预见这些设计选择在部署时将如何表现为行为。这种不透明性后果重大:看似无害的提示可能引发过度谄媚、毒性或其他不良特征,损害实用性并引发安全问题。作为应对,我们引入了一种通过在聊天机器人人格设计期间暴露语言模型内部机制来实现神经透明性的接口。我们的方法通过计算引发对立行为的对比系统提示之间的神经激活差异来提取行为特征向量(共情、毒性、谄媚等)。我们通过将系统提示的最终标记激活投影到这些特征向量上来量化聊天机器人的人格,创建人格分数,然后进行跨特征归一化,并使用交互式旭日图进行可视化。为评估这一方法,我们进行了一项在线用户研究(N=80),将我们的神经透明性接口与没有透明性的基线聊天机器人接口进行比较。我们的分析表明,用户系统性地错误校准了AI行为:参与者在15个可分析特征中有11个误判了特征激活,这促使日常生活人机交互中需要透明性工具。虽然我们的接口没有改变设计迭代模式,但显著提高了用户信任度并受到热情欢迎。定性分析揭示了用户与可视化交互的细微体验,为未来工作建议了接口和交互改进。这项工作为如何将机械可解释性操作化以供非技术用户使用提供了一条路径,建立了更安全、更对齐的人机交互方法。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226589/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统、算法透明度与可审计性、隐私设计与用户控制
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
7 篇相关论文