神经透明性:用于预测模型行为的可解释性接口服务于个性化AI
数百万用户现在通过系统提示设计个性化基于LLM的聊天机器人来塑造日常交互,但能力有限,无法预见这些设计选择在部署时将如何表现为行为。这种不透明性后果重大:看似无害的提示可能引发过度谄媚、毒性或其他不良特征,损害实用性并引发安全问题。作为应对,我们引入了一种通过在聊天机器人人格设计期间暴露语言模型内部机制来实现神经透明性的接口。我们的方法通过计算引发对立行为的对比系统提示之间的神经激活差异来提取行为特征向量(共情、毒性、谄媚等)。我们通过将系统提示的最终标记激活投影到这些特征向量上来量化聊天机器人的人格,创建人格分数,然后进行跨特征归一化,并使用交互式旭日图进行可视化。为评估这一方法,我们进行了一项在线用户研究(N=80),将我们的神经透明性接口与没有透明性的基线聊天机器人接口进行比较。我们的分析表明,用户系统性地错误校准了AI行为:参与者在15个可分析特征中有11个误判了特征激活,这促使日常生活人机交互中需要透明性工具。虽然我们的接口没有改变设计迭代模式,但显著提高了用户信任度并受到热情欢迎。定性分析揭示了用户与可视化交互的细微体验,为未来工作建议了接口和交互改进。这项工作为如何将机械可解释性操作化以供非技术用户使用提供了一条路径,建立了更安全、更对齐的人机交互方法。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 75%
通过设计研究人工智能的可读性
CHI '20· 可解释人工智能(XAI) +2
- 75%
注意差异:设计师和标准在用户算法系统透明度方面的设计
CHI '24· 可解释人工智能(XAI) +2
- 75%
用户何时应该检查?多步骤智能体人工智能任务中确认频率的建模
CHI '26· AI 辅助决策与自动化系统 +2
- 75%
用户驱动算法审计中的意义建构:图像字幕模型性别偏见的案例研究
CHI '26· 可解释人工智能(XAI) +2
- 67%
代理音频主持人与人类在出声思考可用性测试中的对比
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 63%
可解释、可问责和可理解系统的趋势与轨迹:一项HCI研究议程
CHI '18· 可解释人工智能(XAI) +2
- 60%
计算机使用代理用户体验设计空间的映射
IUI '26· 大语言模型(LLM)的人机协作 +4
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)