Policy Maps:引导大型语言模型无界行为的工具
作者
可解释人工智能(XAI)算法透明度与可审计性算法公平与偏见AI/ML 研究员与工程师隐私政策制定者HCI 研究员
人工智能政策为人工智能模型的行为划定了可接受的边界,但在大型语言模型的背景下这是一项挑战:如何确保对广阔行为空间的覆盖?我们引入了政策地图,这是一种受物理地图绘制实践启发的 AI 政策设计方法。政策地图不追求全面覆盖,而是通过有意的设计选择来帮助有效导航——决定要捕捉哪些方面以及哪些方面需要抽象。借助 Policy Projector 这一用于设计 LLM 政策地图的交互式工具,AI 从业者可以概览模型输入输出的全貌,定义自定义区域(如「暴力」),并使用可作用于 LLM 输出的条件策略规则导航这些区域(例如,如果输出包含「暴力」和「图形细节」,则重写去除「图形细节」)。Policy Projector 支持使用 LLM 分类和引导进行交互式策略创作,并提供反映 AI 从业者工作的地图可视化。我们通过 12 名 AI 安全专家的评估表明,我们的系统可以帮助策略设计师制定针对问题模型行为的策略,如错误的性别假设和即时物理安全威胁的处理。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
表达方式会影响决策吗?探讨AI解释语气对决策制定的影响
CHI '25· 可解释人工智能(XAI) +2
- 71%
访问 denied:定量算法审计的有意义的数据访问
CHI '25· 可解释人工智能(XAI) +2
- 71%
走钢丝般的透明度:基础模型数据透明度的风险与收益分类法(为透明度倡导者)
CHI '26· 可解释人工智能(XAI) +2
- 67%
探索的路径,遗漏的路径,模糊的路径:端到端数据分析中的决策点与选择性报告
CHI '20· 可解释人工智能(XAI) +1
- 67%
操纵和测量模型可解释性
CHI '21· 可解释人工智能(XAI) +1
- 67%
每个人都想做模型工作,而不是数据工作:高风险人工智能中的数据级联
CHI '21· 可解释人工智能(XAI) +1
- 67%
共享兴趣:测量人机对齐以识别模型行为中的重复模式
CHI '22· 可解释人工智能(XAI) +1
- 67%
去偏CAM以减轻图像扰动并提供机器学习的忠实可视化解释
CHI '22· 可解释人工智能(XAI) +1
- 67%
文本分类中的公平性评估:机器学习从业者对个体和群体公平性的看法
CHI '23· 可解释人工智能(XAI) +1
- 67%
对机器学习中多重性公平影响的认知
CHI '25· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747680
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、算法透明度与可审计性、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、隐私政策制定者、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文