Policy Maps:引导大型语言模型无界行为的工具

可解释人工智能(XAI)算法透明度与可审计性算法公平与偏见AI/ML 研究员与工程师隐私政策制定者HCI 研究员

人工智能政策为人工智能模型的行为划定了可接受的边界,但在大型语言模型的背景下这是一项挑战:如何确保对广阔行为空间的覆盖?我们引入了政策地图,这是一种受物理地图绘制实践启发的 AI 政策设计方法。政策地图不追求全面覆盖,而是通过有意的设计选择来帮助有效导航——决定要捕捉哪些方面以及哪些方面需要抽象。借助 Policy Projector 这一用于设计 LLM 政策地图的交互式工具,AI 从业者可以概览模型输入输出的全貌,定义自定义区域(如「暴力」),并使用可作用于 LLM 输出的条件策略规则导航这些区域(例如,如果输出包含「暴力」和「图形细节」,则重写去除「图形细节」)。Policy Projector 支持使用 LLM 分类和引导进行交互式策略创作,并提供反映 AI 从业者工作的地图可视化。我们通过 12 名 AI 安全专家的评估表明,我们的系统可以帮助策略设计师制定针对问题模型行为的策略,如错误的性别假设和即时物理安全威胁的处理。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206991/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747680
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、算法透明度与可审计性、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、隐私政策制定者、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文