“非默认”行为调整:利用大语言模型自播和自改进指定规范外模型行为

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)AI/ML 研究员与工程师HCI 研究员数据科学家与分析师

指定模型行为具有挑战性——尤其是当期望行为与模型训练数据相比不受欢迎时。逆转大规模训练语料的影响既耗时又昂贵,且此类干预通常最终用户无法访问。虽然大语言模型(LLM)使使用自然语言编写指令更容易,但指定不受欢迎的行为仍然是困难的任务。我们引入了Undefault,一个人在循环框架,结合自播和自改进以更好地指定此类行为。我们的系统使用户能够通过自播识别受欢迎(但不受欢迎)的模型行为,然后通过在自改进循环中优化提示词迭代引导模型走向首选替代方案。我们的第一个评估涉及在聊天机器人行为情境中实施Undefault系统的用户研究。我们的系统通过模拟用户交互进行自播以识别模式,并基于模式创建有效提示词。在被试内研究(N=12)中,参与者通过自播识别了更多模式并制作了更好的提示词。令人惊讶的是,用户在指定模型行为时感到成功水平有所不同。跟进众包研究(N=60)确认聊天机器人遵守指令且未牺牲质量。我们的第二个评估是使用Undefault在电影评分数据集上的真实世界实施案例研究,证明了其在建模从低到高评分范围内影评人偏好的有效性和鲁棒性。这些结果共同表明了AI如何改进交互AI系统的设计过程。此外,它们表明这些工具的益处对最终用户可能并不明显。我们反思这些发现并提出未来方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226656/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文