LLM 输出对启发式诱导提示结构的脆弱性

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员数据科学家与分析师

大型语言模型已成为日常生活中不可或缺的工具。尽管 LLM 应用已在各个领域快速扩展,但扭曲的输出(特别是偏见和幻觉)仍是威胁基于 LLM 的人工智能代理可靠性的未解决问题。专注于内部机制和社会偏见,先前研究很少考虑从具有特定输入模式的非恶意、普通提示中诱导扭曲的可能性。本研究实证调查了暴露于某些提示结构的 LLM 是否能诱导通常在人类中引发的偏见,即代表性启发式、锚定启发式和框架启发式。为此,我们构建了一个触发三种启发式之一的测试集,并评估了最先进的 LLM 的输出。我们进一步检查了提示工程和去偏见干预的有效性。LLM 在某些提示条件下继续产生启发式衍生的偏见输出。锚定启发式的发生率显著高于随机水平,而代表性和框架启发式则取决于模型和提示结构。去偏见干预显著减少了代表性启发式,但对锚定和框架启发式影响有限。本研究强调需要增强对 LLM 输出针对特定提示的脆弱性的认识。它还揭示了典型的提示工程策略对此类提示结构提供了不足的保护。这些结果将有助于在人机交互和 AI 部署中安全有效地使用 LLM。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226666/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文