LLM 输出对启发式诱导提示结构的脆弱性
大型语言模型已成为日常生活中不可或缺的工具。尽管 LLM 应用已在各个领域快速扩展,但扭曲的输出(特别是偏见和幻觉)仍是威胁基于 LLM 的人工智能代理可靠性的未解决问题。专注于内部机制和社会偏见,先前研究很少考虑从具有特定输入模式的非恶意、普通提示中诱导扭曲的可能性。本研究实证调查了暴露于某些提示结构的 LLM 是否能诱导通常在人类中引发的偏见,即代表性启发式、锚定启发式和框架启发式。为此,我们构建了一个触发三种启发式之一的测试集,并评估了最先进的 LLM 的输出。我们进一步检查了提示工程和去偏见干预的有效性。LLM 在某些提示条件下继续产生启发式衍生的偏见输出。锚定启发式的发生率显著高于随机水平,而代表性和框架启发式则取决于模型和提示结构。去偏见干预显著减少了代表性启发式,但对锚定和框架启发式影响有限。本研究强调需要增强对 LLM 输出针对特定提示的脆弱性的认识。它还揭示了典型的提示工程策略对此类提示结构提供了不足的保护。这些结果将有助于在人机交互和 AI 部署中安全有效地使用 LLM。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
复数系统:通过模拟社交群体引导大语言模型的系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
对话语言模型交互中过度依赖的行为指标
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
设计负责任的人工智能:适应UX实践以应对负责任的人工智能挑战
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
“我认为负责任AI不适用于我的模型”——通过黏性故事吸引非 champion 参与负责任AI工作
CHI '26· AI 伦理、公平与问责 +2
- 71%
感知问卷遗漏之处:通过用户建模理解并个性化主动式LLM支持
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
红队测试LLM作为社会技术实践:从探索与数据创建到评估
CHI '26· 可解释人工智能(XAI) +2
- 71%
负责任数据科学行为干预措施的效果评估
CHI '26· AI 伦理、公平与问责 +2
- 71%
多任务人机交互中的信念更新与委托:以受控模拟为证据
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
多智能体议价中人与人工智能的战略权衡
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)