大语言模型在人类机器人交互中的心智理论能力:一种幻觉?

电肌肉刺激(EMS)控制脑机接口(BCI)与神经反馈大语言模型(LLM)的人机协作AI 辅助决策与自动化系统UI/UX 设计师AI/ML 研究员与工程师HCI 研究员

大语言模型在各种自然语言生成任务中展现了卓越的生成能力。然而,对其拟人化倾向和失败案例的宽容态度推动了关于大语言模型新兴能力的讨论,特别是心智理论(ToM)能力。虽然存在多种错误信念测试来验证推断和维持他人心理模型的能力,但我们研究了一种更高风险且可能产生不可逆后果的ToM应用:人类机器人交互。在这项工作中,我们探索感知行为识别任务,其中机器人使用大语言模型以类似于人类观察者的方式评估其生成的行为。我们关注四种行为类型:可解释性、可读性、可预测性和模糊性行为,这些行为已被广泛用于合成可解释的机器人行为。大语言模型的目标是作为人类在循环中的代理,回答人类会如何感知某个智能体行为的问题。我们进行了一项人类受试者研究,以验证用户在五个领域的特定情境(机器人设置和计划)中能够正确回答此类问题。对信念测试的初步分析显示出极其积极的结果, inflate了人们对大语言模型具备ToM能力的期望。然后,我们提出并执行了一套扰动测试,揭示了这一幻觉,即不一致信念、无信息上下文和信念测试。我们得出结论,大语言模型在普通提示下的高分展示了其在人机交互设置中的潜在用途,但要真正具备心智理论能力,需要对上下文中琐碎或无关的扰动保持不变,而这正是大语言模型所缺乏的。我们报告了在GPT-4和GPT-3.5-turbo上的结果。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/152458/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
电肌肉刺激(EMS)控制、脑机接口(BCI)与神经反馈、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文