通过交互式解释接口提升人类对大语言模型推理的验证能力

大语言模型(LLM)的人机协作可解释人工智能(XAI)原型设计与用户测试大学教授与研究人员AI/ML 研究员与工程师HCI 研究员

大语言模型的推理能力导致它们在几个关键应用中得到越来越多的使用,特别是在教育领域,它们支持问题解决、辅导和个性化学习。虽然有大量研究表明大语言模型通过思维链推理在推理基准测试中生成逐步解决方案的有效性,但对于生成的思维链是否有助于最终用户提高理解数学推理问题和检测大语言模型生成解决方案中的错误/幻觉的能力,我们知之甚少。为了填补这一空白并为理解推理如何改善人-AI互动做出贡献,我们提出了三种新的交互式推理接口:交互式思维链(iCoT)、交互式思维程序(iPoT)和交互式图(iGraph),以及一个将大语言模型推理从传统思维链转换为替代交互式格式的新框架。在125名参与者中,我们发现交互式接口显著改善了性能。具体而言,iGraph接口产生了最高的清晰度和错误检测率(85.6%),其次是iPoT(82.5%)和iCoT(80.6%),均优于标准思维链(73.5%)。交互式接口还带来了更快的响应时间,其中使用iGraph的参与者最快(57.9秒),而iCoT和iPoT为60秒,标准思维链基线为64.7秒。此外,参与者更偏好iGraph推理接口,引用其卓越的使用户能够跟随大语言模型推理过程的能力。我们讨论了这些结果的启示,并为未来推理模型的设计提供建议。该项目的代码和接口可在此处找到:https://github.com/Runtaozhou/Interactive-CoT。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226670/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文