通过交互式解释接口提升人类对大语言模型推理的验证能力
作者
大语言模型的推理能力导致它们在几个关键应用中得到越来越多的使用,特别是在教育领域,它们支持问题解决、辅导和个性化学习。虽然有大量研究表明大语言模型通过思维链推理在推理基准测试中生成逐步解决方案的有效性,但对于生成的思维链是否有助于最终用户提高理解数学推理问题和检测大语言模型生成解决方案中的错误/幻觉的能力,我们知之甚少。为了填补这一空白并为理解推理如何改善人-AI互动做出贡献,我们提出了三种新的交互式推理接口:交互式思维链(iCoT)、交互式思维程序(iPoT)和交互式图(iGraph),以及一个将大语言模型推理从传统思维链转换为替代交互式格式的新框架。在125名参与者中,我们发现交互式接口显著改善了性能。具体而言,iGraph接口产生了最高的清晰度和错误检测率(85.6%),其次是iPoT(82.5%)和iCoT(80.6%),均优于标准思维链(73.5%)。交互式接口还带来了更快的响应时间,其中使用iGraph的参与者最快(57.9秒),而iCoT和iPoT为60秒,标准思维链基线为64.7秒。此外,参与者更偏好iGraph推理接口,引用其卓越的使用户能够跟随大语言模型推理过程的能力。我们讨论了这些结果的启示,并为未来推理模型的设计提供建议。该项目的代码和接口可在此处找到:https://github.com/Runtaozhou/Interactive-CoT。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 86%
Criticality:基于交互式批判性思维与循证推理痕迹的决策支持脚手架
IUI '26· 大语言模型(LLM)的人机协作 +3
- 71%
HCI中LLM集成系统的报告与评审:挑战与考量
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
大语言模型还是人类?研究摘要的信任与质量感知研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
Cocoa:与AI智能体的协作规划与协同执行
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
学术问答系统中大语言模型错误评估的专家模式
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
Minor Revisions接受:AI辅助科学写作的价值
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
交互式机器学习中可控性与认知负荷的多模态研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
相关的:利用现有相关工作部分构建文献综述
CHI '23· 可解释人工智能(XAI) +1
- 67%
交互式知识获取中避免过拟合的用户建模方法
IUI '18· 大语言模型(LLM)的人机协作 +1
- 67%
DxHF:通过交互式分解为LLM对齐提供高质量人类反馈
UIST '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)