装傻以求聪明:在大学计算机科学课程中创建和评估基于LLM的教学代理
作者
研究背景与问题
-
作者发现了哪些问题或挑战?
学生在学习编程时通过 "学习-教学" (Learning by Teaching, LBT) 方法可以有效加深理解,但传统基于人类的学习-教学存在规模限制和可能错误地强化误解的风险。因此,需要一个由大型语言模型(LLM)驱动的可教代理,以模拟非专家的学习者角色并拓展LBT的实践范围。 -
为什么这个问题很重要?
LBT不仅能帮助学生巩固知识,还能促进主动学习、辨别知识缺陷和提升编程态度。然而,实施这一方法的工具通常依赖人类资源甚至专家资源,使得此类方法难以普及到规模较大的教育环境中。此外,学生传统上使用LLM作为知识提供工具,但当前尚缺乏研究将其作为“可教学习者”的潜力和长效影响。 -
研究动机与相关工作
现有工作表明,通过让AI或机器人充当教学对象可以改善学生的学习效果,且LLM通过其生成对话能力显然具备模拟学习者角色的潜力。然而,在长时间的课程环境中,基于LLM的学习-教学的影响还需要更多实证研究。
解决方案
-
作者提出了哪些方法或解决方案?
本研究设计并评估了一种基于LLM的可教代理工具——MatlabTutee,通过链式推理(Chain-of-Thought)提示引导LLM模拟非专家学习者角色,以促进学生的学习-教学体验。同时比较其与人类假扮非专家的行为,并探索这种系统在真实大学计算机科学课程中的长期使用效果。 -
该解决方案的创新之处是什么?
- 使用简单的链式推理提示来控制LLM生成教学对话,而无需复杂的知识状态模拟。
- 整合多个故意错误和典型非专家的表现方式,以保持学习者角色的一致性。
- 将该系统与传统LLM和人类假扮学习者直接比较,以量化其可教代理性能和学生交互方式。
-
实施步骤是什么?使用了哪些关键技术?
- 初步设计与评估:开发初步提示,通过单日实验观察学生与LLM或人类助手的交互。
- 链式推理优化:根据反馈调整提示以引入链式推理方法,并测试其生成错误代码和错误解释的能力。
- 全面比较实验:将MatlabTutee与同类人类和传统LLM进行为期一周的结构化比较实验,分析交互质量、学生行为及认知负荷。
- 长期使用研究:进行两项为期一个月的纵向实验(部分控制和完全不控制),评估学生在真实教学场景中对系统的自主采用情况,及其长时间效果。
研究成果
-
取得了哪些具体成果?
- MatlabTutee能够成功模拟非专家学习者角色,其智力水平被学生认为与假装无知的专家人类相似。
- 学生通过与MatlabTutee互动,能够发现知识缺陷、真实评估自身能力,并改善对计算机科学的积极态度。
-
与现有解决方案相比,它有哪些优势?
- MatlabTutee相比传统的GPT模型,更能促进学生主动参与学习,而非简单地从AI获取答案。
- 它的交互模式与人类学习者类似,能够更加有效地激发学习-教学过程中的主动知识构建和深度反思。
-
实验或评估结果是什么?
- 在受控条件下,MatlabTutee的学习-教学体验与人类相似,能引发学生主动的教学行为,例如解释、推理及深度学习。相比之下,传统GPT模型更多用于知识检索,导致学生的学习行为偏被动。
- 在长时间实验中,大多数学生尽管认识到系统的潜在益处,却因错误反馈和课程冲突减少了使用频率,平均交互时间较短。
-
局限性与未来方向
- MatlabTutee在长时间交互中表现为“学习速度过快”,引发部分学生的不信任,需进一步优化模拟学习轨迹设计。
- 学生对教学错误的反应两极化,可能影响系统的持续使用,未来可探索更具动力性的设计以提高反馈接受度。
- 纵向实验显示学生自主采用率较低,需结合课程目标或评分机制以推动更广泛的系统整合。
总结与讨论
- 本研究展示了链式推理提示在构建简单但有效的LLM可教代理中的潜力,但也暴露出学生自然使用意图不足、对错误反馈敏感及系统模拟学习轨迹不一致等挑战。
- 面向未来的开放问题包括如何在透明性和学习轨迹定制化之间保持平衡;如何在教学交互中提供建设性但不会削弱动力的反馈;以及如何扩大学生对这类系统的长期自律性使用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何使用大语言模型(LLM)模拟非专家学习者以改进“通过教学学习”(LBT)方法的应用?分类: LLM学习支架与反思支持同类问题arrow_forward
- 设计基于LLM的可教学代理有哪些创新性方法能增强学生的教学体验?分类: LLM学习支架与反思支持同类问题arrow_forward
- 在实际编程课程中引入基于LLM的LBT工具将对学生的学习行为和长期学习效果产生什么影响?分类: LLM学习支架与反思支持同类问题arrow_forward
现实痛点
1- 学生缺乏可扩展且高效的工具来实践“通过教学学习”方法。分类: LLM学习支架与反思支持同类问题arrow_forward
- 100%
探索AI生成代码认知参与技术的设计空间以增强学习
IUI '25· 大语言模型(LLM)的人机协作 +1
- 80%
DBox:通过学习者-LLM 共同分解构建算法编程学习
CHI '25· 大语言模型(LLM)的人机协作 +2
- 80%
LingoQ:通过AI生成的工作相关测验弥合EFL学习与工作之间的差距
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
从代码生成到概念学习:学生在网页编程课程中使用大型语言模型的研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
探索程序综合工具对初学者的可学习性
UIST '22· 大语言模型(LLM)的人机协作 +1
- 60%
CodeAid:评估基于LLM的编程助手在课堂部署中平衡学生和教育者需求的情况
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
BIDTrainer:一种基于大规模语言模型的教育工具,用于提高对生物启发设计的理解和推理能力
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
教AI如何编码:使用大型语言模型作为可教学代理进行编程教育
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
PromptHive:通过协作提示工程将主题专家重新置于教育内容创作的前沿
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
人类如何用自然语言交流编程任务以及这对使用大语言模型的终端用户编程的启示
CHI '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)