协同更智能:利用教师认知多智能体大型语言模型框架增强人机协作评分
作者
基于评分标准的简答题开放式问题的自动评分经常处理不当部分学分、校准和可操作透明度,最终需要教师重新评估。这一挑战在资源受限环境中(例如教师有限但学生众多的情境)更加严重,导致学习效果较弱。为解决这一挑战,我们提出教师认知多智能体评分框架(TC-MAG),该框架通过锚定的大型语言模型智能体镜像教师的微步骤进行评分标准创建、指南检查、盲双重评分、仲裁和交叉检查以校准置信度。每个步骤都会产生简明解释以供针对性审查。我们首先进行了一项动机研究来为TC-MAG设计提供信息。接下来,我们在新加波2000名小学生针对1-4分数学问题的回答数据集上验证了TC-MAG框架的有效性,这些回答具有教师判定的黄金标签。TC-MAG达到了部署级可靠性(1分题目κ=0.968;2-4分题目二次加权κ=0.936),优于人类教师(Δκ=+0.063,p<.001)和最先进的语言模型基线(最小Δκ=+0.012,p<.001)。在混合方法教师研究(N=14;12.1年经验)中,解释格式和TC-MAG的置信度分数影响了教师是否将评分委托给TC-MAG。阶段性解释产生了更大的诊断性(LR+ 11.5 vs 4.60对于总结性解释),为基于置信度的解释渐进式披露策略提供了信息。总体而言,TC-MAG提供了可复制的多智能体框架和分类方法,可用于课堂部署,同时保留教师监督。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
向自动化反馈教师话语以促进教师学习
CHI '20· 智能辅导系统与学习分析 +1
- 83%
绘制基于项目的AI学习的未来:与学生的共同设计探索
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
解锁科学概念:LLM生成的类比对学生理解和课堂实践的有效性如何?
CHI '25· 大语言模型(LLM)的人机协作 +1
- 71%
OATutor:一个开源的自适应辅导系统和精心策划的内容库,用于学习科学的研究
CHI '23· 编程教育与计算思维 +2
- 71%
ClassMeta:设计互动虚拟同学以促进VR课堂参与
CHI '24· VR 中的社交与协作 +2
- 71%
VIVID:人类与AI协作从讲座视频中创作替代对话
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
TutorCraftEase: 使用大型语言模型提升教学问题设计
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
TeachTune: 使用模拟学生针对多样化的学习者档案审查教学代理
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
EvaluAId:开放性学生论文的人机协作评估
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
探索块式编程中教师与聊天机器人的交互及情感
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)