协同更智能:利用教师认知多智能体大型语言模型框架增强人机协作评分

作者

SU

Sanskriti Uma

Geniebook
DD

Dio Dzaky Achmad Mustaqim

Geniebook
大语言模型(LLM)的人机协作智能辅导系统与学习分析用户研究方法(访谈、调查、观察)中小学教师(K-12)大学教授与研究人员在线课程设计师

基于评分标准的简答题开放式问题的自动评分经常处理不当部分学分、校准和可操作透明度,最终需要教师重新评估。这一挑战在资源受限环境中(例如教师有限但学生众多的情境)更加严重,导致学习效果较弱。为解决这一挑战,我们提出教师认知多智能体评分框架(TC-MAG),该框架通过锚定的大型语言模型智能体镜像教师的微步骤进行评分标准创建、指南检查、盲双重评分、仲裁和交叉检查以校准置信度。每个步骤都会产生简明解释以供针对性审查。我们首先进行了一项动机研究来为TC-MAG设计提供信息。接下来,我们在新加波2000名小学生针对1-4分数学问题的回答数据集上验证了TC-MAG框架的有效性,这些回答具有教师判定的黄金标签。TC-MAG达到了部署级可靠性(1分题目κ=0.968;2-4分题目二次加权κ=0.936),优于人类教师(Δκ=+0.063,p<.001)和最先进的语言模型基线(最小Δκ=+0.012,p<.001)。在混合方法教师研究(N=14;12.1年经验)中,解释格式和TC-MAG的置信度分数影响了教师是否将评分委托给TC-MAG。阶段性解释产生了更大的诊断性(LR+ 11.5 vs 4.60对于总结性解释),为基于置信度的解释渐进式披露策略提供了信息。总体而言,TC-MAG提供了可复制的多智能体框架和分类方法,可用于课堂部署,同时保留教师监督。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226570/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、智能辅导系统与学习分析、用户研究方法(访谈、调查、观察)
work
职业/产业
中小学教师(K-12)、大学教授与研究人员、在线课程设计师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文