开放式结构化问题评估中的人机协作
大语言模型(LLM)的人机协作智能辅导系统与学习分析参与式设计(Participatory Design)原型设计与用户测试大学教授与研究人员在线课程设计师
文献标题
Open-ended Structured Question Assessment with Human-LLM Collaboration
出版信息
- 主题领域: 教育评估中的AI辅助评分系统
- 关键词: 开放式结构化问题,大型语言模型,人机协作,教育评估,评分效率,评分点分析,上下文学习,可解释性,迭代优化,教师反馈
背景与问题
- 问题/挑战: 对开放式结构化问题(OSQ)的评分需要细粒度的评分点级别分析,这是一项劳动密集型任务。现有的自动化或人机协作系统缺乏对评分点级别的检查、修正和反馈集成的支持。
- 重要性: 准确且可扩展的OSQ评分对于评估学生的推理和表达能力、确保公平性以及减轻教师工作负担至关重要。
- 动机与相关工作: 现有系统主要关注整体答案的评分,缺乏透明性、可解释性以及对教师反馈的适应性。本文通过引入一个专为细粒度OSQ评分设计的系统来填补这一空白。
解决方案
- 提出的方法: VeriGrader,一个用于OSQ评分的人机协作系统,通过交互式界面将基于LLM的评分与教师反馈相结合。
- 创新点:
- 使用链式思维提示和上下文学习实现可解释的评分点级别评分。
- 提供多视图界面,高效验证答案片段、评分点和评分理由。
- 利用教师反馈对LLM评分行为进行迭代优化。
- 流程与关键技术:
- 将学生答案分段并映射到预定义的评分点。
- 将答案片段分类为正确、错误或不明确,并附上评分理由。
- 通过交互式界面让教师审阅、重新标注并确认评分结果。
- 使用确认结果作为示例,迭代提升LLM性能。
结果
- 具体发现:
- VeriGrader将评分时间减少了56.3%(从每个OSQ的3.82分钟降至1.67分钟),准确率提高了5.6%(从86.26%提升至91.86%)。
- LLM在独立评分中表现出较高的准确率(数据结构OSQ为89.5%,数值方法OSQ为89.2%)。
- 少量示例提升了平均准确率2.7%,最终通过人工审阅将准确率提升至95%。
- 相较基线的优势:
- 在效率和准确性上均优于人工评分。
- 与人工评分和仅LLM评分相比,提高了评分者间的一致性。
- 实验/评估:
- 用户研究:12名参与者对30份学生答案进行评分,涵盖两个OSQ。
- 评估指标:F1分数(准确性)、每个OSQ的评分时间(效率)、片段匹配率(PMR)、评分者间一致性(Fleiss’ Kappa、ICC、Gwet’s AC1)。
- 局限性与未来工作:
- 对非结构化或多模态答案(如图表、公式)的适用性有限。
- 处理模糊或信息密集型答案时存在挑战。
- 在多教师工作流中解决冲突性反馈的需求。
- 未来方向包括多模态评估、更广泛的问题类型以及容错评估指标的开发。
总结
VeriGrader是一个旨在解决开放式结构化问题(OSQ)评分挑战的人机协作系统。通过利用LLM进行细粒度的答案分段和评分,并通过交互式界面集成教师反馈,该系统提高了评分效率、准确性和一致性。用户研究表明,该系统在性能上显著优于人工评分,展示了其在可扩展和公平教育评估中的潜力。未来工作将专注于扩展至多模态和非结构化答案的适用性,以及优化多教师工作流。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
协同设计 Ripplet:一个基于教师工作流概念模型的 LLM 辅助评估题目创作系统
CHI '26· 大语言模型(LLM)的人机协作 +3
- 86%
情境化的想象:与计算机科学教学助理共同设计 AI 未来
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
从答案引擎到学习伙伴:AI 辅助学习的双 ZPD 设计框架
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
设计支架卡片以促进基于LLM的苏格拉底式教学:响应策略支持学习的探索性研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
EvaluAId:开放性学生论文的人机协作评估
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
SimStep:通过任务级抽象的人机协作交互式教育模拟创作
CHI '26· 智能辅导系统与学习分析 +2
- 67%
课堂仿真:在线教育中构建情境学生生成代理以模拟学习行为
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
好篱笆造就好学习:自主语言学习者如何权衡LLM委托决策
CHI '26· 大语言模型(LLM)的人机协作 +1
- 67%
AskNow:一个用于大规模课堂实时问答的LLM驱动交互系统
CHI '26· 大语言模型(LLM)的人机协作 +1
- 67%
AI赋能数学教育:利用情境感知AI支持大规模数学课程中的教师
CHI '26· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791034
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、智能辅导系统与学习分析、参与式设计(Participatory Design)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、在线课程设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文