开放式结构化问题评估中的人机协作

大语言模型(LLM)的人机协作智能辅导系统与学习分析参与式设计(Participatory Design)原型设计与用户测试大学教授与研究人员在线课程设计师

文献标题

Open-ended Structured Question Assessment with Human-LLM Collaboration

出版信息

  • 主题领域: 教育评估中的AI辅助评分系统
  • 关键词: 开放式结构化问题,大型语言模型,人机协作,教育评估,评分效率,评分点分析,上下文学习,可解释性,迭代优化,教师反馈

背景与问题

  • 问题/挑战: 对开放式结构化问题(OSQ)的评分需要细粒度的评分点级别分析,这是一项劳动密集型任务。现有的自动化或人机协作系统缺乏对评分点级别的检查、修正和反馈集成的支持。
  • 重要性: 准确且可扩展的OSQ评分对于评估学生的推理和表达能力、确保公平性以及减轻教师工作负担至关重要。
  • 动机与相关工作: 现有系统主要关注整体答案的评分,缺乏透明性、可解释性以及对教师反馈的适应性。本文通过引入一个专为细粒度OSQ评分设计的系统来填补这一空白。

解决方案

  • 提出的方法: VeriGrader,一个用于OSQ评分的人机协作系统,通过交互式界面将基于LLM的评分与教师反馈相结合。
  • 创新点:
    1. 使用链式思维提示和上下文学习实现可解释的评分点级别评分。
    2. 提供多视图界面,高效验证答案片段、评分点和评分理由。
    3. 利用教师反馈对LLM评分行为进行迭代优化。
  • 流程与关键技术:
    • 将学生答案分段并映射到预定义的评分点。
    • 将答案片段分类为正确、错误或不明确,并附上评分理由。
    • 通过交互式界面让教师审阅、重新标注并确认评分结果。
    • 使用确认结果作为示例,迭代提升LLM性能。

结果

  • 具体发现:
    • VeriGrader将评分时间减少了56.3%(从每个OSQ的3.82分钟降至1.67分钟),准确率提高了5.6%(从86.26%提升至91.86%)。
    • LLM在独立评分中表现出较高的准确率(数据结构OSQ为89.5%,数值方法OSQ为89.2%)。
    • 少量示例提升了平均准确率2.7%,最终通过人工审阅将准确率提升至95%。
  • 相较基线的优势:
    • 在效率和准确性上均优于人工评分。
    • 与人工评分和仅LLM评分相比,提高了评分者间的一致性。
  • 实验/评估:
    • 用户研究:12名参与者对30份学生答案进行评分,涵盖两个OSQ。
    • 评估指标:F1分数(准确性)、每个OSQ的评分时间(效率)、片段匹配率(PMR)、评分者间一致性(Fleiss’ Kappa、ICC、Gwet’s AC1)。
  • 局限性与未来工作:
    • 对非结构化或多模态答案(如图表、公式)的适用性有限。
    • 处理模糊或信息密集型答案时存在挑战。
    • 在多教师工作流中解决冲突性反馈的需求。
    • 未来方向包括多模态评估、更广泛的问题类型以及容错评估指标的开发。

总结

VeriGrader是一个旨在解决开放式结构化问题(OSQ)评分挑战的人机协作系统。通过利用LLM进行细粒度的答案分段和评分,并通过交互式界面集成教师反馈,该系统提高了评分效率、准确性和一致性。用户研究表明,该系统在性能上显著优于人工评分,展示了其在可扩展和公平教育评估中的潜力。未来工作将专注于扩展至多模态和非结构化答案的适用性,以及优化多教师工作流。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222211/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791034
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、智能辅导系统与学习分析、参与式设计(Participatory Design)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、在线课程设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文