EvaluAId:开放性学生论文的人机协作评估
作者
大语言模型(LLM)的人机协作智能辅导系统与学习分析用户研究方法(访谈、调查、观察)原型设计与用户测试大学教授与研究人员在线课程设计师
文献标题
EvaluAId: Human-AI Collaborative Evaluation of Open-Ended Student Essays
出版信息
- 主题领域: 人工智能与人类协作评估开放性学生作文。
- 关键词: 人工智能与人类协作、评分、开放性作文、基于评分标准的评估、反馈综合、自适应基准测试、自动写作评估、证据识别、教育技术、反思性判断。
背景与问题
- 问题/挑战: 开放性作文评分具有挑战性,原因在于学生提交内容的多样性、评分标准的主观性以及个性化反馈的需求。自动写作评估(AWE)系统通常缺乏适应性,倾向于关注表面质量,无法提供透明、基于证据的评分,从而降低评分者的主动性。
- 重要性: 准确且深思熟虑的评分对于学生学习和公平性至关重要。在大规模课堂中,在不降低质量的情况下扩展评分流程尤为重要。
- 动机与相关工作: 以往关于自动写作评估系统和人类与人工智能协作的研究主要集中在自动化上,但这些方法在开放性、由教师定义的场景中往往失败。本文通过将人工智能嵌入评分者的推理过程,增强人类主动性和责任感,从而填补这一空白。
解决方案
- 提出的方法: EvaluAId是一种人类与人工智能协作的系统,通过提供以证据为基础的支持,增强评分者在基于评分标准评估开放性作文中的能力。
- 创新点:
- 交互式评分标准与证据映射,帮助评分者定位并证明与评分标准相关的证据。
- 自适应基准测试,通过成对比较实现自我校准和一致评分。
- 支架式反馈综合,提供个性化、基于证据的反馈。
- 人类参与设计,确保评分者控制权和责任感。
- 流程与关键技术:
- 将评分标准分解为指导性问题,并在作文中突出显示相关文本。
- 允许评分者设置基准作文,用于自适应基准测试,并可视化提交内容之间的相似性。
- 提供与评分标准和学生内容相关的人工智能生成、可编辑的反馈草稿。
- 通过要求评分者确认所有人工智能贡献,确保透明度和人类监督。
结果
- 具体发现:
- EvaluAId将均方根误差(RMSE)降低至0.744,相较于对话式人工智能基线的1.046和自动写作评估系统的1.031。
- 与专家评分的皮尔逊相关性更高(0.754 vs. 基线的0.509)。
- 生成的反馈更具可操作性,改进方向评分更高(4.042 vs. 基线的3.292)。
- 反馈草稿中91%的理由充分,98%的建议可操作,虚假信息率较低(理由虚假率7%,建议虚假率6%)。
- 相较基线的优势:
- 提高评分准确性和评分者间一致性。
- 相较于对话式人工智能基线和自动写作评估系统,评分者满意度、自信心和协作感更高。
- 反馈更加个性化且与评分标准一致。
- 实验/评估:
- 在12名助教中进行的被试内研究,比较EvaluAId与对话式人工智能基线和自动写作评估系统。
- 独立评分者从四个维度(准确性、基于标准、改进方向、语气)评估反馈质量。
- 对12名助教、6名教师和6名学生进行半结构化访谈,收集多方观点。
- 局限性与未来工作:
- 仅限于基于文本的评分,不支持多模态输入(如图表)。
- 短期研究;需要长期部署以评估持续影响。
- 样本量较小且集中于单一课程,限制了普适性。
- 未来工作包括扩展至多样化学科、改进评分标准设计工具以及解决评分者偏见问题。
总结
EvaluAId将人工智能重新定位为开放性作文评分中的按需协作者,通过以证据为基础的工作流程增强人类主动性。通过整合评分标准与证据映射、自适应基准测试和支架式反馈综合,EvaluAId提高了评分准确性、一致性和反馈质量。与对话式人工智能和自动写作评估基线相比,EvaluAId在与专家评分一致性和评分者满意度方面表现更优。多方访谈强调了其在深思熟虑评分和课堂整合中的潜力,但在扩展和透明度方面仍面临挑战。该系统倡导人类参与的评估方式,作为端到端自动化的替代方案。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
扩展时间词汇表以设计“不可发现学习”
CHI '26· 智能辅导系统与学习分析 +2
- 83%
“展示它,而不仅仅是说出它”:软件指导中指令多模态的互补效应
CHI '26· 智能辅导系统与学习分析 +2
- 71%
开放式结构化问题评估中的人机协作
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
协同更智能:利用教师认知多智能体大型语言模型框架增强人机协作评分
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
课堂仿真:在线教育中构建情境学生生成代理以模拟学习行为
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
好篱笆造就好学习:自主语言学习者如何权衡LLM委托决策
CHI '26· 大语言模型(LLM)的人机协作 +1
- 67%
AskNow:一个用于大规模课堂实时问答的LLM驱动交互系统
CHI '26· 大语言模型(LLM)的人机协作 +1
- 67%
AI赋能数学教育:利用情境感知AI支持大规模数学课程中的教师
CHI '26· 大语言模型(LLM)的人机协作 +1
- 67%
AI伙伴能否赋能学习者提出批判性问题?
IUI '25· 大语言模型(LLM)的人机协作 +1
- 63%
协同设计 Ripplet:一个基于教师工作流概念模型的 LLM 辅助评估题目创作系统
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790814
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、智能辅导系统与学习分析、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、在线课程设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文