iRULER:基于评分标准的可解释用户自定义LLM评估与修订系统

大语言模型(LLM)的人机协作AI辅助写作与文本生成参与式设计(Participatory Design)原型设计与用户测试大学教授与研究人员HCI 研究员软件工程师与开发者

文献标题

iRULER: Intelligible Rubric-Based User-Defined LLM Evaluation for Revision

出版信息

  • 主题领域: 人工智能与人类协作在写作评价和评分标准创建中的应用。
  • 关键词: 大型语言模型,基于评分标准的反馈,可解释的人工智能,写作修订,用户定义标准,可解释人工智能,分步反馈,元评分标准,人机协同评价,技能迁移。

背景与问题

  • 问题/挑战: LLM生成的反馈通常难以理解、过于笼统,且缺乏针对用户定义标准的可操作指导。评分标准虽然有效,但在没有专业知识的情况下难以创建和评估。
  • 重要性: 结构化且易于理解的反馈对于提升写作质量以及支持教育和创作环境中的用户定义标准至关重要。
  • 动机与相关研究: 先前的系统如LLM-Rubric和Prometheus虽然能将AI评分与评分标准对齐,但未能提供针对具体标准的解释或可操作的修订指导。评分标准共创显示出潜力,但缺乏系统的评估和改进机制。

解决方案

  • 提出的方法: iRULER——一个用于基于评分标准的用户定义LLM评价的交互式系统,支持写作修订和评分标准创建。
  • 创新点:
    1. 提出了六项用户定义反馈设计指南:具体性、分步性、有依据性、可操作性、可评估性和可改进性。
    2. 双层反馈工作流,结合写作修订和评分标准创建,将反馈原则递归应用于作品和标准。
    3. 集成元评分标准评价,用于评估和改进用户定义的评分标准。
  • 流程和关键技术:
    • 写作修订:用户通过评分标准获得分数、解释(为什么、为什么不)以及可操作的修订建议(如何)。
    • 评分标准创建:用户设计评分标准并接收元评分标准反馈以进行迭代改进。
    • 递归工作流:基于评分标准在写作作品中的应用对其进行改进,确保与用户定义目标一致。

结果

  • 具体发现:
    • 写作质量提升:iRULER显著提高了分数(Δ 分数:Text-LLM = 16.1,Rubric-LLM = 23.8,iRULER = 30.8)。
    • 评分标准质量提升:iRULER得分最高(Text-LLM = 76.8,Rubric-LLM = 79.7,iRULER = 86.3)。
    • 技能迁移:iRULER带来了更大的无辅助修订改进(Δ 分数后-前:Text-LLM = 4.17,Rubric-LLM = 6.33,iRULER = 9.73)。
  • 相较基线的优势:
    • iRULER在写作质量、评分标准质量、感知帮助性、正确性和用户信心方面均优于Text-LLM和Rubric-LLM。
    • 效率:iRULER所需迭代次数更少(Text-LLM = 3.38,Rubric-LLM = 2.69,iRULER = 2.09)。
  • 实验/评估:
    • 写作修订(N = 48):测试反馈对作文改进的影响。
    • 评分标准创建(N = 36):评估评分标准设计质量。
    • 端到端(N = 6):探索评分标准的递归改进和应用。
    • 专家验证(N = 2):确认LLM评分与人工判断的一致性(α ≥ 0.80,QWK = 0.88,针对Rubric-LLM)。
  • 局限性与未来工作:
    • 对递归工作流的量化数据有限;未来研究应在大规模上验证端到端流程。
    • 长期技能保留尚未探索;需要进行纵向研究。
    • 对主观和多模态领域的普适性需要进一步研究。

总结

iRULER提出了一种新颖的框架,用于基于评分标准的可理解反馈,支持写作修订和评分标准创建,并以六项设计原则为指导。实证结果表明,其在提升作品质量、用户信心和技能迁移方面优于基线系统。通过支持用户定义标准的递归改进,iRULER促进了个性化、结构化的人机协作。未来工作应探索其在更广泛领域的适用性,并评估其对学习成果的长期影响。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223208/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790539
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI辅助写作与文本生成、参与式设计(Participatory Design)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、HCI 研究员、软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文