共同思考,更好地工作:结合人类和大语言模型的思维 aloud 结果进行有效的文本评估

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作可解释人工智能(XAI)AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 作者发现了哪些问题或挑战?

    1. 当前基于大语言模型(LLMs)的文本评价方法依赖于特定任务的提示(prompt),导致覆盖范围不足,难以获得可靠结果。
    2. 基于人工设计的检查清单方法依赖人类主观定义的关键评价标准,可能导致偏差且不够细粒度化。
    3. 单独依赖人类或LLM进行评价无法充分发挥各自的优势。例如,人类在处理大规模任务时容易疲劳,而LLM可能难以捕捉复杂的语义细节。
  • 为什么这个问题很重要? 精确评价生成文本的质量是文本生成和自然语言处理领域的核心挑战,直接影响应用场景的可靠性(如教育、新闻生成等)。只有结合人类的灵活性和LLMs的高一致性,才能促进自动化评价方法的改进。

  • 研究动机与相关工作

    1. 相关文献探讨了LLM评估能力的局限性,如基于提示的文本评分(G-Eval)和基于清单的二进制评分框架(CheckEval)。
    2. 先前研究表明,人类与AI的协作可以在创造性过程和数据标注等多个领域中表现出优越性。本研究尤其关注如何在文本评价任务中融合两者优势。

解决方案

  • 作者提出了哪些方法或解决方案? 作者提出了名为InteractEval的框架,该框架融合了人类和LLMs的创新性思维过程(Think-Aloud, TA)以生成评分清单,用于更细致和可靠的文本评价。

  • 该解决方案的创新之处是什么?

    1. 首次结合人类和LLM的“Think-Aloud”生成评估属性,提高了结果的全面性和可靠性。
    2. 提出了一个基于问题生成的清单机制,使用合并的属性生成具体、细粒度的评价标准。
    3. 通过人类和LLMs在文本属性生成上的互补优势实现更高效的协作。
  • 实现步骤是什么?使用了哪些关键技术?

    1. 属性收集:人类专家和LLMs分别通过TA过程生成用以构建清单的文本属性。
    2. 清单构建:
      • 提取组件:通过GPT-4从合并属性中提取与维度相关的关键主题。
      • 属性聚类:将不同的文本属性分组,生成与主题相关的问句。
      • 生成问题:基于每个组件提出“是/否”问答的细化问题,最终形成检查清单。
    3. 基于清单的评价:评估LLM通过回答清单问题生成最终评分,并与数据集中的人工评分(实际值)比较。
    4. 实验与对比分析:在文本总结数据集(SummEval)和作文评价数据集(ELLIPSE)上验证其性能。

研究成果

  • 取得了哪些具体成果?

    1. InteractEval在文本总结(SummEval)和作文文本评价(ELLIPSE)两种任务中均优于现有基线方法。
    2. 分析表明,人类和LLMs在不同维度上优势互补:
      • 人类在内部质量(如一致性、流畅性)上的评价更为优异。
      • LLMs在外部对齐(如一致性和相关性)方面表现更佳。
  • 与现有解决方案相比,它有哪些优势?

    1. 在性能方面,InteractEval超越了基线方法ROUGE-L、BLEU、G-Eval和CheckEval。
    2. 能够通过结合人类和LLM的长处减少单一来源偏倚,同时提高属性多样性和精细程度。
    3. 表现出较高的可扩展性和跨任务适应性。
  • 实验或评估结果是什么?

    1. 在SummEval数据上,InteractEval的评分与人工评分的相关性(Spearman’s Rho和Kendall’s Tau)明显高于基于LLM的现有方法。
    2. 在ELLIPSE数据集上的拓展性验证显示,InteractEval在多个写作评分维度上也优于所有现有基线方法。
  • 局限性与未来方向

    1. 局限性:
      • 方法仅在英文数据上验证,尚未扩展到多语言场景。
      • 未充分探索更小规模的LLMs的表现。
      • 未应用到其他相关任务(如问题回答或图像描述生成),其通用性有待进一步验证。
    2. 未来方向:
      • 探索更广泛的文本相关任务中的适用性。
      • 评估更精简的LLM在文本评价中的能力。
      • 在线上线下任务上进一步结合人类与AI的协作,并优化交互流程。

总结

本研究通过设计并验证InteractEval框架,提出了一种结合人类与大语言模型成果的文本评价方法。实验结果表明,人类与LLMs在文本评价中的协作具有显著的潜力,其互补性可以有效提升生成文本的评估精确度,推动了自动化评价技术的发展。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189107/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713181
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文