Evalet: 通过功能碎片化评估大型语言模型

荣誉提名
大语言模型(LLM)的人机协作可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试AI/ML 研究员与工程师HCI 研究员数据科学家与分析师

文献标题

Evalet: Evaluating Large Language Models through Functional Fragmentation

出版信息

  • 主题领域: 大型语言模型(LLMs)的评估方法
  • 关键词: 大型语言模型,评估,功能分解,LLM-as-a-Judge,模型行为,定性分析,片段级功能,交互式系统,用户研究,可视化

背景与问题

  • 问题/挑战: 当前的LLM评估方法依赖整体评分,这掩盖了影响评估的具体元素,使得难以识别系统性问题或在大规模上验证评估结果。
  • 重要性: 解决这一限制对于确保LLM的安全部署、使输出与用户目标保持一致,以及让从业者能够有效信任和利用评估结果至关重要。
  • 动机与相关工作: 现有方法提供了数值评分和理由,但需要手动审查才能将评估映射到具体片段,限制了可扩展性。现有的细粒度方法集中于预定义的错误类别或文本跨度,但缺乏生成性标注能力。

解决方案

  • 提出的方法: 功能分解,一种将LLM输出分解为关键片段的方法,解释其相对于评估标准的修辞功能,并将这些功能可视化以供检查、评分和比较。
  • 创新点:
    1. 将输出解构为与评估标准相关的片段级功能。
    2. 支持跨输出的生成性标注和功能聚类。
    3. 通过Evalet实现交互式探索和评估验证。
  • 过程与关键技术:
    • 使用LLM提示提取与标准相关的片段。
    • 用简洁的功能描述标注片段并评估其一致性。
    • 根据片段评分总结评估结果为整体理由和分数。
    • 使用嵌入和层次聚类技术将功能聚类为基础和超级集群。
    • 可视化功能和集群以支持细粒度和可扩展分析。

结果

  • 具体发现:
    • 功能分解在片段提取中实现了更高的召回率(90%),相比整体方法(84%)。
    • 在识别高质量输出的准确性方面有所提升(80.1% vs. 75.5%)。
    • 用户研究参与者通过Evalet识别了多出48%的评估不一致性。
  • 相较基线的优势:
    • 通过生成性功能标注实现更细致的评估。
    • 改善LLM评估的可解释性和信任校准。
    • 增强识别输出中可操作问题的能力。
  • 实验/评估:
    • 在Scarecrow和RewardBench数据集上进行技术评估,使用IoU、精度、召回率和准确性指标。
    • 用户研究(N=10),比较Evalet与整体评估方法在两个任务上的表现:恐怖故事生成和广告帖创建。
  • 局限性与未来工作:
    • 未考虑功能的相对重要性。
    • 在更大数据集和实际工作流程上的测试有限。
    • 需要额外的控制(如片段大小编辑)以及整体属性的整合。

总结

Evalet通过功能分解评估LLM输出,将其解构为片段级功能并可视化其与用户定义标准的一致性。与整体方法相比,该方法提高了可解释性、信任校准以及可操作问题的识别能力。技术和用户评估证明了其在提取相关片段、评估整体质量以及支持多样化任务的细致分析方面的有效性。未来工作旨在优化功能优先级、扩大可扩展性,并将片段化和整体评估整合到实际应用中。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222991/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790285
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文