Evalet: 通过功能碎片化评估大型语言模型
荣誉提名作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试AI/ML 研究员与工程师HCI 研究员数据科学家与分析师
文献标题
Evalet: Evaluating Large Language Models through Functional Fragmentation
出版信息
- 主题领域: 大型语言模型(LLMs)的评估方法
- 关键词: 大型语言模型,评估,功能分解,LLM-as-a-Judge,模型行为,定性分析,片段级功能,交互式系统,用户研究,可视化
背景与问题
- 问题/挑战: 当前的LLM评估方法依赖整体评分,这掩盖了影响评估的具体元素,使得难以识别系统性问题或在大规模上验证评估结果。
- 重要性: 解决这一限制对于确保LLM的安全部署、使输出与用户目标保持一致,以及让从业者能够有效信任和利用评估结果至关重要。
- 动机与相关工作: 现有方法提供了数值评分和理由,但需要手动审查才能将评估映射到具体片段,限制了可扩展性。现有的细粒度方法集中于预定义的错误类别或文本跨度,但缺乏生成性标注能力。
解决方案
- 提出的方法: 功能分解,一种将LLM输出分解为关键片段的方法,解释其相对于评估标准的修辞功能,并将这些功能可视化以供检查、评分和比较。
- 创新点:
- 将输出解构为与评估标准相关的片段级功能。
- 支持跨输出的生成性标注和功能聚类。
- 通过Evalet实现交互式探索和评估验证。
- 过程与关键技术:
- 使用LLM提示提取与标准相关的片段。
- 用简洁的功能描述标注片段并评估其一致性。
- 根据片段评分总结评估结果为整体理由和分数。
- 使用嵌入和层次聚类技术将功能聚类为基础和超级集群。
- 可视化功能和集群以支持细粒度和可扩展分析。
结果
- 具体发现:
- 功能分解在片段提取中实现了更高的召回率(90%),相比整体方法(84%)。
- 在识别高质量输出的准确性方面有所提升(80.1% vs. 75.5%)。
- 用户研究参与者通过Evalet识别了多出48%的评估不一致性。
- 相较基线的优势:
- 通过生成性功能标注实现更细致的评估。
- 改善LLM评估的可解释性和信任校准。
- 增强识别输出中可操作问题的能力。
- 实验/评估:
- 在Scarecrow和RewardBench数据集上进行技术评估,使用IoU、精度、召回率和准确性指标。
- 用户研究(N=10),比较Evalet与整体评估方法在两个任务上的表现:恐怖故事生成和广告帖创建。
- 局限性与未来工作:
- 未考虑功能的相对重要性。
- 在更大数据集和实际工作流程上的测试有限。
- 需要额外的控制(如片段大小编辑)以及整体属性的整合。
总结
Evalet通过功能分解评估LLM输出,将其解构为片段级功能并可视化其与用户定义标准的一致性。与整体方法相比,该方法提高了可解释性、信任校准以及可操作问题的识别能力。技术和用户评估证明了其在提取相关片段、评估整体质量以及支持多样化任务的细致分析方面的有效性。未来工作旨在优化功能优先级、扩大可扩展性,并将片段化和整体评估整合到实际应用中。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
从叙事到数字:利用大语言模型评估调查问卷
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
Rationalizer:利用大语言模型支持用户为Likert量表问卷评分提供理由
IUI '26· 大语言模型(LLM)的人机协作 +2
- 75%
SemTabla:一种用于数据表格语义丰富化和验证的人机交互框架
CHI '26· 可解释人工智能(XAI) +3
- 75%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
将互补特征集整合用于人类-AI决策
IUI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Criticality:基于交互式批判性思维与循证推理痕迹的决策支持脚手架
IUI '26· 大语言模型(LLM)的人机协作 +3
- 71%
AI of Oz:利用人工智能辅助人工Moderator增强人机交互中的Wizard of Oz研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
LAPS:使用大型语言模型自动化公共调查的假设驱动统计分析
CHI '26· 大语言模型(LLM)的人机协作 +4
- 67%
计算机使用代理用户体验设计空间的映射
IUI '26· 大语言模型(LLM)的人机协作 +4
- 63%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790285
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文