谁验证验证者?将LLM辅助的LLM输出评估与人类偏好对齐
作者
由于人工评估的繁琐性以及基于代码的评估的局限性,大型语言模型(LLM)越来越多地被用于辅助人类评估LLM输出。然而,LLM生成的评估器简单地继承了它们所评估的LLM的所有问题,需要进一步的人工验证。我们提出了一种混合主动的方法来“验证验证者”——将LLM生成的评估功能(无论是提示还是代码)与人类需求对齐。我们的界面EvalGen为用户提供自动化的辅助,帮助生成评估标准并实现断言。在生成候选实现(Python函数、LLM评分提示)时,EvalGen让人类对一部分LLM输出进行评分;这种反馈被用于选择与用户评分更一致的实现。定性研究发现EvalGen总体上获得了支持,但强调了对齐的主观性和迭代性质。特别地,我们发现了一种被我们称为标准漂移的现象:用户需要标准来评估输出,但评估输出有助于用户定义标准。更重要的是,有些标准似乎依赖于观察到的特定LLM输出(在观察模型输出之前无法独立定义),这对于假设评估独立于模型输出观察的方法提出了严重问题。我们展示了我们的界面和实现细节、我们的算法与基线方法的比较,以及对未来LLM评估助手设计的启示。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 80%
AILA:基于注意力机制的深度神经网络文档分类的注意交互式标签助手
CHI '19· 大语言模型(LLM)的人机协作 +1
- 80%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
EvalLM:基于用户定义标准的大语言模型提示的交互式评估
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
RAG无延迟:使检索增强生成管道的“假设”分析成为可能
CHI '26· 大语言模型(LLM)的人机协作 +1
- 75%
MAPLE:利用大型语言模型嵌入的移动应用预测
UbiComp '24· 大语言模型(LLM)的人机协作
- 75%
LlamaTouch:一个可信且可扩展的移动UI任务自动化测试平台
UIST '24· 大语言模型(LLM)的人机协作
- 67%
结晶体:降低开发者收集和组织决策信息的成本
CHI '22· 大语言模型(LLM)的人机协作 +2
- 67%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)