如果在众包数据标注流水线中,GPT-4
作者
CC
Chien-Kuang Cornelia Ding
University of California, San Francisco生成式AI(文本、图像、音乐、视频)众包任务设计与质量控制数据科学家与分析师HCI 研究员Amazon Mechanical Turk 工作者
文献标题
If in a Crowdsourced Data Annotation Pipeline, a GPT-4
文献信息
- 主题领域: 人工智能、众包数据标注、自然语言处理
- 关键词: Crowdsourcing, 数据标注, GPT-4, 大型语言模型 (LLM), 数据清洗, 标签聚合, 人机协作, 数据准确性, 人机交互, 数据质量
研究背景与问题
-
问题或挑战:
- GPT-4 在数据标注的准确性和效率上被发现超越了众包工人,尤其是来自 Amazon Mechanical Turk (MTurk) 的工人;
- 现有研究中常忽视标准众包实践,并更关注个体工人的表现,而非整个数据标注流程的效果;
- 缺乏对如何综合 GPT-4 和众包工人标签以提高总体准确性的深入探讨。
-
重要性: 高质量的数据标注是训练高级 AI 模型的核心,但是当前使用人类来完成大规模数据标注的成本高且效率有限。评估和优化 GPT-4 和众包工人结合的潜力具有显著价值。
-
研究动机与相关工作:
- 现有文献表明 GPT-4 在有限场景中优于众包工人,但大多忽视了真实情境下的标签清洗和结果聚合。
- 聚焦于更全面地比较 GPT-4 与标准化、伦理执行的众包数据标注流程,探讨这两者之间的协同性。
解决方案
-
方法或解决方案:
- 收集了来自 415 位 MTurk 工人的 127,080 个标签和来自 GPT-4 的标注,具体任务基于 CODA-19 标签体系,对学术文章摘要中的句子段落进行分类标注;
- 使用两种独立设计的工人界面(基础界面与高级界面),以测试界面设计对标注质量的潜在影响;
- 使用 8 种标签聚合算法(如 Majority Voting 和 Dawid-Skene),评估最终标签的质量;
- 加入 GPT-4 的标签进行结合,以测试其与众包工人标签组合后的协同效应。
-
创新之处:
- 考虑了完整的众包数据标注流程,包括数据清洗、质量控制和标签聚合技术;
- 探讨了 GPT-4 和众包工人标签的互补性,提出在两者的优势相结合时能提高整体准确性的设想。
-
实施步骤与技术:
- 数据搜集与分组:基于 CODA-19 标注体系,MTurk 工人每篇文章提供 20 个标签;
- 接口差异化设计实验:测试基础与高级界面的任务完成效率和数据质量;
- 数据清洗与筛选:采用 "All","Exclude-By-Worker","Exclude-By-Batch" 等不同策略;
- 执行标签聚合算法,对比工人和 GPT-4 的表现。
研究成果
-
具体成果:
- 即使在最佳实践条件下,MTurk 管道的最高准确率为 81.5%,略低于 GPT-4 的 83.6%;
- 当将 GPT-4 的标注与众包工人标签结合使用时,其中 2 种算法(One-Coin Dawid-Skene 和 MACE)的准确率分别达到 87.5% 和 87.0%,高于单独使用 GPT-4 的精度;
- 研究表明,众包工人在某些特定类别(如“Finding/Contribution”类别)上表现更好,与 GPT-4 的整体优势互补。
-
与现有解决方案相比的优势:
- 涵盖了更全面的流程分析,从数据采集到后续数据处理;
- 强调了人机协作的潜力,而非单独采用某一方法;
- 通过比较多种标签清洗与聚合技术,提供了更广泛的方法视角。
-
实验或评估结果:
- 在 "Exclude-By-Worker" 策略下,One-Coin Dawid-Skene 和 MACE 算法在结合 GPT 的情境中显著提高了准确率;
- 混合标签的实验显示,众包标签对 GPT 单独表现有所优化,特别是在 GPT 表现较弱的细分类别中。
-
局限性与未来方向:
- 本研究仅针对 CODA-19 标注任务,其他任务的通用性尚需进一步验证;
- 没有测试其他 LLM 模型(如 GPT-3.5)或开放模型(如 LLaMA);
- 未来研究方向:进一步探索如何生成小规模、高质量的专家标注数据,优化 LLM 标注表现;设计更鲁棒的用户界面和交互。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- GPT-4与众包工人在数据标注中的表现如何比较?分类: 众包任务清晰度与质量控制同类问题arrow_forward
- 如何通过结合GPT-4与众包工人标签来提高数据标注的准确性?分类: 众包任务清晰度与质量控制同类问题arrow_forward
- 界面设计如何影响众包工人的数据标注质量?分类: 众包任务清晰度与质量控制同类问题arrow_forward
lightbulb
现实痛点
1- 大规模高质量数据标注成本高且效率低。分类: 众包任务清晰度与质量控制同类问题arrow_forward
- 60%
专家众包中不可分解的大任务的在线排序
CHI '18· 众包任务设计与质量控制
- 60%
导向多样性:利用语言嵌入距离提高人群创意集思广益的集体创造力
CHI '21· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642834
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、众包任务设计与质量控制
work
职业/产业
数据科学家与分析师、HCI 研究员、Amazon Mechanical Turk 工作者
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文