众包分层多标签文本注释的界面设计
众包任务设计与质量控制实地研究(Field Study)HCI 研究员Amazon Mechanical Turk 工作者
文献标题
Interface Design for Crowdsourcing Hierarchical Multi-Label Text Annotations
文献信息
- 主题领域: 人机交互 (HCI)、众包数据标注、机器学习
- 关键词: 众包, 文本标注, 用户体验设计, 层次结构, 多标签分类, 分类界面, 用户界面设计, 数据标注效率, 文本处理, 人工智能标注
- 发表会议: CHI 2023(计算机人机交互国际会议)
研究背景与问题
-
发现的挑战:
- 使用人工标注生成监督学习数据集不仅昂贵,还面临主观性和任务复杂度的问题。尤其是在多标签任务中,特别是具有层次结构的标签分类任务,如何提高标注质量和效率仍不明朗。
- 主观性高的标注任务(如疫苗相关误信息的标注)进一步凸显了标注中存在的精度与一致性挑战。
- 如何基于概念层次结构设计标注任务界面以改善性能(如分组相似概念、减少认知负担)还未有明确答案。
-
重要性:
- 数据标注的高成本和高质量需求对机器学习模型的性能至关重要。
- 多标签任务中的标注问题具有广泛的实际应用(如误信息研究、社会媒体分析等)。
-
研究动机:
- 探索如何通过结合层次结构信息设计用户界面,改善标注任务的质量和效率。
- 提出适配不同任务场景的方法,并提供定量评估如何最佳利用有限预算以收集高质量数据。
解决方案
方法和创新
-
引入多种标注界面设计:
- 比较三种界面布局:
- 单标签 (Binary-Label): 每次标注一个“是/否”问题。
- 扁平多标签 (Multi-Label): 所有标签平铺显示,允许选择多标签。
- 层次多标签 (Hierarchical Multi-Label): 标签按层次结构设计,逐级选择标签。
- 进一步结合三种标注逻辑:
- 单次通过 (Single-Pass)、多次通过 (Multi-Pass)、层次递进式多次通过 (Hierarchical Multi-Pass)。
- 比较三种界面布局:
-
实现关键实验设置:
- 固定预算,综合考虑工人认知负担与多工人协作的权衡。
- 对比基于随机分组标签和层次结构指导分组标签的效果差异。
-
核心技术与流程:
- 标注层次设计:
- 设计用于疫苗误信息的层次标签系统 (如一级标签“健康风险”及其子标签“特定副作用”)。
- 标注流程:
- 工人在任务开始之前接受自定义培训和考核(如教程和测试)。
- 使用自定义众包平台控制标注任务显示逻辑并收集多轮标注数据。
- 标注层次设计:
研究成果
-
主要结论:
- 融入层次结构信息后的标注方案提高了工人的 F1 分数(+0.16 分),尤其体现在:
- **分组相似概念(Grouping Similar Concepts)**显著提高了标注质量(使用层次结构分组 F1 = 0.50,而随机分组仅为 0.34)。
- 对难标注例子相对性能提升显著(+0.40 F1 分数)。
- 对无关负例的过滤(预检测)提高了标注精度,F1 从 0.50 提升到 0.57。
- 融入层次结构信息后的标注方案提高了工人的 F1 分数(+0.16 分),尤其体现在:
-
与现有方法的比较:
- 单次通过的层次多标签方案结合多数投票机制(Majority Vote)在固定预算内效果最佳(F1 = 0.70)。
- 多次通过方案(特别是层次递进式方案)在 recall 上有一定优势,但在 precision 上则稍逊。
-
实验与评估结果:
- 不同界面设计和标注逻辑的详细对比:
- 分层分组效果优于随机分组。
- 层次多标签方案对复杂、主观性高的任务有帮助。
- 整体分析表明标注工人的表现受标注频率、正例频率(True Positive Frequency)、标注任务分组等因素的显著影响。
- 不同界面设计和标注逻辑的详细对比:
-
局限性与未来方向:
- 局限性:
- 未包含“二元标签 (Binary Label)”的实验结果。
- 层次结构的泛化性存在不确定性(需验证更多层次类型任务)。
- 仅在 Amazon Mechanical Turk 平台上测试,结果或不适用于其他众包平台。
- 未来方向:
- 进一步优化标签层次结构设计。
- 探索与更大预算、多样化任务和更复杂层次标签的适用性。
- 加强对子任务分解和专题预过滤机制的探索。
- 局限性:
总结
- 本研究系统地分析了在高主观性文本标注任务中集成层次结构信息对界面设计和标注质量的影响。
- 研究结果为未来众包平台构建复杂数据标注工具提供了有价值的指导意见。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过界面设计集成概念层级信息以提高多标签文本标注任务的质量和效率?分类: 人机协同标注与示例选择同类问题arrow_forward
- 分层多标签标注方案是否在处理复杂和高度主观的任务中具有显著优势?分类: 人机协同标注与示例选择同类问题arrow_forward
- 相较于随机分组,基于层级结构的分组能否显著提升标注准确率和一致性?分类: 人机协同标注与示例选择同类问题arrow_forward
lightbulb
现实痛点
1- 文本标注任务复杂、成本高且容易出现主观不一致的问题。分类: 人机协同标注与示例选择同类问题arrow_forward
- 75%
专家众包中不可分解的大任务的在线排序
CHI '18· 众包任务设计与质量控制
- 60%
Crowdlicit:一个用于进行分布式最终用户需求提取和识别研究的系统
CHI '19· 众包任务设计与质量控制 +1
- 60%
众包检测情感操控语言
CHI '20· AI 伦理、公平与问责 +1
- 60%
我们可以众包Tacton相似性感知和隐喻评价吗?
CHI '23· 振动反馈与皮肤刺激 +1
- 60%
QButterfly:非技术型研究人员用于在线用户交互研究的轻量级调查扩展
CHI '23· 用户研究方法(访谈、调查、观察) +1
- 60%
推动公平的激励机制以激发有偿和无偿的众包贡献
CHI '25· 众包任务设计与质量控制 +1
- 60%
众包注释的可解释建模
IUI '19· 可解释人工智能(XAI) +1
- 60%
Sprout:众包任务设计的群体赋能任务设计工具
UIST '18· 众包任务设计与质量控制 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581431
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
众包任务设计与质量控制、实地研究(Field Study)
work
职业/产业
HCI 研究员、Amazon Mechanical Turk 工作者
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文