DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
DALL: Data Labeling via Data Programming and Active Learning Enhanced by Large Language Models
出版信息
- 主题领域: 结合数据编程、主动学习和大型语言模型的文本标注框架。
- 关键词: 数据标注, 数据编程, 主动学习, 大型语言模型, 文本分类, 标注函数, 范围集, 迭代优化, 可用性, 标注效率。
背景与问题
- 问题/挑战: 现有的文本标注方法在标注质量和成本之间难以平衡。数据编程需要编程技能,主动学习存在冷启动问题,而基于大型语言模型(LLM)的标注在没有人工监督的情况下可能不一致且不可靠。
- 重要性: 高质量的标注数据集对自然语言处理(NLP)任务中的深度学习至关重要,减少标注的成本和工作量可以加速该领域的进步。
- 动机与相关工作: 之前的研究探索了数据编程、主动学习和LLM的两两结合,但尚未完全整合三者。挑战包括数据编程中的编程负担、主动学习中的效率问题,以及LLM标注中对人工监督的需求。
解决方案
- 提出的方法: DALL,一个统一的文本标注框架,整合了数据编程、主动学习和LLM,以提高标注效率和准确性。
- 创新点:
- 提出通过配置而非编码来定义标注函数的结构化规范。
- 将数据编程与主动学习结合,以优化噪声标注并解决冷启动问题。
- 利用LLM协助标签校正、范围集扩展和标注函数优化。
- 实现了一个具有用户友好界面的交互式标注系统,用于迭代优化。
- 流程与关键技术:
- 用户通过无代码的结构化规范定义标注函数。
- 主动学习基于不确定性、分歧或弃权选择信息量大的实例。
- LLM分析选定实例,推荐标签、扩展范围集并建议新的标注函数。
- 通过用户与系统的交互进行迭代优化以提高标签质量。
结果
- 具体发现:
- DALL在标注时间显著减少的情况下,达到了与Doccano、Snorkel和GPT-3.5 Turbo相当或更高的准确性。
- 跨任务重用标注函数实现了快速收敛到高准确性。
- 消融研究表明,结合数据编程、主动学习和LLM提高了准确性并降低了时间成本。
- 相较基线的优势:
- 比其他方法更快达到85%的准确性。
- 通过主动学习和LLM辅助的迭代优化实现了持续的准确性提升。
- 实验/评估:
- 在情感分析任务上对36名参与者进行了对比研究。
- 对18名参与者进行了消融研究,以评估各模块的贡献。
- 对15名参与者的可用性研究显示了较高的满意度和易用性。
- 局限性与未来工作:
- 难以处理跨句推理或隐含表达。
- 需要领域特定的范围集和提示优化。
- 有潜力构建可重用范围集的库并自动化提示调整。
总结
DALL是一个整合了数据编程、主动学习和LLM的文本标注框架,旨在提高标注效率和准确性。它引入了一种无需编码的结构化规范来定义标注函数,并结合主动学习以优先处理信息量大的实例,同时利用LLM分析辅助标签优化。评估结果表明,DALL在准确性和效率上均优于现有系统,并且参与者对其可用性评价较高。未来工作包括解决复杂表达的处理限制、扩展领域特定资源以及优化新任务的提示设计。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 100%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
"我们是否要深入探讨?":为异步在线讨论中推进知识共建设计并评估LLM智能体策略
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
TurnStyle:一个分析人类对话行为以预测LLM辅助任务成功的框架
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791356
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文