早期交互式机器学习的采样与搜索权衡
大语言模型(LLM)的人机协作计算方法在HCI中的应用大学教授与研究人员软件工程师与开发者HCI 研究员
文献标题
Trade-offs in Sampling and Search for Early-stage Interactive Text Classification
文献信息
- 主题领域: 交互式文本分类与主动学习在早期阶段的采样与搜索方法的权衡
- 关键词: 采样, 分类, 交互式机器学习, 主动学习, 搜索, 性能估计, 偏差
研究背景与问题
- 发现的问题或挑战:
- 在许多自动分类任务中,获取标注数据是训练有监督模型的主要障碍。
- 交互式机器学习 (IML) 系统可以快速收集标注数据并展示模型性能,但在采样策略上存在性能改进和性能估计偏差之间的权衡。
- 主动学习可能在早期冷启动阶段的性能表现较弱,特别是在类别分布严重不平衡的情况下。
- 全文搜索可以利用用户的领域知识找到相关数据,但可能会引入偏差,影响模型的泛化性能。
- 问题的重要性: 减少需要人工标注的数据量能够降低成本,特别是在早期冷启动阶段,但如何平衡效率与性能估计的准确性仍然是一个关键问题。
- 研究动机与相关工作:
- 主动学习一直是交互式机器学习系统的核心技术,用于选择对分类器最有用的训练实例。
- 过去的研究表明,在极度类别不平衡的情况下,指导式学习(通过用户来搜索标注数据)可能比主动学习表现更优。
- 本文旨在通过模拟用户交互系统,研究不同采样及搜索策略的性能,填补对模型性能估计和采样方法权衡的理解。
解决方案
- 提出的方法或解决方案:
- 比较了三种采样策略(随机采样、不确定性采样、多样性采样)。
- 引入了全文搜索来在早期阶段“种子”分类器,通过用户定义的搜索条件,快速标注少量正类文档。
- 模拟用户交互行为,分析不同策略对分类器泛化性能和性能估计偏差的影响。
- 解决方案的创新之处:
- 系统性地探索采样方法和搜索策略对早期交互式机器学习系统的影响,包括分类器性能和估计偏差的权衡。
- 提出结合搜索与主动学习的方法,用于解决类别不平衡任务。
- 提供了详细的实证结果和设计指导,帮助设计良好的 IML 用户界面与标注流程。
- 实施步骤与关键技术:
- 实现交互式数据标注界面,支持采样与基于全文搜索的文档过滤。
- 模拟用户标注文档的行为,通过重采样、交叉验证,估算模型的表现。
- 使用 RoBERTa 作为文本嵌入的特征提取器,并采用逻辑回归作为分类器。
- 在多个任务场景中比较多种采样和搜索策略的有效性。
研究成果
- 具体成果:
- 未使用搜索时,不确定性采样策略在提高分类器泛化性能方面始终优于随机采样和多样性采样。
- 不确定性采样会引入显著的性能估计偏差,偏向保守预测,而随机采样的估计偏差最低。
- 使用全文搜索进行早期“种子”标注可以快速提升分类器性能,尤其是在类不平衡任务中(如电影/电视分类任务中正类文档占比低)。
- 多样性采样和主动学习结合带来的实际估算偏差可能对用户的信任造成影响。
- 与现有解决方案的对比优势:
- 提供了主动学习与搜索在早期阶段冷启动的综合解决方案。
- 使用人类生成的搜索查询和模拟用户搜索行为,结果更贴近实际应用。
- 针对现有工作中忽视的性能估计偏差问题进行了深入分析。
- 局限性与未来方向:
- 仅基于仿真用户,而非真实用户行为进行实验,未来需开展用户研究以进一步验证。
- 实验仅在文本数据上进行,而现实任务多为多模态数据标注,应用场景受限。
- 可进一步探索动态采样策略,优化主动学习与搜索的切换机制。
指导原则
- 给模型创建者的关键建议:
- 如果准确的模型性能估计至关重要,尽量减少标注数据的非随机采样行为。
- 预期主动学习会产生保守的性能估计,可采用人为标注的随机评估集。
- 在早期阶段通过查询筛选正类样本建立初始分类器,提高冷启动性能。
- 使用搜索时须注意可能增加模型性能估计的方差,建议额外标注较多随机样本。
- 给 IML 系统设计者的建议:
- 若性能估计可能不准确,请避免向用户实时显示模型性能预测。
- 如果用户的主要目标是真实性能表现,可以鼓励主动学习和搜索功能。
- 在用户搜索阶段,提供工具帮助用户通过搜索结果进行语义解析。
文献揭示了在文本分类任务中采样策略与搜索之间的复杂权衡,同时提供了实践中有用的具体指导。这些研究对于 IML 系统设计与交互式标注的优化具有重要参考价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在早期阶段的交互式文本分类中,不同的采样方法(如随机采样、不确定性采样和多样性采样)如何影响分类器的泛化性能和性能估计偏差?分类: 主动学习与机器教学中的不确定性同类问题arrow_forward
- 在任务类别严重不平衡的情况下,利用全文搜索进行早期正类标注能否显著提高分类器性能?分类: 主动学习与机器教学中的不确定性同类问题arrow_forward
- 结合活跃学习(active learning)和全文搜索的方法,是否能有效减少冷启动阶段的标注数据需求?分类: 主动学习与机器教学中的不确定性同类问题arrow_forward
lightbulb
现实痛点
1- 用户在冷启动阶段难以高效收集标注文本数据。分类: 主动学习与机器教学中的不确定性同类问题arrow_forward
- 100%
使用LLM同伴学习基于代理的建模:初学者和专家使用ChatGPT和NetLogo Chat的经验
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
对大型语言模型在学术文献理解和评审方面的评估:一项针对初级学者的实证研究
CHI '24· 大语言模型(LLM)的人机协作 +1
- 80%
Assuage:使用引导探索的汇编合成
UIST '21· 大语言模型(LLM)的人机协作 +1
- 71%
通过通信分类有向图估计共享心智模型
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
调查计算机科学研究人员如何与人工智能共同设计他们的合作写作体验
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
Hypothesizer:一种基于假设的调试器用于查找和测试调试假设
UIST '23· 沉浸感与临场感研究 +2
- 67%
PaperBridge:通过人机协作探索制作研究叙事
UIST '25· 大语言模型(LLM)的人机协作 +2
- 60%
计算交互:理论与实践
CHI '18· 计算方法在HCI中的应用
- 60%
基于模型的回溯交互技术评估
CHI '24· 计算方法在HCI中的应用
- 60%
MAPLE:利用大型语言模型嵌入的移动应用预测
UbiComp '24· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511134
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、计算方法在HCI中的应用
work
职业/产业
大学教授与研究人员、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文