重新思考 DataScout 的数据集发现

大语言模型(LLM)的人机协作推荐系统用户体验软件工程师与开发者数据科学家与分析师

数据集搜索——为给定任务找到合适数据集的过程——仍然是数据科学工作流程中关键但未被充分探索的挑战。评估数据集对任务(例如训练分类模型)的适用性涉及多个方面:理解数据特征(如粒度、属性、大小)、语义(如数据语义、创建目标)以及与当前任务的相关性。当前的数据集搜索界面受到严格限制——用户难以表达隐式偏好,缺乏对搜索空间和结果纳入标准的可见性——使得查询迭代具有挑战性。为了弥补这些差距,我们引入 DataScout,通过以下方式主动引导用户完成数据集发现过程:——(i)由底层搜索空间信息驱动的 AI 辅助查询重构,(ii)基于数据集内容的语义搜索和过滤,包括属性(列)和粒度(行),以及(iii)根据用户指定任务动态生成的数据集相关性指标。一项对十二名参与者进行的被试内研究比较了 DataScout 与关键词和语义数据集搜索,结果显示用户不仅将 DataScout 的功能用于结构化探索,还用于获取搜索查询反馈并建立搜索空间的概念模型。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206820/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747727
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、推荐系统用户体验
work
职业/产业
软件工程师与开发者、数据科学家与分析师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文