使用开放数据自动生成本地化类比
交互式数据可视化数据故事讲述(Data Storytelling)计算方法在HCI中的应用HCI 研究员统计学家与数据科学家
文献标题
使用公开数据自动生成本地化类比
文献信息
- 主题领域: 人机交互(HCI),基于公开数据改进数字类比
- 关键词: 类比, 数字理解, 测量, 众包, 开源数据, 本地化, Wikipedia, 用户适配
研究背景与问题
-
发现问题:
- 数字信息在新闻和统计中普遍存在,但许多人难以理解或识别错误的数字,即便在重要的领域如自然灾害、政策或健康方面。
- 使用类比(即“视角”)将复杂的数字转化为易于理解的形式已被证明可以提高阅读者的理解力和记忆力,但当前方法在规模化、本地化及多文化适配上存在不足。
- 目前的类比生成方法依赖于众包或特定领域的模型,难以覆盖广泛的受众并有效适配不同国家和文化。
-
研究重要性:
- 准确理解数字信息对选民、消费者和政策制定者至关重要。
- 在全球化背景下,将复杂统计信息传达给文化和语言多样化的受众,显得尤为重要。
-
研究动机与相关工作:
- 现有方法中,众包常常耗时且依赖于某一特定国家或语言的用户群特点,导致本土化效果有限。
- 本研究尝试通过自动化技术,结合开放数据资源(如Wikidata和Wikipedia),开发一种可扩展且国际化的解决方案。
解决方案
-
提出的方法:
- 构建一个包含39,532项基础对象的参考数据库,借助Wikidata提取长度、高度、面积和质量等测量信息。
- 设计模型,使用多种开放数据信号(如搜索量、文本嵌入、N-gram统计和Wiki页面流量)构建代理特征,预测类比的适用性。
- 通过简化模型设计,发现仅基于Wikipedia流量的模型也能提供高效性能,从而减少计算和建模成本。
- 进行模型评估:测试性能在新测量类型(如人口统计)和不同的文化背景间(美国和法国)能否保持适应性。
-
创新之处:
- 利用Wikipedia流量作为代理特征,绕过了对人工干预和复杂模型的需求,显著降低了实现适应性类比生成的难度和成本。
- 模型无需针对新领域或新文化重新训练,从而更容易扩展。
-
实施步骤:
- 数据收集:通过Wikidata的SPARQL API,获取测量信息和对多种语言的链接。
- 数据处理:清洗和整合冗余、模糊、不实用对象,建立高质量候选集合。
- 模型设计:将参考对象与用户的关联信号作为输入特征,验证其对类比适用性的预测力。
- 用户验证:通过问卷调查收集用户对类比的主观评价,并将其作为模型性能评估的标杆。
研究成果
具体成果
- 模型能够仅依赖Wikipedia页面流量信号生成高质量的类比,对用户普遍有用且容易理解。
- 模型在未经训练的人口领域、新测量类型中表现出色 (Spearman相关系数ρ高达0.83)。
- 模型在文化适配性方面也表现较好,比如对于美国和法国受众生成不同且更具接受度的类比。
对现有解决方案的优势
- 避免了众包方法的高成本和文化单一性,通过开放数据资源实现了自动化和规模化。
- 无需重新训练模型即可适应新测量类型和新语言/文化的受众。
- 使用Wikipedia这种跨文化、全球性开源平台,有助于全球适用性。
实验或评估结果
- 模型性能:
- 对现有测量类型的类比生成:ρ = 0.77(总和)。
- 在新测量类型(如人口)中的适应性突出:ρ = 0.83。
- 文化之间的适应性:
- 美国用户在80%的时间里更喜欢与其文化匹配的类比。
- 实验中,法国用户的选择更偏向法国本地化视角占比59%。
- 用户估算实验:
- 使用本地化类比的美国用户对测量值的估算误差比使用非本地化类比分小(数量级差为4倍与10倍)。
局限性与未来方向
-
局限性:
- Open Data不包含所有潜在有用的常见对象(如床、微波炉等)信息。
- Wikipedia流量信号存在语言覆盖不均、跨文化情况下细化不足等问题。
- 知识库中质量较低的条目可能干扰模型,例如某些模糊实体(如无名小路或特定雕塑)可能无用。
-
未来工作:
- 集成众包,以补充Wikidata或Wikipedia中缺失的信息。
- 提供多选项类比而非单一参考,以提高用户选择适应性。
- 深入探索跨国家区域内部的微调,比如针对同一种语言文化的差异化适配(如美国 vs 英国)。
- 在更多文化和语言背景下展开验证,确保模型的普遍适用性和公平性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过开放数据实现复杂数值信息的自动类比生成,并提升用户的数值理解力?分类: 新闻接触、信息素养与核查分析同类问题arrow_forward
- 在多文化和多语言的背景下,自动类比生成如何确保适配性?分类: 新闻接触、信息素养与核查分析同类问题arrow_forward
- 仅基于维基百科流量数据的模型能否高效生成适合不同文化的类比?分类: 新闻接触、信息素养与核查分析同类问题arrow_forward
lightbulb
现实痛点
1- 普通用户难以理解新闻或统计中的复杂数值信息。分类: 新闻接触、信息素养与核查分析同类问题arrow_forward
- 80%
ConceptScope: 基于领域本体组织和可视化文档中的知识
CHI '21· 交互式数据可视化 +1
- 67%
CrossData:利用文本-数据连接进行数据文档编写
CHI '22· 交互式数据可视化 +1
- 67%
Idyll Studio:用于创作交互式数据驱动文章的结构化编辑器
UIST '21· 交互式数据可视化 +1
- 60%
从可检测到可检查:理解音像数据的定性分析
CHI '21· 交互式数据可视化 +1
- 60%
交互插图分类法:用于视觉表示交互场景的风格和技术分类
CHI '21· 交互式数据可视化 +1
- 60%
多类散点图的交互式上下文保留颜色高亮
CHI '23· 交互式数据可视化
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642638
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
交互式数据可视化、数据故事讲述(Data Storytelling)、计算方法在HCI中的应用
work
职业/产业
HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文