众包学术论述标注

众包任务设计与质量控制原型设计与用户测试大学教授与研究人员软件工程师与开发者

文献标题

Crowdsourcing Scholarly Discourse Annotations

文献信息

  • 主题领域: 学术论文语义信息标注及知识图谱构建
  • 关键词: 群众外包文本标注, 智能用户界面, 知识图谱构建, 结构化学术知识, 基于网络的标注界面

研究背景与问题

  • 研究问题: 每年学术论文数量不断增长,导致研究者难以有效查找、评估和比较学术知识。此外,学术论文通常以 PDF 格式发布,难以被机器直接处理。虽然知识图谱能解决这些问题,但构建它仍然非常复杂。
  • 重要性: 为解决学术论文数量多以及无法机器处理的问题,语义知识图谱被证明是有潜力的工具。然而,目前许多学术知识图谱仅包含论文元数据,而未包括实际研究贡献内容。
  • 研究动机: 当前的基于自然语言处理(NLP)的自动图谱生成方法不足以高效处理学术论文内容,作者提出利用群众外包和机器智能协同创建结构化知识图谱,以克服现有技术的不足。

解决方案

  • 方法与解决方案:

    1. 提出一种基于网络的用户界面,允许学术论文作者选择和标注关键句子。
    2. 使用人工智能(AI)技术辅助标注过程,包括句子自动高亮和类别推荐。
    3. 将该界面集成到论文提交系统中,构建结构化的知识描述。
  • 创新点:

    1. 将机器学习技术与用户标注结合(机-人协同模式)。
    2. 设计了一种无需使用复杂数据建模的标注工具,提高任务的易用性。
    3. 提供任务分离的标注设计,专注于“选取内容”而不是“如何建模”。
  • 实施步骤:

    1. 用户通过界面选择关键句子,并针对每个句子选择预定义类别。
    2. 系统自动生成推荐类别,通过零样本分类器实现。
    3. 用户使用工具对 PDF 格式文档进行语义标注。
    4. 标注数据最终存储在知识图谱中。
  • 关键技术:

    • 使用 Bert 提取摘要法进行自动句子高亮。
    • 零样本分类器用于类别推荐(基于 Hugging Face 技术)。
    • 结合学术语义出版相关的 DEO(Discourse Elements Ontology)构建语义标注体系。

研究成果

  • 具体成果:

    1. 开发了可公开访问的基于网络的语义标注工具,该工具集成到 Open Research Knowledge Graph(ORKG)平台。
    2. 完成用户评估,证明学术论文句子标注任务是切实可行的,用户对操作界面和任务流程评价总体正面。
  • 优势:

    1. 与传统知识图谱构建方法相比,该工具任务更明确且更易操作。
    2. 实现了机-人协同工作,提供机器辅助功能如自动句子高亮和类别建议。
  • 实验和评估结果:

    1. 系统 Usability Scale(SUS)评分为76("好"级别),表明系统具有良好的用户体验。
    2. NASA Task Load Index(TLX)平均耗时为35.87,工作负荷较低,表明任务易于完成。
    3. 基本句子分类的推荐准确率为57%。虽然分类质量还有改进空间,但用户总体接受机器辅助支持功能。
  • 局限性与未来方向:

    1. 用户评价样本较小(23位研究者),需更多参与者来提高实验结果的广泛性。
    2. 机器学习组件的性能有待优化,例如自动句子高亮和类别推荐的精准性。
    3. 探讨将该接口扩展到其他领域的应用,例如法律、专利或政府数据文档的标注任务。

总结来看,这项工作为改善学术传播效率提供了一种可行的解决方案,未来研究可进一步优化智能标注技术,并结合自动实体识别与链接技术加强语义知识图谱的结构化应用。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/57981/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3397481.3450685
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
众包任务设计与质量控制、原型设计与用户测试
work
职业/产业
大学教授与研究人员、软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文