通过利用编辑行为模式自动标注维基百科低质量内容
维基百科文章旨在成为权威的百科全书内容来源。然而,根据其质量标准,只有 0.6% 的维基百科文章具有高质量,原因是维基百科编辑数量不足且文章数量庞大。可以自动识别和修复内容问题的监督机器学习(ML)质量改进方法依赖于对维基百科句子质量的手动标注。然而,当前的标注方法繁琐且会产生噪声标签。本研究提出一种自动标注方法,识别历史维基百科编辑的语义类别(例如添加引用、澄清),并使用编辑前修改的句子作为需要该语义改进的示例。评分最高的文章句子是不再需要语义改进的示例。我们证明,使用我们的标签训练现有的句子质量分类算法比使用现有标签训练更能提高性能。我们的研究表明,维基百科编辑者的编辑行为比缺乏上下文判断能力的众包工作者生成的标签更好。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3479503
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文