总结用户生成的文本内容:算法摘要公平性的动机与方法
随着用户生成的文本内容快速增长,文本摘要算法越来越多地被用于为用户提供信息内容的快速概览。传统上,摘要算法仅根据其与人类编写的摘要的匹配程度进行评估(例如通过 ROUGE 分数)。在这项工作中,我们提出从完全新的角度评估摘要算法,这一点在要汇总的用户生成数据来自不同显著社会群体时尤为重要,例如男性或女性、高加索人或非裔美国人,或不同政治群体(共和党人或民主党人)。在这种情况下,我们检查生成的摘要是否公平地代表这些不同社会群体。具体而言,考虑到提取式摘要算法选择原始数据中的文本单元子集(例如微博)包含在摘要中,我们研究这种选择是否"公平"。我们对真实微博数据集的实验表明,现有摘要算法与原始数据中的分布相比,往往对显著社会群体的代表差异很大。更重要的是,一些群体在生成的摘要中经常被"低估",因此获得的曝光远低于他们在原始数据中本会获得的曝光。为了减少这种不利影响,我们提出了新颖的公平保留摘要算法,在确保各群体公平的同时生成高质量摘要。据我们所知,这是首次尝试产生公平的文本摘要,可能会开辟一个有趣的研究方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2019
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文