L3.08.3sentence-grain attribution设计研究
标注粒度应到句或段,仅在文末列出来源无法定位对应关系
别名: 句级标注 · 文末文献不够 · citation granularity
概念解释
正文十二句,文末十二个链接,中间没有角标。读者无法知道第三句对应哪一条,于是要么整篇当有据,要么放弃核验。句级标注(sentence-grain attribution)要求:来源与被支持的文本之间有可定位的对应,粒度至少到句或段。文末总表提供的是库存,不是对应关系。
一键打得开,解决的是通道。打开之后对不上号,是粒度失败。
机制
核验是「这一句 ←→ 那一段」的配对。文末列表把 n 句和 m 条来源留在两个无连线的集合里,配对是 n×m 的搜索,人不会做。生成器尤其会把来源和句子的真实对应弄乱:检索到的文件和当前句只是主题近。没有句级挂钩,这种错位无法被读者局部发现,只能整篇怀疑或整篇放过。
段落级是下限。一段里若混着来自不同文件的命题,段级仍然不够,必须再落到句。
怎么研究
同一篇文章,文末总表 vs. 句旁角标 vs. 段旁角标。指定若干句让人找出对应来源。因变量:配对正确率、放弃率、把无关来源安到该句上的比例。自变量:句数与来源数的比、一段内是否多来源。
配对正确率是主指标。打开过文末列表但不记得对应哪句,应记为粒度失败,不是核验成功。
边界
整篇只改写用户贴入的单一来源,篇章级一句「来源即上文」就够。诗歌、口号、无事实槽的短文本没有对应可标。表格按单元格标注比按句更合适。综合结论本来就不该挂单一来源,那是另一条。这条不处理光晕把未标注句抬高。
怎么落地
- 每个被当作有据的句或段,在其旁给出对应来源,而不是只在文末堆清单。
- 文末清单若保留,只能当索引,不能当唯一标注。
- 一段内多来源时拆句标,不要用一个段标把不同命题捆在一起。
- 验证:指着中间一句问「来源是哪一条」。答不出或答成文末随便一条,粒度不够。