L3.12.3mark human edits on generated text设计研究
人工修改的部分应被标记,否则事后无法区分哪一段出自谁
别名: 人工改动标记 · 出自谁 · authorship of patches
概念解释
交出去的稿里,数字是人改的,论证是模型写的。三个月后审计问「这句谁负责」,文档里没有任何分色、批注或作者轨。人工改动标记(marking human edits)要求:人动过的范围在事后仍能被读出来,否则责任、再训练数据和合并规则都失去对象。
再生成会不会盖住改动,需要先知道改动在哪。标记是那条规则的感知层。
机制
生成物与补丁在同一文本流里,字面上看不出缝。人的记忆只覆盖很短的编辑会话,离开窗口或换人之后,「哪一段是我改的」就没了。系统若也不记,作者身份在字符级塌缩成一篇匿名混成品。
责任、版权声明、模型更新用的「人类偏好」都依赖这条缝。没有缝,出了错只能整篇归系统或整篇归人;拿去训练则把人的补丁当模型输出,或把模型输出当人类示范。
怎么研究
让人改若干处,间隔一段时间或换一个人来标「哪些是人改的」。比较:无标记、行内高亮、边栏作者轨。因变量:识别准确率、责任归属判断、再生成时能否避开人改区。自变量:改动量、时间间隔、是否换人。
换人条件最硬。原作者靠记忆也能猜,不能代表事后可区分。
边界
一次性私人草稿、从不外发、从不训练,标记的外部需求弱,但仍利于自己再生成时避让。极小改动(改一个错字)可用字符级轨,不必做成醒目高亮以免干扰阅读。共同编辑已有作者轨时,生成应作为一名「作者」写入同一条轨,而不是另搞一套。这条不处理门槛把人拦在编辑之外。
怎么落地
- 记录字符级或句级的作者:模型 / 当前用户 / 他人。默认对编辑者可见,外发时可选择是否保留。
- 再生成、导出、问责视图都读同一条标记,不要各记各的。
- 人改过的范围不要在「一键美化」里被无提示抹掉标记。
- 验证:隔一天换一个人打开文档,问「哪几句是人改的」。指不出,标记没有事后可用性。