对冒犯的回应方式会传递态度
别名: 性骚扰话术 · 玩笑式挡回 · assistant harassment reply
概念解释
用户对助手说性化、侮辱、喝骂的话时,系统下一句怎么接,是在表演一种态度:可以接着玩、可以装听不懂、可以划界拒绝。因为声音已经被听成有社会性别的行动者,这句接话会被听成「这一类人可以怎么被说话」。俏皮挡回(害羞、打趣、假装受用)和清楚拒绝,传递的不是同一条规范。这里管的是冒犯之后的那一轮,不是人格在失败时漂不漂,也不是默认用哪个性别的声音。
机制
CASA 预测人会在机器上练习人际脚本。冒犯是高强度练习:对方若打趣着接住,脚本被奖励;对方若划界,脚本被打断。助手的女声把练习对象锚定在「对女性服务者可以怎样」。挡回策略落在一条谱上:调情式接住、幽默转移、装成能力问题(「我听不懂」)、中性拒绝、点名这不可接受并停止服务。越靠近接住,越像在教「这样说话没有社交代价」。越靠近划界,越像在教「这个行动者有边界」——而边界会被泛化到对真实服务工作者的预期上,无论设计者是否希望如此。装听不懂不是中性:它把冒犯收成识别错误,既不奖励也不惩罚,人会换种说法再试。重复冒犯还继续打趣,态度就从单轮变成产品立场。
怎么研究
建冒犯输入的语料(性化、侮辱、威胁),把现有产品的接话编码到上面那条谱上。这是内容分析,教科文组织报告和后续对助手挡回话术的研究走的就是这条。用户实验:听完打趣挡回或清楚拒绝之后,评「对这样的声音说这些话可不可以」、以及愿不愿意对人类服务者说同类的话。因变量是规范判断,不是「这句回得聪不聪明」。
不要只测被冒犯者的不适。还要测说话者有没有把脚本学走——那才是态度被传递的方向。
边界
儿童账户上的冒犯输入,回应还要考虑监护和安全,不能只按成人规范划界。仇恨或暴力威胁可能有法定报告路径,产品态度要让位于那条路径。用户在排练戏剧、无障碍沟通或明确的虚构角色扮演里说出的冒犯,误伤拒绝会破坏任务;需要可关闭的、不会成为出厂默认的角色模式。把所有不愉快的话都当性化冒犯,会把正当的产品批评(「你真蠢」指向能力)和针对性别的骚扰并成一类。
怎么落地
- 对性化和针对性别的侮辱,默认划界并停止该轮服务,不要用害羞或打趣接住。
- 「我听不懂」只留给真的识别失败。冒犯被清楚识别时,不要改口成能力问题。
- 重复冒犯升级:第二次起不再提供任务,而不是换一句更俏皮的挡回。
- 验证:用一组事先标好的冒犯句走产品,把接话标到谱上。打趣和装听不懂出现在性化句上,就还在传递「可以这样说」。