DxHF:通过交互式分解为LLM对齐提供高质量人类反馈

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI/ML 研究员与工程师HCI 研究员

人类偏好广泛用于通过强化学习人类反馈(RLLM)等方法对齐大型语言模型。然而,当前用户界面要求注释者比较文本段落,当文本较长或不熟悉时这在认知上具有挑战性。本论文通过研究分解原则作为提高LLM对齐人类反馈质量的方法做出了贡献。这一方法将文本分解为单个论点,而非直接比较两个长文本响应。基于该原则,我们构建了新型用户界面DxHF。它通过显示分解的论点、增强比较过程,视觉编码论点与对话的相关性,并链接相似论点。这使用户能够浏览关键信息并识别差异,以获得更好更快的判断。我们的技术评估显示,分解通常会提高关于真值的反馈准确性,特别是对于不确定的用户。160名参与者的众包研究表明,使用DxHF可将反馈准确性平均提高5%,尽管平均反馈时间增加了18秒。值得注意的是,在用户确定性较低的情况下,准确性显著提高。研究发现强调了人机交互作为改善人类-AI对齐有效方法的潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206972/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747600
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文