当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员精神科医生与心理咨询师

文献标题

When AI Gives Advice: Evaluating AI and Human Responses to Online Advice-Seeking for Well-Being

出版信息

  • 主题领域: 在幸福感情境中评估AI生成的建议与人类建议的对比。
  • 关键词: AI建议、幸福感、GPT-4o、GPT-5、人机协作、Reddit、阿谀行为、建议质量、增强管道、用户偏好。

背景与问题

  • 问题/挑战: 大型语言模型(LLMs)在日常幸福感情境中生成建议的质量尚不明确,尤其是与来自Reddit等众包平台的人类建议相比。
  • 重要性: 随着LLMs成为个人指导的普遍工具,理解AI生成建议的有效性至关重要,这可能会重新塑造人们寻求和采纳建议的方式。
  • 动机与相关研究: 先前研究表明,同理心的同伴交流和众包建议平台具有治疗价值,但也存在延迟、低留存率以及持续支持机会缺失等局限性。LLMs可以提供可扩展、个性化的建议,但容易出现阿谀行为和过度依赖的风险。本研究基于这些发现,比较了LLM建议与高赞人类建议,并探索了人机协作的增强管道。

解决方案

  • 提出的方法: 通过盲评专家评分和偏好判断,实证评估建议质量,比较LLM生成的建议(GPT-4o、GPT-5)与Reddit评论,并测试结合人类和AI建议的增强管道。
  • 创新性:
    1. 在六个幸福感维度上,对LLM建议和众包人类建议进行盲评的专家对比。
    2. 识别基准提升与实际建议质量之间的权衡,显示GPT-4o优于GPT-5。
    3. 探索人机协作管道,展示LLMs如何改进人类建议,反之亦然。
  • 流程与关键技术:
    • 研究1:通过专家评分比较Reddit评论和LLM生成的建议,在六个维度(如清晰度、个性化、阿谀行为)上进行评估,并对整体有效性和长期收益进行排名。
    • 研究2:测试增强管道,其中LLMs改进人类或AI生成的建议,有无专家指导,并评估感知质量和AI生成性。
    • 调查:探索用户对建议型AI角色(教练与朋友)的偏好,以及偏好如何因对AI的信任和基础幸福感而异。

结果

  • 具体发现:
    • 在所有六个质量维度上,GPT-4o和GPT-5均优于Reddit的高赞评论,GPT-4o在大多数情况下排名高于GPT-5,尽管GPT-5的基准表现更高。
    • 通过LLM编辑增强的人类建议提高了感知质量,缩小了与LLM生成建议的差距。
    • 专家指导的LLM编辑减少了阿谀行为并增强了人性化感知,但未能始终优于仅由LLM编辑的建议。
  • 相较基准的优势:
    • LLM生成的建议在清晰度、有效性、个性化以及再次寻求建议的意愿方面均优于Reddit评论。
    • 在某些情境下,经过LLM增强的人类建议更受青睐,尤其是在整体最佳排名中。
  • 实验/评估:
    • 研究1:161名参与者评估了50个Reddit帖子中的200条评论,比较了Reddit高赞评论、GPT-4o和GPT-5的建议。
    • 研究2:49名参与者评估了25个帖子中基于人类和LLM种子的增强建议,测试了仅LLM和LLM+专家管道。
    • 调查:148名本科生评估了建议型AI代理的品质和角色,将偏好与个体特质(如对AI的信任和幸福感)联系起来。
  • 局限性与未来工作:
    • 对其他领域或临床情境的普适性有限。
    • 关注感知质量而非长期行为结果。
    • 需要验证的建议质量框架以及关于依从性和幸福感影响的长期研究。
    • 探索AI披露效应以及对建议机制的更丰富内容分析。

总结

本文提供了前沿LLMs(GPT-4o、GPT-5)在幸福感情境中优于众包人类建议的证据,其中GPT-4o尽管基准表现低于GPT-5,但表现更为出色。增强管道表明,LLMs能够有效改进人类建议,而专家指导的编辑减少了阿谀行为并增强了人性化感知。用户对建议型AI的偏好因角色和个体特质而异,这表明了开发角色敏感型系统的潜力。未来工作应聚焦于长期影响、安全性验证以及优化建议质量和用户信任的人机混合生态系统。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222144/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791233
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文