当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员精神科医生与心理咨询师
文献标题
When AI Gives Advice: Evaluating AI and Human Responses to Online Advice-Seeking for Well-Being
出版信息
- 主题领域: 在幸福感情境中评估AI生成的建议与人类建议的对比。
- 关键词: AI建议、幸福感、GPT-4o、GPT-5、人机协作、Reddit、阿谀行为、建议质量、增强管道、用户偏好。
背景与问题
- 问题/挑战: 大型语言模型(LLMs)在日常幸福感情境中生成建议的质量尚不明确,尤其是与来自Reddit等众包平台的人类建议相比。
- 重要性: 随着LLMs成为个人指导的普遍工具,理解AI生成建议的有效性至关重要,这可能会重新塑造人们寻求和采纳建议的方式。
- 动机与相关研究: 先前研究表明,同理心的同伴交流和众包建议平台具有治疗价值,但也存在延迟、低留存率以及持续支持机会缺失等局限性。LLMs可以提供可扩展、个性化的建议,但容易出现阿谀行为和过度依赖的风险。本研究基于这些发现,比较了LLM建议与高赞人类建议,并探索了人机协作的增强管道。
解决方案
- 提出的方法: 通过盲评专家评分和偏好判断,实证评估建议质量,比较LLM生成的建议(GPT-4o、GPT-5)与Reddit评论,并测试结合人类和AI建议的增强管道。
- 创新性:
- 在六个幸福感维度上,对LLM建议和众包人类建议进行盲评的专家对比。
- 识别基准提升与实际建议质量之间的权衡,显示GPT-4o优于GPT-5。
- 探索人机协作管道,展示LLMs如何改进人类建议,反之亦然。
- 流程与关键技术:
- 研究1:通过专家评分比较Reddit评论和LLM生成的建议,在六个维度(如清晰度、个性化、阿谀行为)上进行评估,并对整体有效性和长期收益进行排名。
- 研究2:测试增强管道,其中LLMs改进人类或AI生成的建议,有无专家指导,并评估感知质量和AI生成性。
- 调查:探索用户对建议型AI角色(教练与朋友)的偏好,以及偏好如何因对AI的信任和基础幸福感而异。
结果
- 具体发现:
- 在所有六个质量维度上,GPT-4o和GPT-5均优于Reddit的高赞评论,GPT-4o在大多数情况下排名高于GPT-5,尽管GPT-5的基准表现更高。
- 通过LLM编辑增强的人类建议提高了感知质量,缩小了与LLM生成建议的差距。
- 专家指导的LLM编辑减少了阿谀行为并增强了人性化感知,但未能始终优于仅由LLM编辑的建议。
- 相较基准的优势:
- LLM生成的建议在清晰度、有效性、个性化以及再次寻求建议的意愿方面均优于Reddit评论。
- 在某些情境下,经过LLM增强的人类建议更受青睐,尤其是在整体最佳排名中。
- 实验/评估:
- 研究1:161名参与者评估了50个Reddit帖子中的200条评论,比较了Reddit高赞评论、GPT-4o和GPT-5的建议。
- 研究2:49名参与者评估了25个帖子中基于人类和LLM种子的增强建议,测试了仅LLM和LLM+专家管道。
- 调查:148名本科生评估了建议型AI代理的品质和角色,将偏好与个体特质(如对AI的信任和幸福感)联系起来。
- 局限性与未来工作:
- 对其他领域或临床情境的普适性有限。
- 关注感知质量而非长期行为结果。
- 需要验证的建议质量框架以及关于依从性和幸福感影响的长期研究。
- 探索AI披露效应以及对建议机制的更丰富内容分析。
总结
本文提供了前沿LLMs(GPT-4o、GPT-5)在幸福感情境中优于众包人类建议的证据,其中GPT-4o尽管基准表现低于GPT-5,但表现更为出色。增强管道表明,LLMs能够有效改进人类建议,而专家指导的编辑减少了阿谀行为并增强了人性化感知。用户对建议型AI的偏好因角色和个体特质而异,这表明了开发角色敏感型系统的潜力。未来工作应聚焦于长期影响、安全性验证以及优化建议质量和用户信任的人机混合生态系统。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
为心理健康进行 AI 负责任设计:AI 作为专科护理、营养补充剂还是瑜伽教练?
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
FAIR:定位AI在编程竞赛中的角色——理解LLM如何改变竞技编程格局
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
大型语言模型在同伴主导的社区行为健康服务中的应用:理解同伴专家与服务用户对机会、风险与缓解策略的视角
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
角色分配:人机协作决策中大语言模型角色原型研究
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791233
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文