Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions
文献信息
- 主题领域: 编程辅助工具的性能比较与用户行为分析
- 关键词: Stack Overflow, 问答平台, 大型语言模型, ChatGPT, 误信息
研究背景与问题
- 发现问题或挑战:
- 随着 ChatGPT 等大型语言模型(LLM)的广泛应用,其对程序员在线寻求帮助行为的影响逐渐深入。
- ChatGPT的答案质量(例如正确性、一致性、全面性以及简洁性)尚未得到系统性分析。
- ChatGPT生成的误信息可能误导用户,从而造成软件设计缺陷甚至潜在社会风险。
- 研究重要性:
- 误信息的传播可能威胁软件质量、网络安全以及整个社会的正常运行。
- 程序员逐渐倾向于使用 ChatGPT,而非传统社区平台(如 Stack Overflow),需要深入了解这一趋势及其影响。
- 研究动机与相关工作:
- 现有研究主要集中于 ChatGPT 在法律、金融、医疗等领域的能力对比,缺少对编程问题的回答质量与特性的全面分析。
- 本研究旨在填补这一空白,探索 ChatGPT 在编程问题回答中的表现以及编程社区对其的感知。
研究问题
研究从以下几方面展开:
- ChatGPT的答案与Stack Overflow回答在正确性和质量方面有哪些差异?
- ChatGPT答案的质量问题有哪些细化分类?出现问题的具体原因是什么?
- 编程问题的种类是否影响ChatGPT答案的质量?
- ChatGPT答案的语言表达特性与Stack Overflow答案之间有何差异?
- ChatGPT答案的情感基调是否与Stack Overflow答案不同?
- 程序员是否能区分ChatGPT答案与人类撰写答案?
- 程序员能否识别ChatGPT答案中的误信息?
- 程序员在选择答案时更倾向于偏好ChatGPT还是Stack Overflow?
解决方案
-
研究方法与步骤:
- 数据采集: 从Stack Overflow获取517个编程问题,并通过ChatGPT生成对应答案;同时随机采样2000个问题用于语言学分析。
- 手动分析: 使用多标签的开放式编码方法对ChatGPT答案进行细化标注,重点关注正确性、一致性、全面性及精简程度。
- 语言学与情感分析: 使用LIWC工具和RoBERTa情感分析模型对语言特征与情感基调进行自动化评估。
- 用户研究: 设计了一项涉及12位参与者的用户实验,包括回答质量评分、偏好选择以及误信息辨识。
-
技术创新性:
- 提出了ChatGPT回答问题错误的分类体系并揭示其根本原因。
- 通过语言学分析揭示ChatGPT答案在正式程度、分析性和情感上的特性。
- 包括通过用户实验揭示程序员偏好和对误信息的敏感性。
研究成果
主要发现:
-
ChatGPT回答的错误特性:
- 正确性不足: 52%答案包含误信息,其中概念性错误占比最高(54%)。
- 语言繁琐: 77%答案存在冗余、无关或过量信息。
- 一致性问题: 78%答案与人类答案存在一致性差异,包括概念性、一致性以及提供解决方案数量的不同。
- 语言表达特性: ChatGPT答案更正式、分析性强,情感基调更正面,而人类答案更随意但表达了更多风险警告。
-
用户对回答的感知:
- 人类答案在正确性、简洁性和实用性上的评分明显高于ChatGPT。
- 用户对ChatGPT答案更高的语言素养和全面性表示认可,但约39%用户未能识别其中误信息。
-
问题类型对质量的影响:
- 流行性与新旧问题:更流行和较旧的问题其答案质量较高。
- 问题类型:调试问题答案不够准确但更简洁,而概念性问题及操作指南类问题较为冗长。
局限性与未来方向:
-
局限性:
- 数据偏向于ChatGPT的免费版本(GPT-3.5),可能不同于最新的GPT-4表现。
- 未考虑多轮交互对回答质量的潜在提升。
- 分析过程中存在主观性与人类偏好的影响。
-
未来方向:
- 开发更深入的验证机制以降低误信息的影响,包括框架内对生成内容的自动审查。
- 探索改善大型语言模型的推理能力及问题语义理解。
- 提高对编程任务的不确定性沟通以及开发有效的可视化框架。
- 在教育领域,使用错误文本作为学习素材的新教学方法。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- ChatGPT与Stack Overflow的答案在正确性和质量上有哪些差异?分类: LLM使用不满、策略调整与满意度同类问题arrow_forward
- ChatGPT答案中的质量问题具体有哪些类别,其根本原因是什么?分类: LLM使用不满、策略调整与满意度同类问题arrow_forward
- 程序员能否区分ChatGPT生成的答案和人工书写的答案,并识别其中的误导信息?分类: LLM使用不满、策略调整与满意度同类问题arrow_forward
lightbulb
现实痛点
1- 程序员越来越依赖ChatGPT回答技术问题,但其误导性信息可能导致代码缺陷。分类: LLM使用不满、策略调整与满意度同类问题arrow_forward
- 86%
美国大型科技公司采用AI优先政策的日常实践者体验
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 83%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
人们是否适当依赖人工智能建议?人机交互研究中关于人机决策的分析综述
CHI '26· AI 辅助决策与自动化系统 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642596
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文