Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions

文献信息

  • 主题领域: 编程辅助工具的性能比较与用户行为分析
  • 关键词: Stack Overflow, 问答平台, 大型语言模型, ChatGPT, 误信息

研究背景与问题

  • 发现问题或挑战:
    • 随着 ChatGPT 等大型语言模型(LLM)的广泛应用,其对程序员在线寻求帮助行为的影响逐渐深入。
    • ChatGPT的答案质量(例如正确性、一致性、全面性以及简洁性)尚未得到系统性分析。
    • ChatGPT生成的误信息可能误导用户,从而造成软件设计缺陷甚至潜在社会风险。
  • 研究重要性:
    • 误信息的传播可能威胁软件质量、网络安全以及整个社会的正常运行。
    • 程序员逐渐倾向于使用 ChatGPT,而非传统社区平台(如 Stack Overflow),需要深入了解这一趋势及其影响。
  • 研究动机与相关工作:
    • 现有研究主要集中于 ChatGPT 在法律、金融、医疗等领域的能力对比,缺少对编程问题的回答质量与特性的全面分析。
    • 本研究旨在填补这一空白,探索 ChatGPT 在编程问题回答中的表现以及编程社区对其的感知。

研究问题

研究从以下几方面展开:

  1. ChatGPT的答案与Stack Overflow回答在正确性和质量方面有哪些差异?
  2. ChatGPT答案的质量问题有哪些细化分类?出现问题的具体原因是什么?
  3. 编程问题的种类是否影响ChatGPT答案的质量?
  4. ChatGPT答案的语言表达特性与Stack Overflow答案之间有何差异?
  5. ChatGPT答案的情感基调是否与Stack Overflow答案不同?
  6. 程序员是否能区分ChatGPT答案与人类撰写答案?
  7. 程序员能否识别ChatGPT答案中的误信息?
  8. 程序员在选择答案时更倾向于偏好ChatGPT还是Stack Overflow?

解决方案

  • 研究方法与步骤:

    • 数据采集: 从Stack Overflow获取517个编程问题,并通过ChatGPT生成对应答案;同时随机采样2000个问题用于语言学分析。
    • 手动分析: 使用多标签的开放式编码方法对ChatGPT答案进行细化标注,重点关注正确性、一致性、全面性及精简程度。
    • 语言学与情感分析: 使用LIWC工具和RoBERTa情感分析模型对语言特征与情感基调进行自动化评估。
    • 用户研究: 设计了一项涉及12位参与者的用户实验,包括回答质量评分、偏好选择以及误信息辨识。
  • 技术创新性:

    • 提出了ChatGPT回答问题错误的分类体系并揭示其根本原因。
    • 通过语言学分析揭示ChatGPT答案在正式程度、分析性和情感上的特性。
    • 包括通过用户实验揭示程序员偏好和对误信息的敏感性。

研究成果

主要发现:

  1. ChatGPT回答的错误特性:

    • 正确性不足: 52%答案包含误信息,其中概念性错误占比最高(54%)。
    • 语言繁琐: 77%答案存在冗余、无关或过量信息。
    • 一致性问题: 78%答案与人类答案存在一致性差异,包括概念性、一致性以及提供解决方案数量的不同。
    • 语言表达特性: ChatGPT答案更正式、分析性强,情感基调更正面,而人类答案更随意但表达了更多风险警告。
  2. 用户对回答的感知:

    • 人类答案在正确性、简洁性和实用性上的评分明显高于ChatGPT。
    • 用户对ChatGPT答案更高的语言素养和全面性表示认可,但约39%用户未能识别其中误信息。
  3. 问题类型对质量的影响:

    • 流行性与新旧问题:更流行和较旧的问题其答案质量较高。
    • 问题类型:调试问题答案不够准确但更简洁,而概念性问题及操作指南类问题较为冗长。

局限性与未来方向:

  • 局限性:

    • 数据偏向于ChatGPT的免费版本(GPT-3.5),可能不同于最新的GPT-4表现。
    • 未考虑多轮交互对回答质量的潜在提升。
    • 分析过程中存在主观性与人类偏好的影响。
  • 未来方向:

    • 开发更深入的验证机制以降低误信息的影响,包括框架内对生成内容的自动审查。
    • 探索改善大型语言模型的推理能力及问题语义理解。
    • 提高对编程任务的不确定性沟通以及开发有效的可视化框架。
    • 在教育领域,使用错误文本作为学习素材的新教学方法。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146667/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642596
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文