反对无效!普通民众可以区分大型语言模型和律师,但仍倾向于接受LLM的建议

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责网络安全工程师AI/ML 研究员与工程师律师与法律研究员HCI 研究员

研究背景与问题

  • 作者发现了哪些问题或挑战?
    随着大型语言模型(LLM)在各个领域的渗透,其在法律领域的应用也获得了关注。LLM可能提供可靠的法律建议,但其“幻觉”(即生成不准确或虚假的文本内容)的风险对公众构成威胁。本研究主要探讨:

    1. 是否普通人更愿意采纳LLM生成的法律建议,而非律师提供的建议?
    2. 当建议的来源未知时,普通人能否区分LLM与律师生成的法律建议?
  • 为什么这个问题很重要?
    LLM技术在法律领域的使用可能影响公众对法律建议的信任,而公众在高风险场景中对这些建议的选择和行为可能产生广泛的社会后果。例如,不准确的法律建议可能导致个人决策错误,或对司法系统产生负面影响。

  • 研究动机与相关工作
    以前的研究表明,人们对算法生成内容存在一定的信任,但算法可能导致错误或误导。同时,有调查显示公众对使用LLM生成法律建议表现出高度兴趣,但尚未深入研究人们是否会愿意实际采纳这些建议,以及其辨别能力。

解决方案

  • 作者提出了哪些方法或解决方案?
    作者设计了三项实验,通过对比LLM与律师生成的法律建议,调查普通人的行为倾向及辨别能力:

    1. 实验1:比较当法律建议来源已知或未知时,参与者对建议采纳意愿的差异。
    2. 实验2:复制实验1中的“来源未知”条件,以验证核心结果的可靠性。
    3. 实验3:评估参与者在不知道建议来源的情况下,辨别建议来源的准确性(通过ROC曲线分析)。
  • 该解决方案的创新之处是什么?
    研究关注了LLM生成的法律建议在“来源未知”场景中的影响,揭示了与传统专业领域(如律师)相比,公众信任LLM的趋势。这种设计弥补了现有文献中关于公众行为决策和辨别能力的空白。

  • 实施步骤是什么?使用了哪些关键技术?

    1. 准备18个基于英国法律的真实法律问题:由律师和ChatGPT-4生成对应法律建议。
    2. 设置实验条件:包括法律建议来源已知与未知的对比,以及对参与者辨别能力的评估。
    3. 使用统计分析(如ROC曲线)和Bayes因子检验参与者意愿及准确性。
    4. 分析公众对LLM生成建议的偏好原因,并提出对信任偏差的解决路径。

研究成果

  • 取得了哪些具体成果?

    1. 实验1和2:当法律建议来源未知时,参与者显著更倾向于采纳LLM生成的建议,而当来源已知时,参与者对律师生成建议的倾向更高。
    2. 实验3:虽然参与者在“来源未知”时对LLM有更高采纳意愿,但他们能够显著地(AUC = 0.59)区分LLM与律师生成建议。
  • 与现有解决方案相比,它有哪些优势?
    本研究揭示了公众对LLM生成法律建议“高采纳意愿与有限辨别能力”并存的现象,扩展了现有文献对AI信任和行为倾向的理解,尤其是在高风险法律场景下。

  • 实验或评估结果是什么?

    1. 实验1和2的结果显示:LLM生成建议在未知来源场景中受到更多青睐(LLM:M=7.32;律师:M=7.02)。
    2. 实验3的ROC分析表明,参与者能够区分建议来源,但准确性有限(59%的概率高于随机性)。
  • 局限性与未来方向

    1. 局限性:律师建议和LLM生成内容的复杂度与长度可能存在差异;所选LLM样本仅局限于ChatGPT-4;未评估建议的准确性。
    2. 未来方向:
      • 探索影响公众行为决策的具体因素(如语言复杂度或社交偏差)。
      • 验证LLM与律师共同协作生成建议的可能性。
      • 针对公众受教育和AI内容剖析能力设计干预措施,提高辨别能力。
      • 考察不同语言模型(如Google Gemini)的行为效果。

总结

这项研究表明,普通人在采纳LLM生成法律建议时表现出超乎预期的倾向,且虽然能够辨别建议来源,但辨别能力较低。研究强调了LLM在高风险场景中应用的潜在风险,如“幻觉”问题,并提出需要提升公众的AI识别能力和相关政策(如欧盟AI法)的重要性,同时为法律领域中的AI研究提供了未来方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189004/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713470
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
网络安全工程师、AI/ML 研究员与工程师、律师与法律研究员、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文