反对无效!普通民众可以区分大型语言模型和律师,但仍倾向于接受LLM的建议
作者
研究背景与问题
-
作者发现了哪些问题或挑战?
随着大型语言模型(LLM)在各个领域的渗透,其在法律领域的应用也获得了关注。LLM可能提供可靠的法律建议,但其“幻觉”(即生成不准确或虚假的文本内容)的风险对公众构成威胁。本研究主要探讨:- 是否普通人更愿意采纳LLM生成的法律建议,而非律师提供的建议?
- 当建议的来源未知时,普通人能否区分LLM与律师生成的法律建议?
-
为什么这个问题很重要?
LLM技术在法律领域的使用可能影响公众对法律建议的信任,而公众在高风险场景中对这些建议的选择和行为可能产生广泛的社会后果。例如,不准确的法律建议可能导致个人决策错误,或对司法系统产生负面影响。 -
研究动机与相关工作
以前的研究表明,人们对算法生成内容存在一定的信任,但算法可能导致错误或误导。同时,有调查显示公众对使用LLM生成法律建议表现出高度兴趣,但尚未深入研究人们是否会愿意实际采纳这些建议,以及其辨别能力。
解决方案
-
作者提出了哪些方法或解决方案?
作者设计了三项实验,通过对比LLM与律师生成的法律建议,调查普通人的行为倾向及辨别能力:- 实验1:比较当法律建议来源已知或未知时,参与者对建议采纳意愿的差异。
- 实验2:复制实验1中的“来源未知”条件,以验证核心结果的可靠性。
- 实验3:评估参与者在不知道建议来源的情况下,辨别建议来源的准确性(通过ROC曲线分析)。
-
该解决方案的创新之处是什么?
研究关注了LLM生成的法律建议在“来源未知”场景中的影响,揭示了与传统专业领域(如律师)相比,公众信任LLM的趋势。这种设计弥补了现有文献中关于公众行为决策和辨别能力的空白。 -
实施步骤是什么?使用了哪些关键技术?
- 准备18个基于英国法律的真实法律问题:由律师和ChatGPT-4生成对应法律建议。
- 设置实验条件:包括法律建议来源已知与未知的对比,以及对参与者辨别能力的评估。
- 使用统计分析(如ROC曲线)和Bayes因子检验参与者意愿及准确性。
- 分析公众对LLM生成建议的偏好原因,并提出对信任偏差的解决路径。
研究成果
-
取得了哪些具体成果?
- 实验1和2:当法律建议来源未知时,参与者显著更倾向于采纳LLM生成的建议,而当来源已知时,参与者对律师生成建议的倾向更高。
- 实验3:虽然参与者在“来源未知”时对LLM有更高采纳意愿,但他们能够显著地(AUC = 0.59)区分LLM与律师生成建议。
-
与现有解决方案相比,它有哪些优势?
本研究揭示了公众对LLM生成法律建议“高采纳意愿与有限辨别能力”并存的现象,扩展了现有文献对AI信任和行为倾向的理解,尤其是在高风险法律场景下。 -
实验或评估结果是什么?
- 实验1和2的结果显示:LLM生成建议在未知来源场景中受到更多青睐(LLM:M=7.32;律师:M=7.02)。
- 实验3的ROC分析表明,参与者能够区分建议来源,但准确性有限(59%的概率高于随机性)。
-
局限性与未来方向
- 局限性:律师建议和LLM生成内容的复杂度与长度可能存在差异;所选LLM样本仅局限于ChatGPT-4;未评估建议的准确性。
- 未来方向:
- 探索影响公众行为决策的具体因素(如语言复杂度或社交偏差)。
- 验证LLM与律师共同协作生成建议的可能性。
- 针对公众受教育和AI内容剖析能力设计干预措施,提高辨别能力。
- 考察不同语言模型(如Google Gemini)的行为效果。
总结
这项研究表明,普通人在采纳LLM生成法律建议时表现出超乎预期的倾向,且虽然能够辨别建议来源,但辨别能力较低。研究强调了LLM在高风险场景中应用的潜在风险,如“幻觉”问题,并提出需要提升公众的AI识别能力和相关政策(如欧盟AI法)的重要性,同时为法律领域中的AI研究提供了未来方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
2- 普通人是否更愿意采纳大型语言模型(LLMs)生成的法律建议,而不是由律师提供的建议?分类: 医疗风险解释与假设探索同类问题arrow_forward
- 在法律建议的来源未知时,普通人是否能区分LLMs生成的建议与律师提供的建议?分类: 医疗风险解释与假设探索同类问题arrow_forward
现实痛点
1- 普通人可能在高风险场景中信任不准确的LLM生成法律建议。分类: 医疗风险解释与假设探索同类问题arrow_forward
- 71%
交互上下文通常会增加大型语言模型中的谄媚行为
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 63%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 63%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 63%
视角问题:对比人类和大型语言模型在微妙性别歧视主观决策中的论证
CHI '25· 大语言模型(LLM)的人机协作 +2
- 63%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 63%
当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
FAIR:定位AI在编程竞赛中的角色——理解LLM如何改变竞技编程格局
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)