校园 AI 与商业 AI:比较学生和员工对其大学 LLM 聊天机器人与 ChatGPT 的感知
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统大学教授与研究人员软件工程师与开发者HCI 研究员
文献标题
Campus AI vs. Commercial AI: Comparing How Students and Employees Perceive their University’s LLM Chatbot vs. ChatGPT
出版信息
- 主题领域: 定制化LLMaaS聊天机器人与商业LLM聊天机器人在学术环境中的用户感知对比。
- 关键词: LLMaaS, ChatGPT, 用户信任, 隐私, 幻觉, 可持续性, 学术AI, 聊天机器人定制化, 信任校准, 人机交互。
背景与问题
- 问题/挑战: 现有研究主要关注LLMaaS聊天机器人的技术适配,但忽略了用户感知,尤其是与商业替代品如ChatGPT的比较。
- 重要性: 理解用户感知对于大学采用AI系统至关重要,以确保信任、隐私和适当使用,同时尽量减少幻觉和隐私问题等风险。
- 动机与相关研究: 先前研究强调了LLM聊天机器人在学术领域的日益普及,以及AI系统中信任和隐私的重要性。然而,用户面向的定制化对感知和行为的影响尚未充分探索。本研究通过比较大学定制化的LLMaaS聊天机器人与ChatGPT来填补这一空白。
解决方案
- 提出的方法: 基于调查的现场研究,比较用户对大学定制化LLMaaS聊天机器人和ChatGPT的感知,重点关注信任、隐私、幻觉和可持续性意识的AI使用。
- 创新点:
- 证明定制化LLMaaS聊天机器人相比ChatGPT具有更高的信任、更大的隐私感知以及更少的幻觉感知。
- 基于信任评估模型(Trustworthiness Assessment Model, TrAM),理论化定制化线索(如品牌和界面设计)在塑造用户感知中的作用。
- 将信任校准的概念扩展到学术AI使用案例中的隐私和幻觉领域。
- 提供设计和部署LLMaaS聊天机器人的实践建议,以使用户感知与系统能力保持一致。
- 研究程序与关键技术:
- 对德国某大学的526名参与者(学生和员工)进行调查。
- 聚焦于116名同时定期使用大学聊天机器人和ChatGPT的参与者进行组内比较。
- 测量信任、隐私担忧、幻觉感知、谨慎行为以及可持续性意识的AI使用。
- 进行探索性基准评估(TruthfulQA和HaluEval),以评估幻觉倾向和检测性能。
结果
- 具体发现:
- 定制化LLMaaS聊天机器人的信任显著高于ChatGPT(M = 3.60,ChatGPT M = 3.08,p < 0.001,d = 0.73)。
- 定制化聊天机器人的隐私感知更高(M = 2.38),而ChatGPT的隐私感知较低(M = 3.61,p < 0.001,d = -1.15)。
- 定制化聊天机器人中幻觉感知较少(M = 3.23),而ChatGPT中幻觉感知较多(M = 3.85,p < 0.001,d = -0.72)。
- 对幻觉的谨慎行为和可持续性意识的AI使用未显示显著差异。
- 基准评估显示定制化聊天机器人的幻觉发生率更高(TruthfulQA中50% vs. 38%),但幻觉检测性能略优(HaluEval中F1分数:0.7591 vs. 0.7397)。
- 相较基线的优势:
- 定制化LLMaaS聊天机器人被认为更值得信赖且更注重隐私,尽管其使用的底层LLM技术与ChatGPT相同。
- 机构品牌和界面设计可能对用户感知产生了积极影响。
- 实验/评估:
- 基于调查的现场研究,使用配对t检验进行组内比较。
- 探索性基准评估(TruthfulQA和HaluEval),以评估幻觉倾向和检测性能。
- 局限性与未来工作:
- 双系统用户子样本中的自我选择偏差。
- 依赖自我报告的测量;未来研究应包括行为数据。
- 在非欧洲背景或学术领域以外的领域中推广性有限。
- 需要实验设计以隔离特定定制化线索对用户感知的影响。
总结
本研究探讨了学生和员工如何感知大学定制化LLMaaS聊天机器人与ChatGPT的差异。尽管基准证据显示定制化聊天机器人的幻觉率更高,但其与更高的信任、更大的隐私感知以及更少的幻觉感知相关。这些差异突显了定制化线索(如品牌和界面设计)对用户感知的影响。研究结果强调了将用户感知与系统能力保持一致的重要性,以确保校准信任和适当使用。未来研究应探索定制化线索与用户感知之间的因果关系,并将研究结果扩展到其他背景和领域。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
利用AI重构的正面总结来理解和支持同行评审
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
OmniQuery:上下文化增强捕获的多模态记忆以实现个人问题回答
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
交互式机器学习中可控性与认知负荷的多模态研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
理解大型语言模型在个性化和构建策略以对抗学术拖延中的作用
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
SummAct:通过交互行为总结揭示用户意图
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
好奇心特质与按需解释在AI辅助决策中的影响
IUI '25· 可解释人工智能(XAI) +1
- 63%
DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790622
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
大学教授与研究人员、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文