下面隐藏着什么?探讨AI注入系统中底层AI模型更新的影响

生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)AI 辅助决策与自动化系统AI/ML 研究员与工程师HCI 研究员认知科学家社会学家与人类学家

研究背景与问题

  • 问题与挑战:论文研究了AI模型的频繁更新问题,尤其是这些更新往往以“静默”或最低限度的方式进行,用户无从知晓更改。这种“黑盒”模型更新可能会对用户的行为、任务表现以及对AI系统的信任产生深远影响,但该领域的研究尚未充分展开。
  • 重要性:随着AI模型在不同领域的广泛使用(如健康、金融、图像识别等),理解更新如何影响用户互动,以减少工作流中断并最大化更新收益,显得尤为关键。
  • 研究动机与相关工作:AI更新可能带来全新能力,但可能意外破坏现有工作流或导致错误结果。尽管现有指导原则建议通知用户修改内容,但由于全面基准测试的复杂性,实际的设计和沟通常被弱化。

解决方案

  • 研究方法:作者通过两项研究探讨AI模型更新对用户的影响:
    1. 在线实验:模拟用户在不知晓模型更新的情况下执行历史照片的识别任务,观察用户能否感知模型变更以及对行为、表现的影响。
    2. 日记研究:研究真实部署中的用户如何感知不同版本的AI模型,并探索他们对模型性能的偏好。
  • 创新点:
    • 结合实验与真实场景部署,以多维度探索AI模型更新的实际影响。
    • 提及用户开发的“民间理论”(folk theories),分析用户对AI行为背后的独特认知和假设。
  • 实施步骤与关键技术:
    1. 在实验中,模拟历史照片识别任务,用户在不知晓模型差异的情况下完成8轮试验。
    2. 在真实平台中,赋予用户对两种模型(新旧版本)的显性控制权,允许用户切换并记录对比结果。
    3. 数据收集包括用户行为、准确性评价、模型偏好和任务表现等指标。

研究成果

  • 主要成果:
    1. 在实验中,参与者对于模型切换的辨别几乎接近随机水平(准确度仅为48.87%);即使新模型性能更好,其能力未能被用户完全利用。
    2. 在真实部署中,大多数用户倾向于新模型(因更高的精准性和质量),但部分人因老模型提供更多结果选项而偏好旧模型。
    3. 用户形成了关于模型行为的多种相互矛盾的“民间理论”(例如,认为某模型更注重特定面部特征或对年龄更敏感)。
  • 与现有方案比较:
    • 提供了对比实验和真实世界研究的系统化框架,帮助展示了模型更新对用户行为的潜在复杂影响。
    • 揭示了静默更新面临的信任与效能问题,不同于鲜有实证研究的传统软件更新领域。
  • 实验评估:
    • 实验结果:在实验中,新模型效率提升较大(召回率从老模型的56.05%提升至62.64%),但未转化为用户的显著绩效增益。
    • 行为分析:用户在新模型环境中更快完成任务,但调整自身交互行为的速度和范围有限。
  • 局限性与未来方向:
    1. 局限性:参与者在实验中的短期接触和熟悉程度有限,生态有效性可能有所限制。
    2. 未来方向:建议开发动态沟通策略,例如基于用户行为的个性化指导,探索设计教育型界面以减少性能差异的服务设计。

总结:本研究通过两项互补的实验揭示了AI模型更新对用户行为和任务绩效的显著影响,特别是静默更新不足以让用户感知改进。论文建议更多关注以用户为中心的更新沟通方式,如结合动态基于行为的提示或多模态解释方法,使得用户能够更充分地采用和信任更新后的AI系统。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188738/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713751
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文