可用且快速的交互式心理人脸重建

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作可解释人工智能(XAI)软件工程师与开发者HCI 研究员社会学家与人类学家

文献标题

Usable and Fast Interactive Mental Face Reconstruction

文献信息

  • 主题领域: 用户交互、深度学习、人脸建模
  • 关键词: 心理图像重建, 人脸, 用户建模, 深度学习, 生成模型, 系统可用性, 认知负荷, 排序算法

研究背景与问题

  • 问题或挑战:

    • 心理图像重建是将人脑中模糊的、未明确描述的图像还原为清晰图像的过程,具有诸多应用如个性化虚拟化身和目击者回忆犯罪嫌疑人。但这一问题具有挑战性,因为脑神经动态复杂且对其的理解有限。
    • 早期研究多依赖侵入性或昂贵的传感技术(如EEG或fMRI)或使用复杂的交互工具,但效果和可用性有限。
    • 现有方法(如基于CG-GAN的系统)虽然可以实现某些成果,但仍需用户进行繁杂的手动调整,交互复杂且耗时,可能增加用户的心理负担。
  • 为什么重要:

    • 高效、可用性强且易用的心理图像重建系统不仅可缩短生成时间,还可用于关键场景(如司法调查)中,从人类用户交互中获取关键线索。
  • 研究动机与相关工作:

    • 文献中提出的心理图像重建主要分为隐式和显式反馈两类。隐式反馈方法(例如EEG和fMRI)通常侵入性高且不便于日常使用,而显式反馈方法(例如基于用户输入选择的进化算法)面临可用性和效率的局限。
    • 作者旨在开发一种基于用户排序反馈的高效系统,利用深度模型从用户响应中提取最优信息并生成视觉上逼真的心理图像。

解决方案

  • 方法/解决方案:

    • 提出了一种名为“交互式心理人脸重建系统 (MFRS)”的方法,基于用户提供的图像相似性排序信息,结合生成模型实现心理图像的逐步重建。
    • 开发了一个计算用户模型,可模拟用户的排序行为,从而减少人工数据采集成本。
  • 创新之处:

    • 用户交互仅需要直观排序(ranking)而无需复杂调整,减轻用户认知负荷。
    • 使用预训练生成神经网络(StyleGAN2)生成人脸,综合了多个用户反馈支持高效迭代。
    • 提出一个数据驱动的重新编码架构,用以增强生成图像与用户心理图像的相似度。
    • 设计了学习用户行为的模拟模型,减少昂贵的数据采集需求同时提升算法性能。
  • 实施步骤与关键技术:

    1. 用户交互设计:
      • 包括20次迭代,每次向用户展示6张人脸样本,用户按相似度排序。
    2. 深度学习模型:
      • 用于整合20轮交互数据预测最终心理图像的潜向量。
      • 使用预训练StyleGAN2生成真实图像。
    3. 用户模型训练:
      • 利用真实人类排序反馈微调深度模型以达到更接近人类偏好的排序结果。
    4. 优化目标:
      • 在特征嵌入空间中优化生成的人脸与目标心理图像的余弦相似度。

研究成果

  • 具体成果与优势:

    • 与现有方法CG-GAN相比,该方法在系统可用性(SUS分数:85 vs. 59)、认知负荷(NASA-TLX分数:27 vs. 43)和完成时间(10分钟 vs. 17分钟)上显著提升。
    • 重建质量在视觉评分方面(4.1 vs. 3.9)与现有最佳方法相当,识别准确率(55.3% vs. 56.1%)无显著差异。
    • 用户对界面的直观性评价较高,反馈任务简单明了。
  • 实验与评估结果:

    • 用户研究中取得了高交互性和满意度。
    • 对比实验表明,20轮交互是任务时间与生成质量之间的最佳折衷点。
    • 在高交互性评价中,新的用户排序反馈方法显著优于手动调整的进化策略。
  • 局限性与未来方向:

    • 局限性包括:
      • 当前系统仍需优化以追求更高的视觉和心理图像一致性。
      • 基于合成数据的深度模型仍存在泛化风险。
      • 在实验中,目标面孔总是已知的,但真实应用中不能保证。
    • 未来方向:
      • 探究动态停止机制以减少用户任务时间,同时维持高质量重建。
      • 优化用户反馈界面以逐步减少用户排序中的不确定性。
      • 拓展研究至更复杂或动态场景,包括真实视频或记忆干扰的评估。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/126743/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3586183.3606795
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、HCI 研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文