D-Twins:专为实时无聊干预设计的数字双胞胎
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者AI/ML 研究员与工程师
研究背景与问题
- 作者发现的问题或挑战: 自动化环境中的无聊感无处不在,尤其是在低刺激性的工作任务中,例如监控数据或参与长时间在线会议。传统对话代理缺乏个性化、情感理解能力,仅能使用预定义任务或有限的对话语料库,无法准确识别和响应用户的情绪,使得减轻无聊的效果有限。
- 为什么这个问题很重要: 无聊不仅影响个人体验,也会降低工作效率,增加操作错误,甚至可能导致安全隐患,例如在无人驾驶车辆监控中的注意力减退。解决无聊问题可以提高用户的警觉性和生产力,改善自动化环境中的人机交互体验。
- 研究动机与相关工作: Affective AI 和大规模语言模型 (LLM) 提供了更强的情感识别能力和灵活的互动方式,结合用户生理数据可以创建个性化 AI 代理。这种具备情感共鸣的“数字孪生”可以探索实时的无聊解决方案。
解决方案
- 作者提出的方法或解决方案: 作者提出了一种基于 LLM 的情感 AI 代理“D-Twins”,能够实时反映用户的情绪状态和个性,通过用户的表达和 EEG(脑电图)数据来检测无聊并提供个性化干预。
- 该解决方案的创新之处:
- 数字反映: D-Twins 通过自然语言处理创建个性化的 AI 代理,能够体现用户的个性特征。
- 情感状态对齐: 同用户共享情感状态,能够通过“情绪共鸣”来增强交互体验。
- 实时个性化干预: 集成 EEG 数据实时检测无聊状态,并根据检测结果动态调整干预策略。
- 实施步骤与关键技术:
- 数据收集与建模: 使用 Wizard-of-Oz 方法收集用户对话数据,用于训练个性化的大规模语言模型。
- 无聊检测模型: 通过 50 名参与者的 EEG 数据训练基于支持向量机 (SVM) 的无聊分类器,准确率最高达 87.2%。
- 系统集成: 将 LLM 模型与 EEG 检测功能集成到 D-Twins 中,通过动态交互框架执行无聊缓解和情绪激活功能。
研究成果
- 取得的具体成果: 实验表明,D-Twins 能够有效检测用户的无聊状态,并通过个性化的对话缓解无聊。这种实时干预不仅减少了无聊,还增加了用户的参与感和信任感。
- 与现有解决方案相比的优势:
- 高度个性化:体现用户语言、行为和性格特点的数字孪生。
- 情感共鸣:通过共享用户的情感状态(如无聊),增强交互体验。
- 实时灵活性:利用 EEG 数据,动态调整模型的反应。
- 实验或评估结果:
- 主观评价显示,用户的无聊水平显著降低(Wilcoxon 检验 p < 0.01),尤其是在注意力、时间感知、低唤醒度等维度。
- EEG 数据表明,与无干预状态相比,干预状态下用户的脑电波信号(如 θ 和 α 波)模式更接近非无聊状态,证明 D-Twins 在改善用户情绪上的有效性。
- 用户对 D-Twins 表现出的语言和行为与自身的相似性感到满意,这增加了互动深度和情感连接。
- 局限性与未来方向:
- 任务设计: 当前任务简单,无法衡量无聊对实际工作表现的影响,未来需要更复杂的场景以量化干预效果。
- 多模式交互: D-Twins 仅使用文本对话,缺乏多模态信息(如视觉、语音),导致社交存在感较低,未来可探索视频和音频整合。
- 长期应用: 无聊检测和干预效果验证主要在实验环境中,需进一步扩展到更广泛的用户群体或真实场景。
总结
本研究成功设计并验证了个性化 AI 代理 D-Twins,其结合 LLM 和 EEG 技术,实时检测无聊并提供个性化干预。通过与用户共享情感状态和个性化对话,D-Twins 不仅显著减轻了用户的无聊,还验证了情感共鸣的潜力,为提升人机交互体验提供了新路径。这项研究为未来的 AI 应用在自动化环境中的个性化和实时干预提供了重要参考,同时揭示了设计高度人性化 AI 代理时需要注意的挑战和机遇。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 基于大语言模型(LLM)的个性化AI能否通过情绪共振有效缓解用户在自动化环境中的无聊感?分类: 自我调节、心理负荷与行为改变支持同类问题arrow_forward
- 整合EEG脑电数据的无聊检测模型在实时干预中能达到何种准确性和效果?分类: 自我调节、心理负荷与行为改变支持同类问题arrow_forward
- D-Twins如何利用用户的语言和行为特征实现高水平的个性化交互?分类: 自我调节、心理负荷与行为改变支持同类问题arrow_forward
lightbulb
现实痛点
1- 用户在枯燥的自动化任务中易感到无聊,降低效率和警觉性。分类: 自我调节、心理负荷与行为改变支持同类问题arrow_forward
- 100%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 100%
《它想让我怎么说》:弥合最终用户程序员与代码生成大型语言模型之间的抽象差距
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 100%
接受、拒绝还是修正:人机协作中生产力与信任的度量
IUI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
通过自动生成的图像画廊探索生成对抗网络(GANs)的方法
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 80%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
Ivie:新生成代码的轻量级锚定解释
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
科学组织中知识工作者的生成式AI用途与风险
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
探索空白空间:人机交互数据增强
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714163
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文