OmniQuery:上下文化增强捕获的多模态记忆以实现个人问题回答

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统软件工程师与开发者数据科学家与分析师HCI 研究员

研究背景与问题

  • 作者发现了哪些问题或挑战? 作者指出,尽管现有的人工智能工具可以通过自然语言查询照片、视频等记录的个人记忆,但这些工具主要用于检索单个信息片段(例如,照片中的特定物体),却难以回答需要上下文关联的更复杂问题。这是因为这些“捕获的记忆”通常缺乏明确的上下文信息,而这类信息往往隐含地分散在多个互相关联的记忆中。

  • 为什么这个问题很重要? 掌握更复杂的个人记忆查询能力可以帮助用户更好地反思过去的经历,从而更高效地做出相关决策。此外,开发一种能够综合处理这些捕获记忆的问答系统,可以大大提升智能个人助手的实用性和与用户的交互水平。

  • 研究动机与相关工作 现有解决方法(如检索增强生成系统,RAG)虽然能够通过结合外部数据库回答问题,但这些方法依赖于显式链接的外部数据,同时对上下文分散的个人记忆无法有效处理。因此,作者提出全新方法OmniQuery,旨在弥补这一缺陷。


解决方案

  • 作者提出了哪些方法或解决方案? 作者提出了OmniQuery系统,该系统通过整合多模态(例如照片和视频)的个人捕获记忆中的语义上下文信息,来回答更复杂、有语义需求的个人记忆问题。OmniQuery的核心机制包括基于上下文的信息增强和问答系统的全流程设计。

  • 该解决方案的创新之处是什么?

    1. 提出了一种上下文分类法,细分了三种重要上下文类型:
      • 原子上下文 (Atomic Context):单一记忆实例中直接可获取的上下文。
      • 复合上下文 (Composite Context):通过多个相关记忆综合得出的事件、行为等。
      • 语义知识 (Semantic Knowledge):从多个记忆推导出的个人行为模式或一般性知识。
    2. 利用滑动窗 (Sliding Window) 方法,根据捕获记忆的时间序列关系进行复合上下文的识别。
    3. 集成了支持自然语言输入、多模态记忆检索和链式推理生成答案的问答系统。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 记忆结构化:处理原始记忆内容(通过生成标题、识别地理/时间元数据等),并标注原子上下文。
    2. 复合上下文识别:借助大语言模型(LLM)和滑动窗方法,自动识别时间序列内的事件上下文。
    3. 语义知识推导:通过分析抽取的上下文,生成更高层次的行为模式和习惯等语义信息。
    4. 问答系统:通过检索增强生成架构 (RAG),结合上下文信息和检索到的记忆来回答问题。

研究成果

  • 取得了哪些具体成果?

    1. 提出了针对捕获记忆的上下文分类法,通过一项为期一个月的日记研究总结出真实用户对个人记忆的查询需求。
    2. 提出了基于此分类法的记忆增强管道,使得原本零散的个人记忆能够通过上下文集成化。
    3. 开发了一个端到端问答系统,在用户评估中较传统RAG基线表现更优。
  • 与现有解决方案相比,它有哪些优势? OmniQuery能够处理更复杂且多步推理的问题,与传统RAG系统相比,其准确性提高了28.4%(71.5% vs 43.1%),在所有测试中赢或平局的比例为74.5%。

  • 实验或评估结果是什么?

    • 用户实验涉及137个复杂问题,包括直接内容查询、上下文过滤和混合查询,涵盖了来自用户捕获记忆的真实场景。
    • 平均用户感知准确性(UPA)为3.98(满分5分),而基准系统得分为3.06。
    • 用户案例显示,OmniQuery在处理需要综合推理和上下文整合的混合查询中表现尤为突出。
  • 局限性与未来方向 作者指出了以下几个局限性:

    1. 处理复杂关系(如个人互动和社交关系识别)仍存在不足。
    2. 目前基于特定用户数据的研究,尚未发展出可通用的公开数据集进行标准化测试。
    3. 主动查询精确度在多层嵌套问题(如“最佳自拍”)中存在主观性问题。 未来工作包括:
    • 构建固定的基准数据集以进一步优化系统参数。
    • 扩展支持多模态输入/输出的实时交互(如通过语音或图像补充查询)。
    • 集成增强隐私保护技术,如差分隐私以及启用更多局端计算。

通过其严谨的分类体系与生成性问答能力,OmniQuery展示了在多模态个人记忆管理与复杂问题回答中的显著潜能,将进一步支持构建可扩展的智能化个人助手。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189035/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713448
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、数据科学家与分析师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文