Gensors:利用多模态基础模型与推理构建个性化视觉传感器
作者
多模态大语言模型(MLLMs)凭借其广阔的世界知识和推理能力,为终端用户创造了构建个性化AI传感器的独特机会。用户可以用自然语言描述所需的 sensing 任务(例如「当我蹒跚学步的孩子在客厅里捣乱时提醒我」),MLLM 只需几秒钟就能分析摄像画面并做出响应。在一项形成性研究中,我们发现用户对定义自己的传感器有极大兴趣,但仅通过提示工程很难准确表达其独特的个人需求并调试传感器。为解决这些挑战,我们开发了 Gensors,一个支持用户利用 MLLM 推理能力定义定制传感器的系统。Gensors 1) 通过自动生成和手动创建传感器标准来帮助用户获取需求;2) 允许用户并行隔离和测试单个标准来促进调试;3) 根据用户提供的图像建议额外标准;4) 提出测试用例帮助用户对潜在不可预见场景进行「压力测试」。在 12 名参与者用户研究中,用户报告在使用 Gensors 定义传感器时,掌控感、理解力和沟通便利性显著提升。除了解决模型局限性,Gensors 还支持用户通过基于标准的推理进行调试、获取需求和表达独特的个人需求;它还通过揭示被忽视的标准和未预见的失败模式,帮助用户发现自己的「盲点」。最后,我们描述了 MLLM 的独特特征(如幻觉和不一致的响应)如何影响传感器创建过程。这些发现共同为未来直观且可供日常用户定制的 MLLM 驱动传感系统的设计做出了贡献。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何利用多模态大语言模型(MLLMs)提高智能摄像传感器的灵活性和可定制性?分类: GenAI 个性化内容生成同类问题arrow_forward
- 用户如何直观地定义、测试和调试个性化视觉传感器?分类: GenAI 个性化内容生成同类问题arrow_forward
- 多模态大语言模型如何在传感器规则生成和错误调试中提供透明的推理支持?分类: GenAI 个性化内容生成同类问题arrow_forward
现实痛点
1- 智能摄像机难以满足用户个性化高级场景需求,通知杂乱无效。分类: GenAI 个性化内容生成同类问题arrow_forward
- 67%
多点触摸表面用户识别的统一模型。综述与元分析。
CHI '18· 眼动追踪与注视交互 +1
- 67%
邻近感知移动界面中的变化失明
CHI '18· 环境感知与上下文计算 +1
- 67%
智能对象:第六届智能对象交互研讨会
CHI '18· 环境感知与上下文计算 +1
- 67%
阐明“隐性交互”:对概念及研究挑战的考察
CHI '19· 环境感知与上下文计算 +1
- 67%
基于交叉的移动目标选择中的终点不确定性建模
CHI '20· 眼动追踪与注视交互 +1
- 67%
日常移动设备交互过程中用户视觉注意力的量化
CHI '20· 眼动追踪与注视交互 +1
- 67%
改进虚拟现实中的无视觉空中盲打手指击键识别率
CHI '22· 眼动追踪与注视交互 +1
- 67%
AdHocProx:使用双超宽带无线电感应移动的、自组网协作设备配置
CHI '23· 环境感知与上下文计算 +1
- 67%
像素记忆:生活日志摘要是否未能增强记忆但提供了隐私意识的记忆评估?
CHI '25· 环境感知与上下文计算 +1
- 67%
基于视觉的多模态界面:增强上下文感知系统设计的调查和分类
CHI '25· 环境感知与上下文计算 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)