Gensors:利用多模态基础模型与推理构建个性化视觉传感器

眼动追踪与注视交互环境感知与上下文计算普适计算(Ubiquitous Computing)

多模态大语言模型(MLLMs)凭借其广阔的世界知识和推理能力,为终端用户创造了构建个性化AI传感器的独特机会。用户可以用自然语言描述所需的 sensing 任务(例如「当我蹒跚学步的孩子在客厅里捣乱时提醒我」),MLLM 只需几秒钟就能分析摄像画面并做出响应。在一项形成性研究中,我们发现用户对定义自己的传感器有极大兴趣,但仅通过提示工程很难准确表达其独特的个人需求并调试传感器。为解决这些挑战,我们开发了 Gensors,一个支持用户利用 MLLM 推理能力定义定制传感器的系统。Gensors 1) 通过自动生成和手动创建传感器标准来帮助用户获取需求;2) 允许用户并行隔离和测试单个标准来促进调试;3) 根据用户提供的图像建议额外标准;4) 提出测试用例帮助用户对潜在不可预见场景进行「压力测试」。在 12 名参与者用户研究中,用户报告在使用 Gensors 定义传感器时,掌控感、理解力和沟通便利性显著提升。除了解决模型局限性,Gensors 还支持用户通过基于标准的推理进行调试、获取需求和表达独特的个人需求;它还通过揭示被忽视的标准和未预见的失败模式,帮助用户发现自己的「盲点」。最后,我们描述了 MLLM 的独特特征(如幻觉和不一致的响应)如何影响传感器创建过程。这些发现共同为未来直观且可供日常用户定制的 MLLM 驱动传感系统的设计做出了贡献。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195801/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712085
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
眼动追踪与注视交互、环境感知与上下文计算、普适计算(Ubiquitous Computing)
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文