Script2Screen:通过交互式视听生成支持以对话为中心的剧本写作Wang等人开发Script2Screen工具,将剧本写作与视听场景创建同步,通过文本到视听管道生成情感演讲和动画角色,交互式生成增强编剧迭代完善过程。2026ZWZhecheng Wang et al.多伦多大学AI 辅助创意写作视频制作与编辑创意协作与反馈系统IUI
VidTune:利用生成式音乐和视频缩略图创作视频配乐Huh 等人开发了 VidTune 系统,通过生成式音乐和可视化缩略图帮助创作者高效预览和比较视频配乐选项,提升配乐创作效率与体验。2026MHMina Huh et al.University of Texas, Austin生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具视频制作与编辑CHI
Vidmento:基于生成式视频的脚手架式扩展视频故事创作工具Yeh 等人开发 Vidmento 工具,通过上下文感知扩展技术帮助创作者将生成视频与拍摄素材混合,系统性填补叙事空白并支持表达性视频故事创作。2026CYCatherine Yeh et al.哈佛大学生成式AI(文本、图像、音乐、视频)视频制作与编辑创意协作与反馈系统CHI
MapStory:使用LLM代理原型化可编辑地图动画Gunturu 等人开发 MapStory 工具,采用双代理LLM架构从自然语言生成可编辑的地图动画,支持自动场景分解和地理信息查询,通过专家访谈和可用性研究验证其降低创作门槛的有效性。2025AGAditya Gunturu et al.卡尔加里大学地理空间与地图可视化计算方法在HCI中的应用UIST
SimTube:利用生成式 AI 和用户画像模拟视频观众反馈Hung 等人开发了 SimTube 系统,利用视频多模态数据与用户画像生成多样化模拟评论,经评估表明其生成的评论比真实观众反馈更详细、更有信息量,有助于创作者在发布前完善内容。2025YHYu-Kai Hung et al.国立台湾大学生成式AI(文本、图像、音乐、视频)流媒体与内容创作者AI 辅助创意写作IUI
GazeNoter:通过凝视选择LLM建议来匹配用户意图的共驾AR笔记记录Tsai 等人设计 GazeNoter 系统,利用 AR 头显的凝视选择快速匹配 LLM 生成的笔记建议,实现实时共驾记笔记,两项研究验证其在坐姿演讲和行走会议场景下的可用性。2025HTHsin-Ruey Tsai et al.国立政治大学眼动追踪与注视交互混合现实工作空间大语言模型(LLM)的人机协作CHI
LAVE:LLM驱动的智能体辅助与语言增强视频编辑Wang 等人开发LAVE系统利用LLM为视频生成语言描述并辅助编辑,研究表明该系统能有效降低视频编辑门槛并提升用户创造力。2024BWBryan Wang et al.多伦多大学大语言模型(LLM)的人机协作视频制作与编辑IUI
SynthScribe:用于合成器声音检索与探索的深度多模态工具Brade 等人开发SynthScribe多模态深度学习系统,通过多模态搜索引擎、用户中心遗传算法和声音编辑支持功能,实现合成器声音检索、创建新声音及有意义修改三大功能,拓展音乐家创作边界。2024SBStephen Brade et al.多伦多大学生成式AI(文本、图像、音乐、视频)音乐创作与声音设计工具创意协作与反馈系统IUI
Promptify:基于大语言模型的交互式提示词探索实现文本到图像生成Brade 等人提出 Promptify 系统,利用大语言模型驱动建议引擎辅助文本到图像提示词优化,显著降低用户认知负荷,首次尝试即生成高质量图像。2023SBStephen Brade et al.多伦多大学生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作UIST
Stargazer:一种基于细微讲师提示捕捉教学视频的交互式相机机器人Li 等人设计 Stargazer 相机机器人,通过追踪讲师动作中的兴趣区域并响应微妙手势和语音提示,自动捕捉教学视频,六位不同领域讲师验证可创建多样化动态教程内容2023JLJiannan Li et al.新加坡管理大学远程操控与遥呈现(Telepresence)CHI
使用大型语言模型实现与移动UI的对话交互Wang等人提出使用大语言模型实现移动UI对话交互,通过提示工程技术适配移动界面,在四个任务上取得竞争力性能,无需专门数据集和训练2023BWBryan Wang et al.多伦多大学语音用户界面(VUI)设计大语言模型(LLM)的人机协作CHI
恐怖助手:开发和验证一个衡量语音助手被感知恐怖程度的量表Phinnemore 等人开发了7项感知语音助手毛骨悚然量表(PCAS),用于衡量语音助手令人不安的程度,帮助研究者和设计师在发布前评估语音助手。2023RPRachel Phinnemore et al.多伦多大学语音用户界面(VUI)设计会话代理的人格与拟人化可解释人工智能(XAI)CHI
一次录制,多平台发布:面向社交媒体的音频故事自动缩短技术Wang等人开发ROPE系统,通过组合优化算法自动将音频内容缩短至不同平台限制,创作者可定制编辑,显著减轻内容缩短的认知负担。2022BWBryan Wang et al.多伦多大学语音用户界面(VUI)设计对话式聊天机器人AI 辅助决策与自动化系统UIST
Screen2Words:基于多模态学习的自动移动端UI摘要生成Wang 等人提出 Screen2Words 多模态学习方法自动生成移动端UI语言摘要,构建了包含11.2万条摘要的大型数据集,实验表明该方法可生成高质量的屏幕描述。2021BWBryan Wang et al.多伦多大学语音用户界面(VUI)设计大语言模型(LLM)的人机协作UIST
独奏者:通过音频处理从现有的吉他教学视频生成混合发起教程Wang 等人开发 Soloist,利用深度学习音频处理从 YouTube 吉他教学视频生成交互式教程,提供实时反馈,远程用户研究显示更受青睐2021BWBryan Wang et al.多伦多大学健身追踪与运动监测音乐创作与声音设计工具创意协作与反馈系统CHI
BlyncSync:通过同步触摸和眨眼启用多模式智能手表手势Wang 等人提出 BlyncSync 多模态智能手表手势,通过同步触摸与眨眼实现输入,比物理按钮快33%,真正率达97%。2020BWBryan Wang et al.多伦多大学智能手表与健身手环CHI
ActiveErgo:使用自我驱动家具实现自动和个性化的工效学Wu 等人开发了首个结合传感和驱动家具的主动工效学系统 ActiveErgo,利用 Kinect 自动调整家具位置,显著提升工效学效率。2018YWYu-Chian Wu et al.国立台湾大学全身交互与体感输入知识工作者工具与工作流CHI