流式传输,快与慢:认知负载感知的流式传输实现高效LLM服务

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI/ML 研究员与工程师统计学家与数据科学家

由大型语言模型(LLMs)驱动的生成式对话界面通常以计算预算决定的速率逐个token流式输出输出内容,往往忽略了实际的人类阅读速度和与内容相关的认知负载。这种不匹配经常导致计算资源使用效率低下。例如,在云服务中,以超过用户阅读速度流式传输内容似乎是不必要的,导致计算资源浪费并可能给其他用户带来延迟,特别是在高峰使用期。为了解决这个问题,我们提出了一种自适应流式传输方法,根据推断的认知负载实时动态调整LLM流式输出的节奏。我们的方法估计与流式内容相关的认知负载,并在复杂或信息丰富的片段战略性地放慢流速,从而释放其他用户的计算资源。我们进行了统计分析 和基于从针对各种LLM生成内容的众包用户研究中收集的数据得出的统计模型的模拟。我们的结果表明,这种自适应方法可以有效减少计算消耗,同时在很大程度上保持流式速度高于用户的正常阅读速度。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206905/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747721
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
AI/ML 研究员与工程师、统计学家与数据科学家
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文