P4.15.3Linear accumulation of inference cost设计研究

模型推理的成本随调用次数线性累加

别名: 推理成本累加 · per-request energy · inference cost scaling

概念解释

传统界面功能的边际成本近于零:多渲染一个按钮、多一个页面浏览,服务器侧几乎不花钱。模型推理打破了这一直觉——每次调用都真实地耗电:加载权重、执行前向计算、生成 token,单次成本虽小,但随调用次数严格线性累加,没有规模摊薄。一个「顺手加个 AI 功能」的产品决定,在千万日活乘以每天数十次调用的量级下,把一个原本近零边际成本的应用变成一座常开的计算设施。线性律使推理成本与产品决策直接挂钩:调用频率的每个设计选择(是否自动触发、是否批量、是否可跳过)都是能耗决策。

机制

线性来自推理的结构:每次请求独立执行完整计算,前一次的结果不减少后一次的开销(不同于人类的「熟能生巧」,也没有传统软件的缓存命中式摊薄——相同问题两次调用,付费两次)。三个设计变量控制着斜率。模型规模:参数量与单次能耗大体同阶增长,为偶发难题调用大模型、为高频简单任务用小模型,是斜率的第一个决定者。生成长度:自回归生成的成本随输出 token 数线性增长,「话多」的输出直接按字收费。触发方式:自动触发(每次输入都调模型)与按需触发(用户明确请求才调)之间是数倍的调用量差距——这也是最大的隐性变量,因为它藏在交互默认值里而非模型配置里。批处理与专用硬件能压低单次成本,但只改斜率的常数项,不改线性本身。

怎么研究

每请求能耗基准是基本测量范式:在受控硬件上按模型规模、序列长度、批大小分组测量单次推理能耗(GPU 功率遥测 × 时长),建立「规模 × 长度 → 能耗」的查表模型;数据中心侧再乘 PUE 与电网碳强度得到碳归属。系统研究测量真实产品的调用画像:调用频率分布、输入输出长度分布、冗余调用占比(相同请求的重复率),把产品级能耗拆到交互模式层面。方法论注意点:专用加速硬件与通用 GPU 的能效差一个量级,报告需绑定硬件假设;「训练成本 / 预计调用量」的分摊对使用频率敏感,短命功能的训练分摊能耗可能反超推理,结论需按产品预期寿命敏感性分析。

边界

线性律描述推理的算力部分,边界在两处。其一,固定成本的存在:模型训练是一次性大额投入,低频功能里训练分摊可能主导总成本,此时优化重点在「要不要做」而非「怎么调」;线性律适用于已上线、调用量主导成本的功能。其二,交互层的中介:用户感知的「智能感」与调用次数非线性相关——连续自动补全调用上千次换来的流畅感,可能不如一次明确的人工触发给用户的信任感强;能耗优化的空间因此常在交互设计(减少不必要的调用)而非模型压缩(有代价地降低每次调用的质量)。

怎么落地

  • 为每个模型功能建立调用预算:预估日活 × 触发频率 × 平均序列长度的月度推理成本(能耗与碳两口径),预算超限作为功能设计约束而非事后发现。
  • 触发方式默认按需:涉及生成的功能默认用户显式触发,自动触发(输入即推理)需在评审中给出频率与收益的证据;高频简单任务路由到小模型,大模型留给显式请求的难题。
  • 控制生成长度作为输出约束:回复类功能设置长度上限与简洁模式默认,长输出的完整版留给显式展开。
  • 验证:月度复盘调用量分布,统计冗余调用占比(相同输入的重复请求)与自动触发的放弃率(推理完成但用户未采纳),两者合计超过阈值即收紧触发条件。

延伸

  • 同组P4.15.1 能耗发生的位置决定谁承担成本 · P4.15.4 缓存以存储换传输的方向性权衡
  • 相邻L6 智能系统交互的调用模式 · P4.08.1 传输与计算的能耗事实
  • 站内检索inference cost · per-request energy · LLM energy consumption

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/P4.15.3