跳转到正文

相关领域

无线边缘大模型推理可以按用户切换解码模式

BALANCE 在时延和内存约束下联合调度用户与边缘算力,并为每个用户选择自回归或推测解码。

一种解码策略无法适配所有边缘请求

自回归解码逐个词元生成大语言模型输出,内存结构相对直接,但可能带来较长时延。推测解码先让小模型生成多个草稿词元,再由大模型验证,以额外模型内存换取更少的串行等待。BALANCE没有为所有请求固定选择一种方法,而是把这组时延—内存矛盾建模成无线边缘资源分配问题。

方案让边缘服务器同时托管一个小语言模型和一个大语言模型。每个用户被分配到自回归或推测解码,服务器并发运行两种模式。优化问题同时决定服务哪些用户、如何在两种模式之间分配算力,并满足每个用户的时延要求和服务器总内存约束。这种耦合不能忽略:如果更多用户被分配到表面上更快的模式,额外模型状态可能耗尽内存,反而降低可服务容量。

混合解码成为调度变量

任务吞吐量最大化问题是 NP-hard。作者把原问题拆成两个子问题,并设计了具有常数近似保证的多项式时间算法。这个保证让该方法区别于纯经验调度器:它没有声称精确求解组合问题,但在既定模型下给出了可说明的解质量边界。

公开摘要称,实验结果持续优于全自回归和全推测两种常规配置,并提升可服务任务数。不过,摘要没有给出具体增益、模型规模、无线条件或对输出长度变化的敏感性,也没有在既定时延与内存约束之外证明能耗或服务质量。要判断方案能否迁移到具体边缘平台,这些细节仍然关键。

即使部署测量尚不完整,系统启示已经清晰:边缘大模型服务不只是压缩模型或增加加速器的问题。解码算法本身会改变资源占用。能够按请求选择解码模式的调度器,多了一个把异构用户匹配到有限算力和内存的控制变量。

研究札记

BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

  • 作者: Guanqiao Qu、Shuo Chen、Qian Chen、Kin K. Leung、Xianhao Chen
  • 公开记录: arXiv
  • 已确认内容: BALANCE 在时延与内存约束下联合选择用户、分配自回归或推测解码模式并配置算力,算法为具有常数近似保证的多项式时间方法。
  • 阅读边界: 摘要只报告定性吞吐量收益,没有给出具体幅度、能耗、模型规模或部署相关无线条件。