返回技术博客
vLLM 最新动向:大模型 Agent 的瓶颈,正在从模型转向推理系统

vLLM 最新动向:大模型 Agent 的瓶颈,正在从模型转向推理系统

vLLM 最新动向:大模型 Agent 的瓶颈,正在从模型转向推理系统

如果只看模型发布,很容易误判 2026 年下半年的 AI 竞争。真正值得关注的一个暗线是推理系统。vLLM 8 月的博客更新非常密集:8 月 23 日写 AMD GPU 上的 speculative decoding,8 月 22 日写 Ray Direct Transport 做大规模 sharded weight transfer,8 月 17 日写 vLLM-Omni 的 Distributed Layerwise Offload。它们共同指向同一个问题:大模型和 Agent 越强,推理层越会成为成本和体验中心。

过去很多人理解推理服务,重点是“能不能把模型跑起来”。现在这个问题已经不够了。企业要跑的是长上下文、工具调用、多轮 Agent、在线 RL、视频/多模态生成、超大 MoE 模型。这里的瓶颈不只是显卡数量,而是 token 延迟、吞吐、KV cache、权重加载、跨节点通信、模型更新、失败恢复和成本稳定性。

先看 speculative decoding。标准自回归解码每次只提交一个 token,生成长文本时解码循环会主导延迟。vLLM 的文章解释了 draft-and-verify 思路:用轻量 draft 组件提出多个候选 token,再由目标模型一次验证。如果多个 token 被接受,就能用一次目标模型验证推进多个输出 token。

这类技术对 Agent 很关键。Agent 不只回答一次,它会计划、调用工具、读结果、总结、再计划。输出 token 和中间推理 token 会被放大很多倍。如果每个 token 都慢,整个任务就拖住。Speculative decoding 的价值不是让 demo 更炫,而是让长任务的单位 token 成本下降。

再看 Ray Direct Transport 权重同步。vLLM 8 月 22 日的文章讨论在线 RL 场景下,模型权重需要周期性同步,确保 rollout 使用较新的权重版本。开源模型走向 trillion+ 参数后,如果还用传统广播方式,每个 worker 接收整模型再丢掉不属于自己的 shard,会浪费内存和传输时间。vLLM 的 sharded weight-transfer engine 能让推理 rank 只拉自己需要的 shard,并且展示了 Kimi K2 BF16 在 48 个 8xH100 节点上的权重传输案例。

这听起来很底层,但它背后是一个更大的变化:训练和推理不再完全分离。在线 RL、self-improving agent、持续评测和模型更新都要求训练端和推理端更频繁地交换状态。权重同步慢,就会卡住整个闭环。

第三条线是 Distributed Layerwise Offload。vLLM-Omni 面向视频生成等大模型场景,问题是模型参数和显存不匹配。文章以 Cosmos3-Super 这类 64B、124GB BF16 模型为例,说明单卡 HBM 放不下,传统 layerwise offload 又会让每个 rank 在 host memory 存完整模型,设备一多内存爆炸。

DLO 的思路是把权重初始化、mmap、sharding、AllGather、double-buffer 和数据并行并发组合起来。它不是单点技巧,而是一套让大模型在有限显存和主机内存里可服务化的系统方案。文章给出的信号很明确:推理服务已经从“加载模型然后生成”变成“在内存、通信、并发和拓扑之间做系统工程”。

这对应用开发者意味着什么?第一,不要只看模型名。一个模型能不能稳定服务,取决于推理框架是否支持它的结构、量化、工具解析和上下文策略。第二,不要只看 benchmark。Agent 产品的真实成本来自多轮调用和长上下文,吞吐、延迟和缓存策略会决定能不能赚钱。第三,开源权重越来越强,但越强的模型越需要专业推理栈。

这也是为什么 vLLM、SGLang、TensorRT-LLM、TGI 这些项目会越来越重要。模型公司可以发布权重,但真正把权重变成可用服务,需要推理系统承担大量复杂性。尤其是 Agent 场景,服务层还要处理请求调度、工具调用前后的等待、长会话状态、并发隔离和失败重试。

我的判断是,2026 年下半年 AI 基础设施的关键词会从“模型接入”转向“推理经济性”。谁能用更少显存、更低延迟、更高吞吐跑更长任务,谁就能让 Agent 从演示进入生产。

所以这篇值得发。它不是单个版本更新,而是一个趋势判断:当模型能力继续前进,系统瓶颈会后移到推理层。大模型 Agent 的下一场硬仗,不在聊天框里,而在 serving stack 里。

参考来源:vLLM BlogvLLM:Exploring Speculative Decoding in vLLM on AMD GPUsvLLM:Large-Scale Sharded Weight Transfer with Ray Direct TransportvLLM:Distributed Layerwise Offload