vLLM v0.26.0 发布:引擎、硬件、服务前端与安全修复同步推进
vLLM v0.26.0 当日发布,包含 212 位贡献者、61 位新人的 411 个提交。核心变化包括按 KV-cache group 选择注意力后端、滑窗成为显式后端能力、对象存储二级 KV 分层卸载;DeepSeek-V4 在 NVIDIA、ROCm、XPU 获得专用内核与端到端 TPOT 优化;新增 Inkling 家族、BERT/Roberta 分类、Cosmos3、TranslateGemma 等模型支持;Rust 前端扩展多模态视频/音频与原生 vllm-bench;OpenAI API 增加 bad_words、logprob_token_ids、include_reasoning 与端点插件框架;安全侧替换 diskcache 以去除 pickle 反序列化、修复并发竞争并增加提示列表与正则编译限制。升级前需注意 Transformers 5.13.0、FlashInfer 0.6.14、NIXL 1.3.1 依赖提升,以及 TeleChat、Persimmon、Fuyu 模型被移除。
- 为什么重要
- 这是当日最实质的基础设施事件:混合注意力模型服务、长上下文 KV 成本、多硬件开箱即用性能和生产安全姿态都被同一版本触及。采用 vLLM 的团队既能获得吞吐与显存效率收益,也必须在升级窗口中核对依赖、已移除模型与安全修复兼容性。
- 趋势影响
- vLLM 在推理架构灵活性、存储分层和多硬件覆盖上持续演进,团队升级后可获得更好的混合模型服务与长上下文成本优化。
- 置信度 / 来源数
- 高 · 4 条来源 · 1 位达人

