Products and Tools · Models
vLLM v0.29.0 发布:Model Runner V2 成为默认,支持新模型与性能优化
vLLM v0.29.0发布,Model Runner V2成为默认,Mamba前缀缓存带来9%-25%首token时延改进,移除十个弃用模型架构。
阅读 Curated GitHub Releases 原文为什么重要
推理引擎更新提升性能和易用性,对部署大模型的企业和开发者有直接影响。
关键事实
事实 1
Model Runner V2 现在成为所有模型的默认运行器。
来源与依据
Model Runner V2 is now the default for all models
事实 2
Mamba 前缀缓存可带来 9%-25% 的首 token 时延改进。
来源与依据
internal prefill checkpoints deliver a 9%-25% TTFT improvement
事实 3
该版本移除了十个已弃用的模型架构,包括 Arctic、Chameleon 和 MPT。
来源与依据
Ten deprecated architectures removed: Arctic, Chameleon, Cheers, Fairseq2Llama, FireRedLID, GritLM, HCXVision, MPT