大模型推理框架 vLLM 发布 v0.28.0 版本,新增对 DeepSeek-VL 等多模态模型支持

开源大模型推理引擎 vLLM 正式发布了 v0.28.0 版本,带来了多项关键技术更新与模型支持。本次版本迭代的核心在于对多模态能力的强化,正式引入了对 DeepSeek-VL 的支持,并同步兼容了 Meta 最新发布的 Llama 3.3 模型。在工程化方面,vLLM 团队优化了视觉语言模型的预处理流程,显著提升了多模态推理的吞吐效率。此外,新版本还修复了 OpenAI 兼容 API 在流式传输场景下的潜在问题,进一步增强了其作为通用推理后端的稳定性。随着大模型架构从纯文本向视觉-语言乃至 MoE 架构演进,vLLM 此次更新不仅降低了开发者部署 SOTA 模型的技术门槛,也为构建高性能 AI 应用提供了更坚实的底层算力调度基础。

事件分析

此次更新反映了推理框架紧跟模型架构快速迭代的行业现状。特别是对 DeepSeek-VL 的原生支持,标志着社区对混合专家模型及端到端视觉语言模型的优化进入新阶段。从产业角度看,vLLM 不断扩大的模型兼容库,正在使其成为不同模型厂商竞争时的标准“底座”。对于开发者而言,更稳定的 API 兼容性意味着可以更低成本地在不同 SOTA 模型间切换,这加速了 AI 应用层的创新速度。

核心观点:大模型推理框架的快速迭代表明,开源基础设施正在通过极致性能优化,支撑 AI 多模态应用的爆发式落地。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册