免费领取大会全套演讲PPT    

点击领取

我要参会

郑春晓

LMCache 核心开发者

郑春晓是 LMCache 的 maintainer 和核心架构师,LMCache 是面向 LLM 推理构建的模块化 KV Cache 层,在 GitHub 已收获 11k+ Star。他已成功合并了 100 多个 PR(Pull Request),是该项目排名前五的贡献者,其主要贡献包括 MLA 相关支持、DSA 相关支持、IO 流程优化、以及 CLI 相关的实现等。

演讲主题

统一KV Cache管理层:LMCache 的开放架构与生态集成实践(联合演讲)

随着大模型推理场景从单引擎、单机部署走向多引擎、多后端和云原生生产环境,KV Cache 的管理方式正在从引擎内部机制演进为独立的系统能力。LMCache 通过开放、中立、可扩展的架构,为推理引擎与存储后端之间提供统一的 KV Cache 管理层。 本议题将介绍 LMCache 的项目定位、开源社区和核心架构,重点分享它如何支持灵活扩展:一方面以 MooncakeStore 为例,讲解如何接入新的 KVStore 后端;另一方面以 SGLang 为例,讲解如何集成推理引擎。最后,议题将进一步讨论 LMCache 在部署、观测、调试和生产化运维中的实践,并展望 KV Cache 管理层在开放推理生态中的发展方向。 大纲: 一、LMCache 项目与开源社区介绍 - 介绍 LMCache 的项目背景、核心定位、适用场景,以及它在开源推理生态中的角色和社区状态。 二、统一 KV Cache 管理层的架构设计 - 讲解 LMCache 如何在推理引擎和存储后端之间提供中立、开放、可扩展的 KV Cache 管理能力。 三、如何扩展 KVStore:以 MooncakeStore 为例 - 介绍 LMCache 的存储后端扩展机制,以及 MooncakeStore 集成过程中的接口、数据路径和工程关注点。 四、如何集成推理引擎:以 SGLang 为例 - 讲解推理引擎如何通过 LMCache 实现 KV Cache 的查找、加载、存储与复用,并分析集成中的调度、生命周期和 kvgroup 适配的问题。 五、部署、观测与生产化运维 - 分享 LMCache 在实际部署中的配置方式、运行模式、指标观测、日志排查和问题定位方法。 六、总结与展望 - 总结 LMCache 作为统一 KV Cache 管理层的价值,并展望它未来的演进方向。 听众收益: 1. 理解为什么 KV Cache 需要从推理引擎内部能力演进为独立、统一的管理层。 2. 掌握 LMCache 的核心架构,以及它如何同时连接推理引擎和存储后端。 3. 了解如何基于 LMCache 扩展新的 KVStore、集成新的推理引擎,并将其部署到可观测、可运维的生产环境中。

© boolan.com 博览 版权所有

沪ICP备15014563号-6

沪公网安备31011502003949号