免费领取大会全套演讲PPT    

点击领取

我要参会

王书文

SGLang 核心贡献者、RadixArk 研发工程师

SGLang 核心贡献者、HiCache Maintainer,任职于 RadixArk。主要参与 HiCache、Unified Radix Cache 及投机解码相关功能的开发与优化,专注于大模型推理中的 KV 缓存管理、分层缓存与推理性能优化,同时参与开源社区代码审查与维护。

演讲主题

Agentic Inference 的上下文缓存:从 RadixAttention 到 Unified Radix Cache

介绍 SGLang 上下文缓存从 RadixAttention 到 Unified Radix Cache 的演进,以及其面向 Agentic Inference、Hybrid Model 和多级缓存场景的设计思路。 大纲: RadixAttention 与 Prefix Cache → Agentic Inference 带来的新挑战 → Unified Radix Cache 的设计与实现 → HiCache 与未来演进 听众收益: 理解 SGLang KV Cache 的核心设计、演进动机,以及 Agentic Inference 场景下上下文复用与缓存管理的关键问题。

© boolan.com 博览 版权所有

沪ICP备15014563号-6

沪公网安备31011502003949号