李沛霖
KTransformers核心开发者
李沛霖,清华大学博士在读、师从章明星副教授,参与趋境科技引擎开发工作,研究方向为 GPU/CPU 异构系统的推理与微调、大规模异构/同构集群推理优化。他是超大模型低成本推理与微调框架 KTransformers 的核心贡献者,目前主要负责微调能力建设与开源生态维护。该架构在 GitHub 上已获得超过 1.9 万星标,并与 LlamaFactory 和 SGLang 等主流开源大模型训推框架开展了多次合作。
演讲主题
KTransformers:支撑超大模型算法—系统协同的低成本训推平台
超大 MoE 模型持续扩张,算法研究却越来越受制于显存和集群成本。KTransformers 是面向超大模型的开放异构训推平台:它通过 CPU/GPU 协同承载稀疏 Expert,连接 LlamaFactory 与 SGLang,并提供可扩展的放置、后端和训推接口,为算法设想与系统优化的联合验证创造条件。分享将结合社区实践,展示从微调到推理评测的完整闭环,并公开垂直领域微调案例,帮助高校实验室和中小团队在有限资源下开展可复现、有研究价值的超大模型研究。 大纲: 1. 超大 MoE 模型在单机场景下的训推瓶颈与资源边界; 2. KTransformers 的 CPU/GPU 异构架构与关键优化; 3. 从 LlamaFactory 微调到 SGLang 推理的训推评闭环; 4. 社区共创:垂直领域微调的研究案例展示。 听众收益: 1. 理解超大 MoE 模型在内存、计算、通信和调度上的核心瓶颈,以及KTransformers是如何充分利用 GPU/CPU 的异构性完成本地化训推。 2. 掌握基于 KTransformers、LlamaFactory 与 SGLang 的低成本训推路径,能够结合自身硬件完成微调、部署和评测迭代。 3. 企业:从真实案例中学习如何把垂直领域需求转化为可复现的实验。 4. 高校:获得有限资源下开展超大模型算法—系统研究的思路。