智能引擎-KV Cache 存储系统开发-杭州
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published August 3, 2026
岗位职责
- KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate。
- 设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。
- 推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制。
- 系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力。
任职要求
- 扎实的系统编程能力,精通 C++/Python,熟悉高性能并发编程与内存管理。
- 深入理解 KVCache 相关技术,PagedAttention / vAttention 等显存分页管理,Prefix Cache / Semantic Cache 等缓存复用技术,KVCache 量化(INT8/FP8 KV)压缩技术,KVCache Offload 至 CPU/SSD 的分层存储技术。
- 理解 LLM 推理原理,熟悉 Transformer 架构及 Attention 计算机制,熟悉主流 LLM 推理框架。
- 熟悉 CUDA 编程,了解 GPU 显存管理、PCIe/NVLink 传输机制。
- 加分项:有在 vLLM / SGLang / Mooncake 等开源项目贡献 KVCache 相关 PR 的经验,熟悉存储系统(Ceph / 3FS)或分布式缓存系统(Redis / Memcached)设计原理。
岗位标签
NEW