强化学习框架研发工程师-【可灵】
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published July 31, 2026
岗位职责
- 参与强化学习框架底座研发,面向生成理解统一与 Diffusion 场景下的 Agentic RL,提供高吞吐、易用、可扩展的训练与推理能力;
- 针对 Agentic RL / Diffusion Agentic RL 做训推一体化优化,重点保障训推一致性,并推进 Flow GRPO、Refl 等算法在框架侧的高效落地;
- 优化推理侧长尾问题,深入 KV Cache 管理、调度与资源复用等路径,持续提升在线与离线推理稳定性与效率;
- 调研并落地业界最新 RL / 训推技术与性能工具,完成与训练、推理、分布式等框架的对接与集成。
任职要求
- 具备良好的团队协作能力,热爱钻研技术,善于分析并解决复杂工程问题;
- 有深度学习与强化学习基础,熟悉 Transformer / GPT 等模型结构,了解 RLHF / Agentic RL 相关范式更佳;
- 对开源强化学习框架(如 veRL Omni、slime 等)有深入了解,有二次开发或性能优化经验者优先;
- 对推理框架(如 vLLM、SGLang 等)有较深入了解,熟悉 KV Cache、调度与长尾优化相关实践;
- 对训练框架(如 TorchTitan、Megatron 等)有较深入了解,具备分布式训练或 HPC 基础;
- 对分布式框架(如 Ray 等)有较多了解,熟悉集合通信更佳;了解 CUDA 编程者优先。