jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

强化学习框架研发工程师-【可灵】

Company Kuaishou

Focus Tech · Algorithm

Location 北京

Published July 31, 2026

岗位职责

  1. 参与强化学习框架底座研发,面向生成理解统一与 Diffusion 场景下的 Agentic RL,提供高吞吐、易用、可扩展的训练与推理能力;
  2. 针对 Agentic RL / Diffusion Agentic RL 做训推一体化优化,重点保障训推一致性,并推进 Flow GRPO、Refl 等算法在框架侧的高效落地;
  3. 优化推理侧长尾问题,深入 KV Cache 管理、调度与资源复用等路径,持续提升在线与离线推理稳定性与效率;
  4. 调研并落地业界最新 RL / 训推技术与性能工具,完成与训练、推理、分布式等框架的对接与集成。

任职要求

  1. 具备良好的团队协作能力,热爱钻研技术,善于分析并解决复杂工程问题;
  2. 有深度学习与强化学习基础,熟悉 Transformer / GPT 等模型结构,了解 RLHF / Agentic RL 相关范式更佳;
  3. 对开源强化学习框架(如 veRL Omni、slime 等)有深入了解,有二次开发或性能优化经验者优先;
  4. 对推理框架(如 vLLM、SGLang 等)有较深入了解,熟悉 KV Cache、调度与长尾优化相关实践;
  5. 对训练框架(如 TorchTitan、Megatron 等)有较深入了解,具备分布式训练或 HPC 基础;
  6. 对分布式框架(如 Ray 等)有较多了解,熟悉集合通信更佳;了解 CUDA 编程者优先。

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.