Token Foundry-RLHF 算法专家-Qwen
Company 通义实验室
Focus 技术 · 算法
北京, 杭州
July 29, 2026
岗位职责
- 用户偏好采集与建模:设计并构建系统化的用户偏好数据采集方案,深入分析用户行为与反馈信号,建立多维度、可扩展的用户偏好表征与建模体系,为 Reward Model 训练提供高质量数据基础。
- Reward Model 训练与优化:训练高精度、低偏差的 Reward Model,覆盖创作质量、指令遵循、安全对齐、人类偏好等多个专项维度;持续优化训练策略,有效缓解 Reward Hacking 与分布偏移问题,为下游 RL 训练(PPO / GRPO 等)和用户偏好评测提供可靠的奖励信号。
- 用户反馈分析与 Badcase 聚类:建立从线上用户反馈到模型迭代的闭环机制,利用聚类、归因分析等方法系统性挖掘 Badcase,定位模型能力短板与偏好盲区,驱动数据策略与训练目标的持续优化。
- LLM Judge / Verifier 体系建设:研究并构建基于 LLM 的自动化评测与验证体系,设计可 Scalable 的 Verifier 信号,使其既能作为高效的偏好评测工具,也能作为奖励信号直接融入 RL 训练流程,提升模型迭代的自动化程度与覆盖广度。
- 偏好对齐前沿探索:持续跟踪 RLHF / RLAIF / DPO / Constitutional AI 等对齐技术的前沿进展,探索更高效的偏好学习范式,推动 Qwen 在对齐质量与训练效率上的双重突破。
任职要求
- 计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。
- 具有 RLHF / Reward Modeling / 偏好对齐方向的实践经验,熟悉 PPO、DPO、GRPO 等主流算法的原理与工程实现。
- 精通 Python 及 PyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据处理、模型训练到评测部署的全链路工作。
- 对数据质量高度敏感,具备优秀的数据分析与问题诊断能力,能够从复杂反馈信号中提炼有效的优化方向。
加分项
- 熟悉主流 RL 训练框架(如 veRL )及大规模分布式训练方案(DeepSpeed、Megatron-LM、FSDP)。
- 在 Reward Model 泛化性、Reward Hacking 缓解、偏好数据合成等方向有深入研究或实际落地经验。
- 曾在 NeurIPS、ICLR、ICML、ACL 等顶级会议发表对齐、强化学习或 NLP 相关论文,具有一定学术影响力。
- 拥有知名开源项目贡献经历,在开源社区具有较好的影响力。 具备线上系统用户反馈分析经验,熟悉 A/B 测试、用户行为建模等方法论。
岗位标签
NEW