数据技术及产品部-RL Data 工程师-Coding
Company 阿里巴巴
Focus 技术 · 后端
杭州
July 30, 2026
岗位职责
- 端到端负责RL数据(coding 方向)项目:从方案设计、数据有效性验证到规模化生产 ,帮助模型在性能上达到业界SOTA。
- Rubric 与评估体系设计:将业务目标和模型能力目标抽象为多维度、层级化的评分标准(Rubric),设计权重、评分规则和边界 case 处理策略;持续迭代 Rubric 以覆盖新场景、堵住 reward hacking 路径。
- RL Data 生产与质量保障:端到端负责 Agentic 场景的数据生产项目,从任务设计、轨迹采样、标注执行到质量验收;构建 QA 框架,对 Grader 输出做一致性校验和失败模式分析,确保进入训练的数据可信。
- 失败模式归纳与数据迭代: 从大量 Trajectory 中归纳 Error Taxonomy,建立失败模式分类体系,将分析结论转化为数据策略调整(任务难度、Reward 信号修正、标注规范更新),形成数据飞轮闭环。
- 协同算法团队闭环:与模型训练/RL算法团队紧密配合,对接 Reward/Grader 需求, 将模型效果反馈翻译为数据改进策略。
- 数据体系设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐;
- 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率;
- 探索更科学的评测指标、更高效的评测方法。
任职要求
- 具备 RL/Post-Training 研究背景、Applied Scientist 经历,有 Agentic/轨迹评估方面的深度经验
- 能够将模糊的质量目标编码为可执行、可量化、可扩展的评估标准。
- 熟练的编程能力(Python 为主),能独立完成数据处理脚本、pipeline 开发和自动化工具搭建
- 能读懂 Agent 轨迹(多轮工具调用、代码执行、搜索检索等),理解 Agentic 系统的行为模式和失败模式
- 了解 Reward Modeling 基本原理,理解 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响
- 优秀的书面表达和文档能力,能撰写清晰的 Rubric 规范和技术方案
- 下设细分方向 方向 1:移动端开发、全栈Web、前端组件、Node.js BFF、浏览器Agent 方向 2:系统底层、高性能计算、嵌入式、安全、运维 方向 3:企业级后端、微服务、云原生、中间件 方向 4:AI/ML、数据科学、自动化脚本 方向 5:数据分析、ETL、Text-to-SQL Agent 方向 6: 游戏开发
岗位标签
NEW