阿里控股-RL Data工程师-Work领域(法律方向)
Company 阿里巴巴
Focus 技术 · 后端
北京, 杭州
July 30, 2026
岗位职责
我们正在从 0 到 1 搭建 Work(AI 协同办公)方向的 RL/RFT 训练数据体系,覆盖多个专业领域。端到端负责一个(或多个)领域的数据集从任务定义、instance 构造、reasoning 生成到分层验证的全链路,是模型训练飞轮里承上启下的关键位置。
-
领域任务体系搭建(Taxonomy 设计) 对法律专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系。
-
Instance 与 Reasoning 构造 设计 instance 结构(instruction + context + reasoning + output),并针对不同任务选择合适的 reasoning 获取路径(强模型蒸馏、模板化拆解、真实文本抽取、人机协作等)。保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链。
-
分层验证方案设计 针对不同任务定义分层校验机制:规则硬匹配 → 结构完整性 → LLM-as-judge(将主观判断拆解为 yes/no 子问题)。把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务。
-
Rubric 与评分标准建设 制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代。擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则。
-
轨迹标注与 Bad Case 归因 对模型 Rollout 产出的多步执行轨迹进行逐步标注(正确性 / 必要性 / 思考质量 / 整体 Reward),并对失败步骤做根因分类(模型能力不足 / 评测标准缺陷 / 任务定义模糊 / 运行依赖缺失),输出结构化改进清单驱动训练数据补充与评测体系修正。
-
标注质量管控 建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练。
-
外部协作与专家资源整合 与高校老师、领域专家协作定义验收标准、评审样本、迭代规范,把外部资源转化为规模化精标数据;管理供应商时能给出清晰的标注规范、边界案例和仲裁依据。
-
数据 → 模型 → 评测 闭环 周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布;随模型迭代补充更高难度标注数据,保持 Reward Model 区分度。
任职要求
- 领域深度:在法律方向的至少某一个专业领域有系统性认知,如,有合同审查、法条检索、判例分析实务经验,能基于专业判断对 Agent 输出做准确的对错裁定,而不仅凭"看起来合理";同时具备跨领域快速上手的能力。
- RL/RFT 数据 sense:熟悉 RFT 和 RL 对数据质量的要求,理解 reasoning 字段在 SFT / RFT / RL 各阶段的作用差异,能筛选与构建高质量的训练数据。
- Taxonomy 与 instance 设计能力:能独立完成从领域拆解 → 任务类型定义 → instance 模板设计 → 种子来源确定的完整链路。
- Rubric 设计能力:熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆解为可校验的子问题。
- 轨迹级标注与归因能力:能判断多步执行的完整性、正确性、思维连贯性;能准确区分 bad case 是模型能力问题 / 评测标准问题 / 任务定义问题 / 依赖环境问题。
- 轻量工程能力:熟悉 Python,能独立完成数据抓取、清洗、批量调用 LLM、结果聚合等脚本化工作;能读懂 Agent 执行日志和代码片段,判断工具调用是否冗余或有隐性副作用;具备规模化数据生产经验。
岗位标签
NEW