Agent DevOps 资深研发工程师 (JR2026073100A)
Company Didi
Focus Tech · Backend
Location 北京
Published July 31, 2026
岗位职责
- 负责 Agent DevOps 方向核心平台能力建设,面向 Coding Agent、Harness、Skill、MCP、Prompt、LLM 等 AI 研发资产,建立评测、发布、观测和持续优化能力。
- 近期重点建设 Agent 效果评测平台,支持测试数据集管理、自定义验证条件、评测任务执行、运行日志采集、版本结果对比和评测报告生成。
- 设计并实现面向 Coding Agent 的评测数据模型和执行链路,支持对 Claude Code、Codex 类 Agent 的单步命令产出进行验证。
- 与业务 SDD 开发项目合作,收集和沉淀真实测试数据集,覆盖需求分析、设计生成、任务拆解、代码修改、测试生成、验证执行等场景。
- 建设 Harness、Skill、MCP、Tool、Prompt、Agent、LLM 等被测对象的版本化记录和对比机制,支持升级前后效果评估。
- 推动评测结果进入 AI 研发资产发布流程,支撑发布准入、灰度验证、效果回归、失败分析和后续优化。
- 与AI基础设施相关团队协作,定义 Agent DevOps 平台与现有研发工具体系的集成方式。
- 长期参与 Agent 研发交付体系建设,逐步扩展到 Agent 运行观测、问题定位、RCA、oncall 支撑、资产治理和持续运营。
任职要求
- 具备扎实的后端或平台研发能力,熟悉服务端系统设计、数据模型设计、任务调度、日志分析、平台工程或 DevOps 工具链建设。
- 有研发效能、DevOps、CI/CD、测试平台、代码质量平台、可观测平台、开发者工具、内部工程平台等相关经验者优先。
- 理解 AI Coding / Coding Agent 的工作方式,实际使用过 Claude Code、Codex、Cursor、Copilot、Cline 等工具者优先。
- 理解 Agent 工作流中的 Harness、Skill、MCP、Tool、Prompt、上下文、模型调用、验证命令等关键概念。
- 具备评测平台或测试体系建设经验,能设计测试数据集、验证规则、评分指标、版本对比和效果报告。
- 具备良好的工程抽象能力,能把业务试点中的零散经验沉淀成平台能力和可复用工具。
- 具备较强的跨团队协作能力,能与业务研发、平台工具、模型网关、Agent 工具、产品运营等团队共同推进复杂项目。
- 对 AI 研发工具方向有兴趣,愿意探索 Agent 研发、评估、发布、观测、治理的长期工程体系。
部门
AI Dev