数据技术及产品部-Coding & Agent 评测专家-杭州/北京
Company 阿里巴巴
Focus 技术 · 后端
北京, 杭州
July 29, 2026
岗位职责
主导 Coding & Agent 方向评测体系的设计与落地实施,定义模型能力,设计评测方法并构建专业评测集。具体包括:
- 主导设计并构建面向代码生成与智能体的评测基准,涵盖能力维度拆解、任务难度分级、数据集构造、评分标准制定等全流程,具备从 0 到 1 打造高区分度评测集的能力。
- 持续跟踪学术界与工业界在代码智能(Code Intelligence)和 Agent 领域的前沿进展,提出评测方向演进策略的专业判断,确保评测体系能有效度量模型的真实能力边界。
- 设计覆盖真实开发场景的代码评测任务,包括但不限于:代码补全、多文件编辑、调试修复、重构优化、仓库级理解、工具调用链路等,推动评测从"解题"向"工程实践"演进。
- 设计面向复杂 Agent 场景的评测任务体系,涵盖多步推理、环境交互、工具编排、长程规划、错误恢复等维度,构建能反映真实 Agentic 工作流的端到端评测方案。
- 建立评测数据质量管控机制,包括题目查重与污染检测、难度标定与校准、人工标注规范制定与一致性审核,确保评测结果的可信度与可复现性。
- 与模型训练团队紧密协作,将评测洞察转化为模型能力改进方向;与工程团队协同推动评测基础设施建设,支撑高频次、大规模的自动化评测流程。
任职要求
- 对代码生成与智能体领域有深入理解和判断,能清晰阐述"什么是好的代码能力"和"什么是好的 Agent 能力",并将其转化为可量化的评测维度。
- 具备从零设计 Benchmark 的完整经验,理解评测集在区分度、抗污染性、生态效度等方面的设计权衡。
- 扎实的软件工程背景,具备实际的中大型项目开发经验,能从一线开发者视角审视代码能力评测的合理性。
- 熟悉主流代码评测集(如SWE-bench、LiveCodeBench、BigCodeBench 等)和 Agent 评测集(如 WebArena、OSWorld、GAIA、AgentBench 等)的设计理念与局限性。
- 熟练掌握 Python,具备数据处理、统计分析与可视化能力;了解主流 LLM 推理服务的调用方式与工程约束。
- 了解 Agent 框架的核心机制(如 ReAct、Tool Use、Planning 等范式),对 MCP 等工具协议有认知或实践经验。
- 优秀的技术写作与沟通能力,能将评测设计思路清晰传达给研究与工程团队,并撰写高质量的评测报告与技术文档。 加分项
- 研发背景、在代码智能或 Agent 评测领域有学术发表或开源项目贡献(如参与 SWE-bench、BigCodeBench 等项目建设)。
- 有评测数据污染检测、动态评测集构建等方向的研究或工程经验。
- 有竞赛编程或开源社区深度参与背景,对代码能力的分层评估有直觉认知。
- 有将评测能力产品化的经验,如构建过评测平台、Leaderboard 或内部评测服务。
- 对模型训练流程有基本了解,能将评测信号与训练策略对齐。
岗位标签
NEW