蚂蚁集团-大模型评测测试开发工程师-杭州/北京
Company Antgroup
Focus Tech · Testing
Location 北京, 杭州
Published July 31, 2026
岗位职责
评测正在成为驱动大模型能力迭代和发版决策的关键基础设施。我们希望建设系统化的质量工程能力,持续验证快速演进的评测系统能够稳定产出可信、可复现的结论。
- 负责大模型评测质量工程体系的设计与建设,搭建覆盖单元、契约、集成、端到端和跨版本回归的自动化测试框架,并将关键质量检查接入 CI/CD,形成高效、可解释的发布门禁。
- 建设评测可信度验证能力,围绕模型、Benchmark、Judge、数据、代码、镜像和运行环境建立测试基线与兼容性矩阵,通过差异检测和受控变量验证评测结果可复现、可比较、可追溯。
- 面向大规模、长链路和 Agentic 评测场景,建设故障注入、任务回放和稳定性测试能力,验证任务编排、状态一致性、幂等、失败隔离、断点恢复和结果完整性等关键系统机制。
- 与研发、评测专家和基础设施团队共同定义质量标准,深入参与技术方案评审、测试设计、灰度发布和线上质量分析;基于真实运行数据识别系统性风险,推动问题闭环并沉淀可复用的质量能力。
任职要求
- 【研发与系统设计】具备扎实的计算机基础、编码能力和系统设计能力,熟练掌握 Java、Go、Python 等至少一种主流开发语言,能够独立设计和开发测试框架、平台及工程工具。
- 【质量工程】熟悉自动化测试和持续交付体系,对单元测试、契约测试、集成测试、端到端测试、回归测试以及 CI/CD 的设计和实践有深入理解。
- 【分布式系统】熟悉服务治理、消息与事件、状态管理、幂等、重试、并发控制、数据一致性和故障恢复等常见机制,能够针对复杂系统设计有效的验证方案。
- 【质量分析与诊断】具备较强的质量分析和复杂问题定位能力,能够结合代码、日志、监控、运行状态和上下游依赖还原故障现场,并善于通过自动化、故障注入和数据对比发现静默错误与系统性风险。
- 【学习与协作】具备快速学习能力和持续的技术热情,对复杂工程问题保持好奇心和主动性;具备良好的沟通协作能力,能够与研发、评测、模型及基础设施团队共同定义质量标准并推动落地。
- 【加分项】有测试开发、质量平台、工作流或调度系统、机器学习平台、模型训练推理、LLM / Agent 评测或开源 Benchmark 工程化经验者优先
岗位标签
NEW
特色标签
Agent系统、Docker、Golang、Golang服务端开发经验、Java、Kubernetes、Linux开发/部署经验、LLM、Python、QA工程、Redis、Spark、中大型项目开发经验、云服务、云计算、云计算经验、分布式经验、发布门禁、可重现、回归检查、回归验证、基准测试、大模型系统、大语言模型、实验可重复、异常注入、微服务经验、持续集成持续交付、故障模拟、智能体、有留学背景、服务端开发经验、机器学习经验、标准测试集、流水线、测评、测试工具、测试工具链、测试框架、混沌测试、版本回归、研发效能、系统架构设计经验、结果复现、自主代理、自动测试平台、英语读写能力良好、计算机相关专业、评估、评估基准、质量体系建设、质量保障、金融、验证