蚂蚁集团-AI Infra 训练系统高级技术专家-杭州/上海

Company Antgroup

Focus Tech · Algorithm

Location 上海, 杭州

Published August 25, 2026

岗位职责

  1. 主导大模型训练引擎与训练框架的核心架构设计,定义关键技术路线和长期演进方向;
  2. 建设覆盖 CPT、SFT、RL、MoE、长上下文及多模态训练的统一训练体系;
  3. 设计和优化数据并行、张量并行、流水并行、序列并行、专家并行及多维混合并行策略;
  4. 面向万卡级集群,系统优化计算、通信、显存、存储和网络效率,持续提升端到端训练性能与扩展效率;
  5. 建设 Checkpoint、断点续训、故障恢复、弹性训练、精度保障、性能分析和可观测体系,提升长周期训练任务的可靠性;
  6. 推动训练框架、编译器、通信库、算子与多种 AI 芯片之间的深度协同;
  7. 与模型算法团队共同开展 Algorithm-System Co-design,支持新模型结构、新训练算法和新型并行范式快速落地;
  8. 识别并解决跨模型、框架、系统和硬件层的关键瓶颈,沉淀可复用的架构、标准与方法论;
  9. 发挥技术影响力,牵引复杂项目落地,并推动团队在训练系统核心方向形成长期能力。

任职要求

  1. 具备扎实的计算机系统基础,在分布式系统、高性能计算、机器学习系统或计算机体系结构等方向有深入积累;
  2. 精通 Python、C++ 中至少一种语言,具备复杂系统架构设计和核心模块研发能力;
  3. 深入理解 PyTorch 运行机制,对自动微分、计算图、分布式通信、并行训练和显存管理有系统认识;
  4. 深入理解 Megatron-LM、FSDP、DeepSpeed、verl 等训练框架中的一种或多种,能够分析其核心架构与性能边界;
  5. 熟悉大规模分布式训练中的通信、计算、显存和存储瓶颈,能够完成跨层性能分析与优化;
  6. 熟悉 NCCL/HCCL、RDMA、集合通信算法、通信计算重叠或大规模网络拓扑;
  7. 具备复杂技术问题的抽象能力,能够从局部现象识别系统性根因,并形成可演进的解决方案;
  8. 具备较强的技术判断力和推动力,能够主导关键技术方向并协调多团队完成复杂系统建设。

加分项:

  1. 主导或深度参与过百亿、千亿参数模型的预训练、后训练或强化学习训练系统建设;
  2. 具备数百卡、千卡及以上规模的分布式训练实践;
  3. 在 MoE、长上下文、多模态、Agentic RL 或新型模型架构方向有系统经验;
  4. 具备 CUDA、Triton、CANN、算子开发、编译优化或性能建模经验;
  5. 具备异构芯片适配、跨硬件精度对齐或大规模训练稳定性建设经验;
  6. 在训练框架、分布式系统、高性能计算相关开源项目中有核心贡献;
  7. 有从技术方向规划、核心架构设计到规模化生产落地的完整经验。

特色标签

C/C++、Continual Pre-Training、Linux开发/部署经验、Long Context、Mixture-of-Experts、Python、PyTorch、Reinforcement Learning、RLHF、Supervised Fine-Tuning、万卡规模集群、上万卡集群、专家混合模型、中大型项目开发经验、云计算、云计算经验、分布式经验、分布式计算、分布式训练、动态扩缩容训练、千卡万卡集群、团队管理经验、图文联合训练、基础设施、多模态学习、多模态预训练、大数据、大模型算法、大模型训练平台、大模型训练底座、大模型训练框架、大模型训练系统、容错训练、并行计算、弹性伸缩训练、弹性分布式训练、强化学习、强化学习训练、微调阶段、持续预训练、持续预训练任务、持续预训练阶段、断点保存、有监督微调、服务端开发经验、机器学习经验、检查点、模型加速/性能优化、模型检查点、深度学习、混合专家、监督微调、稀疏专家网络、算法工程化经验、系统架构设计经验、英语读写能力良好、计算机相关专业、训练快照、超大规模GPU集群、跨模态训练、金融、长上下文窗口、长序列、长序列建模、长文本