Token Foundry-大模型训练Infra研发工程师-北京/上海/杭州
Company 通义实验室
Focus 技术 · 算法
北京, 杭州, 上海
July 29, 2026
岗位职责
● 负责主流深度学习框架在Token Foundry大模型场景下的工程优化,包括但不局限于MoE模型大规模训练框架、多模态训练框架、RLHF训练框架等,参与包括基模型Pretrain、SFT等多个阶段的训练任务优化; ● 致力于提升不同阶段模型训练负载的极限吞吐,能够针对不同模型负载系统化的分析不同阶段耗时并提供相应的优化手段,优化手段包括但不局限于算子优化、通信优化、分布式策略优化等; ● 负责超大规模训练任务的稳定性的设计,通过各种手段来提升训练任务的有效吞吐,构建更可靠的故障检测系统和自愈系统,提供超大规模训练任务的丝滑体验。
任职要求
● 熟悉计算机体系结构基础知识,有扎实异构计算优化(GPGPU/x86/ARM等)、高性能网络架构通信优化、分布式训练策略优化等方面的经验; ● 扎实的工程能力,优良的编程风格,熟悉Python/C++语言和常用设计模式,具备复杂系统的设计开发调试能力; ● 熟悉深度学习的基础理论概念,熟悉Transformer架构,熟悉主流大语言模型、多模态模型等模型特点; ● 熟练PyTorch等领域常用框架,掌握Megatron、DeepSpeed、JAX等不同训练框架的各自特点和细节; ● 优良的沟通表达能力、团队合作意识和经验;具备快速学习的能力,以及深入钻研技术问题的耐心。
岗位标签
NEW