蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】
Company 蚂蚁集团
Focus 技术 · 算法
北京, 上海, 杭州
July 29, 2026
岗位职责
- 负责垂类大模型后训练(Post-training)阶段的算法研发工作。
- 设计并优化高质量的指令数据微调(SFT)与对齐(Alignment)工作,构建针对如金融事实性、合规性及逻辑推理的 Reward 模型系统,激发模型的专业对话、复杂逻辑推理及合规风控能力。
- 构建基于 Agentic-RL 的金融数据仿真环境及 API 对接体系,通过合成高质量多轮决策轨迹,打造具备极致专业性与安全性的垂类行业模型。
任职要求
● 计算机科学、人工智能或相关专业背景,具备大模型后训练实战经验。 ● 精通 SFT、RLHF(PPO/DPO/GRPO)及对齐算法,具备构建复杂奖励模型(Reward Model)的实战经验。 ● 理解Agentic技术栈,有仿真环境构建、工具调用(Tool Use)及多轮决策轨迹合成的相关研发经验。 ● 具备扎实的算法工程实现能力,熟悉 PyTorch、Megatron、vLLM 等主流训练推理框架,能够解决从数据合成到模型落地的全链路工程问题,有handson进行修改的能力 ● 具备良好的定义、分析和解决问题能力,具备敏锐的数据洞察力。 ● 具备较强的团队合作和沟通能力,能够与工程团队、产品团队或其他相关团队紧密配合。
加分项 ● Curiosity-driven(极强的好奇心) ● Following the First Principle(坚持第一性原理解决问题) ● Good research taste(卓越的研究品味) ● Good data taste(极佳的数据审美) ● Strong Algorithm & System Co-design capability(具备算法与系统协同设计的全局视野,能通过训练框架优化解决算法扩展性瓶颈) ● Performance optimization experience(具备训练或推理性能优化经验,熟悉 CUDA/Triton 算子开发、显存优化或通信加速技术,致力于极致压榨硬件算力以提升实验迭代效率) ● Full-stack coding skills(全栈工程能力) ● Interdisciplinary background(金融+计算机/数学的复合背景,弥合业务与算法的鸿沟)
岗位标签
NEW
特色标签
Agent-based RL、Alignment、CUDA优化、LLM、Post-training、Python、RM、Supervised Fine-tuning、代理强化学习、仿真系统、决策路径、合规、回报模型、多轮对话轨迹、大模型算法、大规模语言模型、奖励模型、强化学习、指令微调、推理加速、推理轨迹、数据合成环境、显存优化、智能体、智能体强化学习、模型加速/性能优化、模型对齐、模型微调、模拟环境、深度学习框架、深度学习模型、监督微调、神经网络框架、算法工程化经验、自然语言处理算法、训练加速、训练框架、金融、风控、风控算法