蚂蚁集团-后训练数据基础设施-AGI专项
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published July 31, 2026
岗位职责
- 负责统一数据平台的架构设计与模块开发,涵盖批处理、流处理、交互式查询与服务化计算能力,构建高效、灵活、智能的后训练数据合成与实验的基础设施。
- 负责构建样本级的数据全链路血缘溯源系统,实现数据种子-合成-处理-实验-评估的全生命周期可追溯,构建高可用、高吞吐的多 Agent 协同合成链路。
任职要求
- 熟悉 spark/ray 等计算引擎,了解分布式存储与计算原理,能优化数据处理效率,具备性能调优经验。
- 熟悉文本、多模等不同模态的向量检索技术,有相关工程系统的调优经验。具备准备数据训练召回模型的能力,对业界的前沿数据召回的方法保持持续的追踪,持续提升召回模型的效果。
- 具备扎实的计算机基础,本科及以上学历,2年以上工作经验。熟悉Java/python研发技术栈,具备良好的编程素养,有强烈的技术热情和快速学习能力,具备良好的执行力且目标导向,敢于担当,善于协同合作。
- 有大模型数据预处理、SFT/RL 训练数据管线建设、或大模型实验平台(LLMOps)开发经验。
岗位标签
NEW
特色标签
ANN检索、distributed computing、Hadoop、Hive、infrastructure、intelligent agent、intelligent R&D、Java、Linux开发/部署经验、Python、Spark、人工合成数据、分布式经验、分布式计算、合成数据、向量搜索、基础设施、多Agent系统、多智能体协同、大数据、大数据经验、大模型实验平台、大模型生命周期管理、大模型运维、实时流处理、强化学习、批式处理、批量处理、搜索/推荐/广告经验、数据 lineage、数据后训练、数据生成、数据血缘追踪、智能体、智能体协同、智能研发、有监督微调、服务端开发经验、机器学习经验、架构设计经验、模型后训练、流式处理、监督微调、系统架构设计经验、计算机相关专业、近似最近邻搜索