阿里控股-数据算法-杭州/北京
Company 阿里巴巴
Focus 技术 · 算法
北京, 杭州
July 30, 2026
岗位职责
- 高质量数据挖掘:负责重点领域高质量网页挖掘算法的设计与优化,提升有价值数据的召回率与准确率。针对特定类型数据源(如专业知识库、代码仓库、学术论文、多模态内容等)研发定向挖掘策略,构建可持续扩展的数据获取能力。
- 多模态合成数据生成:设计并构建 LLM / VLM / Omni 等多种模态的 SFT(监督微调)与 RL(强化学习)合成数据生产链路。研究合成数据的可控生成、多样性增强、难度调度与分布对齐方法,提升合成数据对模型能力的增益。
- 数据处理算法研发:研发新一代数据处理算法,包括但不限于网页解析、质量评分模型、数据去重与去污染、图像预处理、跨模态对齐等。推动算子的工程化落地,形成标准化、可插拔的数据处理组件。
- 数据质检与配比优化:构建数据质量验证算法,覆盖完整性、准确性、安全性、知识密度等多维指标。研发数据改写、数据清洗、数据配比优化等方法,保障训练数据分布合理、质量稳定。
任职要求
- 具有 LLM、VLM 或多模态大模型数据处理、预训练或后训练相关项目经验。
- 熟悉至少一种深度学习框架(PyTorch / TensorFlow 等)。
- 具备良好的问题分析和团队协作能力,能够独立推进算法研究到业务落地。
加分项: 1.有大模型核心团队(如知名 AI lab、头部互联网公司大模型团队、顶尖高校研究组等)工作经历。 2.在 ACL、EMNLP、NeurIPS、ICML、CVPR、ICCV、MM 等顶级会议或期刊发表过数据挖掘、多模态学习、大模型训练相关论文。 3.对网页解析、数据去重、质量模型、跨模态对齐、合成数据生成等方向有深入研究和实践经验。
岗位标签
NEW