Token Foundry-大模型算法专家-Qwen Agent
Company 通义实验室
Focus 技术 · 算法
北京, 杭州, 上海
July 29, 2026
岗位职责
- Agent模型后训练: 负责大模型在Agent场景下的后训练(Post-training)工作,提升模型在复杂Agent任务中的表现。
- 强化学习与RL探索: 设计并优化基于强化学习(RL)的Agent训练框架,提升模型的长期规划能力、试错反思能力及工具调用准确率。
- 核心能力构建: 针对Agent的核心能力进行专项模型训练与对齐优化。
- 行业解决方案落地: 深入理解具体行业的业务痛点,将Agent模型能力与行业Know-how结合,设计并落地端到端的行业Agent解决方案。
- 前沿技术追踪: 跟踪学术界和工业界在LLM Agent、RLHF、后训练领域的最新进展,将前沿技术转化为团队的工程与算法资产。
任职要求
【基础要求】
- 计算机科学、人工智能、数学或相关专业硕士及以上学历。
- 具备扎实的理论基础,熟悉Transformer架构及大模型底层原理。
- 具备优秀的编程习惯和工程实现能力,熟悉 PyTorch 等主流深度学习框架。 【核心技能与经验】
- 深入理解大模型后训练流程,有丰富的 SFT、RLHF、PPO、DPO 等算法的实操经验;熟悉强化学习理论,有将 RL 应用于 LLM 或 Agent 决策过程的实战经验。
- 熟悉主流 Agent 框架与范式,有针对 Agent 特定能力进行模型微调或训练的经验。
- 熟悉大模型分布式训练框架,有大规模集群上的模型训练与调优经验。 【加分项】
- 对 AI Agent 在真实行业场景中的应用有强烈的好奇心和探索欲,不局限于“刷榜”,更关注技术如何解决实际业务问题。
- 在知名大模型开源项目或 Agent 框架中有核心代码贡献。
- 有具体行业大模型或 Agent 落地经验者优先。 【软性素质】
- 具备极强的自驱力和解决复杂问题的能力,能够在模糊的业务场景中找到技术突破口。
- 优秀的沟通协作能力,能够与工程团队、产品团队及业务方高效协同,推动项目落地。
岗位标签
NEW