jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-评估系统算法工程师-Qwen

Company 通义实验室

Focus 技术 · 算法

北京, 杭州, 上海

July 29, 2026

岗位职责

  1. 模型弱点挖掘与诊断:建立系统化的模型能力诊断框架,通过自动化探测与深度分析相结合的方式,持续挖掘模型在推理、创作、指令遵循、事实性、安全性等维度的弱点与盲区,输出可行动的优化建议,驱动训练策略的精准迭代。
  2. 评测数据集构建:持续、快速地构建覆盖各项模型能力的高质量评测数据集,涵盖知识问答、逻辑推理、代码生成、多轮对话、多模态理解等核心场景;建立数据质量管控与版本管理机制,确保评测集的权威性、时效性与区分度。
  3. 前沿评测方法探索:研究并落地可靠、可扩展的评测方案,包括 LLM-as-Judge、Process-level Evaluation、动态自适应评测、对抗性评测等,解决传统静态 Benchmark 的饱和、污染与泛化性不足等问题,构建面向下一代模型能力的评测范式。
  4. 模型边界能力测试:以前瞻性视角构造模型边界能力测试集,探索模型在极端推理深度、超长上下文、复杂多步规划、跨模态协同等前沿场景下的能力极限,为模型能力演进提供方向性指引。
  5. 评测工程框架开发:参与开发 Evaluation 所需的工程框架,设计模块化、可配置的评测 Pipeline,简化各类测试任务与模型集成流程,提升团队在评测执行、结果分析、报告生成等环节的整体效率。

任职要求

  1. 计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。
  2. 具有大模型评测、Benchmark 构建、NLP 评测体系设计等相关方向的实践经验,对主流评测数据集的方法论与局限性有深入理解。
  3. 精通 Python,具备扎实的工程能力,能够独立完成评测框架设计、数据处理、自动化评测 Pipeline 搭建等工作。
  4. 具备优秀的分析思维与问题拆解能力,能够从评测结果中提炼深层洞察,将抽象的模型能力问题转化为可量化、可追踪的评测方案。
  5. 对大模型能力边界有强烈的好奇心与敏锐的判断力,能够前瞻性地识别值得评测的新兴能力维度。

加分项

  1. 在 LLM-as-Judge、自动化评测、动态 Benchmark 构建等方向有深入研究或实际落地经验,熟悉相关方法论的优势与陷阱(如位置偏差、自我偏好、评分校准等)。
  2. 曾在 NeurIPS、ICLR、ICML、ACL、EMNLP 等顶级会议发表评测方法论、Benchmark 构建或模型分析相关论文。
  3. 拥有知名评测相关开源项目贡献经历,在开源社区具有较好的影响力。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.