数据技术及产品部-LLM评测专家-通用及垂类方向
Company 阿里巴巴
Focus 技术 · 算法
北京, 杭州
July 29, 2026
岗位职责
- 负责大模型通用能力及各专业垂类能力评测体系的建设与持续迭代,覆盖工程科学、数学、物理、化学、生物、医学、法律、金融、人文社科等核心方向,搭建科学、严谨、可复现的评测体系。
- 围绕模型智能上限设计评测方案,通过高难度推理、复杂多步任务、长程规划等真实生产力任务检验模型的能力天花板,构建能有效区分模型能力层级的高区分度评测体系。
- 深入分析模型在真实场景任务中的 bad case,精准归因问题来源(指令遵循失败、幻觉、上下文遗忘等),输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与数据反馈。
- 持续跟踪评测领域前沿方法,对现有评测基准进行充分调研与优缺点分析,建立评测数据的版本管理与防泄露机制,保障评测集的时效性与区分度。
- 探索评测自动评估方案,研究主观评测新方法(如 LLM-as-Judge、对比评分、多维度量表等),将主观判断转化为可量化、可复现的评估指标,持续提升评测覆盖度与效率。
任职要求
- 本科及以上学历,工程科学、数学、物理、化学、生物、医学、语言学、文学、法律、金融、心理学或相关学科专业优先。
- 具备良好的学科知识素养,至少在一个学科领域(工程科学/自然科学/医学/法律/金融等)有较深入的理解,能够提供专家级的评测方案。
- 对大模型的推理流程、能力边界有基本认知,了解主流学科评测集的设计思路与局限性,有实际构建或深度分析过至少一个领域评测集的经验优先。
- 较强的跨领域沟通能力与团队协作意识,能与不同学科背景的研究人员、算法团队及外部专家高效配合,将学科需求准确转化为可落地的评测方案。
- 有良好的自驱力和学习能力,持续跟踪大模型与评测领域技术进展。 加分项:
- 熟练掌握 Python,具备良好的工程编码习惯与数据处理能力,对大模型生产系统的工程设计有基本理解。
- 了解 SFT、RLHF 等模型训练基本流程,能从学科评测角度为训练策略提供可操作的优化建议。
- 有 LLM-as-Judge 或自动化评分系统的设计与实现经验,有评测数据合成、自动评估方案设计的实践。
- 有多语言、跨文化学科评测的建设经验。
岗位标签
NEW