数据技术及产品部-语音大模型评测专家-杭州/北京

Company Alibaba

Focus Tech · Algorithm

Location 北京, 杭州

Published August 14, 2026

岗位职责

  1. 负责语音大模型评测体系的系统性建设,围绕ASR、TTS、音频理解、语音对话等核心能力,设计全面、科学、可持续迭代的评测方案。
  2. 主导音频评测数据集的建设工作,深入调研前沿音频评测基准,负责数据需求规划、采集方案设计、标注规范制定与质量审核全流程,持续优化评测维度与指标体系。
  3. 设计音频领域自动评分与人工评审相结合的混合评测方案,制定主观听感评测标准,建设自动化评测链路,持续验证自动化及人工评测结果的一致性。
  4. 输出高质量评测报告,从语言学/语音信号专业视角清晰呈现模型在各维度的能力表现,识别模型的典型失败案例与能力边界,为模型迭代提供具体可操作的改进建议。
  5. 与模型研发、数据、产品等团队紧密协作,将评测结论有效转化为模型优化建议,形成评测驱动模型迭代的良性闭环。

任职要求

  1. 本科及以上学历,语音信号处理、语言学等相关专业优先。

  2. 具备扎实的音频领域专业背景,熟悉ASR、TTS、音频理解、语音对话等主流任务的技术原理与发展现状。

  3. 熟悉音频大模型的主流评测基准与评测方法论,对评测指标的含义、局限性及适用场景有深入理解。

  4. 具备丰富的音频数据标注规范制定、数据集建设、评测方案设计能力,能从任务定义、数据构建、指标选取到结果分析进行系统性规划,兼顾评测的全面性与可操作性。

  5. 具备良好的数据分析能力,能够对评测结果进行多维度统计与深入解读,善于从数据中挖掘模型能力规律与薄弱环节。

  6. 较强的文档写作与沟通表达能力,能撰写兼顾专业深度与可读性的评测报告,并向研发、产品等不同背景的团队有效传递评测洞察。 加分项:

  7. 音频算法研发背景

  8. 具备主导音频模型系统性评测的实际经验。

  9. 具有音频评测相关学术论文或技术报告的经验。

  10. 具备训练评估音频质量的Reward Model经验。

  11. 对前沿音频模型具备深度体验与系统性分析能力。