数据技术及产品部-语音数据策略专家-杭州/北京

Company Alibaba

Focus Tech · Backend

Location 北京, 杭州

Published September 8, 2026

岗位职责

  1. 面向 ASR、TTS、语音对话及相关音频模型场景,结合模型评测、业务反馈和 badcase 识别数据缺口,形成数据产品需求和优先级建议。
  2. 负责分配的数据产品或业务线,设计自建生产、定制采购、成品采购、业务回流和合成数据等来源组合,明确产品范围、业务规则、质量目标、里程碑、成本和风险。
  3. 将数据产品需求分别转化为生产交付、数据处理、Data Agent 和平台业务需求,定义输入输出、业务字段语义、产品指标和验收条件。
  4. 与生产交付团队协作完成试产和规模交付,管理产品范围变更,验收交付完整性、质量证据、版本清单和风险说明。
  5. 跟踪数据进入模型或业务后的效果,结合 WER/CER、MOS、任务成功率、用户反馈等适用指标复盘数据价值,提出下一轮调整建议。
  6. 沉淀可复用的数据方案、业务规则、需求模板、验收方法和复盘结论。

任职要求

  1. 计算机、人工智能、语音/声学、语言学、计算语言学、数据科学或相关专业优先。

  2. 具备 3 年及以上 AI 数据产品、模型数据、语音技术产品或复杂数据交付经验;至少独立负责过一个从问题定义、数据方案、协同交付到结果复盘的数据产品或模型数据项目。

  3. 理解 ASR、TTS、语音对话等至少一个语音场景的数据和效果问题;能把模型指标、badcase 或业务反馈转成数据建设方案。

  4. 具备数据产品能力,做过需求发现、优先级建议、方案设计、跨团队评审和产品验收,能清楚说明本人作出的产品取舍。

  5. 能说明采集、采购、合成、业务回流等来源的适用条件,并在质量、周期、成本、合规和复用之间做取舍。

  6. 具备复杂项目协同能力,能够与生产交付、供应商、数据处理、算法、Agent 和平台团队共同完成交付。

  7. 具备数据质量和评测意识,能够定义可执行的质量目标、验收条件和结果复盘方法。 加分项:

  8. 有语音大模型、端到端语音、Audio LLM、实时语音或多模态模型数据建设经验。

  9. 有多语种、方言/口音、长音频、多人对话、情感/表现力语音或复杂音频经验。

  10. 有数据配比、合成数据、业务回流、模型评测或数据价值归因经验。

  11. 有数据采购、供应商/SOW 或较大规模数据生产协作经验。

  12. 能使用 SQL、Python、数据分析或 AI 工具完成自助分析