CareerPlanSign in

语音大模型数据专家(国际化数据) - AI数据与安全

北京💼 Full-time🗓 2026-09-28

Core

Lead end-to-end management of training data for large language models across multiple languages (Spanish, Portuguese, Russian, Arabic, Malay, etc.), establishing annotation frameworks and quality standards tailored to linguistic nuances.

Role type

Senior IC multi-lingual data production expert

Builds

Multi-lingual training datasets for Seed base models and AI-native applications

Domain

AI/ML, Natural Language Processing, Internationalization

Deliverable

production ML models

Required skills

Multi-lingual data production, annotation framework design, data quality assessment, Python scripting, PE tool usage, cross-functional coordination

Preferred skills

Linguistics background, C1 language certification, NLP/ASR/TTS research experience, automated data pipeline architecture

Technologies

Python, PE tools, LLM training frameworks

Responsibilities

Design multi-lingual annotation frameworks aligned with algorithm team needs; Lead multi-lingual data production, preprocessing, and validation; Build automated data production pipelines; Collaborate on multi-lingual intelligent data production modes; Establish cross-team collaboration mechanisms for data progress and quality.

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 902,000+ jobs from 20+ sources.