语音大模型数据专家(国际化数据) - AI数据与安全
Core
Lead end-to-end management of training data for large language models across multiple languages (Spanish, Portuguese, Russian, Arabic, Malay, etc.), establishing annotation frameworks and quality standards tailored to linguistic nuances.
Role type
Senior IC multi-lingual data production expert
Builds
Multi-lingual training datasets for Seed base models and AI-native applications
Domain
AI/ML, Natural Language Processing, Internationalization
Deliverable
production ML models
Required skills
Multi-lingual data production, annotation framework design, data quality assessment, Python scripting, PE tool usage, cross-functional coordination
Preferred skills
Linguistics background, C1 language certification, NLP/ASR/TTS research experience, automated data pipeline architecture
Technologies
Python, PE tools, LLM training frameworks
Responsibilities
Design multi-lingual annotation frameworks aligned with algorithm team needs; Lead multi-lingual data production, preprocessing, and validation; Build automated data production pipelines; Collaborate on multi-lingual intelligent data production modes; Establish cross-team collaboration mechanisms for data progress and quality.
Seniority
Senior, hands-on IC