CareerPlanSign in

音频大模型算法专家 - 音视频技术

北京💼 Full-time🗓 2026-09-28

Core

Designing and developing streaming audio large models for unified tasks including speech recognition, speaker diarization, emotion analysis, and audio Q&A, while enhancing speech synthesis and audio generation capabilities.

Role type

Senior IC audio large model algorithm expert

Builds

Industry-leading audio understanding and generation models for internal products (Douyin, Toutiao) and external cloud services (Volcano Engine)

Domain

Audio technology, Large Language Models (LLM), Multi-modal AI

Deliverable

production ML models

Required skills

Audio signal processing, Deep learning, PyTorch/TensorFlow, Python/C++, Model pre-training and fine-tuning, Cross-modal alignment

Preferred skills

Model compression and quantization, End-side deployment, Top-tier conference publications (ICML/NeurIPS), Acoustic engineering background, TTS/Audio generation experience

Responsibilities

Architect streaming audio large models for multi-task learning, Research real-time audio generation and encoding algorithms, Build large-scale multi-modal audio data pipelines, Fuse audio encoders with LLMs to optimize attention mechanisms, Track frontier technologies and drive SFT/RLHF/DPO for product integration

Sourced via bytedance · Listed on CareerPlan, which tracks 851,000+ jobs from 20+ sources.