Research Scientist, Intelligent Editing and AI Agent (Multimodality) Graduate (Intelligent Creation) -Global Frontier Tech Recruitment Program -2027 Start (PhD)
Core
Conduct cutting-edge research in multimodal understanding, vision-language models, and agentic foundation models to build efficient intelligent multimedia creation systems for TikTok users.
Role type
PhD-level research scientist (multimodal generative AI and agents)
Builds
Multimodal foundation models for content creation, image/video generation, and editing
Domain
Generative AI, Computer Vision, Natural Language Processing
Deliverable
production ML models
Required skills
algorithms, Python, C++, large-scale training, reinforcement learning, multimodal understanding, vision-language modeling
Preferred skills
video highlight detection, audio/music understanding, image/video captioning, retrieval, VQA, RLHF, publications in top-tier venues (CVPR, NeurIPS, etc.)
Technologies
Python, C++, agentic foundation models, SFT, RLHF
Responsibilities
Conduct R&D in computer vision and machine learning; explore new AI products; participate in unified modeling for image and video generation; apply agent technology and architecture; optimize tool-calling and long-horizon task capabilities.
Seniority
PhD, research scientist