Multimodal Data Engineer
Core
Build systems and workflows to turn complex data requirements into high-quality multimodal datasets for advanced AI teams.
Role type
Senior Multimodal Data Engineer
Builds
Scalable pipelines for multimodal data sourcing, processing, cleaning, annotation, quality assurance, storage, and delivery
Domain
Generative AI, Embodied AI, Automotive AI
Deliverable
production ML models
Required skills
Large-scale data pipeline design, distributed processing (Spark, Ray, Flink), orchestration (Airflow, Dagster, Argo), cloud object storage, containerized batch compute, data quality gate design, data privacy and security practices, technical planning for ambiguous requirements
Preferred skills
Experience with multiple data modalities (text, images, audio, video, 3D point clouds), infrastructure cost monitoring, automation of manual workflows
Technologies
Spark, Ray, Flink, Airflow, Dagster, Argo, cloud object storage, GPU resources, annotation platforms
Responsibilities
Assess data requirements for feasibility, risks, and cost; own technical delivery from scoping to handoff; build and improve scalable multimodal data pipelines; establish quality gates at ingestion and delivery; improve visibility into project status via tracking tools; operate infrastructure including storage, compute, and orchestration environments; track infrastructure usage and costs; standardize workflows and build internal tooling; partner with client and model teams to clarify needs and raise risks
Seniority
Senior, hands-on IC