CareerPlanSign in

混元大模型漫爬数据策略算法工程师

Shenzhen, China💼 Full-time🗓 2026-09-28

Core

Design and optimize web crawling strategies for large model pre-training and AI search, covering multi-language and multi-modal data discovery, scheduling, quality filtering, and content understanding.

Role type

Senior IC machine-learning engineer (crawling strategy & data engineering)

Builds

Large-scale training datasets for LLMs and AI search systems

Domain

AI/ML, Data Engineering, Web Crawling

Deliverable

production ML models

Required skills

Python, C++, Machine Learning, NLP, LLMs, BERT, GPT, Hadoop, Spark, SQL, Data Warehousing

Preferred skills

Computer Science degree, Data Engineering experience

Technologies

Python, C++, Hadoop, Spark, BERT, GPT, LLMs, SQL

Responsibilities

Design global crawling strategies for resource discovery and scheduling; Build content filtering strategies using ML/NLP/LLM to identify low-quality or duplicate pages; Optimize URL and content deduplication strategies to improve crawling efficiency; Develop web content understanding and classification models to assist LLM training and AI search.

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 853,000+ jobs from 20+ sources.