混元Agentic Vision算法研究员(北京/上海)(深圳)
Core
Researching and developing core algorithms for Visual2Code capabilities, enabling multi-modal large language models to understand visual inputs (interfaces, charts, documents) and generate high-quality code.
Role type
Agentic Vision Algorithm Researcher
Builds
Visual2Code models and data systems for code generation from visual inputs
Domain
Artificial Intelligence / Computer Vision / Large Language Models
Deliverable
production ML models
Required skills
Deep learning, Transformer architecture, LLM/VLM, SFT, Reinforcement learning, Code generation, Visual understanding, Data construction, Experiment analysis
Preferred skills
Agentic Vision, Tool calling, Visual logic reasoning, Benchmark creation
Technologies
Multi-modal large language models, Visual2Code frameworks, Verifier/Reward Models
Sourced via tencent · Listed on CareerPlan, which tracks 855,000+ jobs from 20+ sources.