端到端数据工程与离线模型算法工程师 (MJ003050)
Indexed description
该职位来源于猎聘 职位描述 构建支持L4级自动驾驶量产的高效数据闭环体系,通过高精度的真值(Ground Truth)生成算法与大规模数据挖掘策略,驱动车端模型性能的持续迭代。 真值工程自动标注 多模态融合真值: 开发基于LiDAR、Camera、RTK等多源传感器融合的离线感知算法,构建高精度的3D目标检测、跟踪及占据栅格(Occupancy)真值系统。 自动化与一致性: 解决多车/多路段时空对齐、ID Switch修复等工程难题,大幅降低对人工标注的依赖,提升真值生产的自动化率和准确率。 大模型辅助标注: 落地SAM (Segment Anything)、VLM (Vision-Language Models) 等前沿大模型技术辅助生成2D/3D语义分割及场景描述真值。 数据挖掘与场景库构建 高价值场景挖掘: 基于主动学习(Active Learning)和规则引擎,从海量量产回传数据中自动识别Corner Case(如鬼探头、VRU博弈、恶劣天气、施工区),建立高价值训练样本库。 场景结构化: 建立精细化的场景标签体系(Tagging System),实现数据的语义化检索与管理,支持针对特定规控失效场景的定向数据回流。 评测体系与数据质量管理 轨迹与预测评测: 建设预测/规划模块的离线评测工具链,开发基于规则校验与学习打分的轨迹合理性评估指标(平滑度、舒适度、合规性)。 数据质量监控: 建立数据全生命周期的质量监控体系,自动检测异常数据(脏数据、传感器失效、时间戳漂移),保障入库数据的“纯净度”。 职位要求 基础背景 计算机、自动化、数学或相关专业硕士及以上学历,3年以上自动驾驶或AI领域相关工作经验(优秀者可放宽年限)。 具备扎实的数理统计基础,对数据敏感,能够从海量数据统计特征中发现算法长尾问题。 编程与工程能力 精通 Python/C++,拥有优秀的工程代码风格,具备高并发、大数据量下的系统设计与性能优化经验。 熟悉大数据处理工具栈者优先,能够处理大规模离线数据任务。 熟练掌握至少一种深度学习框架(PyTorch/TensorFlow)。 有后处理经验,可高效完成基于动、静态要素的相关需求。 算法与业务经验(以下方向至少熟悉其一) 感知算法背景: 熟悉主流3D检测/分割/跟踪算法(如BEVFusion、Occupancy等),有完整的离线自动标注(Auto-labeling)系统开发经验。 数据挖掘背景优先: 熟悉主动学习、自监督学习、对比学习算法,有在海量无标签数据中进行有效样本挖掘的成功落地案例。 多传感器融合/多目标跟踪背景: 熟悉多传感器融合、多目标跟踪以及轨迹优化方案。 加分项 量产经验: 有主机厂或Tier 1 L2+/L3级自动驾驶量产项目的数据闭环落地经验。 前沿技术: 语义检索、多模态检索经验。 竞赛与开源: 在nuScenes、Waymo、Argoverse等权威榜单排名Top,或对相关开源项目有实质性贡献。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search