多模态数据工程师(视频生成方向)
Indexed description
有相关岗位经验:在其他公司做过视频生成 / 多模态方向的数据或算法工作,熟悉 DiT、video generation 模型的训练流程,理解模型能力边界,能独立针对新产品需求设计数据与训练管线
工程能力突出:有大规模数据处理或高性能计算(HPC)开发经验,深度学习基础扎实,擅长搭建高吞吐、可扩展的数据处理系统,即使此前没有直接做过视频生成方向的数据工作 【工作职责】 1.设计并搭建从原始视频到训练数据的端到端数据管线:镜头切分、运动 / 画质 / 人物 / 水印 / 转场检测、VLM 打标等算子的自动化与规模化 2.构建视频生成模型的评测体系:设计 benchmark、自动化指标(音视频同步、画质、动作自然度、指令遵循等)与人工评测流程 3.打通数据 - 评测 - 模型的闭环:用评测结果定位模型 failure mode 反推数据策略,用模型表现筛选高价值数据 4.通过实验研究数据与模型效果的关系(data composition / mixture / scaling),回答"什么样的数据能让模型更好" 5.跟踪、复现业界 SOTA 的数据 pipeline 与评测方案,结合自身场景持续改进 【任职要求】(满足以下任一背景即可) 背景 A:视频生成 / 多模态数据经验
有在视频生成、多模态或数字人相关方向担任数据 / 算法岗位的经验(不限公司大小,实习经历同样欢迎)
熟悉 DiT 类架构、视频生成模型(如 Sora、Wan、HunyuanVideo、LTX-Video 等)的训练流程与数据需求
对模型能力边界有实际判断经验,做过"为解决某个 failure mode 而调整数据"的工作 背景 B:工程 / 大规模系统能力
有大规模数据处理、分布式系统或高性能计算开发经验(如处理过 TB/PB 级数据、构建过高吞吐 pipeline)
深度学习基础扎实,熟练 Python,能快速理解模型训练流程并将其转化为工程需求
计算机 / AI / 数学等相关专业,优秀应届生、在校实习生或有工作经验者均可 【通用要求 】 1.对数据质量敏感,能在快速迭代中独立推进任务 2.有好奇心和探索欲,能读懂并复现前沿论文 3.英文文献阅读无障碍 【加分项】 1.深入理解主流视频生成架构的底层机制(如 DiT、flow matching / diffusion、Self-Forcing / DMD训练细节),并能就数据构成如何影响这些机制形成自己的判断 2.主导或深度参与过千万级以上视频数据的清洗、去重、质量分层 pipeline 建设,有可复用、可迁移的工程方案沉淀,而非一次性脚本 3.有在分布式或异构计算集群上设计大规模数据处理系统的经验(如 Ray、Spark、自研任务调度系统) 4.有顶会(CVPR / ICCV / NeurIPS / ICML 等)一作或核心贡献论文,或有具备行业影响力的开源项目(如 star 数量、被业界采用情况)
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search