AI Infrastructure Engineer
Indexed description
5年以上 AI Infra / MLOps / 分布式系统 / 平台工程经验 扎实的系统能力(Kubernetes / Linux / 容器化 / 分布式系统设计) 熟悉主流 AI 框架(如 PyTorch / TensorFlow)
能与算法、数据、应用及基础设施团队高效协作, 能清晰表达复杂技术问题,并推动跨团队达成共识与落地
对系统具备端到端 ownership(设计、实现、运行与稳定性),能在不确定环境中推动复杂项目落地,并对结果负责
能快速学习并掌握新技术(如 LLM、Edge AI 等),对 AI Infra 领域保持持续关注,能够适应技术快速演进 核心能力(满足其中一部分即可) MLOps / AI Platform(Kubeflow / Ray 等) GPU / 分布式训练(DDP / Megatron / DeepSpeed) AI 推理系统(高并发 / 低延迟) LLM / GenAI 基础设施(Fine-tuning / Serving / RAG) 混合云 / 多集群架构 加分项 CUDA / GPU 深度优化经验 Edge AI / 视频分析 / IoT / 机器人相关经验 TensorRT / ONNX 等推理优化经验 有复杂系统(多集群 / 多地域 / 边缘)的设计经验 开源贡献或技术影响力 *为什么这个岗位值得做(Why This Role) 不是做一个平台,而是构建 AI 基础设施体系 同时解决: 大规模算力问题(GPU) 大模型问题(LLM) 真实世界问题(门店 / 仓储 / IoT) 覆盖从云到边缘的完整技术栈(极少见组合) 技术深度 + 业务影响力同时具备
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search