基础设施研发工程师(OS / Cloud Infra)
Indexed description
该职位来源于猎聘 面向下一代实时视频模型,建设稳定、高效、可扩展的计算基础设施。 Philo AI 正在构建以人物为核心的下一代实时视频模型,探索语音、视频与行为表达协同的人机交互方式。在这里,你将有机会接触并参与 GPU 资源管理、异构计算环境、复杂任务调度、系统稳定性和工程效率等关键领域的建设工作。 我们正在寻找一位基础设施研发工程师,参与云基础设施及计算平台的设计、建设与持续演进。你将深入操作系统、容器、网络、资源调度及 GPU Runtime 等系统层,围绕训练、推理和服务交付建设平台化与自动化能力,让计算资源发挥更大的价值。 岗位职责 1. 负责云基础设施及计算平台建设,持续完善计算、存储、网络、容器和资源调度能力; 2. 深入 Linux、容器及运行时,优化系统性能、资源隔离、稳定性和异构环境适配能力; 3. 建设任务编排、资源准入、生命周期管理、故障恢复及可观测体系,提升资源利用率和交付效率; 4. 支持 AI 训练与推理任务,完善 GPU 资源管理、运行环境、任务调度和服务部署能力; 5. 定位跨操作系统、网络、容器、GPU Runtime 和应用的复杂问题,推动系统性治理; 6. 开发自动化平台及工程工具,减少重复操作,提高基础设施的自助化和可维护性; 7. 熟练运用 AI Coding Agent 等工具辅助代码开发、系统分析、故障排查、测试及文档沉淀。 任职要求 1. 扎实的操作系统、计算机网络和分布式系统基础,熟悉 Linux 系统原理; 2. 熟悉主流云平台、容器及云原生技术,具备计算平台或基础设施系统建设经验; 3. 熟练使用 Python,并掌握 Go、C++、Rust 中至少一种语言,具备良好的工程研发能力; 4. 熟悉计算、存储、网络、调度或可观测性中的至少一个方向,并有较深入的实践; 5. 具备复杂系统问题的分析和定位能力,能够推动问题从发现到工程化解决; 6. 了解 AI 模型训练与推理的基本流程,愿意深入 GPU 计算及 AI 基础设施场景; 7. 能够有效使用 AI 工具提升研发效率,并具备判断、验证和维护 AI 生成代码的能力; 8. 具备较强的自主性和 ownership,能够独立推动系统设计、研发和落地。 加分项 1. 有 GPU 集群、AI 计算平台或混合云基础设施建设经验; 2. 熟悉 Kubernetes、Ray、Slurm 等调度或编排系统; 3. 熟悉 CUDA、NCCL、RDMA、InfiniBand/RoCE 等 GPU 与高速网络技术; 4. 有 Linux Kernel、eBPF、虚拟化、容器 Runtime 或性能优化经验; 5. 参与过操作系统、云原生或分布式系统相关开源项目。 在这里,你将有机会 - 从早期阶段参与计算平台和基础设施体系建设,对系统架构、技术选型和工程标准产生直接影响; - 处理横跨操作系统、云平台、容器、网络、调度和 GPU 计算栈的真实复杂问题,建立完整的系统视角; - 与模型、算法和工程团队紧密协作,让基础设施能力直接服务于模型训练、推理效率和产品交付; - 在高自主性和高 ownership 的环境中,将问题从分析、设计和开发一路推进到上线验证与持续演进。 我们期待你愿意深入理解系统运行机制,持续探索资源效率的提升空间,并通过更好的抽象和工程设计支持快速演进的模型与产品需求。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search