Back to search
祥恩股权投资管理(上海)有限公司 Linkedin · Posted 7d ago

基础设施研发工程师(OS / Cloud Infra)

Shenzhen

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

该职位来源于猎聘 面向下一代实时视频模型,建设稳定、高效、可扩展的计算基础设施。 Philo AI 正在构建以人物为核心的下一代实时视频模型,探索语音、视频与行为表达协同的人机交互方式。在这里,你将有机会接触并参与 GPU 资源管理、异构计算环境、复杂任务调度、系统稳定性和工程效率等关键领域的建设工作。 我们正在寻找一位基础设施研发工程师,参与云基础设施及计算平台的设计、建设与持续演进。你将深入操作系统、容器、网络、资源调度及 GPU Runtime 等系统层,围绕训练、推理和服务交付建设平台化与自动化能力,让计算资源发挥更大的价值。 岗位职责 1. 负责云基础设施及计算平台建设,持续完善计算、存储、网络、容器和资源调度能力; 2. 深入 Linux、容器及运行时,优化系统性能、资源隔离、稳定性和异构环境适配能力; 3. 建设任务编排、资源准入、生命周期管理、故障恢复及可观测体系,提升资源利用率和交付效率; 4. 支持 AI 训练与推理任务,完善 GPU 资源管理、运行环境、任务调度和服务部署能力; 5. 定位跨操作系统、网络、容器、GPU Runtime 和应用的复杂问题,推动系统性治理; 6. 开发自动化平台及工程工具,减少重复操作,提高基础设施的自助化和可维护性; 7. 熟练运用 AI Coding Agent 等工具辅助代码开发、系统分析、故障排查、测试及文档沉淀。 任职要求 1. 扎实的操作系统、计算机网络和分布式系统基础,熟悉 Linux 系统原理; 2. 熟悉主流云平台、容器及云原生技术,具备计算平台或基础设施系统建设经验; 3. 熟练使用 Python,并掌握 Go、C++、Rust 中至少一种语言,具备良好的工程研发能力; 4. 熟悉计算、存储、网络、调度或可观测性中的至少一个方向,并有较深入的实践; 5. 具备复杂系统问题的分析和定位能力,能够推动问题从发现到工程化解决; 6. 了解 AI 模型训练与推理的基本流程,愿意深入 GPU 计算及 AI 基础设施场景; 7. 能够有效使用 AI 工具提升研发效率,并具备判断、验证和维护 AI 生成代码的能力; 8. 具备较强的自主性和 ownership,能够独立推动系统设计、研发和落地。 加分项 1. 有 GPU 集群、AI 计算平台或混合云基础设施建设经验; 2. 熟悉 Kubernetes、Ray、Slurm 等调度或编排系统; 3. 熟悉 CUDA、NCCL、RDMA、InfiniBand/RoCE 等 GPU 与高速网络技术; 4. 有 Linux Kernel、eBPF、虚拟化、容器 Runtime 或性能优化经验; 5. 参与过操作系统、云原生或分布式系统相关开源项目。 在这里,你将有机会 - 从早期阶段参与计算平台和基础设施体系建设,对系统架构、技术选型和工程标准产生直接影响; - 处理横跨操作系统、云平台、容器、网络、调度和 GPU 计算栈的真实复杂问题,建立完整的系统视角; - 与模型、算法和工程团队紧密协作,让基础设施能力直接服务于模型训练、推理效率和产品交付; - 在高自主性和高 ownership 的环境中,将问题从分析、设计和开发一路推进到上线验证与持续演进。 我们期待你愿意深入理解系统运行机制,持续探索资源效率的提升空间,并通过更好的抽象和工程设计支持快速演进的模型与产品需求。

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search