TCL.Online Services Incorporated
Linkedin · Posted today
云计算工程师
Continue to application
Add your email once, then Caio opens the original posting.
Indexed description
工作职责
- 混合云与AI算力基础设施运维 负责企业公有云、私有云及数据中心的日常巡检、故障排查与性能监控,保障通用算力资源稳定运行;承担GPU/NPU等AI异构算力集群的基础运维工作,支撑大模型训练、推理等AI业务的资源供给; 2. AI算力资源交付与调度 负责AI算力资源的申请开通、环境部署、任务配置及资源配额管理;根据业务需求制定合理的资源使用策略,保障AI项目高效运行; 3. AI平台稳定性保障 负责AI训练/推理平台的稳定性建设,搭建监控告警与日志分析链路;及时发现并响应AI业务异常(如训练中断、显存溢出、通信超时等),制定并执行故障恢复方案,保障AI业务连续性; 4. 技术文档沉淀 编写并维护技术文档,包括云资源操作手册、AI算力使用指南、故障处理SOP、运维规范等。推动AI基础设施运维流程的标准化与自动化建设; 5. 新技术研究与应用 主动跟踪云计算与AI基础设施前沿技术(如GPU虚拟化、容器化调度、推理优化等),将新技术转化为可落地的运维工具或流程改进,并在团队内进行技术分享; 6. 跨团队技术对接 作为基础设施侧的技术接口人,对接算法、AI工程、网络等团队,完成需求分析、方案制定与技术交付,解决AI业务在基础设施层面的各类问题。
- 学历专业:本科及以上学历,计算机科学、软件工程、信息技术等相关专业; 2. 计算机基础:熟悉操作系统、网络协议(TCP/IP)、数据库等基本原理;了解虚拟化、云计算、容器化(Docker/Kubernetes)等现代IT技术; 3. 编程能力:熟练运用至少一门主流编程语言(Python/Go/C++),具备良好的代码规范和脚本开发能力; 4. AI技术基础:了解GPU/NPU等异构算力的基本概念,对CUDA编程、NCCL通信库有初步认知;了解或使用过至少一种AI框架(PyTorch/TensorFlow/MindSpore); 5. 调度与编排:了解Kubernetes在AI场景下的调度方案(如Volcano)。有容器编排、资源调度相关实践经验者优先; 6. 解决问题能力:具备强烈的责任心和owner意识,能够独立排查和定位技术问题;具备良好的逻辑思维和分析能力,推动问题闭环; 7. 学习与成长:对云计算和AI基础设施有浓厚兴趣,具备快速学习新技术的能力。对AI负载特性(如训练任务对算力、网络、存储的要求)有基本认知或强烈学习意愿; 8. 沟通协作:具备良好的沟通能力和团队合作精神,主动承担责任,与多角色高效协作。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search
Want help applying to roles like this?
Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search