上海泛思信息科技有限公司
Linkedin · Posted yesterday
初级驻场GPU服务器运维工程师
Continue to application
Add your email once, then Caio opens the original posting.
Indexed description
该职位来源于猎聘 【岗位职责】 1. 硬件运维与资产管理(IDC现场工作)
- 设备上下架:负责GPU服务器、交换机等网络设备的收货、开箱、上架、物理连线(电源线、网线、光纤、IB线)及标签规范化化张贴。
- 硬件排障:熟练通过BMC/IPMI等带外管理工具或现场排查,定位服务器硬件故障。负责内存、硬盘、电源、风扇及GPU加速卡的拔插、更换与测试。
- 厂商对接:配合服务器硬件厂商(如浪潮、新华三、戴尔、NVIDIA等)工程师进行现场部件更换,追踪维修进度。
- 资产盘点:维护IDC机房现场的硬件资产台账(CMDB),确保实物与系统数据一致,管理现场备品备件库。 2. 系统与环境部署
- OS安装:负责大批量GPU服务器的Linux操作系统安装(Ubuntu/CentOS等)及基础网络配置。
- 驱动与环境:负责NVIDIA GPU显卡驱动(Driver)、CUDA Toolkit、cuDNN等基础深度学习运行环境的安装与初步配置。
- 基础测试:使用nvidia-smi、nvddl、gpu-burn 等工具对新上架或维修后的GPU服务器进行压力测试和健康度检查。 3. 日常巡检与监控响应
- 现场巡检:每日按SOP执行机房现场巡检(温湿度、异响、报警灯状态、动环系统状态),填写巡检日志。
- 告警响应:监控Zabbix/Prometheus等告警平台,对服务器死机、网络中断、GPU掉卡/过热等初级告警进行第一层响应(L1 Support)。
- 升级跟进:对于无法独立解决的复杂系统级或网络级故障,快速收集日志并准确升级至高级SRE工程师或网络工程师,配合完成故障恢复(保障SLA目标)。 【任职要求】 1. 基本要求
- 统招大专及以上学历,计算机科学、网络工程、电子信息等相关专业优先。
- 1年以上IDC数据中心运维或Linux系统运维经验(优秀的应届毕业生亦可考虑)。
- 能够适应IDC机房环境(噪音、低温),接受一定程度的倒班或周末值班安排(7x24小时响应要求)。 2. 专业技能
- 系统基础: 熟悉Linux操作系统基础命令,了解文件权限、进程管理、系统日志查看及基本网络配置(IP/路由/DNS)。
- 硬件知识: 熟悉X86服务器内部架构,了解CPU、内存、RAID阵列卡、NVMe SSD的工作原理。
- GPU认知: 了解GPU服务器与普通CPU服务器的物理区别,对主流NVIDIA GPU(如A100/H100/RTX 4090等)、PCIe与SXM架构有一定认知者优先。
- 网络基础: 了解基础网络拓扑,认识常见的光模块、光纤线、DAC线缆,了解交换机基本连线规则。 3. 软性素质
- 极强的执行力和责任心,做事严谨细致(机房操作无小事,需严格遵守SOP规范)。
- 具备良好的沟通表达能力及服务意识(需对接客户及二线技术团队)。
- 具备一定的抗压能力,在突发故障时能保持冷静并按流程处理。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search
Want help applying to roles like this?
Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search