UNISOC
Linkedin · Posted 16d ago
智能化运维工程师8246
Continue to application
Add your email once, then Caio opens the original posting.
Indexed description
工作职责
- 统一监控体系建设
- 设计并落地覆盖 网络、机房、服务器、存储 的一体化监控架构,构建指标(Metrics)、日志(Logs)、链路(Traces)全栈可观测性平台。
- 主导监控工具链选型与自研,推进 Prometheus、Zabbix、Grafana等系统的规模化部署与高可用调优。 2. CMDB 规划与建设
- 负责 CMDB 配置管理数据库的整体规划、模型设计及常态化运营,确保 IT 资产与配置数据精准、实时、完整。
- 建立跨领域数据自动发现与消费机制:打通网络设备(SNMP/Netconf)、服务器(IPMI/Redfish/iDRAC/iLO)、存储设备及机房动环的自动入库链路。
- 将 CMDB 作为监控、告警、变更、自动化、成本分析等场景的统一数据底座,推动消费侧应用。 3. 运维看板与可视化大屏建设
- 构建面向不同角色(NOC 值班、领域专家、管理者、决策者)的运维看板与指挥大屏,整合网络拓扑、机房动力环境、服务器性能、存储容量等多维数据。
- 使用 Grafana等工具,实现资源水位、健康度评分、SLA 合规率、告警风暴趋势等核心指标可视化。
- 探索 3D 机房可视化、数字孪生展示,提升数据中心基础设施的可视化运营能力。 4. 智能化运维(AIOps)落地
- 基于海量监控数据,开发并落地智能异常检测、趋势预测、告警收敛降噪、根因分析等算法模型,大幅降低告警噪音与平均发现时间(MTTD)。
- 设计故障自愈策略,联动自动化平台实现网络链路切换、服务容灾、磁盘隔离等场景的闭环处置,缩短平均修复时间(MTTR)。 5. 告警管理与流程优化
- 制定多领域统一的告警分级、抑制、升级与通知策略,对接 IT 服务管理(ITSM)系统,实现告警到工单的自动流转。
- 定期复盘告警有效性,持续推进告警治理,确保每一条告警都具有明确可操作的处置路径。 6. 硬件运维标准化与跨品牌管理
- 建立覆盖多品牌的服务器、存储设备运维标准,包括带外管理接入规范、固件/驱动版本基线、硬件故障诊断手册及备件更换流程。
- 协同厂商技术支持和各领域运维工程师,完成设备巡检、健康检查、批量固件升级及生命周期管理,确保不同品牌设备运维的一致性。 7. 横向拉通与标准化
- 协同网络、系统、存储、数据中心设施团队,制定监控标准化规范(采集对象、指标口径、标签命名、阈值模板),保障多领域数据可融合、可关联。
- 推动监控与运维数据的治理,建设运维数据湖/数仓,支撑多维分析与 AIOps 算法训练。
- 学历与经验
- 计算机科学、通信工程、电子信息等相关专业本科及以上学历。
- 8 年以上运维开发或监控系统建设经验,其中 3 年以上专注于大型数据中心基础设施监控或智能化运维领域。 2.服务器与存储品牌运维经验(必须项)
- 服务器:精通主流 x86 服务器品牌硬件架构及运维,包括但不限于 Dell PowerEdge、HPE ProLiant、Lenovo ThinkSystem、Inspur、Supermicro 等,熟悉其带外管理系统(iDRAC、iLO、BMC)、RAID 配置、故障诊断面板及固件升级方法。
- 存储:熟悉主流存储设备品牌及运维,包括但不限于 Dell EMC(Unity/PowerStore)、HPE Primera/3PAR、NetApp FAS/AFF、华为 OceanStor、Pure Storage 等,能够进行 LUN/卷管理、性能分析、控制器/磁盘故障排查及容量规划。
- 具备跨品牌硬件统一纳管经验,能制定兼容多品牌的监控采集模板与自动发现规则,实现硬件级指标的标准化暴露。 3.CMDB 领域
- 深刻理解 CMDB 架构与 ITIL 配置管理流程,有 Atlas、iTop、NetBox 或自研 CMDB 实战经验。
- 精通数据模型设计、自动发现规则与 API 开放,熟悉网络、服务器、存储、机房设备的纳管技术。 4.监控系统与看板
- 精通至少一种主流监控系统(如 Prometheus+Thanos/VictoriaMetrics、Zabbix、Nightingale、商业产品如 Datadog),具备 10 万+指标吞吐量系统的调优经验。
- 熟练使用 Grafana 设计复杂看板,掌握 PromQL/LogQL/SQL 查询语言,有大屏可视化设计经验,具备前端(Vue/React)基础者优先。 5.领域技术覆盖
- 网络监控:熟悉 SNMP、Syslog、NetFlow/sFlow、Streaming Telemetry、NETCONF 等,能监控路由器、交换机、防火墙、负载均衡器等全量网络设备。
- 机房监控:掌握 DCIM/BMS 系统集成,熟悉动环监控(UPS、精密空调、温湿度、电力、漏水检测),Modbus/BACnet 等工业协议经验优先。
- 服务器监控:精通 Linux/Windows 系统监控,带外管理(IPMI、Redfish、各品牌带外接口),物理机、虚拟机(KVM/VMware)及容器化(Kubernetes)环境的指标与日志采集。
- 存储监控:理解 SAN(FC)、NAS、分布式存储、对象存储架构,可监控 IOPS、吞吐量、时延、容量利用率、磁盘/控制器健康状态等关键指标,并具备不同品牌存储的差异化监控适配能力。 6.AIOps 与开发能力
- 具备真实的 AIOps 落地经验,熟悉异常检测、时序预测、告警聚合等常见算法,有使用 PyTorch/TensorFlow 或商业智能运维平台(如 Splunk ITSI、Dynatrace)的经验。
- 扎实的编程能力,精通 Python 或 Go,能够独立开发监控采集器、告警插件与自动化脚本,有 API 集成开发经验。 7.软技能
- 优秀的跨团队沟通与推动能力,能同时协调网络、系统、设施等多领域团队,达成监控标准共识。
- 对运维数据治理有较深认知,善于用数据衡量运维质量。 【加分项】
- 持有主流服务器/存储厂商认证(如 Dell Technologies Certified、HPE ASE、NetApp NCDA、华为 HCIP-Storage 等)。
- 持有 CCIE、RHCA、AWS/GCP/Azure 专业级架构师认证。
- 参与过开源监控或运维项目(如 OpenTelemetry、Nightingale、Grafana 插件)贡献。
- 熟悉运维数据仓库技术栈(ClickHouse、Kafka、Flink),有海量指标/日志处理经验。
- 有基础架构即代码(IaC)和自动化编排(Ansible/Terraform)的实践经验,以及通过 Redfish/Ansible 模块批量管理多品牌服务器的实战能力。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search
Want help applying to roles like this?
Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search