SRE运维工程师(A215576)
Indexed description
该职位来源于猎聘 职位描述: what you will do: 1. 负责部署在阿里云、腾讯云、AWS、GCP、Azure 或自建机房上的基础设施运维和稳定性保障,支持跨区域业务运行。 2. 负责 Kubernetes 集群及工作负载的日常运维、发布升级、资源调度、扩缩容、网络、存储、安全和故障排查。 3. 建设和维护指标、日志、分布式链路及告警平台,持续完善业务 SLI/SLO、告警分级、降噪、值班升级和故障定位能力。 4. 参与线上 On-call,处理生产故障,完成影响评估、应急止损、根因分析、复盘和改进项闭环。 5. 建设 CI/CD、配置管理和基础设施自动化能力,使用 Shell、Python 或 Go 减少重复操作和人为变更风险。 6. 负责容量水位、性能趋势和资源成本分析,推动扩缩容、高可用、容灾和成本优化方案落地。 7. 与研发、测试、安全和业务团队协作,完善发布、变更、演练、应急和服务交付规范。 8. 沉淀架构图、Runbook、故障案例和运维标准,提升团队协作效率和系统可维护性。 职位要求: what we are looking for: 1. 具备 3 年及以上相关经验,亲自承担过生产环境的运维、发布或故障处理工作。 2. 熟悉 Linux,能够使用常用系统和网络工具定位 CPU、内存、磁盘 IO、进程、连接及网络性能问题。 3. 具备 Kubernetes 和 Docker 生产实践,能够独立处理 Pod 生命周期、调度、资源限制、服务发现、网络、存储、发布和常见集群故障。 4. 熟悉 Prometheus、Grafana 或同类可观测平台,能够设计指标、查询、告警规则和 Dashboard,并说明告警触发后的处置流程。 5. 理解指标、日志和 Trace 的适用边界,具备至少一种日志或链路平台的实际运维经验。 6. 熟悉 TCP/IP、DNS、HTTPS/TLS、反向代理和负载均衡,能够按网络层次排查连接、超时和性能问题。 7. 能够使用 Shell、Python 或 Go 完成自动化工具或脚本开发,并考虑幂等、错误处理、日志和安全边界。 8. 具备高可用、容量管理、备份恢复或容灾实践,能够说明方案的故障边界、验证方法和 RTO/RPO 或其他验收指标。 9. 能接受合理排班的 7×24 On-call,并能在故障期间进行清晰沟通、风险判断和升级协作。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search