SRE运维工程师(A215576)
Indexed description
About AI Rudder
AI Rudder is a conversational AI company on a mission to transform how businesses communicate with their customers — across voice and digital channels that feel genuinely human.
Founded in 2019 and headquartered in Singapore, we're building technologies that bridge languages, enhance understanding, and enable meaningful human–machine communication at scale.
Today, we serve 500+ enterprise clients globally processing 50 million calls daily and having delivered more than 8 billion calls to date.
Most recently, we have raised $50M in a Series B fundraising from leading global investors including Tiger Global, Peak XV Partners, and Cathay Innovation.
职位描述:
what you will do:
1. 负责部署在阿里云、腾讯云、AWS、GCP、Azure 或自建机房上的基础设施运维和稳定性保障,支持跨区域业务运行。
2. 负责 Kubernetes 集群及工作负载的日常运维、发布升级、资源调度、扩缩容、网络、存储、安全和故障排查。
3. 建设和维护指标、日志、分布式链路及告警平台,持续完善业务 SLI/SLO、告警分级、降噪、值班升级和故障定位能力。
4. 参与线上 On-call,处理生产故障,完成影响评估、应急止损、根因分析、复盘和改进项闭环。
5. 建设 CI/CD、配置管理和基础设施自动化能力,使用 Shell、Python 或 Go 减少重复操作和人为变更风险。
6. 负责容量水位、性能趋势和资源成本分析,推动扩缩容、高可用、容灾和成本优化方案落地。
7. 与研发、测试、安全和业务团队协作,完善发布、变更、演练、应急和服务交付规范。
8. 沉淀架构图、Runbook、故障案例和运维标准,提升团队协作效率和系统可维护性。
职位要求:
what we are looking for:
1. 具备 3 年及以上相关经验,亲自承担过生产环境的运维、发布或故障处理工作。
2. 熟悉 Linux,能够使用常用系统和网络工具定位 CPU、内存、磁盘 IO、进程、连接及网络性能问题。
3. 具备 Kubernetes 和 Docker 生产实践,能够独立处理 Pod 生命周期、调度、资源限制、服务发现、网络、存储、发布和常见集群故障。
4. 熟悉 Prometheus、Grafana 或同类可观测平台,能够设计指标、查询、告警规则和 Dashboard,并说明告警触发后的处置流程。
5. 理解指标、日志和 Trace 的适用边界,具备至少一种日志或链路平台的实际运维经验。
6. 熟悉 TCP/IP、DNS、HTTPS/TLS、反向代理和负载均衡,能够按网络层次排查连接、超时和性能问题。
7. 能够使用 Shell、Python 或 Go 完成自动化工具或脚本开发,并考虑幂等、错误处理、日志和安全边界。
8. 具备高可用、容量管理、备份恢复或容灾实践,能够说明方案的故障边界、验证方法和 RTO/RPO 或其他验收指标。
9. 能接受合理排班的 7×24 On-call,并能在故障期间进行清晰沟通、风险判断和升级协作。
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search