Back to search
DavionLabs Himalayas · Posted yesterday

高级运维 / SRE 工程师 Senior Cloud Infrastructure & SRE Engineer

Singapore Full time

Site Reliability Engineering Cloud Infrastructure Engineering DevOps Engineer Platform Engineering
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

技术环境

核心生产环境运行于 AWS / EKS,服务于 7×24 小时数字资产交易业务,对系统可用性、实时性、安全性、变更质量和故障恢复能力有较高要求。

岗位职责

  • 负责 7×24 小时核心交易业务的生产稳定性保障,覆盖交易链路、行情服务及相关基础设施;参与重大生产故障的应急响应,及时完成问题定位、风险控制、服务恢复和故障复盘,保障交易连续性和用户资产安全。
  • 负责 AWS 及 EKS/Kubernetes 生产基础设施的建设和持续优化,涵盖云架构、网络、高可用、容量规划及容灾,以及 Kubernetes 集群升级、节点生命周期、调度与资源管理、Ingress/负载均衡、DNS、存储和弹性伸缩等;持续优化云资源使用效率和成本,并从稳定性、安全性和可运维性角度参与业务技术架构设计。
  • 建设和持续完善可观测性与生产稳定性体系(Metrics、Logs、Tracing、Alerting、SLI/SLO、Incident Response、Postmortem),提升生产问题的发现、定位和恢复效率,并与研发团队共同解决系统瓶颈、单点风险及架构层面的长期稳定性问题。
  • 推动 IaC、CI/CD 和自动化运维体系建设(Terraform/Terragrunt、GitHub Actions、Ansible 等),实现基础设施和应用交付的标准化、自动化,并完善变更评审、发布、验证和回滚机制,降低生产变更风险。
  • 负责或协同完成 MySQL、Redis、Kafka 等核心数据及中间件服务的生产运维,包括高可用、监控、容量规划、备份恢复、性能优化及故障处理。
  • 推动 AWS、Kubernetes 及生产环境安全治理,包括最小权限和访问控制(IAM/RBAC)、网络隔离、容器及镜像安全、密钥与敏感信息管理(Secrets/KMS)、漏洞治理和安全审计,并协同相关团队完成安全事件响应。

任职要求

  • 计算机或相关专业统招本科及以上学历,5 年以上 DevOps、SRE、云基础设施或相关工作经验;具备中大型生产环境的一线运维、变更管理和复杂故障处理经验,兼具基础设施架构设计和实际落地能力,能够独立推进相关方案的实施和持续优化,并具备较强的风险意识和跨团队协作能力。
  • 具备扎实的 Linux、网络和容器技术基础,以及生产级 Kubernetes/EKS 实践经验,能够独立完成集群建设、升级、调优,以及 Pod、Node、网络和集群层面的复杂故障排查;了解 Java、Go 等常见应用的运行环境和基本排障方法。
  • 具备 AWS 生产环境建设和运维经验,熟悉核心云服务(IAM、VPC、EC2、EKS、ALB/NLB、Route 53、S3、CloudWatch 等),理解多可用区、高可用、网络隔离、最小权限、弹性伸缩、容量规划及成本治理等设计原则,具备生产基础设施架构设计、风险评估和故障排查能力。
  • 具备较强的 IaC、CI/CD 和自动化能力,有相关工具(Terraform/Terragrunt、GitHub Actions、Ansible 等)的实际使用经验;熟练使用脚本语言(Bash、Python 等),能够通过自动化提高基础设施和应用交付的可靠性。
  • 具备生产级可观测性和稳定性治理经验,熟悉相关技术栈(Prometheus、Grafana、ELK/Loki、OpenTelemetry 等),理解 Metrics、Logs、Tracing、SLI/SLO、告警治理、容量规划和容灾机制。
  • 熟悉 MySQL、Redis、Kafka 等常见数据及中间件服务的基本生产运维,并具备实际的安全运维或 DevSecOps 经验(AWS IAM、Kubernetes RBAC、网络安全、主机及容器安全、Secrets/KMS、漏洞治理、安全审计等),具备生产安全风险识别和处置能力。
  • 具备 Web3 / Crypto 行业生产环境运维经验,对区块链及链上业务的基本运行机制有一定理解,能够结合数字资产交易业务识别和处理相关的稳定性与安全风险。

加分项

  • 有数字资产交易所、证券、金融交易、支付等高可用实时系统生产环境经验者优先。
  • 有大规模或高流量 Kubernetes/EKS 生产环境,以及 AWS 多账号治理、跨 Region 容灾或灾备演练实践经验者优先。
  • 有较深入的云原生、云安全或成本治理实践经验者优先(如 Karpenter、Argo CD/Flux、OpenTelemetry、eBPF、FinOps 等)。

公司概述

Davion Labs 现诚邀一位具备丰富云基础设施和生产稳定性经验的高级运维 / SRE 工程师(Senior Cloud Infrastructure & SRE Engineer)加入 ApeX Protocol 核心团队。

ApeX Protocol 是领先的去中心化交易平台(DEX),核心业务 7×24 小时持续运行,对系统的稳定性、安全性、实时性及故障恢复能力有较高要求。生产基础设施以 AWS、EKS/Kubernetes(K8s) 为核心,并通过自动化、可观测性和稳定性治理持续提升系统可靠性。

在这个岗位上,您将深度参与云基础设施建设、Kubernetes 平台、IaC/CI/CD、可观测性、生产稳定性及安全治理。我们希望您既具备基础设施架构设计和系统性思考能力,也保持较强的实际落地能力,能够深入生产环境处理复杂问题,并推动问题从应急响应走向长期改进。

我们期待您具备 Web3 / Crypto 行业生产环境经验,理解链上业务的基本运行机制,并能够与研发团队紧密协作,共同建设稳定、安全、高效且具备良好扩展能力的交易基础设施。

Originally posted on Himalayas

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search