Site Reliability Engineer (SRE) | AWS | Kubernetes | Databricks | Sênior (Remote)
Indexed description
.
Responsabilidades e atribuições
Garantir a confiabilidade, disponibilidade e desempenho de sistemas e aplicações em produção;
Projetar, implementar e evoluir automações para deploy, monitoramento, escalabilidade e operação da plataforma;
Administrar e evoluir ambientes Kubernetes, assegurando estabilidade e alta disponibilidade;
Responder a incidentes críticos, conduzindo análises de causa raiz (RCA) e implementando ações preventivas;
Definir, acompanhar e evoluir indicadores de confiabilidade, como SLIs, SLOs e SLAs;
Gerenciar e otimizar pipelines de CI/CD, promovendo entregas contínuas e seguras;
Implementar e manter infraestrutura como código (IaC), garantindo padronização e automação dos ambientes;
Desenvolver e fortalecer práticas de observabilidade, monitoramento, métricas e alertas;
Colaborar com equipes de desenvolvimento na construção de aplicações resilientes, escaláveis e de alta performance;
Documentar procedimentos operacionais, planos de contingência e boas práticas de operação;
Atuar na melhoria contínua da plataforma, reduzindo falhas recorrentes e aumentando a confiabilidade dos serviços.
Requisitos e qualificações
Experiência sólida como Site Reliability Engineer (SRE), DevOps Engineer ou Platform Engineer;
Vivência em administração de ambientes Kubernetes em produção;
Experiência com infraestrutura em cloud, preferencialmente AWS;
Conhecimento em automação de infraestrutura utilizando Terraform e Infrastructure as Code (IaC);
Experiência com pipelines CI/CD, processos de integração e entrega contínua;
Vivência com ferramentas de observabilidade, monitoramento e gestão de incidentes;
Experiência em troubleshooting de aplicações distribuídas e ambientes críticos de produção;
Experiência com Databricks e Apache Spark;
Experiência com AWS CodePipeline;
Conhecimento em bancos de dados SQL, Data Warehouse e modelagem de dados;
Experiência com Amazon EC2, Amazon S3 e AWS Lambda;
Conhecimento em arquitetura cloud e ambientes Microsoft Azure;
Conhecimento em práticas de alta disponibilidade, escalabilidade, resiliência e recuperação de incidentes;
Capacidade de atuar de forma analítica na identificação de causas raiz e implementação de melhorias contínuas;
Diferencial
Certificações Databricks.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search