Back to search
Compass UOL Gupy · Posted yesterday

Site Reliability Engineer (SRE) | AWS | Kubernetes | Databricks | Sênior (Remote)

Brasil Full-time Remote

remote Brasil Gupy
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

.

Responsabilidades e atribuições

Garantir a confiabilidade, disponibilidade e desempenho de sistemas e aplicações em produção;

Projetar, implementar e evoluir automações para deploy, monitoramento, escalabilidade e operação da plataforma;

Administrar e evoluir ambientes Kubernetes, assegurando estabilidade e alta disponibilidade;

Responder a incidentes críticos, conduzindo análises de causa raiz (RCA) e implementando ações preventivas;

Definir, acompanhar e evoluir indicadores de confiabilidade, como SLIs, SLOs e SLAs;

Gerenciar e otimizar pipelines de CI/CD, promovendo entregas contínuas e seguras;

Implementar e manter infraestrutura como código (IaC), garantindo padronização e automação dos ambientes;

Desenvolver e fortalecer práticas de observabilidade, monitoramento, métricas e alertas;

Colaborar com equipes de desenvolvimento na construção de aplicações resilientes, escaláveis e de alta performance;

Documentar procedimentos operacionais, planos de contingência e boas práticas de operação;

Atuar na melhoria contínua da plataforma, reduzindo falhas recorrentes e aumentando a confiabilidade dos serviços.

Requisitos e qualificações

Experiência sólida como Site Reliability Engineer (SRE), DevOps Engineer ou Platform Engineer;

Vivência em administração de ambientes Kubernetes em produção;

Experiência com infraestrutura em cloud, preferencialmente AWS;

Conhecimento em automação de infraestrutura utilizando Terraform e Infrastructure as Code (IaC);

Experiência com pipelines CI/CD, processos de integração e entrega contínua;

Vivência com ferramentas de observabilidade, monitoramento e gestão de incidentes;

Experiência em troubleshooting de aplicações distribuídas e ambientes críticos de produção;

Experiência com Databricks e Apache Spark;

Experiência com AWS CodePipeline;

Conhecimento em bancos de dados SQL, Data Warehouse e modelagem de dados;

Experiência com Amazon EC2, Amazon S3 e AWS Lambda;

Conhecimento em arquitetura cloud e ambientes Microsoft Azure;

Conhecimento em práticas de alta disponibilidade, escalabilidade, resiliência e recuperação de incidentes;

Capacidade de atuar de forma analítica na identificação de causas raiz e implementação de melhorias contínuas;

Diferencial

Certificações Databricks.

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search