Staff Software Engineer | Observability
Indexed description
Estamos em busca de um(a) Staff Software Engineer – Observability para integrar o time de Engenharia da PWS Cloud e atuar na construção e evolução das capacidades de observabilidade da nossa plataforma de nuvem.
Buscamos uma pessoa com sólida experiência em Engenharia de Software, sistemas distribuídos e observabilidade, que combine profundidade técnica, atuação hands-on e visão sistêmica para resolver desafios complexos envolvendo aplicações e infraestrutura.
Como Staff, você terá um papel importante na evolução da observabilidade da plataforma, influenciando decisões técnicas e ajudando a estabelecer padrões para métricas, logs, traces, alertas e monitoramento. A atuação terá impacto entre diferentes times, contribuindo para ampliar a visibilidade sobre o comportamento dos sistemas e tornar a identificação de problemas mais rápida e eficiente.
Mais do que implementar ferramentas, esperamos alguém capaz de transformar necessidades operacionais em soluções reutilizáveis e sustentáveis, avaliando trade-offs entre cobertura, performance, custo e complexidade.
A posição também terá um papel importante em elevar a maturidade de observabilidade e confiabilidade da engenharia, contribuindo para que os times operem seus serviços com cada vez mais autonomia e segurança.
Responsabilidades e atribuições
Projetar e evoluir a arquitetura de Observabilidade da plataforma, contemplando métricas, logs, traces e alertas;
Definir e disseminar padrões de instrumentação utilizando OpenTelemetry, promovendo consistência entre aplicações e serviços;
Desenvolver ferramentas, integrações e automações que simplifiquem a adoção de observabilidade pelos times de engenharia;
Evoluir e operar soluções baseadas em Prometheus, Grafana, Loki ou tecnologias relacionadas;
Definir estratégias de SLIs, SLOs e alertas, garantindo sinais relevantes para operação e experiência dos produtos;
Apoiar os times na instrumentação, troubleshooting e análise de performance de aplicações e sistemas distribuídos;
Atuar como referência técnica, liderando decisões arquiteturais e iniciativas de maior complexidade relacionadas à observabilidade;
Desenvolver serviços e componentes de plataforma utilizando principalmente Go, quando necessário;
Trabalhar em conjunto com Engenharia, SRE, Infraestrutura, Segurança e Produto na evolução da confiabilidade da plataforma;
Identificar oportunidades de automação, redução de ruído operacional e melhoria contínua da experiência dos times.
Requisitos e qualificações
Sólida experiência com Observabilidade e monitoramento de sistemas distribuídos;
Experiência com OpenTelemetry e instrumentação de aplicações utilizando métricas, logs e distributed tracing;
Experiência com tecnologias como Prometheus, Grafana, Loki ou soluções equivalentes;
Conhecimento de conceitos de SLI, SLO, error budget, alerting e incident response;
Experiência com Kubernetes e observabilidade de workloads e aplicações executadas em ambientes cloud native;
Experiência em desenvolvimento de software utilizando Go, Python ou linguagens equivalentes, com capacidade de construir ferramentas, integrações e automações;
Conhecimento de APIs, sistemas distribuídos e arquiteturas orientadas a eventos;
Experiência com troubleshooting, análise de performance e investigação de problemas em ambientes distribuídos;
Familiaridade com CI/CD, Infrastructure as Code e práticas modernas de Engenharia de Software;
Experiência atuando como referência técnica e contribuindo para decisões arquiteturais e evolução de outros engenheiros.
Informações adicionais
Será considerado um
diferencial
Experiência na construção de plataformas de observabilidade para múltiplos times e produtos;
Conhecimento de arquiteturas de alta escala para armazenamento e processamento de métricas, logs e traces;
Experiência com Grafana Mimir, Tempo, Loki, Prometheus ou tecnologias equivalentes;
Experiência com eBPF e ferramentas de observabilidade de infraestrutura e redes;
Conhecimento de FinOps aplicado à observabilidade, incluindo controle de cardinalidade, retenção e custos de telemetria;
Experiência com plataformas Cloud, SaaS ou ambientes multi-tenant;
Experiência com CloudStack, OpenStack, Ceph ou tecnologias equivalentes.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search