Back to search
PWS Cloud Gupy · Posted yesterday

Staff Software Engineer | Observability

São Paulo Full-time

hybrid Brasil Gupy
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

Estamos em busca de um(a) Staff Software Engineer – Observability para integrar o time de Engenharia da PWS Cloud e atuar na construção e evolução das capacidades de observabilidade da nossa plataforma de nuvem.

Buscamos uma pessoa com sólida experiência em Engenharia de Software, sistemas distribuídos e observabilidade, que combine profundidade técnica, atuação hands-on e visão sistêmica para resolver desafios complexos envolvendo aplicações e infraestrutura.

Como Staff, você terá um papel importante na evolução da observabilidade da plataforma, influenciando decisões técnicas e ajudando a estabelecer padrões para métricas, logs, traces, alertas e monitoramento. A atuação terá impacto entre diferentes times, contribuindo para ampliar a visibilidade sobre o comportamento dos sistemas e tornar a identificação de problemas mais rápida e eficiente.

Mais do que implementar ferramentas, esperamos alguém capaz de transformar necessidades operacionais em soluções reutilizáveis e sustentáveis, avaliando trade-offs entre cobertura, performance, custo e complexidade.

A posição também terá um papel importante em elevar a maturidade de observabilidade e confiabilidade da engenharia, contribuindo para que os times operem seus serviços com cada vez mais autonomia e segurança.

Responsabilidades e atribuições

Projetar e evoluir a arquitetura de Observabilidade da plataforma, contemplando métricas, logs, traces e alertas;

Definir e disseminar padrões de instrumentação utilizando OpenTelemetry, promovendo consistência entre aplicações e serviços;

Desenvolver ferramentas, integrações e automações que simplifiquem a adoção de observabilidade pelos times de engenharia;

Evoluir e operar soluções baseadas em Prometheus, Grafana, Loki ou tecnologias relacionadas;

Definir estratégias de SLIs, SLOs e alertas, garantindo sinais relevantes para operação e experiência dos produtos;

Apoiar os times na instrumentação, troubleshooting e análise de performance de aplicações e sistemas distribuídos;

Atuar como referência técnica, liderando decisões arquiteturais e iniciativas de maior complexidade relacionadas à observabilidade;

Desenvolver serviços e componentes de plataforma utilizando principalmente Go, quando necessário;

Trabalhar em conjunto com Engenharia, SRE, Infraestrutura, Segurança e Produto na evolução da confiabilidade da plataforma;

Identificar oportunidades de automação, redução de ruído operacional e melhoria contínua da experiência dos times.

Requisitos e qualificações

Sólida experiência com Observabilidade e monitoramento de sistemas distribuídos;

Experiência com OpenTelemetry e instrumentação de aplicações utilizando métricas, logs e distributed tracing;

Experiência com tecnologias como Prometheus, Grafana, Loki ou soluções equivalentes;

Conhecimento de conceitos de SLI, SLO, error budget, alerting e incident response;

Experiência com Kubernetes e observabilidade de workloads e aplicações executadas em ambientes cloud native;

Experiência em desenvolvimento de software utilizando Go, Python ou linguagens equivalentes, com capacidade de construir ferramentas, integrações e automações;

Conhecimento de APIs, sistemas distribuídos e arquiteturas orientadas a eventos;

Experiência com troubleshooting, análise de performance e investigação de problemas em ambientes distribuídos;

Familiaridade com CI/CD, Infrastructure as Code e práticas modernas de Engenharia de Software;

Experiência atuando como referência técnica e contribuindo para decisões arquiteturais e evolução de outros engenheiros.

Informações adicionais

Será considerado um

diferencial

Experiência na construção de plataformas de observabilidade para múltiplos times e produtos;

Conhecimento de arquiteturas de alta escala para armazenamento e processamento de métricas, logs e traces;

Experiência com Grafana Mimir, Tempo, Loki, Prometheus ou tecnologias equivalentes;

Experiência com eBPF e ferramentas de observabilidade de infraestrutura e redes;

Conhecimento de FinOps aplicado à observabilidade, incluindo controle de cardinalidade, retenção e custos de telemetria;

Experiência com plataformas Cloud, SaaS ou ambientes multi-tenant;

Experiência com CloudStack, OpenStack, Ceph ou tecnologias equivalentes.

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search