Gerente SRE e Operações TI
Indexed description
Buscamos uma pessoa para atuar como Gerente de Observabilidade em TI, liderando a evolução da operação, da monitoração proativa, da gestão de eventos e da resposta a incidentes críticos em um ambiente de alta complexidade, missão crítica e grande relevância para a experiência dos clientes.
Essa posição exige uma liderança técnica e operacional capaz de atuar em um cenário real de transformação: ambientes legados convivendo com novas arquiteturas, sistemas monolíticos, múltiplas ferramentas de observabilidade, alto volume de demandas, necessidade de resposta rápida a problemas de produção e uma cultura organizacional ainda em amadurecimento quanto aos papéis e responsabilidades de observabilidade.
A pessoa será responsável por conduzir equipes, processos e fornecedores na busca por maior estabilidade, previsibilidade operacional, redução de ruído, eliminação de toil, automação e evolução das práticas de confiabilidade. É uma posição para quem tem maturidade para lidar com pressão, ambiguidade, problemas complexos e, ao mesmo tempo, capacidade de construir uma operação mais simples, integrada, orientada a indicadores e conectada ao negócio.
A área é responsável por garantir a estabilidade, disponibilidade e evolução contínua dos serviços e plataformas tecnológicas que suportam a operação do negócio.
Ter atendimento voltado a necessidade do negócio;
Equilibrar estabilidade e agilidade;
Monitorar e medir serviço sob a perspectiva de negócio;
Ser uma operação preditiva;
Ter processos simples e eficientes;
Pessoas certas nos lugares certos;
Gestão por indicadores.
Dentro do contexto da Diretoria, a Gerência Sênior de TI é responsável pelos Processos de melhoria e evolução da Confiabilidade de TI, como:Resiliência, Gestão de Eventos (Monitoramento e Alarmística), Observabilidade e AIOps;
Planejamento e Acompanhamento da Malha Batch;
Suporte ambiente Mainframe, ferramentas de Orquestração (como Control-M) e ferramentas de Observabilidade (como Zabbix e Elastic);
Suporte especializado nos Canais de Atendimento Presencial e Digitais;
Evolução baseada nas práticas modernas de Engenharia da Confiabilidade (SRE) e ModernOps.
Responsabilidades e atribuições
Liderar as equipes internas e parceiras responsáveis por monitoração, gestão de eventos, observabilidade, operação e apoio à resposta a incidentes críticos.
Garantir a estabilidade, disponibilidade e performance dos serviços críticos, atuando tanto na prevenção quanto na resposta a problemas em produção.
Evoluir o modelo de monitoração proativa, alarmística, gestão de eventos e observabilidade, reduzindo ruído operacional e aumentando a capacidade de detectar impactos relevantes ao negócio.
Atuar em ambientes complexos, com sistemas legados, aplicações monolíticas, integrações críticas, ambientes cloud, on-premises e híbridos.
Conduzir a melhoria contínua dos processos de operação, monitoração, incidentes críticos, reincidência de falhas, postmortem e gestão de problemas.
Apoiar a adoção e evolução de práticas de Engenharia de Confiabilidade, SRE, ModernOps, SLA, SLO, automação e AIOps.
Atuar de forma próxima à operação, com postura hands on quando necessário, especialmente em eventos relevantes, crises, incidentes críticos e problemas recorrentes.
Promover maior clareza sobre papéis e responsabilidades de observabilidade, apoiando a transformação cultural e operacional da organização.
Definir, acompanhar e evoluir OKRs, KPIs e indicadores de desempenho operacional, confiabilidade, eficiência e qualidade, sempre pautado em como a engenharia de confiabilidade e observabilidade podem apoiar nessa evolução.
Reduzir toil por meio de automações, padronização de procedimentos, melhoria de processos e uso mais inteligente das ferramentas existentes.
Garantir comunicação clara, objetiva e executiva em situações de eventos, incidentes críticos, riscos operacionais, evolução de indicadores e planos de ação.
Gerenciar fornecedores, contratos, capacidade de atendimento, orçamento e níveis de serviço relacionados às soluções e operações sob sua responsabilidade.
Assegurar conformidade com políticas, normas, controles operacionais, requisitos de auditoria e boas práticas de gestão de serviços.
Desenvolver lideranças e equipes, incentivando colaboração, senso de dono, produtividade, aprendizado contínuo e foco em resultado.
Conectar as demandas técnicas e operacionais às prioridades do negócio, equilibrando estabilidade, agilidade, eficiência e experiência do cliente.
Requisitos e qualificações
Experiência sólida em liderança de operações de TI, monitoração, observabilidade, gestão de eventos, produção e suporte a ambientes de missão crítica.
Vivência em ambientes de alta complexidade, com múltiplos sistemas, integrações, tecnologias legadas, arquiteturas monolíticas e forte dependência operacional.
Capacidade de liderar equipes técnicas em contextos de pressão, alto volume de demandas, incidentes críticos e mudanças organizacionais.
Perfil analítico, com pensamento crítico, capacidade de priorização e tomada de decisão baseada em dados, riscos e impacto ao cliente.
Comunicação executiva clara, especialmente para reportar incidentes, riscos, planos de ação, indicadores e evolução operacional.
Postura hands on, com disposição para se envolver na operação quando necessário, sem perder a visão estratégica e de transformação.
Experiência na gestão de equipes internas, fornecedores e modelos híbridos de trabalho.
Visão de tecnologia aplicada ao negócio, com foco em estabilidade, eficiência operacional, satisfação do cliente e continuidade dos serviços.
Conhecimento em práticas de gestão de incidentes, problemas, mudanças, eventos, postmortem e melhoria contínua.
Capacidade de atuar em uma cultura ainda em transformação, ajudando a organizar responsabilidades, alinhar expectativas e construir maturidade operacional.
Desejável formação superior em Tecnologia da Informação, Engenharia, Administração, Matemática, exatas ou áreas correlatas.
Necessário inglês ou espanhol, avançado, para interação com fornecedores, documentação técnica ou contextos corporativos.
Disponibilidade para atuação em situações críticas e participação em escalas ou acionamentos previamente definidos, quando necessário.
ConhecimentosObservabilidade, monitoração proativa, gestão de eventos, alarmística, correlação de eventos e redução de ruído operacional.
Ferramentas de monitoração e observabilidade Elastic, Datadog, Zabbix e plataformas correlatas.
Gestão de serviços de TI, ITIL, ITOM em ServiceNow e processos de operação de produção.
SRE, ModernOps, confiabilidade, disponibilidade, resiliência, SLA, SLO, indicadores operacionais e gestão por OKRs/KPIs.
Ambientes legados, sistemas monolíticos, integrações críticas, infraestrutura, aplicações, cloud pública, privada ou híbrida.
Automação operacional, redução de toil, melhoria de processos e padronização de rotinas operacionais.
Gestão de incidentes críticos, gestão de problemas, análise de causa raiz, blameless postmortem e prevenção de reincidências.
Noções de integração entre monitoração, multicloud, CMDB, ITSM, operação, atendimento e times de sustentação.
Consolidação de ferramentas – migração, tombamento, desativação: SPLUNK, ELK OPEN, NINSOFT, ZABBIX 6.
X, etc.
Conhecimento básico sobre pipelines, DevOps, CI/CD, automação, versionamento e práticas modernas de engenharia será valorizado.
Fundamentos de AIOps, uso de IA aplicada à operação, observabilidade de agentes de IA e governança operacional de automações são conhecimentos desejáveis.
DiferenciaisExperiência anterior em empresas de grande porte, operações críticas, serviços digitais ou ambientes com alta dependência tecnológica.
Vivência em transformação de modelos operacionais tradicionais para modelos mais preditivos, automatizados e orientados a confiabilidade.
Experiência prática com ServiceNow, ITOM, Zabbix, Elastic, Datadog ou ferramentas equivalentes.
Conhecimento ambientes heterogêneos com tecnologias legadas e modernas convivendo.
Experiência com AIOps, automação de eventos, correlação inteligente, uso de IA para suporte operacional e proatividade.
Familiaridade com métodos ágeis, DevOps, SRE, CI/CD e práticas de engenharia aplicadas à operação.
Experiência em gestão de fornecedores, contratos, orçamento, capacidade de atendimento e melhoria de desempenho operacional.
Capacidade de influenciar diferentes áreas, alinhar times técnicos e executivos, e conduzir mudanças em ambientes complexos e com baixa clareza inicial de responsabilidades.
Informações adicionais
Benefícios
Pacote flexível de
benefícios
(VA, VR, assistência médica e odontológica, seguro de vida, auxílio farmácia e academia).
Participação nos Resultados (PPR) ou bônus anual.
Previdência privada.
Auxílio creche, escola ou babá.
Modelo híbrido, com até 2 dias de trabalho remoto por semana.
Horário flexível.
Day Off.
Programas de desenvolvimento, capacitação e parcerias educacionais.
Oportunidades de crescimento e mobilidade interna.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search