Site Reliability Engineer Sr.
Indexed description
Site Reliability Engineer Sr. (SRE)
Ubicación
- 100% Remoto
Proyecto
- Asignación para proyecto internacional con equipo de Estados Unidos.
- Ambiente altamente colaborativo y orientado a la confiabilidad, automatización y escalabilidad de plataformas críticas.
Idioma
- Inglés avanzado (oral y escrito) excluyente.
Sobre la posición
Buscamos un/a Site Reliability Engineer Sr. (SRE) con sólida experiencia en infraestructura cloud, automatización, observabilidad y gestión de entornos productivos. La persona será responsable de garantizar la confiabilidad, disponibilidad, escalabilidad y rendimiento de las plataformas, trabajando estrechamente con equipos de desarrollo e infraestructura.
Requisitos
Experiencia
- Más de 5 años de experiencia en posiciones de Site Reliability Engineering, DevOps o Infraestructura.
- Experiencia trabajando en entornos de producción críticos.
- Experiencia en gestión y resolución de incidentes.
- Conocimientos sólidos de administración de sistemas Linux/Unix.
Formación
- Título universitario en Ciencias de la Computación, Ingeniería o carreras afines.
Conocimientos técnicos
- Cloud Platforms: AWS, Azure o Google Cloud Platform.
- Infraestructura como Código (IaC), preferentemente Terraform.
- Automatización y scripting con Python, Bash o tecnologías similares.
- Contenedores y orquestación: Docker y Kubernetes.
- CI/CD: Jenkins, GitHub Actions, GitLab CI o herramientas equivalentes.
- Implementación y gestión de soluciones de monitoreo, logging y alertas.
- Conocimientos de sistemas distribuidos, networking y diseño de arquitecturas escalables.
- Experiencia trabajando con métricas de confiabilidad como SLIs, SLOs y SLAs.
Principales responsabilidades
Automatización y eficiencia operativa
- Automatizar procesos operativos, despliegues, aprovisionamiento y monitoreo.
- Desarrollar scripts y herramientas internas.
- Diseñar, implementar y optimizar pipelines de CI/CD.
- Reducir tareas manuales y repetitivas mediante automatización.
Gestión de infraestructura cloud
- Provisionar y mantener infraestructura en AWS, Azure o GCP.
- Gestionar infraestructura mediante Terraform u otras herramientas IaC.
- Garantizar escalabilidad, resiliencia y alta disponibilidad.
- Implementar mecanismos de auto-scaling y self-healing.
Confiabilidad y performance
- Monitorear aplicaciones e infraestructura mediante métricas, logs y trazas.
- Definir y mejorar indicadores de servicio (SLIs, SLOs y SLAs).
- Realizar análisis de rendimiento y optimización de sistemas.
- Ejecutar actividades de capacity planning.
Gestión de incidentes
- Participar activamente en incidentes críticos de producción.
- Realizar troubleshooting y resolución de problemas complejos.
- Liderar análisis de causa raíz (RCA).
- Impulsar acciones de mejora continua para prevenir recurrencias.
Observabilidad
- Implementar y administrar herramientas de monitoreo y alertamiento.
- Diseñar dashboards e indicadores de salud de aplicaciones y plataformas.
- Mejorar la visibilidad end-to-end de los sistemas.
Colaboración con equipos de desarrollo
- Trabajar junto a equipos de ingeniería para mejorar arquitectura y despliegues.
- Promover buenas prácticas de código resiliente y escalable.
- Integrar prácticas DevOps y SRE dentro del ciclo de desarrollo.
Resiliencia y continuidad operativa
- Implementar prácticas de Chaos Engineering.
- Ejecutar pruebas de carga y estrés.
- Garantizar estrategias de Disaster Recovery y planes de contingencia.
Gobernanza y buenas prácticas
- Definir estándares operativos y de confiabilidad.
- Documentar procesos, procedimientos y arquitecturas.
- Promover y garantizar prácticas de seguridad bajo enfoques DevSecOps.
Originally posted on Himalayas
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search