Site Reliability Engineer
Indexed description
Key Responsibilities
1. Database Administration & Optimization (Primary Focus)
Database Operations
- Administer and maintain ESB-related databases (DB2, Oracle, SQL Server, PostgreSQL, MySQL, or equivalent).
- Perform database installation, configuration, upgrades, patching, and lifecycle management.
- Manage database schemas, tablespaces, indexes, stored procedures, and jobs supporting the integration platform.
- Ensure database high availability and disaster recovery readiness.
Performance Tuning
- Monitor database performance and proactively identify bottlenecks.
- Analyze slow-running queries and optimize execution plans.
- Implement indexing strategies and database optimization techniques.
- Perform capacity planning based on transaction growth and integration workloads.
Backup & Recovery
- Design and execute backup, restoration, and recovery procedures.
- Validate backup integrity through regular recovery testing.
- Establish and maintain RPO/RTO requirements for critical integration databases.
Database Security
- Manage database access control and privileged accounts.
- Ensure encryption, audit logging, and compliance requirements are implemented.
- Collaborate with security teams to remediate vulnerabilities and perform security hardening.
2. ESB Platform Reliability Engineering
Platform Availability
- Ensure ESB services meet defined SLA, SLO, and availability targets.
- Maintain platform resilience through proactive monitoring and preventive maintenance.
- Support middleware platforms such as:
- IBM Integration Bus (ESB Suite)
- WebMethods
- Apache Kafka
- Red Hat
- MFT
- Azure Integration Services
- Hybrid Integration Platforms
Reliability Management
- Implement reliability engineering practices and operational standards.
- Conduct root cause analysis (RCA) and problem management activities.
- Eliminate recurring incidents through automation and service improvements.
3. Monitoring & Observability
- Implement monitoring and alerting for databases, ESB runtimes, API gateways, and messaging services.
- Create operational dashboards and health reports.
- Monitor:
- Database performance
- Queue depth
- Integration transaction volume
- Service latency
- Error rates
- Infrastructure utilization
Preferred Tools
- Elastic
- Splunk
- OpenSearch
4. Incident & Problem Management
- Act as escalation point for critical production incidents.
- Lead incident response activities for integration and database-related outages.
- Perform post-incident reviews and corrective action tracking.
- Participate in 24x7 on-call support rotation when required.
Key Activities
- Incident triage
- Service restoration
- Root cause analysis
- Preventive action implementation
- Knowledge base maintenance
5. Automation & DevOps
- Develop automation scripts to reduce operational overhead.
- Automate:
- Database maintenance activities
- Backup validation
- Health checks
- Monitoring configurations
- Deployment verification
Common Technologies
- Python
- Shell Scripting
- PowerShell
- Terraform
- Jenkins
- GitHub Actions
6. Capacity & Performance Management
- Monitor platform utilization and growth trends.
- Conduct performance benchmarking and stress testing.
- Forecast infrastructure and database resource requirements.
- Recommend scaling strategies for integration workloads.
7. Disaster Recovery & Business Continuity
- Design and maintain DR procedures for ESB platforms and databases.
- Participate in periodic DR drills.
- Ensure service recovery objectives meet business requirements.
8. Governance & Compliance
- Ensure compliance with enterprise security and operational standards.
- Maintain operational documentation, runbooks, and architecture diagrams.
- Support audit and regulatory requirements.
Required Qualifications
Education
- Bachelor's Degree in Computer Science, Information Systems, Engineering, or related discipline.
Experience
- 3+ years of experience in SRE, Middleware Operations, Database Administration, or Platform Engineering.
- 3+ years managing enterprise integration platforms.
- Proven experience supporting mission-critical production environments.
Technical Skills
Database (Mandatory)
- DBA
- Database Performance Tuning
- Backup & Recovery
- Replication & High Availability
- Query Optimization
- Data Security & Auditing
Integration Technologies
- Enterprise Service Bus (ESB)
- API Management
- Kafka
- MQ Series
- ActiveMQ
- RDQM
- REST/SOAP Services
Infrastructure
- Linux Administration
- Windows Server
- Kubernetes
- Docker
- Public Cloud Platforms (Azure preferred)
Monitoring & Observability
- Elastic
- Splunk
- OpenSearch
Soft Skills
- Strong analytical and troubleshooting capabilities.
- Ability to work under pressure during production incidents.
- Stakeholder communication and coordination skills.
- Continuous improvement mindset.
- Strong documentation and knowledge-sharing practices.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search