Job Description: Senior Cloud Operations Engineer (L3)
Job Summary
We are hiring a
Senior Cloud Operations Engineer (L3) to architect, automate, and optimize AWS cloud infrastructure at scale. This leadership role requires deep AWS expertise, mid-level automation proficiency, and the ability to mentor teams while ensuring production-grade reliability, security, and cost efficiency across enterprise workloads.
Experience: 7-10 years
Immediate Joiners Preferred
Key Responsibilities
- Advanced Compute & Scaling: Architect and troubleshoot EC2 instances, Auto Scaling Groups (ASGs), Elastic Load Balancers (ELBs), and ECS; perform capacity forecasting, performance profiling, and migration leadership.
- Database Management: Engineer RDS/Aurora high-availability (HA) setups with read replicas and failover; conduct query tuning, cross-region disaster recovery (DR), and data integrity audits.
- Networking & Security: Design VPCs, Transit Gateways (TGW), Site-to-Site VPNs, and Direct Connect; implement NACLs, Security Groups (SGs), IAM/KMS policies, and GuardDuty for zero-trust compliance.
- Monitoring & Logging: Deploy CloudWatch, X-Ray, and Grafana for Service Level Objectives (SLOs); automate alerting, anomaly detection, and log analytics for proactive issue resolution.
- Storage & Backup: Optimize S3 lifecycle policies, encryption, versioning, and EBS snapshots; align with Business Continuity Planning (BCP)/DR requirements via RPO/RTO and cross-account replication.
- OS, Automation & Mid-Level DevOps: Administer Linux environments (kernel tuning, security hardening); apply Terraform/CloudFormation/Ansible for Infrastructure as Code (IaC) basics, shell scripting for operational tasks, and CI/CD pipelines (Jenkins/Git) without advanced DevOps leadership.
- Operations Leadership: Mentor L1/L2 engineers on AWS best practices and troubleshooting; lead incident response for critical production issues; document runbooks, Standard Operating Procedures (SOPs), and Architectural Decision Records (ADRs).
Required Skills & Experience
- Mastery of AWS core services including EC2, RDS/Aurora, VPC/Transit Gateway, S3, CloudWatch, ELB, and Auto Scaling Groups for production-scale operations.
- 7–10+ years in L3 cloud support/escalations, with proven expertise in root cause analysis (RCA), incident resolution, and high-availability engineering.
- Advanced Linux administration (kernel tuning, security hardening, performance profiling) and shell scripting (Bash/Python) for troubleshooting and automation.
- Strong networking knowledge (subnets, route tables, Site-to-Site VPN, Direct Connect, NACLs, security groups) with focus on secure VPC architectures.
- Mid-level DevOps proficiency: IaC using Terraform/CloudFormation/Ansible basics, CI/CD pipelines (Jenkins/Git), and introductory Docker for deployment support.
- Cloud security implementation via IAM/KMS policies, GuardDuty, and compliance (SOC2/GDPR), plus cost optimization (Savings Plans, FinOps tools).
- Excellent problem-solving, communication, and ITSM experience (ServiceNow/JIRA) for SLAs, mentoring L2 teams, and stakeholder reporting.
- Expert-level AWS services: EC2, EKS, RDS, VPC, Lambda, CloudWatch, IAM.
- Networking expertise: VPC peering, TGW, Direct Connect, Route 53.
- AWS Certification (MANDATORY): Solutions Architect Professional OR DevOps Engineer Professional.
Preferred Skills
- Kubernetes/EKS operations experience.
- Serverless architecture (Lambda, API Gateway, Step Functions).
- Grafana/Prometheus dashboarding.
- FinOps/Cost optimization expertise.