Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours
Course Outline
Core Principles of Cloud Operations on AWS
- Defining operational roles and responsibilities within the cloud ecosystem.
- Understanding AWS account hierarchies, organizational structures, and multi-account strategies.
- Key operational services: an overview of CloudWatch, CloudTrail, and AWS Config.
Infrastructure as Code (IaC) and Provisioning
- Exploring IaC principles and the concept of immutable infrastructure.
- Implementing provisioning workflows with Terraform and AWS CloudFormation.
- Managing state files, modular design, and environment promotion strategies.
CI/CD Pipelines and Deployment Methodologies
- Designing CI/CD pipelines optimized for cloud-native applications.
- Implementing blue/green, canary, and rolling deployment strategies.
- Automating rollback mechanisms, health checks, and release validation processes.
Monitoring, Observability, and Alerting Systems
- Handling metrics, logs, and traces: ingestion, storage, and analysis.
- Utilizing CloudWatch, X-Ray, and third-party observability platforms.
- Establishing SLOs/SLIs, alerting policies, and effective on-call practices.
Security Operations and Identity Governance
- Applying IAM best practices, least privilege principles, and cross-account access controls.
- Managing secrets, KMS integration, and secure parameter stores.
- Operational security measures: patching strategies, vulnerability scanning, and audit trail maintenance.
Resilience, Backups, and Disaster Recovery
- Architecting for fault tolerance and high availability.
- Developing backup strategies, automated snapshotting, and restore procedures.
- Planning disaster recovery scenarios and creating comprehensive runbooks.
Cost Optimization and Governance
- Enhancing cost visibility through billing analysis, tagging, and cost allocation strategies.
- Rightsizing resources, utilizing reserved instances/savings plans, and implementing budget controls.
- Enforcing governance through policies, guardrails, and automated compliance checks.
Containers, Serverless Architectures, and Runtime Operations
- Operational considerations for managing ECS, EKS, and Lambda.
- Configuring service discovery, autoscaling, and resource limits.
- Logging, tracing, and debugging techniques for containerized workloads.
Incident Response, Playbooks, and Chaos Engineering
- Implementing runbook-driven incident response and conducting postmortem analyses.
- Automating remediation processes and establishing self-healing patterns.
- Introduction to chaos experiments for validating system resilience.
Practical Workshop: Managing a Sample Workload
- Deploying a sample application using IaC and a CI/CD pipeline.
- Setting up monitoring, alerts, and automated remediation scripts.
- Simulating incidents and practicing runbook-based response procedures.
Conclusion and Future Recommendations
Requirements
- Foundational knowledge of cloud computing concepts and network architecture.
- Proficiency with the Linux command line and scripting languages.
- Practical experience with source control systems (such as Git) and fundamental CI/CD principles.
Target Audience
- Cloud operations engineers.
- Site Reliability Engineers (SREs) and platform engineers.
- DevOps engineers and technical team leaders.
Testimonials (1)
I've find out new interesting things about Lambda and Serverless