Get in Touch

Course Outline

Fundamentals of Cloud Operations on AWS

  • Defining operational roles and responsibilities within cloud environments
  • Understanding AWS account structures, organizations, and multi-account strategies
  • Exploring key operational services: CloudWatch, CloudTrail, and AWS Config

Infrastructure as Code and Provisioning

  • Core principles of IaC and the concept of immutable infrastructure
  • Executing provisioning tasks using Terraform and AWS CloudFormation
  • Managing state, modules, and the process of environment promotion

CI/CD and Deployment Strategies

  • Building CI/CD pipelines tailored for cloud-native applications
  • Implementing blue/green, canary, and rolling deployment models
  • Automating rollbacks, health checks, and release validation processes

Monitoring, Observability, and Alerting

  • Handling metrics, logs, and traces: shipping, storing, and analysis
  • Leveraging CloudWatch, X-Ray, and third-party observability solutions
  • Establishing SLOs/SLIs, alerting policies, and on-call procedures

Security Operations and Identity Management

  • Applying IAM best practices, enforcing least privilege, and managing cross-account access
  • Managing secrets, utilizing KMS, and securing parameter stores
  • Operational security measures: patching strategies, vulnerability scanning, and audit trails

Resilience, Backup, and Disaster Recovery

  • Designing systems for fault tolerance and high availability
  • Formulating backup strategies, automating snapshots, and defining restore procedures
  • Planning for disaster recovery and creating effective runbooks

Cost Optimization and Governance

  • Enhancing cost visibility through billing, tagging, and allocation strategies
  • Rightsizing resources, utilizing reserved instances/savings plans, and controlling budgets
  • Governance frameworks: policies, guardrails, and compliance automation

Containers, Serverless, and Runtime Operations

  • Operational aspects of managing ECS, EKS, and Lambda
  • Configuring service discovery, autoscaling, and resource constraints
  • Logging, tracing, and debugging techniques for containerized workloads

Incident Response, Playbooks, and Chaos Engineering

  • Conducting runbook-driven incident response and post-incident reviews
  • Automating remediation and implementing self-healing patterns
  • Introduction to chaos engineering experiments for resilience validation

Practical Workshop: Operating a Sample Workload

  • Deploying a sample application using IaC and a CI/CD pipeline
  • Setting up monitoring, alerts, and automated remediation scripts
  • Simulating incidents and practicing runbook-based response procedures

Recap and Future Directions

Requirements

  • Fundamental knowledge of cloud concepts and networking principles
  • Proficiency with the Linux command line and scripting languages
  • Working experience with source control (Git) and foundational CI/CD concepts

Target Audience

  • Cloud operations engineers
  • SREs and platform engineers
  • DevOps engineers and technical team leaders
 21 Hours

Number of participants


Price per participant

Testimonials (1)

Upcoming Courses

Related Categories