On-demand self-service · Broad network access · Resource pooling · Rapid elasticity · Measured service
Why: CapEx→OpEx, speed, elastic scale, global reach, innovation (AI/data), resilience.
| Model | You manage | Examples |
|---|---|---|
| IaaS | OS, runtime, app, data | Azure VMs, EC2, Compute Engine |
| PaaS | App & data | App Service, App Engine, Azure SQL |
| SaaS | Your data & users | Gmail, M365, Salesforce, Dynatrace |
| FaaS | Just functions | Azure Functions, Lambda |
Public = hotel · Private = own house · Hybrid = house + Airbnb · Multi-cloud = several hotel chains
Decide on: regulation (RBI, DPDP Act), latency, cost pattern, skills, lock-in, sovereignty.
| Need | AWS | Azure | GCP |
|---|---|---|---|
| VM | EC2 | Virtual Machines | Compute Engine |
| Serverless | Lambda | Functions | Cloud Run functions |
| Kubernetes | EKS | AKS | GKE |
| Object storage | S3 | Blob Storage | Cloud Storage |
| SQL | RDS | Azure SQL | Cloud SQL |
| NoSQL | DynamoDB | Cosmos DB | Firestore |
| Monitoring | CloudWatch | Azure Monitor | Cloud Monitoring |
| GenAI | Bedrock | Azure OpenAI | Vertex AI |
| VM | Container | |
|---|---|---|
| Isolation | Own OS (hypervisor) | Shared kernel |
| Size | GBs | MBs |
| Start time | Minutes | Seconds |
| Orchestrator | VM scale sets | Kubernetes |
DNS → CDN/WAF → Load balancer → Compute (VM / containers / functions) → Cache → Queue → SQL/NoSQL DB → Object storage. Plus Identity, Secrets vault, Observability, Regions & Availability Zones.
Principles: design for failure · scale out · loose coupling · automate · stateless apps.
Well-Architected pillars: Reliability, Security, Cost, Operational excellence, Performance, Sustainability.
Small, independently deployable services talking via APIs/events. Pros: independent scaling & deploys, fault isolation. Cons: network complexity, harder debugging → needs observability.
Cloud-native = containers + microservices + APIs + CI/CD + DevOps + automation.
1960s time-sharing · 1969 ARPANET · 1989 WWW · 1998 VMware · 1999 Salesforce · 2006 AWS · 2008 App Engine · 2010 Azure · 2013 Docker · 2014 Kubernetes · 2016 UPI · 2022 ChatGPT
Metrics = vital signs (numbers over time) · Logs = diary (detailed events) · Traces = MRI (one request across services) · plus events, profiles, real-user data.
Monitoring = is it broken? Observability = why? Standard: OpenTelemetry.
Golden signals: Latency, Traffic, Errors, Saturation · RED: Rate, Errors, Duration · USE: Utilization, Saturation, Errors
| SLO | Downtime/year | /month |
|---|---|---|
| 99% | 3.65 days | 7.3 h |
| 99.9% | 8.76 h | 43.8 min |
| 99.99% | 52.6 min | 4.4 min |
| 99.999% | 5.26 min | 26 s |
SLI what you measure → SLO target → SLA promise with penalties. Error budget = 100% − SLO: spend it on shipping, freeze when it's gone.
Eliminate toil · on-call with runbooks · blameless postmortems (ask what/how, never who).
Incident Q1: “What changed?” Then correlate metrics (when) + logs (what) + traces (where).
Redundancy across AZs · timeouts · retries with backoff · circuit breakers · graceful degradation · queues · chaos engineering · watch saturation (CPU, memory, connection pools, threads, queues).
Plan → Code → Build → Test → Release → Deploy → Operate → Monitor ↺
DORA: deployment frequency · lead time for changes · change failure rate · time to restore.
Safe deploys: canary · blue-green · feature flags · auto-rollback on SLO breach. IaC: Bicep, Terraform.
Provider secures of the cloud (hardware, data centres); you secure what's in it (data, identities, config, apps). Most breaches = customer misconfiguration.
MFA · least privilege · no secrets in code (Key Vault, managed identities) · encrypt in transit & at rest · Zero Trust · policy-as-code · threat detection.
Scale up (bigger box) vs scale out (more boxes, stateless). Autoscale · cache · queue · pre-warm before known spikes.
FinOps levers: rightsize · reserved/savings plans · Spot VMs · schedule dev/test off · tag everything · budgets & alerts at 80% · watch egress & log volume · delete orphans.
| System | Does | Examples |
|---|---|---|
| CRM | Customers, sales, support | Salesforce, Dynamics 365 |
| ERP | Finance, procurement | SAP S/4HANA, Oracle |
| SCM | Suppliers, logistics | SAP IBP, Blue Yonder |
| HCM | People, payroll | Workday, SuccessFactors |
| ITSM | Incidents, changes | ServiceNow, Jira SM |
| BI | Dashboards | Power BI, Tableau |
Integration: APIs · events · iPaaS (Logic Apps, MuleSoft).
Roles: Cloud Architect · DevOps · SRE · Platform Engineer · Cloud Security · FinOps · Observability · AI/MLOps.
Learn in order: Linux & networking → one cloud → scripting → containers/K8s → IaC → CI/CD → observability → security & cost.
Certs: AZ-900 / AWS Cloud Practitioner / Google Cloud Digital Leader → AZ-104 / AWS SA Associate / Google ACE → CKA, Terraform, AZ-400, AZ-500, FinOps, Dynatrace Associate.
Free: Microsoft Learn · AWS Skill Builder · Google Cloud Skills Boost · Dynatrace University · CNCF / Linux Foundation intro courses · OpenTelemetry docs.