Ability to troubleshoot complex AWS environments, including unhealthy workloads, failed serverless workflows, database/data pipeline issues, routing/DNS problems, capacity constraints, and automation failures. Proven implementation of core Site Reliability Engineering (SRE) practices, including SLIs/SLOs, error budgets, monitoring, alerting, incident response, reliability, and resiliency.