SRE, AWS DevOps, EKS, ECS, EC2, Docker, CloudFormation, CI/CD, GitHub Actions, GitLab CI/CD, Infrastructure as Code, Arize AI, AI Observability, ML Observability, LLM Observability, MLOps, Model Monitoring, Model Drift Detection, Open Telemetry, Prometheus, Grafana, Kubernetes, CloudWatch, ELK Stack, Incident Management, RCA, SLI, SLO, SLA, Reliability Engineering, Performance Optimization, Platform Engineering, Python, Bash, DevSecOps, AWS Security, SageMaker, GenAI Operations . Experienced in implementing CI/CD pipelines, driving SRE best practices, and ensuring platform reliability through proactive monitoring, incident management, and performance optimization using CloudWatch, Prometheus, Grafana, and Arize.