Direct experience developing or extending AI inference runtimes or execution providers, such as ONNX Runtime, TensorRT-like runtimes, OpenVINO, TensorFlow Lite delegates, Qualcomm QNN/SNPE, TVM runtimes, or comparable systems for NPUs, GPUs, DSPs, or other accelerators. The complete runtime must coordinate heterogeneous workloads, manage ownership, synchronization, and safe reuse of shared data buffers, minimize data movement, provide predictable low-latency execution, recover from failures, and expose cohesive APIs and observability to applications and SDK components.