Distributed tracing for ML inference — why?
medium- Single request spans: feature store fetch → preprocess → model call → postprocess → API response.
- Tracing (Jaeger, OpenTelemetry) shows per-span latency + errors + attributes.
- Debugging: p99 latency dominated by feature fetch (not model) reveals where to optimize.
- Correlated failure: one downstream service down → trace shows which span failed.
- Modern: LLM traces per prompt token / retrieval hop (LangSmith, Langfuse, Weights & Biases Traces).