Simulation benchmark for canary deployment strategies in LLM model updates, measuring safety, rollback behavior, bad exposure, and rollout speed across good, bad, and marginal candidate scenarios
performance-engineering benchmark simulation rollback inference systems ab-testing canary-deployment rollout model-deployment model-versioning mlops guardrails llm llm-serving machine-learning-infrastructure serving-systems serving-safety
-
Updated
Jul 26, 2026 - Python