Zone redundante architectuur op papier is geen garantie dat een failover ook echt werkt. Microsofts nieuwe Azure Infrastructure Resiliency Manager koppelt Availability Zones, Chaos Studio en Monitor aan elkaar en laat je een zone-uitval simuleren voordat een storing dat voor je doet.
Veel IT-teams gaan ervan uit dat hun Azure-omgeving weerbaar is zodra ze workloads over meerdere Availability Zones hebben verspreid. Dat is een aanname, geen bewijs. Zonder een test die een zone daadwerkelijk laat uitvallen, weet niemand of de failover ook echt werkt zoals bedoeld: of een database soepel overschakelt, of een AKS-cluster zonder de juiste node pool overeind blijft, of een applicatie stilletjes een dependency mist die alleen in die ene zone stond. De architectuurtekening zegt dat alles redundant is. De praktijk bewijst dat pas op het moment dat een zone daadwerkelijk uitvalt, en dan is het te laat om iets te repareren.
Microsoft introduceerde deze zomer, tijdens Build 2026, de Azure Infrastructure Resiliency Manager, inmiddels in public preview en beschikbaar voor alle Azure-klanten. De tool voegt niets nieuws toe aan de onderliggende bouwstenen: Availability Zones, Azure Advisor, Azure Chaos Studio, Azure Monitor en Azure Copilot bestonden al. Wat ontbrak was een samenhangend proces dat die losse onderdelen aan elkaar knoopt tot een doorlopende resiliency-strategie, in plaats van een verzameling losse dashboards die niemand structureel naast elkaar legt.
De kern van het probleem is dat resiliency vaak op papier goed geregeld lijkt, maar in de praktijk nooit is getest. Advisor geeft aanbevelingen, Chaos Studio kan storingen simuleren, Monitor toont metrics, maar niemand koppelde die drie automatisch aan elkaar. Teams zagen zelden het verschil tussen de architectuur die ze dachten te hebben gebouwd en de configuratie die daadwerkelijk in productie draait. De Resiliency Manager brengt dat verschil expliciet in beeld: het toont per resource of de bedoelde zone redundantie ook echt is geconfigureerd, en niet alleen bij het aanmaken maar ook na latere wijzigingen.
Microsoft organiseert het proces in drie fases. In de fase Start Resilient helpt de tool bij het ontwerpen van nieuwe workloads met de juiste zone redundante basis, voordat er iets in productie gaat. In de fase Get Resilient scant de Resiliency Agent bestaande omgevingen, signaleert misconfiguraties en verklaart de risico's en afwegingen in gewone taal, niet alleen als foutcode of policy-melding. De fase Stay Resilient is waar de tool zijn waarde echt bewijst: continue validatie via herhaalde drills en monitoring, zodat een wijziging die de resiliency stilletjes ondermijnt, bijvoorbeeld een engineer die per ongeluk een resource buiten de zone-redundante configuratie zet, snel wordt opgemerkt in plaats van pas bij de volgende storing.
De meest concrete toevoeging in deze preview zijn de availability zone failure drills, aangedreven door Azure Chaos Studio. In plaats van te hopen dat een failover werkt tijdens een echte storing, simuleert de drill een zone uitval in een gecontroleerde setting: virtuele machines in de doelzone worden gestopt, zone redundante databases worden gedwongen te failovern, en AKS node pools in die zone worden stilgelegd. Zo zie je binnen enkele minuten of je applicatie de uitval opvangt of alsnog omvalt, zonder dat een klant daar iets van merkt en zonder dat je hoeft te wachten op een echte storing om het antwoord te krijgen.
De preview dekt al een breed scala aan resourcetypes: virtuele machines, databases met zone redundante configuraties, AKS clusters en netwerkcomponenten. Microsoft breidt de dekking naar eigen zeggen actief uit, dus verwacht dat meer resourcetypes in de komende maanden volgen. Voor organisaties die vandaag al zone redundant werken, is dat reden genoeg om de eerste scan nu te draaien, in plaats van te wachten tot de tool volledig is uitontwikkeld.
Een gemiste failover kost meer dan alleen downtime. Een storing die een half uur duurt raakt niet alleen de betrokken applicatie, maar ook het vertrouwen van klanten die op dat moment een dienst niet kunnen gebruiken, en het interne vertrouwen in de eigen architectuur. Voor organisaties met een serviceniveauovereenkomst richting klanten telt elke ongeplande minuut mee, en die minuten zijn vaak eenvoudiger te voorkomen dan achteraf te verklaren.
Praktisch begin je met de Resiliency Agent, bereikbaar via Azure Essentials in de portal. Laat die eerst een scan draaien over je belangrijkste productieomgevingen en bekijk welke resources wel op papier zone redundant zijn ingericht, maar het in de praktijk niet blijken te zijn. Plan daarna een eerste drill op een niet kritieke of staging omgeving, niet meteen op productie, om vertrouwd te raken met wat een zone uitval daadwerkelijk met je architectuur doet. Pas als die oefening zonder verrassingen verloopt, is het verantwoord om drills periodiek op productie te herhalen, bijvoorbeeld ieder kwartaal of na elke grote architectuurwijziging.
Voor de meeste organisaties is dit een kans om resiliency van een aanname naar een bewezen feit te maken, zonder dat er een storing voor nodig is om de zwakke plekken te vinden. Twijfel je of je Azure-omgeving daadwerkelijk zone redundant is ingericht, of wil je hulp bij het opzetten en uitvoeren van de eerste drills? Zarioh denkt graag mee over de inrichting en het testen van een weerbare cloudomgeving.
Was dit artikel nuttig?
Zarioh Digital Solutions
IT-specialisten uit Utrecht. Wij helpen bedrijven door heel Nederland met Microsoft 365, AI agents, hosting en telefonie, en delen hier wekelijks wat we in de praktijk tegenkomen. Volg ons op LinkedIn
Ontvang nieuwe artikelen direct in je inbox.
Geen spam. Afmelden kan altijd.

Cloud & Infrastructure

Cloud & Infrastructure

Cloud & Infrastructure