[Incident] CosmosEscape: Vom Sandbox-Escape zum globalen Azure-Generalschlüssel

https://www.wiz.io/blog/cosmosescape-taking-over-every-database-in-azure-cosmos-db

Die Architektur der Isolation: Was wir aus dem CosmosEscape-Vorfall lernen sollten:

Der von den Sicherheitsforschern bei Wiz aufgedeckte Vorfall demonstriert eindringlich, wie eine kleine Schwachstelle in einer vermeintlich isolierten Umgebung eine Kaskade bis hin zur vollständigen Plattform-Kompromittierung auslösen kann.

Durch eine manipulierte Gremlin-Abfrage, die von der Custom-Engine von Cosmos DB in ausführbaren .NET-Code übersetzt wurde, gelang es dem Team, die zugrundeliegende Sandbox zu umgehen. Da die Engine-Beschränkungen die Möglichkeiten von .NET-Reflection nicht ausreichend berücksichtigten, konnten die Forscher ausbrechen und erhielten Code-Ausführungsrechte direkt auf dem DB-Gateway. Dieses Gateway ist tief in die Cosmos-Plattform integriert und verfügt über weitreichende interne Zugriffsmöglichkeiten, sodass von dort aus Konfigurations- und Schlüsselmechanismen der Plattform erreicht werden konnten. Da an dieser Schnittstelle offenbar keine ausreichende, tiefengestaffelte Verteidigung (Defense-in-Depth) griff, die den Zugriff strikt auf das Mandantenkonto begrenzt hätte, standen den Forschern die zentralen Steuerungsmechanismen der gesamten Cloud-Infrastruktur offen.

Das Schadenspotenzial im Falle einer böswilligen Ausnutzung wäre verheerend gewesen: Ein Angreifer hätte im Hintergrund global Daten manipulieren oder exfiltrieren können. Besonders brisant ist die Hebelwirkung auf interne Microsoft-Dienste, wodurch der Vorfall das Potenzial für weitreichende Cross-Service-Angriffe auf unzählige Drittkunden bot.

Dass Software dieser Komplexität Fehler aufweist, ist kalkulierbar. Als das eigentliche und weitaus schwerwiegendere Versäumnis sehe ich hier jedoch die mangelhafte Echtzeit-Überwachung. Dass ein Ausbruch bis hin zu einem plattformweiten Generalschlüssel führt, ohne dass automatisierte Alarmsysteme anschlagen, deutet auf eklatante Defizite im Monitoring hin.

Zwar konnte Microsoft die Aktivitäten der Forscher im Nachgang anhand von Logdaten rekonstruieren. Dass Spuren vorhanden waren, widerlegt das Versagen der Live-Erkennung jedoch nicht, und vor allem garantiert es keineswegs, dass die Schwachstelle nicht schon vor dieser Entdeckung von anderen Akteuren unbemerkt ausgenutzt wurde.

Fazit: Der Vorfall zeigt, dass reine Prävention nicht ausreicht. Neben der Härtung und technischen Absicherung von Systemgrenzen sind lückenloses Logging und eine reaktionsschnelle Echtzeit-Überwachung mindestens ebenso überlebenswichtig für die Sicherheit eines Systems mit hohem Risikopotential.

3 „Gefällt mir“