Wir sind völlig unten für eine Untergruppe von Kunden. Wir untersuchen das Problem und rollen einen Einsatz zurück.
- investigating
Wir untersuchen derzeit dieses Problem.
- investigating
Wir werden dieses Problem weiter untersuchen.
- investigating
Der Rollback scheint Fehler vollständig behoben zu haben. Wir beobachten genau, aber Benutzer sollten wieder auf Asana zugreifen können.
- monitoring
Ein Fix wurde implementiert und wir überwachen die Ergebnisse.
- resolved
Dieser Vorfall wurde behoben.
- postmortem
Vorfall: Ein internes System, das für die automatische Skalierung der Backend-Serverkapazität in einem unserer Compute-Cluster verantwortlich ist, hat aufgehört, Kapazitäten zu ersetzen, die während der routinemäßigen Wartung ausgeschöpft wurden. Dies führte zu einer allmählichen Verringerung der verfügbaren Kapazität über mehrere Stunden. Eine nachfolgende Bereitstellung wurde mit unzureichender Kapazität aktiviert, was dazu führte, dass alle neuen Anforderungen für diesen Compute-Cluster fehlschlugen. Um die Auswirkungen abzumildern, haben wir auf eine vorherige Release-Revision zurückgegriffen, die noch über ausreichende Kapazitäten verfügte. Auswirkung: Für etwa 30 Minuten sahen Kunden, deren Datenverkehr von diesem Compute-Cluster abgewickelt wurde, volle Ausfallzeiten; andere Kunden waren nicht betroffen. Es gingen keine Kundendaten verloren. Wir haben zusätzliche Überwachung hinzugefügt, um diese Art von Fehlern bei der Kapazitätsskalierung viel früher zu erkennen, und Sicherheitsvorkehrungen hinzugefügt, um zu verhindern, dass sich der Datenverkehr verlagert, bevor eine ausreichende gesunde Kapazität bestätigt wird. Unsere Metrik berücksichtigt einen gewichteten Durchschnitt der Betriebszeit, die Benutzer in jedem Rechenzentrum erleben. Die angezeigte Ausfallzeit in Minuten spiegelt diesen gewichteten Durchschnitt wider.
Automatisch aus der offiziellen Störungsmeldung übersetzt.