Problem entdeckt - Serviceunterbrechung in der nordamerikanischen Region - Multiple Services
- investigating
die Überwachungstools von xMatters haben ein Problem mit xMatters On-Demand für einige Kunden in der Region Nordamerika identifiziert, die auf einen Datenbankcluster beschränkt sind. Wir untersuchen derzeit das Problem und werden aktualisiert, sobald Informationen verfügbar sind. Wenn Sie ebenfalls Probleme haben oder sich nicht sicher sind, ob dieses Problem Auswirkungen auf Ihren Service hat, wenden Sie sich bitte an xMatters Client Assistance unter https://support.xmatters.com/hc/en-us/requests/new - unsere Support-Agenten warten darauf, Ihnen zu helfen.
- monitoring
Das xMatters Incident Response-Team hat einen Fix für das Problem bereitgestellt. Wir überwachen derzeit die Situation, um sicherzustellen, dass die Umsetzung stabil ist und alle Dienste wiederhergestellt werden.
- resolved
Das Problem wurde behoben und alle Dienste wurden wiederhergestellt. Vielen Dank für Ihre Geduld, während wir diese Angelegenheit angesprochen haben.
- postmortem
**Was ist passiert?** Am 1. Juli 2026 meldeten einige Kunden ein Problem beim xMatters Customer Support, bei dem beim Zugriff auf die Web-Benutzeroberfläche Authentifizierungsfehler aufgetreten waren. **Warum ist es passiert?** Dieses Problem trat auf, weil ein Datenbankcluster eine Ressourcenauslastung von 100% erreichte, was dazu führte, dass Datenbankanforderungen ausfallen. Ein außergewöhnliches Verkehrsmuster zeigte eine Reihe von langsam laufenden Abfragen, die die Abfragelatenz im Cluster signifikant erhöhten. Mit zunehmender Latenz kam es zu Ressourcenhunger und weiterer Verschlechterung der Reaktionsfähigkeit des Clusters, was zu Timeouts führte. **Wie haben wir reagiert?** Sobald der Kundensupport das Problem bestätigt hatte, beauftragten sie die Engineering-Teams mit der Untersuchung. Wie geplant, hatte sich das System selbst wiederhergestellt, bevor Engineering irgendwelche Minderungs- oder Wiederherstellungsmaßnahmen umsetzen konnte, aber die Teams waren immer noch in der Lage, die Ursache zu identifizieren und zu isolieren. **Was tun wir, um zu verhindern, dass es wieder passiert? ** Um zu verhindern, dass dieses Problem erneut auftritt, entwarf, entwickelte und testete das Engineering-Team einen Fix. Sie setzten den Fix am Mittwochmorgen, dem 8. Juli 2026, ein und er wurde für alle Instanzen erfolgreich umgesetzt.
Automatisch aus der offiziellen Störungsmeldung übersetzt.