Problema scoperto - Disturbo dei servizi nella regione nordamericana - Servizi multipli
- investigating
xMatters strumenti di monitoraggio hanno identificato un problema con xMatters On-Demand per alcuni clienti situati nella regione del Nord America, limitato a un cluster di database. Stiamo attualmente indagando sul problema e aggiorneremo come le informazioni diventano disponibili. Se si verificano anche problemi, o se non si è sicuri se questo problema influisce sul vostro servizio, si prega di contattare xMatters Customer Assistance all'indirizzo https://support.xmatters.com/hc/en-us/requests/new - i nostri agenti di supporto sono in attesa di aiutare.
- monitoring
Il team xMatters Incident Response ha implementato una correzione per il problema. Stiamo monitorando la situazione per garantire che l'implementazione sia stabile e che tutti i servizi siano ripristinati.
- resolved
Il problema è stato affrontato e tutti i servizi sono stati ripristinati. Grazie per la vostra pazienza mentre abbiamo affrontato questa questione.
- postmortem
Che e' successo? Il 1 ° luglio 2026, alcuni clienti hanno riferito un problema a xMatters Customer Support dove stavano incontrando errori di autenticazione quando si accede all'interfaccia utente web. Perche' e' successo? Questo problema si è verificato perché un cluster di database ha raggiunto il 100% di utilizzo delle risorse, causando le richieste del database di time out. Un modello di traffico eccezionale ha esposto una serie di query lento-running, che significativamente aumentato latenza query sul cluster. Con l'aumento della latenza, c'era la fame di risorse e un ulteriore degrado della reattività del cluster, con conseguente timeout. Come abbiamo risposto? Non appena il Customer Support ha confermato il problema, hanno impegnato i team di Ingegneria per indagare. Come progettato, il sistema si era restaurato prima che Engineering potesse implementare qualsiasi azione di mitigazione o recupero, ma le squadre erano ancora in grado di identificare e isolare la causa principale. Cosa stiamo facendo per impedire che accada di nuovo? Per evitare che questo problema si ripeta, il Team Engineering ha progettato, sviluppato e testato una correzione. Hanno implementato la correzione la mattina di mercoledì 8 luglio 2026, ed è stato implementato con successo per tutti i casi.
Tradotto automaticamente dall'aggiornamento ufficiale dell'incidente.