EU KeeperPAM router e connessioni gateway
- resolved
Le connessioni stabilite attraverso il Keeper Router e il gateway nella regione dell'UE stanno fallendo. Ulteriori dettagli saranno pubblicati nel rapporto postmortem.
- postmortem
# Rapporto post-incidente 31 luglio 2026 # Il 30 luglio 2026 alle 11:33 PM CT, il servizio di routing di connessione KeeperPAM nella regione UE ha iniziato a lanciare errori. Gli errori Router/Gateway durarono circa 12 ore e 45 minuti, con il servizio completo ripristinato a circa 12:18 PM CT il 31 luglio. Durante questa finestra, la principale piattaforma Keeper EU \(accesso ai risultati, autenticazione e tutti gli altri servizi Keeper\) è rimasta completamente operativa in tutto. # What Happened # Il 22 luglio, una distribuzione ordinaria al nostro servizio di routing di connessione \(“Keeper Router”\) ha incluso una dipendenza aggiornata che ha cambiato il modo in cui il servizio recupera la sua configurazione di avvio. Una cattiva configurazione nel punto finale ha causato la regione dell'UE a cercare un endpoint FIPS, che non sono disponibili. Di conseguenza, quando i container di servizio nella regione dell'UE si riavviavano dopo l'implementazione, non erano in grado di recuperare la loro configurazione di avvio e sono entrati in uno stato fallito. Due fattori hanno permesso a questo fallimento di andare inosservati per oltre una settimana. In primo luogo, i contenitori esistenti continuarono a servire il traffico mentre i contenitori di sostituzione silenziosamente non riuscirono a partire, quindi non vi fu alcun impatto immediato del cliente dall'implementazione del 22 luglio. QA ha anche superato tutti i test di verifica della produzione. In secondo luogo, il guasto del carico di configurazione è stato registrato a livello INFO piuttosto che ERROR o CRITICAL, quindi non sono stati generati avvisi PagerDuty. La notte del 30 luglio, gli ultimi contenitori sani sono usciti, il bilanciatore di carico del servizio aveva zero obiettivi sani, e il punto finale ha iniziato a restituire errori HTTP 503. Il monitoraggio automatizzato del controllo della salute ha rilevato l'interruzione in pochi secondi e ha chiamato il nostro team di chiamata. # What We're Changing 1. **Alloggio su rollover container falliti.** Stiamo implementando gli allarmi CloudWatch in tutte le regioni e ambienti che sparano quando le attività dei container non riescono più a iniziare, per rilevare i guasti di distribuzione silenziosi. 2. **Log severity per i guasti di avvio.** Qualsiasi mancato caricamento della configurazione di avvio richiesta verrà ora loggato alla gravità ERROR/CRITICAL invece di INFO che attivano gli avvisi idonei. Ci scusiamo con i nostri clienti UE per la disgregazione.
Tradotto automaticamente dall'aggiornamento ufficiale dell'incidente.