Conexiunile de router și de poartă ale EU KeeperPAM
- resolved
Conexiunile stabilite prin intermediul Router-ului Păstrătorului și al Gateway-ului din regiunea UE sunt în scădere. Detalii suplimentare vor fi postate în raportul postmortem.
- postmortem
Raport post-Incident ** 31 iulie 2026 ** ## Rezumat La 30 iulie 2026 la 11:33 PM CT, serviciul de rutare a conexiunilor KeeperPAM din regiunea UE a început să arunce erori. Erorile Router/Gateway au durat aproximativ 12 ore și 45 de minute, serviciul complet fiind restaurat la aproximativ 12:18 PM CT pe 31 iulie. În timpul acestei ferestre, principala platformă a EU Keeper \(vault access, autentificare, și toate celelalte servicii ale Păstrătorului\) a rămas pe deplin operațională pe tot parcursul. ## What happened Pe 22 iulie, o desfăşurare de rutină la serviciul nostru de rutare de conectare \ O configuraţie greşită a obiectivului a determinat regiunea UE să caute un criteriu final FIPS, care nu este disponibil. În consecință, atunci când containerele de servicii din regiunea UE au fost repornite în urma implementării, acestea nu și-au putut recupera configurația de pornire și au intrat într-o stare eșuată. Doi factori au permis ca această eroare să nu fie detectată mai mult de o săptămână. În primul rând, containerele existente au continuat să servească traficului, în timp ce containerele de înlocuire nu au reușit să înceapă în tăcere, astfel încât nu a existat niciun impact imediat al clienților de pe 22 iulie. QA a trecut, de asemenea, toate testele de verificare a producției. În al doilea rând, eșecul de configurare-sarcină a fost înregistrat la nivel INFO mai degrabă decât ERROR sau CRITICAL, astfel încât nu au fost generate alerte PagerDuty. În noaptea de 30 iulie, ultimele containere sănătoase s-au retras, balansul de sarcină al serviciului avea zero ţinte sănătoase, iar obiectivul final a început să revină la erorile HTTP 503. Monitorizarea automată a sănătăţii a detectat întreruperea în câteva secunde şi a chemat echipa noastră de gardă. ## What We're Changing 1. **Alertarea pe rollover-uri de containere eșuate.** Lansăm alarme CloudWatch în toate regiunile și mediile care trag atunci când sarcinile containerelor nu reușesc în mod repetat să pornească, să detecteze defecțiunile de implementare tăcute. 2. ** Log severity for startup failings. ** Orice neîncărcare a configurației de pornire necesare se va conecta acum la severitatea EROR/CRITICAL în loc de INFO care declanșează alertele adecvate. Ne cerem scuze clienților noștri din UE pentru întrerupere.
Traducere automată din actualizarea oficială a incidentului.