Unijny router KeeperPAM i połączenia bramkowe
- resolved
Połączenia ustanowione za pośrednictwem Routera Opiekuna i Bramy Gateway w regionie UE zawodzą. Dodatkowe szczegóły zostaną zamieszczone w raporcie pośmiertnym.
- postmortem
# Post- Incydent Report 31 lipca 2026 Podsumowanie W dniu 30 lipca 2026 r. o godz. 11: 33 CT, usługa routingu połączeń KeeperPAM w regionie UE zaczęła rzucać błędy. Błędy Router / Gateway trwały około 12 godzin i 45 minut, a pełna obsługa została przywrócona około 12: 18 PM CT 31 lipca. W tym oknie główna platforma UE Keeper\ (dostęp do skarbca, uwierzytelnianie i wszystkie inne usługi Keeper\) pozostała w pełni operacyjna przez cały czas. # Co się stało W dniu 22 lipca rutynowe wdrażanie naszej usługi routingu połączeń\ ("Keeper Router"\) zawierało zaktualizowaną zależność, która zmieniła sposób, w jaki usługa pobiera swoją konfigurację startową. Błąd konfiguracji punktu końcowego spowodował, że region UE szukał punktów końcowych FIPS, które nie są dostępne. W rezultacie, gdy kontenery usługowe w regionie UE ponownie rozpoczęły działalność po wdrożeniu, nie były w stanie odzyskać konfiguracji startowej i weszły w stan nieudany. Dwa czynniki pozwoliły na niewykrycie tej awarii przez ponad tydzień. Po pierwsze, istniejące kontenery nadal obsługiwały ruch, podczas gdy kontenery zastępcze po cichu się nie rozpoczęły, więc od 22 lipca nie odnotowano bezpośredniego wpływu na klientów. QA przeszedł również wszystkie testy weryfikacji produkcji. Po drugie, awaria konfiguracji-obciążenia została zalogowana na poziomie INFO zamiast ERROR lub Critical, więc nie zostały wygenerowane żadne ostrzeżenia PagerDuty. W nocy 30 lipca, ostatnie zdrowe kontenery wyszły, balancer obciążenia usługi miał zero zdrowych celów, a punkt końcowy zaczął zwracać błędy HTTP 503. Automatyczne monitorowanie zdrowia wykryło awarię w ciągu kilku sekund i wezwało nasz zespół. # What We 're Changing 1. * * Alerting on fauld contener rollovers. * * Wprowadzamy alarmy CloudWatch we wszystkich regionach i środowiskach, które strzelają, gdy zadania kontenerowe wielokrotnie się nie rozpoczynają, aby wykryć ciche awarie rozmieszczenia. 2. * * Intensywność dziennika dla niepowodzeń startowych. * * Wszelkie niewczytanie wymaganej konfiguracji startowej będzie się teraz logować przy nasileniu ERROR / Critical zamiast INFO, który uruchamia odpowiednie alarmy, które mogą działać. Przepraszamy naszych klientów z UE za zakłócenia.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.