Jesteśmy całkowicie w dół dla podzbioru klientów. Prowadzimy śledztwo w tej sprawie i wycofujemy się z misji.
- investigating
Obecnie badamy tę kwestię.
- investigating
Nadal badamy tę kwestię.
- investigating
Rollback wydaje się mieć całkowicie rozwiązane błędy. Monitorujemy dokładnie, ale użytkownicy powinni mieć dostęp do Asany.
- monitoring
Wprowadzono rozwiązanie i monitorujemy wyniki.
- resolved
Ten incydent został rozwiązany.
- postmortem
Incydent: Wewnętrzny system odpowiedzialny za automatyczne skalowanie pojemności serwera backend w jednym z naszych klastrów obliczeniowych przestał zastępować pojemność, która została przerwana podczas rutynowej konserwacji. Spowodowało to stopniowe zmniejszenie dostępnej przepustowości w ciągu kilku godzin. Kolejne uruchomienie zostało uruchomione z niewystarczającą przepustowością, co spowodowało, że wszystkie nowe wnioski dotyczące niepowodzenia obliczeń tego klastra. Aby złagodzić ten wpływ, powróciliśmy do poprzedniego przeglądu wydania, który nadal miał wystarczające możliwości. Impact: Przez około 30 minut klienci, których ruch był obsługiwany przez ten klaster obliczeń widział pełne przestoje; inni klienci nie zostały naruszone. Nie utracono danych klientów. Dalsze działania: Dodaliśmy dodatkowy monitoring w celu wykrycia tego rodzaju awarii skalowania pojemności znacznie wcześniej oraz dodaliśmy zabezpieczenia zapobiegające przemieszczaniu ruchu, zanim zostanie potwierdzona wystarczająca sprawność. _ Nasza metryka uwzględnia średnią ważoną czasu przestoju doświadczonego przez użytkowników w każdym centrum danych. Liczba minut przestoju odzwierciedla tę średnią ważoną. _
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.