IT Asset Management - APAC Login PageIT Visibility - APAC
investigating
Incydent Opis: Badamy obecnie problem wpływający na dostęp do usług Flexera One w regionie APAC. Uszkodzeni klienci mogą mieć trudności z dostępem do platformy lub mogą wystąpić błędy po uwierzytelnianiu.
Priorytet: P1
Działalność remontowa: Nasze techniczne zostały zaangażowane i aktywnie bada problem w celu zidentyfikowania przyczyny i przywrócenia normalnej obsługi tak szybko, jak to możliwe.
identified
Nasze śledztwo zidentyfikowało problem konfiguracji jako prawdopodobną przyczynę wpływu. Zespoły aktywnie pracują nad wdrożeniem i zatwierdzeniem środków naprawczych w celu przywrócenia normalnej eksploatacji usług. Dalsze aktualizacje zostaną przedstawione w miarę postępu dochodzenia.
identified
W miarę postępów w śledztwie nasze zespoły stwierdziły, że problem nie jest odizolowany od zarządzania aktywami IT i może mieć szerszy wpływ na platformę Flexera One w APAC. Trwają działania zaradcze przeciwko zidentyfikowanej przyczynie, a zespoły skupiają się na przywróceniu pełnej stabilności służby. Dodatkowe aktualizacje będą dostarczane w miarę dostępności większej ilości informacji.
identified
Kontynuujemy prace nad rozwiązaniem tego problemu.
monitoring
Zastosowano rozwiązanie i przywrócono dostęp do platformy Flexera One. Nasze zespoły prowadzą dodatkowe działania w zakresie walidacji i nadal ściśle monitorują zdrowie i wydajność usług w celu potwierdzenia stabilności i zapewnienia pełnej operacyjności wszystkich usług.
resolved
Po rozszerzonych działaniach monitorujących i weryfikacyjnych nasze zespoły potwierdziły, że usługi pozostają stabilne i nie zaobserwowano dalszych skutków. Incydent został rozwiązany, a wszystkie dotknięte usługi są w pełni operacyjne.
Flexera One – IT Asset Management – EU – Reconciliation Failures
Początek 13 sierpnia 2026 01:08 UTC · 4h 49m
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - EU Batch Processing System
investigating
Incident Description: We are currently investigating an issue impacting the reconciliation process within the IT Asset Management platform in the EU region. Affected customers may experience failures when attempting to run reconciliation jobs. As a result, reconciliation processes may not complete successfully, potentially delaying data updates and downstream processing.
Priority: P2
Restoration Activity: Our technical teams have been engaged and are actively working to identify the root cause and restore services. Further updates will be provided as we continue working toward resolution.
monitoring
Our teams identified a configuration issue introduced during the completion of a standard release earlier today, which prevented an instance from successfully communicating with the Reconcile service.
The affected instance's configuration process was successfully re-executed, restoring the required settings and re-establishing connectivity with the Reconcile service. Validation testing confirmed normal service operation, and reconciliation processing has resumed successfully. The environment remains under monitoring to ensure continued stability.
monitoring
We are continuing to monitor for any further issues.
resolved
Following extended monitoring, our teams have confirmed that the platform has remained stable and no recurrence of the issue has been observed since the remediation actions were completed. Reconciliation processing continues to operate normally, connectivity with the Reconcile service remains healthy, and all validation checks have been successful.
Based on the sustained stability of the environment and the absence of any further failures, this incident has been resolved
Flexera One - Optymalizacja kosztów w chmurze (CCO) - NAM - Degradacja usług
Początek 11 sierpnia 2026 17:26 UTC · 3h 0m
OutagePoważny incydent
Dotknięte komponenty
Cloud Cost Optimization - US
investigating
Incydent Opis: Badamy problem wpływający na Cloud Cost Optimization (CCO) usług w regionie Ameryki Północnej (NAM). Klienci mogą doświadczyć stron, które nie są załadowane, wydłużają zachowanie załadowcze lub mają trudności z dostępem do pewnych funkcji optymalizacji kosztów w ramach Flexera One.
Priorytet: P2
Działalność remontowa: Nasze zespoły techniczne aktywnie badają problem i pracują nad przywróceniem normalnej obsługi. Obecne wysiłki koncentrują się na określeniu przyczyny degradacji i weryfikacji działań naprawczych. Dostarczymy dodatkowe aktualizacje w miarę dostępności większej ilości informacji.
identified
Our investigation has identified the issue affecting certain Cloud Cost Optimization (CCO) functionality in the North America region. Following a recent service migration, some application components were not operating with the expected resource configuration, resulting in certain requests failing to complete and impacted pages remaining in a continuous loading state.
Our technical teams have implemented configuration changes to restore the appropriate resource allocation for the affected services and are currently deploying those changes. We are monitoring recovery and validating service functionality as the update takes effect.
We will provide additional updates as progress continues.
monitoring
The configuration changes have been deployed, and the affected service components are now operating with the intended resource configuration. Our technical teams have observed recovery of the impacted Cloud Cost Optimization (CCO) functionality in the North America region and are performing final validation to confirm service stability.
We will continue to monitor the environment closely and provide a further update once validation activities are complete.
resolved
Following a period of monitoring, services have remained stable and no further issues have been observed.
This incident is now considered resolved.
postmortem
**Description:** Flexera One - Cloud Cost Optimization \(CCO\) - North America - Service Degradation Affecting Certain Functionality
**Timeframe:** August 11, 2026, 9:51 AM PDT – August 11, 2026, 10:45 AM PDT
**Incident Summary**
On August 11, 2026, customers may have experienced issues accessing certain Cloud Cost Optimization \(CCO\) functionality in the North America region. Impacted pages could remain in a continuous loading state and fail to render correctly.
Technical teams began investigating after identifying that certain application requests were not completing successfully. The impact was limited to specific functionality rather than the entire CCO service.
During the investigation, technical teams determined that dependent application services were unable to successfully retrieve required configuration information from a supporting service component, resulting in rendering issues for affected functionality.
Corrective configuration changes were implemented and updated service components were deployed. Following deployment, technical teams validated recovery and continued monitoring the environment to confirm stable operation. All affected functionality subsequently returned to normal operation.
**Root Cause**
During a recent service migration, a supporting application component was deployed with an incorrect resource configuration. As processing demand increased, the affected service components exhausted available resources and became unavailable.
As a result, dependent application services were unable to successfully retrieve required configuration information needed to process certain requests. This resulted in rendering issues affecting specific Cloud Cost Optimization \(CCO\) functionality.
**Remediation Actions**
The following actions were taken during the incident response:
1. Incident Investigation Initiated: Technical teams investigated reports of affected CCO functionality remaining in a continuous loading state and failing to render correctly.
2. Service Dependency Analysis Performed: Technical teams identified that dependent application services were unable to successfully retrieve required configuration information from a supporting service component.
3. Configuration Issue Identified: Investigation determined that a supporting application component had been deployed with an incorrect resource configuration following a recent service migration.
4. Corrective Configuration Changes Applied: Technical teams implemented configuration changes to restore the intended operating parameters for the affected service components.
5. Service Recovery Validation Performed: Updated service components were deployed, affected functionality was validated, and the environment was monitored to confirm stable operation before incident closure.
**Future Preventative Measures**
Following this incident, technical teams reviewed the migration and deployment process associated with the affected service component.
1. Configuration Validation Enhancements: An additional validation step has been added to verify that service configurations are appropriate for forecasted processing requirements following migration activities. This additional review is intended to help identify configuration discrepancies before they can affect production workloads.
Flexera - Ticketing service - Degradowana wydajność aktualizacji poczty elektronicznej
Początek 7 sierpnia 2026 04:55 UTC · 7d 0h
IssuesDrobny incydent
investigating
Opis wydania: Nasze zespoły stwierdziły, że niektóre systemy e-mail klientów firmy Flexera odrzucają wysyłane e-maile zawierające powiadomienia o aktualizacjach w sprawach wsparcia firmy Flexera.
Priorytet: P3
Aktywność przywracania:
Zespoły techniczne aktywnie badają tę sprawę.
W międzyczasie prosimy zalogować się do Flexera Community i skorzystać z portalu Support Case pod adresem https: / / community.flexera.com / s / case / Case / Default, aby przejrzeć status sprawy i sprawdzić wszelkie aktualizacje.
identified
Our teams have identified the cause of the issue and are currently working to resolve it.
identified
Our teams continue to work toward a resolution. During the ongoing investigation, we identified that in some instances emails from Flexera may be being blocked by SharePoint. Addressing this issue requires additional investigation and coordination with the relevant parties to ensure the appropriate corrective actions are taken. We will continue to provide updates as more information becomes available.
identified
Our teams continue working toward a resolution. Additional investigation and coordination with the appropriate teams are underway to restore normal email flow. We will provide further updates as more information becomes available.
monitoring
Our teams have implemented corrective measures and are observing positive results. Initial validation testing has been successful, indicating that the mitigation actions are effective. We will continue to closely monitor the service to ensure ongoing stability and will provide further updates as they become available.
resolved
After extended monitoring, our teams have confirmed that all email updates are being delivered successfully. This incident has been declared as resolved.
Flexera One - IT Asset management - APAC - Data loading failures/slowness
Początek 5 sierpnia 2026 08:28 UTC · 0m
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - APAC Inventory UploadIT Asset Management - APAC Batch Processing System
resolved
Incident Description: Our teams identified a service disruption affecting a subset of Flexera One IT Asset Management (ITAM) customers in the APAC Production environment from 4 August 2026, 04:04 AM PDT to 04:25 AM PDT . During the affected period, a subset of our customers experienced intermittent slowness, service unresponsiveness, or data loading failures within the platform.
Priority: P2
Restoration Activity: Our technical teams investigated the issue and determined that an unexpected database resource exhaustion condition occurred during the affected period. The condition subsequently self-corrected, allowing affected services to recover and return to normal operation. Post-incident validation confirmed that platform operations are performing as expected. We are conducting a detailed review of the incident and evaluating additional safeguards, capacity controls, and monitoring improvements to further reduce the likelihood of similar events in the future.
Flexera One- IT Zarządzanie aktywami - UE - Inwentaryzacja i zagadnienia związane z komunikacją beacon
Początek 3 sierpnia 2026 06:56 UTC · 1d 4h
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - EU Beacon CommunicationIT Asset Management - EU Inventory Upload
investigating
Incydent Opis: Obecnie badamy problem wpływający na pakiet inwentaryzacji (* .zip) ładunki w regionie Europy dla Flexera One Zarządzanie aktywami IT. Klienci próbujący przesłać określone pakiety inwentarza mogą napotkać błędy, co prowadzi do nieudanego przesyłania zapasów i opóźnień w przetwarzaniu danych inwentarza.
Priorytet: P2
Działalność remontowa: Nasz zespół techniczny aktywnie bada tę kwestię i dokonuje przeglądu bieżącej działalności przetwórczej w celu potwierdzenia zakresu i postępu. Dokładnie monitorujemy sytuację i dostarczymy aktualizacje w miarę dostępności większej ilości informacji.
investigating
Nasze zespoły nadal aktywnie badają tę kwestię i przeprowadzają szczegółowy przegląd dzienników systemowych i diagnostyki w celu dalszej identyfikacji i potwierdzenia podstawowej przyczyny. Dostarczymy dodatkowe aktualizacje w miarę dostępności większej ilości informacji.
investigating
Podczas trwającego dochodzenia nasze zespoły stwierdziły, że problem ten może mieć również wpływ na łączność sygnalizacyjną ze środowiskiem produkcyjnym Flexera One w UE. W związku z tym mogą mieć wpływ dodatkowe operacje, które opierają się na komunikacji między platformami. Zespół kontynuuje badanie zasadniczej przyczyny, ocenia pełny zakres oddziaływania oraz pracuje nad jak najszybszym wdrożeniem rezolucji.
monitoring
Nasze zespoły zidentyfikowały ostatnią zmianę konfiguracji jako prawdopodobną przyczynę problemu. Od tego czasu konfiguracja została cofnięta, a my obserwujemy odzyskiwanie usług w obrębie dotkniętych komponentów, z funkcjonalnością platformy stopniowo wraca do oczekiwanych poziomów. Zespoły nadal aktywnie angażują się w monitorowanie środowiska w celu walidacji pełnego ożywienia gospodarczego, zapewnienia stabilności platformy oraz szybkiego rozwiązania wszelkich pozostałych skutków.
monitoring
Nadal monitorujemy wszelkie dalsze problemy.
monitoring
Działania łagodzące pozostają skuteczne, a przetwarzanie zapasów jest kontynuowane z powodzeniem. Aktywnie monitorujemy postępy w odzyskiwaniu i pracujemy nad pozostałą zaległością, aby zapewnić pomyślne zakończenie całego przetwarzania. Będziemy nadal dostarczać aktualizacje w miarę postępów w zakresie odbudowy.
monitoring
Odzysk usług jest nadal na dobrej drodze, a środki łagodzące są nadal skuteczne. Przetwarzanie zapasów działa skutecznie, a zaległości zostały znacznie zmniejszone, przybliżając objętości do normalnego poziomu. Nasze zespoły nadal monitorują środowisko i przetwarzają pozostałe zaległości, aby zakończyć odzyskiwanie. W stosownych przypadkach zostaną dostarczone dalsze aktualizacje.
resolved
Środowisko wróciło do normalnego poziomu operacyjnego. Przetwarzanie zapasów i łączność sygnalizacyjna są stabilne, a zaległości powróciły do oczekiwanych progów.
Platforma pozostaje zdrowa, a dalsze monitorowanie potwierdza trwałą stabilność. Dodatkowe informacje na temat przyczyny, działań naprawczych i długoterminowych inicjatyw poprawy zostaną udostępnione w sprawozdaniu poubojowym po zatwierdzeniu ustaleń.
postmortem
* * Opis: * * Flexera One- Zarządzanie aktywami IT - UE - Inwentaryzacja błędów wysyłania
* * Czas: * * 31 lipca 2026, 6: 00 PM PDT do 4 sierpnia 2026, 4: 09 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W niedzielę, 2 sierpnia 2026 r., o godzinie 11: 42 PM PDT, Flexera wskazała na problem wpływający na pakiet inwentaryzacji\ (\ * .zip\) wysyłający i wybierał komunikaty sygnalizacyjne w środowisku produkcyjnym UE Flexera One IT Asset Management. Dotknięci klienci doświadczyli nieudanego przesyłania pakietów inwentaryzacyjnych, w tym odpowiedzi HTTP 504\ (Gateway Timeout\) i HTTP 405\ (Method Not Darled\). Zagadnienie to zakłóciło również wybór łączności między platformami beacon a platformą, powodując opóźnienia lub awarie w przetwarzaniu i przyjmowaniu danych dotyczących zapasów.
Dochodzenie wykazało, że najwcześniejszy wpływ rozpoczął się 31 lipca 2026 r. o godz. 18.00 PDT. Analiza wykazała problem związany z komunikacją na krytycznej ścieżce trasowania usług, która uniemożliwiała podzbiór wniosków z powodzeniem dotarcie do usług przetwarzania niższego szczebla. Spowodowało to powtarzające się próby powtórne, opóźnione przetwarzanie zapasów oraz nagromadzenie zaległości.
Aby złagodzić problem i przywrócić usługę, ruch został przekierowany na alternatywną ścieżkę komunikacji. Po tej zmianie, łączność sygnalizacyjna ustabilizowała się, ładunki zapasowe wznowione z powodzeniem przetwarzania, a zaległości inwentarza zaczął spadać. Do 3: 42 AM PDT w dniu 3 sierpnia 2026 roku, ładunki inwentaryzacyjne zostały zakończone pomyślnie i nie zaobserwowano żadnych nowych błędów.
Środowisko pozostawało pod rozszerzonym monitorowaniem, podczas gdy ilości przetwarzania wróciły do normalnego poziomu operacyjnego. O 4: 09 AM PDT w dniu 4 sierpnia 2026 roku Flexera potwierdził, że łączność sygnalizacyjna, przetwarzanie zapasów i związane z nimi usługi platformy działały normalnie, zaległości powróciły do oczekiwanych progów, a incydent został oficjalnie ogłoszony rozwiązany.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
W dniu 31 lipca 2026 r. Problem pojawił się później, gdy komponenty aplikacji zostały ponownie uruchomione i zaczął tworzyć nowe połączenia przy użyciu zaktualizowanej konfiguracji. Spowodowało to błędy uścisku dłoni i awarię komunikacji, co spowodowało niedostępność usług. W związku z tym nie można było przetwarzać wniosków ze strony nadawców klientów o przesłanie do środowiska produkcyjnego UE pakietów inwentaryzacyjnych\ (\ * .zip\), co spowodowało niepowodzenie wysyłania danych i uniemożliwiło ich odbiór i przetwarzanie. Wpływ na inne interakcje między platformami plażowymi również został naruszony, chociaż nie zaobserwowano natychmiastowego wpływu na klienta.
Usługa została przywrócona poprzez przekierowanie ruchu na alternatywną ścieżkę komunikacji, która nie została naruszona przez problem konfiguracji związanej z certyfikatem. Inwentaryzacja i komunikacja sygnalizacyjna wznowiły normalne działanie.
Czynniki wiążące
* Nieudane próby ustanowienia połączenia spowodowały, że część wniosków nie powiodła się przed osiągnięciem dalszych usług przetwarzania.
* Opóźnienia w przetwarzaniu zapasów: Niepowodzenie komunikacji zapobiegło niektórym pakietom zapasów i powiązanemu importowi z pomyślnie przetwarzaniem, co doprowadziło do opóźnionych aktualizacji zapasów.
* Retri- Driven Backlog Growth: Automatyczne mechanizmy retry pozwoliły wielu transakcjach ostatecznie odnieść sukces, ale przyczyniły się do zwiększenia opóźnień przetwarzania i akumulacji backlog podczas gdy problem pozostał aktywny.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
Aby przywrócić obsługę, zespoły techniczne wykonywały następujące działania:
* Przekierowanie ruchu drogowego: Przekierowany ruch z dala od dotkniętej ścieżki usługi, aby przywrócić stabilną komunikację sygnalizacyjną i pakiet zapasowy.
* Monitoring platformy: Wykonywany ciągły monitoring łączności sygnalizacyjnej, ładunki zapasowe i działania przetwarzania w celu weryfikacji odzysku usług.
* Backlog Recovery Management: Monitorowane przetwarzanie zapasów przepustowości i potwierdzone, że przetwarzanie zaległości stale zmniejsza i wraca do oczekiwanych progów operacyjnych.
* Walidacja stabilności: Przeprowadzona rozszerzona kontrola po przywróceniu w celu potwierdzenia trwałej stabilności platformy i pomyślnego przetwarzania zapasów.
* Potwierdzenie przywracania usługi: O 4: 09 AM PDT w dniu 4 sierpnia 2026, potwierdził, że łączność sygnalizacyjna, przetwarzanie zapasów i związane z nimi usługi funkcjonowały normalnie.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Oporność na komunikację usługową: przegląd i usprawnienie ścieżki komunikacji, która ma wpływ na poprawę niezawodności, odporności i odbudowy po przyszłych zakłóceniach związanych z połączeniami.
* Wzmocniona walidacja zmian: Wzmocnienie procesów walidacji i testowania infrastruktury, konfiguracji, certyfikatu i ścieżki usług w celu identyfikacji niedopasowania komunikacji przed wdrożeniem do środowiska produkcyjnego.
* Ulepszone wykrywanie i alarmowanie: Wzmocnienie monitorowania i ostrzeganie możliwości zapewnienia wcześniejszej identyfikacji trwałych zakłóceń komunikacji, zwiększona aktywność ponowna próby, nieprawidłowe wzorce błędu, i powstające zaległości przetwarzania. Ulepszenia te umożliwią szybsze wykrywanie, prowadzenie dochodzeń i rozwiązywanie problemów, zanim staną się one bardziej skuteczne dla klientów.
Badania wrażliwości oprogramowania (SVR) - zakłócenie usługi
Początek 29 lipca 2026 04:36 UTC · 5h 17m
OutageKrytyczny incydent
Dotknięte komponenty
Software Vulnerability Research
investigating
Incydent Opis: Badamy problem wpływający na badania wrażliwości oprogramowania (SVR) usługi. Klienci mogą mieć obecnie trudności z dostępem do SVR lub z wykorzystaniem SVR.
Priorytet: P1
Aktywność przywracania: Nasze zespoły aktywnie badają problem i pracują nad przywróceniem usługi. Trwają obecnie działania w zakresie łagodzenia sankcji, ponieważ pracujemy nad ponownym uruchomieniem usługi. Dalsze aktualizacje będą dostarczane w miarę dostępności większej ilości informacji.
investigating
Wdrożono działania w zakresie naprawy gospodarczej; jednak w obecnych warunkach pracy usługa nadal doświadcza niestabilności, co powoduje trwające zakłócenia w świadczeniu usług. Nasze zespoły aktywnie pracują nad zmniejszeniem wpływu i przywróceniem dostępności usług. Dalsze aktualizacje będą dostarczane w miarę dostępności większej ilości informacji.
resolved
Zespoły techniczne przywróciły dostępność usług dla badań nad podatnością na drażliwość oprogramowania (SVR). W celu rozwiązania problemu niestabilności usług wdrożono działania naprawcze, a walidacja potwierdziła przywrócenie funkcjonalności SVR. Będziemy nadal ściśle monitorować służbę, aby zapewnić stałą stabilność.
Raport pośmiertny zawierający dodatkowe szczegóły, w tym przyczynę i środki zapobiegawcze, zostanie opublikowany w najbliższych dniach.
postmortem
**Description:** Software Vulnerability Research \(SVR\) - Service Disruption
**Timeframe:** July 28, 2026, 2:00 PM PDT to July 29, 2026, 2:53 AM PDT
**Incident Summary**
On Tuesday, 28 July 2026, at 2:00 PM PDT, the Flexera Software Vulnerability Research\(SVR\) production environment experienced a service disruption that affected API availability and application functionality. The incident occurred when the primary database instance supporting the SVR platform became unavailable. Existing database connections were unexpectedly terminated, and application servers were unable to establish new connections. As a result, customers were unable to reliably access SVR services and APIs during the incident.
During the investigation, our teams determined that the disruption was caused by an unplanned failover initiated by the cloud service provider. According to the provider’s event history, an infrastructure issue was detected on the primary database host, prompting the provider to automatically initiate the failover process.
Our technical teams immediately engaged the cloud service provider to investigate the incident and restore service. Following recovery and validation activities, all production services were successfully restored and returned to normal operation by 2:53 AM PDT on 29 July 2026.
**Root Cause**
The incident was triggered by an unplanned failover of the production database, initiated by the cloud service provider in response to an infrastructure-level issue affecting the primary database host.
During the failover, the primary database instance became temporarily unavailable. This caused active database connections to terminate abruptly, preventing application services from establishing new connections. As a result, API requests failed and service availability across the SVR platform was impacted.
Flexera has formally requested a detailed Root Cause Analysis \(RCA\) from the cloud service provider to determine the precise infrastructure condition that triggered the failover and to identify opportunities to prevent recurrence.
**Contributing Factors**
During the investigation, the following factors were identified as potentially contributing to the overall impact of the incident:
* A significantly elevated volume of client connection attempts was observed originating from customer environments during the incident period.
* Connection volumes exceeded normal operating levels, increasing load on backend services while database services were recovering.
* Elevated connection activity may have amplified the impact of the database failover and increased recovery complexity.
* Existing application retry and connection behaviours generated additional connection demand during database recovery activities.
**Remediation Actions**
* Cloud provider engagement: Our teams immediately engaged the cloud service provider and worked directly with their on-call engineers throughout the recovery effort.
* Database recovery: Executed a controlled database failover/reboot in coordination with the cloud service provider.
* Restored connectivity: Re-established database availability and connectivity to the production environment.
* Application recovery validation: Confirmed that application services successfully reconnected to backend database services.
* Service validation: Verified recovery of APIs and critical SVR application functionality.
* Post-recovery monitoring: Implemented enhanced monitoring of database health, application performance, and connection activity following restoration.
**Future Preventative Measures**
* Continue monitoring customer connection volumes and backend database connection utilisation.
* Review and optimise database connection pooling, connection management, retry logic, and failover handling to improve resilience during future infrastructure events.
* Complete the cloud service provider support engagement and review the provider's detailed Root Cause Analysis once available.
* Conduct an internal post-incident review and implement additional preventive measures identified through the review process.
Incydent Opis: Badamy przerywany problem wpływający na usługi Flexera One w regionie APAC. Podczas korzystania z aplikacji i usług Flexera One klienci mogą doświadczać problemów lub błędów związanych z dostępem przerywanym. Wydaje się, że problem ten ogranicza się obecnie do regionu APAC.
Priorytet: P2
Aktywność odnawiania: Nasze zespoły aktywnie badają tę kwestię. Zakres i wpływ są oceniane w ramach usług Flexera One w regionie APAC, a my pracujemy nad określeniem przyczyny i przywróceniem stabilności usług. Dalsze aktualizacje będą dostarczane w miarę dostępności większej ilości informacji.
investigating
Nasze zespoły techniczne aktywnie badają sprawę. Wydaje się, że problem ten jest przerywany, a niektóre wnioski odnoszą sukcesy, podczas gdy inne nadal zawodzą. Przeglądamy usługi i ich zależności w celu określenia zakresu oddziaływania, określenia przyczyny i przywrócenia stabilności usług.
resolved
Zespoły techniczne złagodziły problem dotyczący usług Flexera One w regionie APAC. Funkcjonalność usług została przywrócona, a walidacja potwierdza, że odpowiednie aplikacje i usługi funkcjonują zgodnie z oczekiwaniami.
W trakcie dochodzenia zespoły zidentyfikowały problemy związane z komunikacją o usługach, które doprowadziły do problemów z dostępem i błędów dla niektórych klientów. W ramach wysiłków na rzecz łagodzenia skutków zmiany klimatu zespoły techniczne ponownie rozpoczęły działalność, po której odzyskano funkcjonalność i walidacja usług potwierdziły pomyślne przywrócenie usług, które miały wpływ. Będziemy kontynuować przegląd incydentu i monitorować zdrowie służby.
postmortem
**Description:** Flexera One - APAC - Intermittent Service Disruption
## Timeframe
**Timeframe:** July 28, 2026, 3:16 PM PDT - July 28, 2026, 5:39 PM PDT
## Incident Summary
On Tuesday, July 28, 2026, at 3:49 PM PDT, customers using Flexera One services in the APAC region began experiencing intermittent service disruptions affecting multiple applications and platform capabilities. Customers may have encountered login issues, application errors, failed page loads, API errors, and intermittent access to certain Flexera One functionality.
During the incident, multiple services experienced intermittent communication failures with shared platform services. As a result, customers experienced inconsistent application behavior, with some requests succeeding while others failed.
Technical teams investigated the issue across affected applications and platform components to determine the scope and source of the failures. The investigation identified a connectivity issue affecting communication between application services and a shared platform dependency. Corrective configuration changes were implemented to restore service communication and stabilize affected functionality.
Following implementation of the corrective changes, technical teams validated functionality across impacted applications and confirmed that services had returned to normal operation. Continued monitoring showed stable service behavior, and the incident was resolved at 5:40 PM PDT on July 28, 2026.
## Root Cause
Investigation determined that the incident was caused by a connectivity issue introduced during a platform infrastructure migration.
Following the migration, certain application services continued using legacy connection ports when communicating with shared platform services. When affected services restarted, they attempted to communicate using endpoint and port combinations that were no longer aligned with the updated platform configuration.
This configuration mismatch resulted in intermittent communication failures between application services and shared platform components, causing customer-facing application errors and service disruptions across multiple Flexera One services in the APAC region.
## Remediation Actions
The following actions were taken during the incident response:
1. **Incident Investigation Initiated:** Technical teams investigated reports of intermittent failures affecting multiple Flexera One services in the APAC region and assessed the scope of customer impact.
2. **Dependency Analysis Performed:** Technical teams reviewed communication paths between impacted applications and shared platform services to identify the source of the connectivity failures.
3. **Configuration Mismatch Identified:** Investigation determined that certain services were attempting to communicate through legacy ports that were not aligned with the updated platform configuration following the migration.
4. **Platform Configuration Updated:** The required ports were added to the updated platform configuration, restoring connectivity for the affected services.
5. **Service Recovery Validation:** Technical teams validated functionality across impacted applications and confirmed that service communication and customer-facing functionality had returned to normal operation.
## Future Preventative Measures
The following improvements have been identified to further reduce the risk of similar incidents in the future:
1. **Platform Configuration Alignment:** Platform connectivity configurations were updated to ensure application services can communicate with shared platform components using the required connection ports. Maintaining alignment between service connectivity requirements and platform configurations helps reduce the risk of similar connectivity issues following future infrastructure changes.
Atlas śnieżny - APAC - Wypadki związane z logowaniem i 404 Błędy
Początek 27 lipca 2026 00:11 UTC · 1h 49m
OutageKrytyczny incydent
Dotknięte komponenty
Snow Atlas - AustraliaSnow Atlas API - Australia
investigating
Incydent Opis: Badamy problem dotykający klientów Atlas śniegu w regionie APAC. Dotknięci użytkownicy mogą nie mieć dostępu do platformy i mogą napotkać 404 błędów podczas próby zalogowania się. Obecne dochodzenie wskazuje, że problem ten ogranicza się do regionu APAC, przy czym nie potwierdzono żadnego wpływu w innych regionach.
Priorytet: P1
Działalność remontowa: Nasze zespoły techniczne aktywnie badają tę kwestię, aby zidentyfikować przyczynę i przywrócić usługę. Dokładnie monitorujemy środowisko i w stosownych przypadkach wdrażamy działania naprawcze. Dalsze aktualizacje będą dostarczane w miarę dostępności większej ilości informacji.
investigating
Nasze zespoły rozwiązały problem dotykający klientów Atlasu Śnieżnego w regionie APAC.
Problem ten miał miejsce, gdy usługa platformowa nie zaczęła się prawidłowo, co doprowadziło do nieregularnych błędów i problemów z dostępem dla niektórych klientów. Zespoły techniczne zidentyfikowały bazową awarię rozruchu i przywróciły obsługę poprzez ponowne uruchomienie komponentów platformy.
Działania w zakresie walidacji potwierdziły udany dostęp do platformy i w tym czasie nie obserwujemy żadnych bieżących skutków dla klientów.
Nasze zespoły będą nadal uważnie monitorować środowisko, aby zapewnić stałą stabilność.
resolved
Ten incydent został rozwiązany.
postmortem
**Description:** Snow Atlas - APAC - Login Failures and 404 Errors
**Timeframe:** July 26, 2026, 5:00 PM PDT to July 26, 2026, 6:15 PM PDT
**Incident Summary**
On Sunday, 26 July 2026, Flexera experienced a service disruption affecting Snow Atlas customers in the APAC Production environment, resulting in login failures and temporary inability to access Agreement pages. The issue was isolated to the APAc region, with no impact to other production regions.
Investigation by our technical teams determined that the disruption was caused by a backend service communication issue that prevented Agreement data from being retrieved successfully. The condition was consistent with a runtime synchronization issue following recent platform infrastructure maintenance.
Flexera teams validated platform health, restored the affected services, and confirmed successful recovery. Customer access was fully restored, and post-recovery monitoring confirmed stable operations with no recurrence of the underlying service communication errors.
A detailed post-incident review was completed, and corrective measures have been implemented to further strengthen platform resilience and recovery processes.
**Root Cause**
The incident was caused by an application communication failure within the APAC Production environment. A component responsible for processing requests between internal application services did not successfully handle Agreement-related requests, preventing those requests from being completed and resulting in customer-facing 404 errors and failures accessing Agreement pages.
**Contributing Factors**
* The application communication failure occurred following a recent infrastructure upgrade to the APAC Production environment.
* Although the application services and underlying infrastructure remained healthy, an internal service responsible for processing Agreement requests did not fully recover after the upgrade.
* Existing health checks validated application and infrastructure availability but did not verify the successful initialization of the internal communication path following the upgrade.
* The issue was therefore not detected until customers began experiencing login failures and HTTP 404 errors when accessing Agreement pages.
**Remediation Actions**
To restore service, technical teams:
* Confirmed the underlying infrastructure remained healthy throughout the incident.
* Identified the failed internal service communication affecting Agreement requests.
* Restarted the affected application services.
* Validated successful recovery across impacted tenants.
* Continued monitoring to confirm service stability.
**Future Preventative Measures**
* Enhanced Post-Upgrade Validation: Introduce additional validation checks following infrastructure upgrades to verify that critical application components and internal service communications are functioning as expected.
* Improved Monitoring and Alerting: Enhance monitoring and alerting to detect internal service communication failures and responder registration issues more quickly.
* Synthetic Health Checks: Implement synthetic health checks that validate critical customer workflows, including Agreement page functionality, following infrastructure changes.
Flexera One- Visibility IT - UE - Niezaładowanie raportów
Początek 22 lipca 2026 10:33 UTC · 21h 18m
OutagePoważny incydent
Dotknięte komponenty
IT Visibility EU
investigating
Incydent Opis: Badamy problem wpływający na widoczność IT w regionie Europy, gdzie wiele raportów Power BI nie są ładowane. Klienci w regionie dotkniętym chorobą mogą nie być w stanie zapoznać się z raportami wpływającymi w ramach wniosku. Obecne dochodzenie wskazuje, że problem ten ogranicza się do regionu Europy, a w chwili obecnej nie odnotowano żadnego wpływu w innych regionach.
Priorytet: P2
Aktywność przywracania: Nasze zespoły techniczne aktywnie badają tę kwestię, aby zidentyfikować przyczynę i przywrócić funkcjonalność raportu. Kontynuujemy ocenę zakresu oddziaływania, monitorujemy zdrowie usług i w stosownych przypadkach wdrażamy działania naprawcze. Dostarczymy dalsze aktualizacje w miarę dostępności większej ilości informacji.
identified
Nasze dochodzenie zidentyfikowało potencjalną kwestię związaną z konfiguracją w środowisku dotkniętym. W ramach naszych wysiłków w zakresie walidacji, działania naprawcze były stosowane w odniesieniu do podzbioru organizacji mających wpływ, a sprawozdania są obecnie z powodzeniem ładowane.
Nasze zespoły skupiają się obecnie na wdrożeniu szerszej remediacji we wszystkich zainteresowanych organizacjach i przeprowadzają szczegółowy przegląd, aby zrozumieć, dlaczego zmiany konfiguracji nie rozprzestrzeniły się zgodnie z oczekiwaniami. Nadal walidujemy rekultywację i uważnie monitorujemy wydajność usług, pracując nad pełną rezolucją.
identified
Działania naprawcze zostały teraz zastosowane wobec większej liczby organizacji, których to dotyczy, a wstępne zatwierdzenie wskazuje, że sprawozdania są z powodzeniem ładowane.
Obecnie zatwierdzamy wszystkie zainteresowane organizacje w celu potwierdzenia, że funkcjonalność i wydajność usług w sprawozdaniu zostały w pełni przywrócone. Równolegle zespoły nadal wdrażają szersze środki zaradcze w całym środowisku i ściśle monitorują służbę w celu zapewnienia stabilności, a jednocześnie kontynuują prace na rzecz pełnej restrukturyzacji i uporządkowanej likwidacji.
identified
Nasze zespoły zastosowały poprawki do wszystkich zidentyfikowanych organizacji. Wstępna walidacja wskazuje, że dotknięte organizacje odzyskują zgodnie z oczekiwaniami.
Zespoły techniczne nadal sprawdzają skuteczność środków naprawczych w całym regionie Europy, aby potwierdzić, że usługa została w pełni przywrócona. Ściśle monitorujemy wydajność platformy i po zakończeniu walidacji regionalnej zapewnimy dalszą aktualizację.
resolved
Dalsze dochodzenie wykazało, że przyczyną incydentu jest kwestia synchronizacji. Nasze zespoły techniczne wdrożyły ukierunkowane działania naprawcze, w tym ponowne uruchomienie serwisu, w celu przywrócenia normalnych operacji. Po rozszerzonym monitorowaniu i walidacji po rekultywacji wydajność usług pozostała stabilna i potwierdziliśmy, że wszystkie usługi, których to dotyczy, powróciły do normalnego funkcjonowania. Problem ten jest teraz uważany za rozwiązany.
postmortem
* * Opis: * * Flexera One - Widoczność IT - UE - Brak wczytywania raportów
* * Czas: * * 22 lipca 2026, 3: 11 AM PDT - 22 lipca 2026, 11: 04 PM PDT
* * Podsumowanie zdarzeń * *
W dniu 22 lipca 2026 r., około 3: 11 AM PDT, problem zaczął mieć wpływ na funkcjonalność sprawozdawczości IT w środowisku produkcyjnym Flexera One w UE. W tym okresie klienci w regionie UE doświadczyli niepowodzeń podczas próby załadowania raportów o widoczności IT i tablic rozdzielczych, w tym informacji na temat oprogramowania, sprzętu, technologii wywiadowczej\ (TI\), zrównoważonego rozwoju i opinii na temat sprawozdań finansowych.
Zespoły techniczne rozpoczęły dochodzenie po otrzymaniu wielu raportów klientów dotyczących niepowodzenia w załadunku raportów w całym regionie UE. Wstępna analiza potwierdziła, że problem ten ogranicza się do środowiska produkcyjnego UE, podczas gdy równoważne funkcje sprawozdawcze w innych regionach nadal funkcjonowały normalnie.
Dochodzenie wykazało, że kwestia związana z uwierzytelnianiem miała miejsce w środowisku sprawozdawczym UE. W rezultacie wpływające na nie raporty i deski rozdzielcze nie były w stanie odzyskać danych wymaganych do skutecznego załadowania, powodując błędy w załadowaniu raportów dla wpływających klientów.
Zespoły techniczne wdrożyły aktualizacje naprawcze w środowisku raportowania dotknięte i przeprowadziły działania w zakresie walidacji w ramach wpływających organizacji klientów. Po tych działaniach sprawozdania i tablice rozdzielcze wznowiły normalne działanie, a klienci po raz kolejny mieli możliwość skutecznego dostępu do danych sprawozdawczych.
Po zatwierdzeniu środowiska klientów i potwierdzeniu, że raporty zostały załadowane pomyślnie, funkcjonalność usługi został przywrócony i incydent został uznany za rozwiązany. Zespoły techniczne kontynuowały monitorowanie po przywróceniu, aby zapewnić ciągłą stabilność usług.
* * Root Cause * *
Incydent został spowodowany kwestią uwierzytelniania w środowisku sprawozdawczym UE. Problem ten uniemożliwił zainteresowanym sprawozdaniom i desce rozdzielczej skuteczne uzyskanie danych wymaganych do wyświetlenia wyników, co doprowadziło do niepowodzenia w załadowaniu raportów dla klientów, którzy mieli wpływ.
* * Działania naprawcze * *
Następujące działania zostały podjęte podczas reakcji na incydent:
1. Regionalna ocena wpływu: Zespoły techniczne zbadały sprawozdania klientów i potwierdziły, że problem ten został odizolowany od środowiska produkcyjnego UE. W innych regionach przeprowadzono dodatkową walidację w celu sprawdzenia, czy funkcjonalność sprawozdawczości pozostaje sprawna poza dotkniętym środowiskiem.
2. Analiza błędów uwierzytelniania: Zespoły techniczne dokonały przeglądu przetwarzania raportów, przepływu uwierzytelniania, raportowania miejsc pracy oraz ostatnich zmian platformy w celu zidentyfikowania źródła awarii. Dochodzenie wykazało, że odnośne sprawozdania nie były w stanie pomyślnie uwierzytelnić podczas pobierania podstawowych danych wymaganych do sporządzania sprawozdań.
3. Remont i walidacja Działania: Zespoły techniczne zastosowały aktualizacje w środowiskach klientów dotkniętych i raportowania przestrzeni roboczej w celu przywrócenia udanego zbierania danych raportu. Po wdrożeniu, wpływające organizacje klientów zostały zatwierdzone w celu potwierdzenia raportów i deski rozdzielcze były załadowywanie pomyślnie i wyświetlanie danych zgodnie z oczekiwaniami.
4. Weryfikacja po odzyskaniu: Po przywróceniu przeprowadzono dodatkowe działania w zakresie monitorowania i walidacji w celu zweryfikowania ciągłej funkcjonalności sprawozdań, potwierdzenia pomyślnego odzysku oraz zapewnienia stabilności usług w całym środowisku produkcyjnym UE.
* * Przyszłe środki zapobiegawcze * *
Podczas incydentu zidentyfikowano następujące działania następcze:
• Autoryzacja Aktualizacja Przegląd Procesu: Zespoły techniczne dokonują przeglądu procesu aktualizacji uwierzytelniania, aby zrozumieć, dlaczego aktualizacja nie została skutecznie zastosowana we wszystkich miejscach pracy objętych raportem w środowisku produkcyjnym UE oraz aby określić ulepszenia, które pomogą zapobiec podobnym problemom w przyszłych aktualizacjach.
Flexera One- Zarządzanie aktywami IT - USA - Degradowana wydajność
Początek 22 lipca 2026 08:25 UTC · 7h 51m
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - US Inventory Upload
identified
Opis zdarzenia: Zidentyfikowaliśmy problem wpływający na przetwarzanie zapasów w Flexera One IT Asset Management po wdrożeniu wersji 2026 R1.1 w naszym amerykańskim środowisku produkcyjnym. W związku z tym niektórzy klienci mogą doświadczać zdegradowanych problemów w zakresie wydajności i niezawodności podczas dostępu do niektórych obszarów interfejsu użytkownika i wykonywania zadań systemowych.
Priorytet: P2
Funkcja przywracania: Nasze dochodzenie wykazało, że problem związany jest z wadą oprogramowania wprowadzoną w wersji 2026 R1.1.
Wada została wcześniej zidentyfikowana, a procedury łagodzące zostały włączone do procesu rozmieszczania, jednak automatyczna rekultywacja napotkała nieoczekiwane problemy z wykonaniem. W rezultacie zespoły techniczne wdrożyły alternatywne środki łagodzące, aby zmniejszyć wpływ na klientów i ustabilizować wydajność systemu.
W dalszym ciągu aktywnie monitorujemy środowisko i stosujemy działania naprawcze w celu zaradzenia defektom i przywrócenia normalnej eksploatacji.
identified
Nasze zespoły nadal pracują nad wdrożeniem hotfix, aby rozwiązać ten problem. Podczas wdrażania hotfix napotkał warunki bazy danych, które uniemożliwiają jego pomyślne ukończenie.
Nasze zespoły techniczne aktywnie pracują nad rozwiązaniem tego problemu i oceniają ukierunkowane działania łagodzące, aby umożliwić ukończenie hotfix. Po pomyślnym zastosowaniu hotfix zespoły potwierdzą wydajność obsługi i będą kontynuować monitorowanie w celu potwierdzenia odzysku.
Dostarczymy kolejną aktualizację, jak więcej informacji stanie się dostępne.
monitoring
Hotfix został z powodzeniem wdrożony, a zespoły inżynieryjne obecnie zatwierdzają jego skuteczność. Zespoły w dalszym ciągu monitorują zachowania platform i dokonują przeglądu telemetrii w celu potwierdzenia rozwiązania problemu.
resolved
Nasze zespoły zakończyły walidację po wdrożeniu i potwierdziły, że wydajność usług wróciła do oczekiwanych poziomów. Kontynuowane monitorowanie wykazało stabilną pracę platformy bez dalszego wpływu. W oparciu o te wyniki uznaje się, że problem ten został rozwiązany.
postmortem
**Description:** Flexera One – IT Asset Management – North America – Degraded Performance
**Timeframe:** July 20, 2026, 8:13 PM PDT – July 22, 2026, 8:41 AM PDT
**Incident Summary**
On July 20, 2026, at approximately 8:13 PM PDT, an issue began affecting Flexera One IT Asset Management customers in the North America production environment following completion of the production release.
During the affected period, some customers experienced intermittent application slowness, delayed processing, reconcile failures, timeout conditions, and degraded performance across inventory-related workflows. Technical teams investigated performance and reliability issues observed following the release and worked to determine the underlying cause and scope of impact.
The investigation determined that the observed behavior was associated with a defect previously identified in the release. Corrective changes intended to address the defect were included as part of the release activity; however, the corrective changes did not successfully apply across all North America production databases during the deployment process. As a result, some environments continued to experience significantly increased database processing activity during inventory-related operations, contributing to elevated resource consumption, processing delays, timeout conditions, and degraded application performance.
Technical teams worked to successfully deploy the corrective changes across the affected North America production databases. Following deployment, teams performed validation activities and monitored processing workflows to confirm recovery.
By July 22, 2026, at approximately 8:41 AM PDT, validation confirmed successful processing of previously impacted workloads and that the previously observed failure patterns were no longer occurring. The incident was considered resolved and technical teams continued monitoring to confirm service stability.
**Root Cause**
The incident was caused by corrective changes intended to address a previously identified defect not successfully applying across all North America production databases during the release deployment process.
As a result, the underlying defect remained active in affected environments and caused significantly more database processing activity than intended during inventory-related processing operations. This increased workload resulted in elevated resource consumption, processing delays, timeout conditions, and degraded platform performance.
These conditions contributed to intermittent application slowness, delayed processing, reconcile failures, and degraded performance affecting some IT Asset Management functionality within the North America production environment.
**Remediation Actions**
1. **Incident Investigation Initiated:** Technical teams investigated reports of application slowness, processing delays, reconcile failures, and degraded platform performance affecting the North America production environment.
2. **Impact Assessment Performed:** Teams reviewed customer-reported symptoms, system performance data, processing activity, and platform behavior to determine the scope and nature of the issue.
3. **Cause Identified:** Investigation determined that corrective changes intended to address a previously identified defect did not successfully apply across all North America production databases during the release deployment process.
4. **Processing Behavior Corrected:** Technical teams deployed corrections designed to eliminate the inefficient processing behavior that was contributing to elevated database workload, processing delays, timeout conditions, and degraded application performance.
5. **Recovery Validated:** Teams validated the effectiveness of the deployed changes through monitoring and successful execution of previously impacted processing activities.
6. **Post-Restoration Monitoring Performed:** Additional monitoring confirmed that the previously observed failure patterns and performance degradation were no longer occurring and that service stability had been restored.
**Future Preventative Measures**
Based on the investigation, the following follow-up activities have been identified:
* **Processing Logic Improvements:** Technical teams implemented and validated corrective changes to the inventory-processing logic responsible for the increased database workload observed following the release. These changes were designed to eliminate the inefficient processing behavior that contributed to processing delays, reconcile failures, timeout conditions, and degraded application performance.
* **Critical Hotfix Deployment Process Review:** Technical teams will review the deployment process for critical database hotfixes and evaluate alternative approaches to help ensure required corrective changes are successfully applied during future release activities.
Flexera- Spot- Wszystkie regiony - Nieprawidłowe dane rozliczeniowe dla klientów AWS
Początek 17 lipca 2026 10:24 UTC · 2d 2h
OutagePoważny incydent
Dotknięte komponenty
Spot UISpot Website
investigating
Opis zdarzenia: Zidentyfikowaliśmy problem wpływający na fakturowanie i widoczność kosztów klientów AWS we wszystkich regionach. W wyniku aktywnego zakłócenia dostawcy usług klienci mogą obserwować niedokładne, niekompletne lub opóźnione szacunkowe informacje dotyczące kosztów i wykorzystania w ramach konsoli do rozliczeń i zarządzania kosztami.
Kwestia ta ogranicza się do usług opartych na AWS i nie wpływa na klientów korzystających z innych platform w chmurze.
Priorytet: P2
Działalność w zakresie przywracania: Nasze zespoły techniczne potwierdziły, że problem związany jest z aktywnym zdarzeniem usługowym AWS dotykającym wszystkie regiony. Aktywnie monitorujemy sytuację i ściśle współpracujemy z aktualizacjami AWS w celu oceny wpływu klienta. Przywrócenie usługi zależy od rozwiązania problemu bazowego przez AWS, a my będziemy nadal dostarczać aktualizacje w miarę dostępności dodatkowych informacji.
investigating
Nadal badamy tę kwestię.
identified
Nadal ściśle monitorujemy brak dostawcy usług i jego wpływ na usługi, których to dotyczy. Dalsze aktualizacje będą dostarczane w miarę dostępności nowych informacji.
identified
Dotychczasowe działania w zakresie badań i walidacji nie wykazały żadnego wpływu na dane dotyczące rozliczeń punktowych lub analizy kosztów. Przeanalizowane dane dotyczące fakturowania i ustalania cen pozostają zgodne z oczekiwanymi wartościami. Chociaż wstępne wyniki walidacji są pozytywne, kontynuujemy dodatkowe działania walidacyjne, ponieważ dostępne są dalsze dane potwierdzające te ustalenia. Pozostajemy zaangażowani w AWS i będziemy nadal uważnie monitorować sytuację. Będziemy dzielić się dodatkowymi aktualizacjami w miarę naszych działań walidacyjnych.
identified
Nadal aktywnie współpracujemy z AWS i nadal uważnie monitorujemy sytuację. AWS określił główną przyczynę i wdrożono środki łagodzące w celu rozwiązania problemu, który doprowadził do nieprawidłowego wyświetlenia szacunkowych danych dotyczących kosztów i wykorzystania.
AWS rozpoczął uzupełnianie danych w celu przywrócenia dokładnych informacji o kosztach i zużyciu dla wszystkich klientów, a pełne odzyskanie jest spodziewane do 18 lipca 2026, 12: 00 PM PDT.
monitoring
Kontynuujemy monitorowanie imprezy usługowej AWS i pozostajemy zaangażowani w AWS, gdy zakończą swoją działalność naprawczą. Ukończone do tej pory walidacja nie wykazała żadnego wpływu na dane dotyczące rozliczeń punktowych lub analizy kosztów. Kontynuujemy monitorowanie sytuacji i kończymy wszelkie pozostałe działania w zakresie walidacji przed ustaleniem zamknięcia tego incydentu.
resolved
AWS rozwiązało zakłócenia w służbie 18 lipca o 6: 57 AM PDT. Po pomyślnym zatwierdzeniu przez nasze zespoły techniczne potwierdziliśmy, że funkcjonalność usługi została przywrócona.
postmortem
* * Opis: * * Flexera Spot - AWS Billing Service Diruption
Czas: 17 lipca 2026, 1: 33 AM PDT - 18 lipca 2026, 6: 57 AM PDT
* * Podsumowanie zdarzeń * *
W dniu 17 lipca 2026 roku, około 1: 33 AM PDT, zespoły techniczne firmy Flexera dowiedziały się o problemie AWS wpływającym na szacowane rachunki i dane dotyczące wykorzystania wyświetlane w AWS Billing and Cost Management, Cost Explorer oraz Cost and Usage Reports.
Biorąc pod uwagę charakter zakłóceń w świadczeniu usług przez AWS, zespoły techniczne wszczęły dochodzenie w celu ustalenia, czy wpływ na naliczanie opłat na miejscu, analizę kosztów lub obliczenia oszczędności dla klientów AWS zostały naruszone. Podczas dochodzenia zespoły dokonały przeglądu danych dotyczących fakturowania i ustalania cen stosowanych przez Spot, zweryfikowały odpowiednie tabele kosztów i cen, monitorowały aktualizacje AWS oraz oceniły, czy wpłynęły na nie dane dotyczące fakturowania lub oszczędności klientów.
Zespoły techniczne zatwierdziły dane dotyczące rozliczeń i cen stosowane przez Spot i potwierdziły, że odpowiednie tabele kosztów i cen funkcjonują zgodnie z oczekiwaniami. W toku dochodzenia nie zidentyfikowano żadnych kwestii w danych wykorzystanych przez Spot i nie zaobserwowano błędnych obliczeń rozliczeń ani oszczędności.
AWS potwierdziło następnie, że kwestia ta powstała w ramach usług AWS Billing and Cost Management, zidentyfikowała i złagodziła podstawową kwestię oraz ukończyła działania związane z odzyskiwaniem danych i backfill.
Na podstawie walidacji przeprowadzonej w trakcie całego dochodzenia nie zaobserwowano wpływu produktu Spot na klientów. Po potwierdzeniu odzyskania AWS i zakończeniu działań walidacyjnych po odzyskaniu uznano, że incydent został rozwiązany.
* * Root Cause * *
Incydent został spowodowany problemem usługi AWS wpływającym na szacowane dane dotyczące rozliczeń i wykorzystania wyświetlane w AWS Billing and Cost Management, Cost Explorer, oraz Cost and Usage Reports. AWS zidentyfikował i ograniczył podstawową emisję i ukończył działania związane z odzyskiwaniem danych.
* * Działania naprawcze * *
Następujące działania zostały podjęte podczas reakcji na incydent:
• Incydent Surveillance Initiated: Zespoły techniczne rozpoczęły badanie AWS fakturowania i wykorzystania danych w celu ustalenia, czy klienci Spot zostały dotknięte.
• Ocena wpływu przeprowadzona: Zespoły techniczne oceniły, czy zakłócenie usługi AWS miało wpływ na analizę rachunków na miejscu i obliczenia oszczędności.
• Zatwierdzanie danych Ukończone: Zespoły dokonały przeglądu i walidacji danych rachunkowych i cenowych wykorzystanych przez Spot i potwierdziły, że odpowiednie tabele kosztów i cen funkcjonowały zgodnie z oczekiwaniami.
• AWS Recovery Monitorowane: Zespoły techniczne monitorowały komunikację AWS, aktualizacje usług i działania odzyskiwania przez cały incydent.
• Post- Recovery Validation Performed: Dodatkowa walidacja została zakończona w następstwie działań AWS odzyskiwania i backfill danych w celu potwierdzenia integralności rozliczeń i cen danych stosowanych przez Spot.
• Rozwiązanie incydentu: Incydent został zamknięty po potwierdzeniu przez AWS odzysku i walidacji technicznej nie stwierdzono wpływu w Spot.
* * Przyszłe środki zapobiegawcze * *
Podczas incydentu zidentyfikowano następujące działania następcze:
• AWS Współpraca i przegląd: Kontynuuj ścisłą współpracę z AWS w celu zrozumienia przyczyny incydentów zarządzanych przez dostawcę i przeglądu wszelkich zaleceń lub uczenia się wynikających z ich dochodzenia.
• Przegląd odporności i walidacji: Przegląd możliwości dalszego wzmacniania procesów walidacji danych związanych z billingiem w celu wsparcia szybszej oceny skutków i reakcji w trakcie podobnych zakłóceń usług dla stron trzecich w przyszłości.
Flexera One- Zarządzanie aktywami informatycznymi - APAC & EU - Słabość i pogorszone wyniki
Początek 17 lipca 2026 08:24 UTC · 1d 11h
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - APAC Inventory UploadIT Asset Management - EU Inventory Upload
identified
Opis zdarzenia: Zidentyfikowaliśmy problem wpływający na przetwarzanie zapasów w Flexera One IT Asset Management po wdrożeniu wersji 2026 R1.1 w naszych środowiskach APAC i Europy. W rezultacie podzbiór klientów może doświadczać pogorszonych wyników przy dostępie do niektórych obszarów interfejsu użytkownika i podczas wykonywania zadań związanych z systemem.
Priorytet: P2
Aktywność przywracania: Nasze zespoły techniczne zidentyfikowały problem jako błąd oprogramowania wprowadzony w wersji 2026 R1.1. Wprowadzono środki łagodzące w celu ograniczenia wpływu na klientów, a zespoły aktywnie pracują nad pełnym przywróceniem wydajności usług. Będziemy nadal dostarczać aktualizacje w miarę postępów.
identified
Nadal czynimy postępy w rozwiązywaniu problemów dotyczących wydajności, które wpływają na podzbiór klientów w środowiskach produkcyjnych APAC i Europy. Zidentyfikowane poprawki zostały już wprowadzone, a my aktywnie monitorujemy środowisko w miarę kontynuowania działań związanych z przetwarzaniem klientów. Nasze zespoły zatwierdzają skuteczność tych zmian i oceniają ogólną wydajność platformy. Dostarczymy dodatkowe aktualizacje w miarę dostępności większej ilości informacji.
monitoring
Nasze zespoły nadal sprawdzają niedawno wdrożone hotfixy, a wstępne wyniki wyglądają pozytywnie. Dokładnie monitorujemy działania związane z przetwarzaniem, aby potwierdzić skuteczność naprawy i zapewnić stabilność platformy.
Walidacja jest w toku i będziemy nadal monitorować wyniki przed potwierdzeniem pełnej rezolucji. Dostarczymy kolejną aktualizację, jak więcej informacji stanie się dostępne.
resolved
Po wdrożeniu zidentyfikowanych poprawek, wcześniej wpływające działania przetwórcze zakończyły się pomyślnie i nie widzimy już ponownego wystąpienia problemów zaobserwowanych po niedawnym wydaniu. Na podstawie wyników zaobserwowanych po wdrożeniu poprawek, ten incydent został rozwiązany. W najbliższych dniach opublikujemy pełny RCA, który będzie zawierał szczegółowe podsumowanie problemu, przyczyny i środków zapobiegawczych wdrażanych w celu zapobiegania nawrotom.
postmortem
* * Opis: * * Flexera One - IT Asset Management - APAC & EU - Slowness and Degraded Performance
* * Czas: * * 13 lipca 2026, 1: 00 PM PDT - 18 lipca 2026, 7: 10 AM PDT
* * Podsumowanie zdarzeń * *
W dniu 13 lipca 2026 r., około 1: 00 PDT, sprawa zaczęła mieć wpływ na klientów Flexera One IT Asset Management w środowiskach produkcyjnych APAC i Europy po wdrożeniu wersji 2026 R1.1.
W tym okresie niektórzy klienci doświadczyli nieregularnego spowolnienia w stosowaniu, opóźnionego przetwarzania, niesprawności pogodzenia oraz pogorszenia wydajności w przypadku dostępu do niektórych obszarów aplikacji lub prowadzenia działań związanych z wynalazkami. Wraz ze wzrostem liczby zgłoszeń klientów, zespoły techniczne rozpoczęły badanie wspólnych wzorców na zgłoszonych objawów w celu określenia przyczyny.
W toku dochodzenia stwierdzono wadę wprowadzoną w ramach Flexera One IT Asset Management 2026 R1.1. Pod pewnymi warunkami defekt spowodował znacznie większą aktywność przetwarzania bazy danych podczas operacji związanych z wynalazkami. W miarę przetwarzania danych inwentaryzacyjnych zwiększony nakład pracy przyczynił się do opóźnień w przetwarzaniu, warunków czasowych oraz pogorszył wydajność aplikacji dla niektórych klientów.
Zespoły techniczne opracowały i wdrożyły hotfixy w celu rozwiązania problemu w dotkniętych środowiskach produkcyjnych. Po wdrożeniu zespoły przeprowadziły działania w zakresie walidacji i monitorowały wpływ procesów przetwarzania w celu potwierdzenia odzysku.
Do 18 lipca 2026 r., około 7: 10 AM PDT, walidacja potwierdziła pomyślne przetwarzanie wcześniej uszkodzonych ładunków i że wzorce awarii związane z tym problemem już nie występują. Uznano, że incydent został rozwiązany, a zespoły techniczne kontynuowały monitorowanie w celu potwierdzenia stabilności służby.
* * Root Cause * *
Incydent został spowodowany wadą wprowadzoną w Flexera One IT Asset Management 2026 R1.1 wydania wpływające na operacje przetwarzania związane z wynalazkami.
Pod pewnymi warunkami defekt spowodował znacznie większą aktywność przetwarzania bazy danych niż planowana podczas operacji przetwarzania związanych z wynalazkami. Zwiększone obciążenie pracą doprowadziło do zwiększenia zużycia zasobów, opóźnień w przetwarzaniu oraz warunków czasowych.
Warunki te przyczyniły się do nieregularnego spowolnienia aplikacji, opóźnień w przetwarzaniu, awarii pogodzenia oraz pogorszenia wydajności wpływających na niektóre funkcje zarządzania aktywami informatycznymi.
* * Działania naprawcze * *
1. Incydent Investigation Initiated: Zespoły techniczne rozpoczęły badanie raportów o powolności aplikacji, opóźnieniach w przetwarzaniu i kwestii niezawodności wpływających na środowisko produkcyjne APAC i Europy.
2. Ocena wpływu przeprowadzona: Zespoły przeanalizowały zgłoszone przez klienta objawy, dane wydajności systemu i zachowania przetwarzania w celu określenia zakresu i charakteru problemu.
3. Przyczyna zidentyfikowana: Dochodzenie wykazało, że wada wprowadzona w wydaniu 2026 R1.1 powodowała nadmierną aktywność przetwarzania podczas operacji związanych z wynalazkami.
4. Hotfixes Developed and Deplomed: Zespoły techniczne opracowały i wdrożyły hotfixes w celu skorygowania wpływu zachowania przetwarzania w środowiskach produkcyjnych APAC i Europy.
5. Potwierdzenie odzyskania: Zespoły potwierdziły skuteczność hotfixów poprzez monitorowanie i pomyślne wykonanie wcześniej wpływających działań przetwarzania.
6. Monitoring po przywróceniu: Dodatkowe monitorowanie potwierdziło, że wcześniej obserwowane awarie i degradacja wydajności przestały istnieć i że stabilność usług została przywrócona.
* * Przyszłe środki zapobiegawcze * *
Na podstawie dochodzenia zidentyfikowano następujące działania następcze:
• Processing Logic Ulepszenia: Zespoły techniczne wdrożyły korekty do chorej logiki przetwarzania w celu wyeliminowania nieefektywnego zachowania, które przyczyniło się do zwiększenia zużycia zasobów i degradacji wydajności.
Flexera One - IT Asset Management - EU - Congnos analytics access issue
Początek 14 lipca 2026 09:13 UTC · 0m
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - EU Business Reporting
resolved
Opis incydentu: Nasze zespoły zidentyfikowały problem dotyczący Cognos Analytics w środowisku produkcyjnym UE. Podczas okna uderzenia, dotknięci klienci mogli nie być w stanie uzyskać dostępu lub załadować Cognos Analytics. Obecne dochodzenie potwierdziło, że wpływ był ograniczony do regionu produkcji UE.
Priorytet: P2
Działalność remontowa: Nasze zespoły techniczne stwierdziły, że problem związany był z niedawną aktualizacją do Cognos Analytics, która została zakończona w ramach działań UE Production IT Asset Management. Zespół zidentyfikował problem konfiguracji wprowadzony podczas aktualizacji, wdrożył niezbędne korekty konfiguracji i przywrócił normalną funkcjonalność usługi. Środowisko pozostaje stabilne w trakcie monitorowania. Dalsze szczegóły, w tym przyczyny i środki zapobiegawcze, zostaną przedstawione w raporcie pośmiertnym.
postmortem
* * Opis: * * Flexera One - Zarządzanie aktywami IT - EU - Congnos analytics access issue
* * Czas: * * 13 lipca 2026, 12: 51 PM PDT do 14 lipca 2026, 1: 52 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W poniedziałek, 13 lipca 2026, o godz. 12: 51 PM PDT, po aktualizacji Cognos Analytics 12.1.2 wdrożonej w ramach wydania Flexera One IT Asset Management w Europie\ (UE\) Production, nasze zespoły zidentyfikowały problem, który uniemożliwiał klientom dostęp do Cognos Analytics. W rezultacie użytkownicy, których to dotyczy, nie byli w stanie z powodzeniem uruchomić aplikacji po zakończeniu zaplanowanych czynności związanych z utrzymaniem.
Zespoły techniczne natychmiast wszczęły dochodzenie i potwierdziły, że kwestia ta została odizolowana od środowiska produkcyjnego UE, nie wywołując żadnego wpływu w innych regionach produkcyjnych. Dalsza analiza wykazała, że samo uaktualnienie zakończyło się pomyślnie; jednak część wymaganych działań konfiguracyjnych po aktualizacji nie została w pełni zastosowana, zapobiegając prawidłowemu uruchomieniu Cognos Analytics.
Pozostałe zadania konfiguracyjne zostały szybko zakończone, przywracając normalne funkcje Cognos Analytics. Po kompleksowej walidacji dostępu do klienta i okresie wzmocnionego monitorowania potwierdzono, że usługa działa normalnie, a incydent został uznany za rozwiązany.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
* Niekompletna konfiguracja Post- Upgrade: Chociaż uaktualnienie Cognos Analytics 12.1.2 zakończyło się pomyślnie, wymagane zadania konfiguracyjne po-upgrade nie zostały w pełni zakończone przed powrotem środowiska do serwisu.
* Błąd inicjalizacji usługi: Niekompletna konfiguracja uniemożliwiła Cognos Analytics prawidłową inicjalizację, co uniemożliwiło klientom dostęp do aplikacji.
* Wpływ regionalny: Kwestia ta była ograniczona do środowiska produkcyjnego UE. Nie stwierdzono wpływu w Ameryce Północnej, APAC ani w innych regionach produkcyjnych.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
Aby przywrócić obsługę, zespoły techniczne:
* Zakończył wymagane działania konfiguracyjne po aktualizacji, które nie zostały w pełni zastosowane w trakcie wdrażania.
* Przywrócone i zatwierdzone usługi Cognos Analytics w celu potwierdzenia udanej inicjalizacji aplikacji.
* Przeprowadzone testy funkcjonalne i walidacja dostępu klienta w celu sprawdzenia, czy zdolności sprawozdawcze funkcjonowały zgodnie z oczekiwaniami.
* Umieścił środowisko pod wzmocnionym monitorowaniem po odzyskaniu, aby zapewnić ciągłą stabilność usług.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Zwiększona walidacja po aktualizacji: Wzmocnienie procedur walidacji wdrożenia w celu sprawdzenia, czy wszystkie wymagane działania konfiguracyjne po aktualizacji zakończyły się pomyślnie przed zakończeniem czynności konserwacyjnych.
* Ulepszony Monitoring i Alerting: Wzmocnienie Cognos Analytics monitorowania i ostrzegania, aby umożliwić wcześniejsze wykrywanie degradacji usług po aktualizacji.
* Ulepszenia listy kontrolnej wdrożeniowej: Uaktualnienie runbooków wdrożeniowych i operacyjnych list kontrolnych w celu włączenia dodatkowej weryfikacji zakończenia konfiguracji po aktualizacji przed powrotem środowiska do usługi produkcyjnej.
* Przegląd Readiness Operational Readiness Review: Przegląd uaktualnienia procedur wykonywania w celu zapewnienia wszystkich obowiązkowych zadań po wdrożeniu są zakończone i zatwierdzone przed zamknięciem okien konserwacji.
Flexera One - Zarządzanie aktywami IT - APAC - Brakujące elementy menu
Początek 12 lipca 2026 23:51 UTC · 3h 53m
OutagePoważny incydent
Dotknięte komponenty
IT Asset Management - APAC Business Reporting
investigating
Incydent Opis: Mamy problem dotykający klientów Flexera One IT Asset Management (ITAM) w regionie APAC. Klienci mogą zauważyć, że niektóre pozycje nawigacyjne i menu w ramach interfejsu ITAM nie są widoczne, co powoduje ograniczony dostęp do niektórych funkcji.
Priorytet: P2
Działalność remontowa: Nasze zespoły techniczne aktywnie badają tę kwestię i pracują nad przywróceniem pełnej funkcjonalności. Będziemy nadal dostarczać aktualizacje w miarę dostępności większej ilości informacji.
identified
Nasze śledztwo zidentyfikowało zwiększone wykorzystanie zasobów wpływające na funkcjonalność związaną ze zgłoszonym problemem. Trwają obecnie działania łagodzące, w tym zwiększenie zdolności systemu do wspierania wysiłków na rzecz odbudowy.
Aktywnie monitorujemy środowisko i sprawdzamy zachowanie platformy, ponieważ zmiany te są wdrażane. Trwają prace nad przywróceniem pełnej funkcjonalności poszkodowanym klientom, a w miarę postępów będziemy dzielić się dodatkowymi aktualizacjami.
identified
Nasze śledztwo zidentyfikowało potencjalny problem konfiguracji związany z uszkodzoną funkcjonalnością. W ramach trwających wysiłków na rzecz łagodzenia zmiany konfiguracji zostały cofnięte, a wcześniej zainicjowane zwiększenie zdolności produkcyjnych zostało zakończone.
Aktywnie monitorujemy środowisko i sprawdzamy zachowanie platformy, gdy zmiany te stają się skuteczne. Trwają prace mające na celu przywrócenie pełnej funkcjonalności poszkodowanym klientom, a w miarę postępów zapewnimy dalsze aktualizacje.
resolved
Po rozszerzonym monitorowaniu potwierdziliśmy, że wydajność usług pozostaje stabilna i funkcjonuje zgodnie z oczekiwaniami. Sprawa ta została rozwiązana.
postmortem
**Description:** Flexera One - IT Asset Management - APAC - Missing Menu Items
**Timeframe:** July 12, 2026, 3:00 PM PDT - July 12, 2026, 7:16 PM PDT
**Incident Summary**
On Sunday, July 12, 2026, at 3:00 PM PDT, customers in the APAC production environment began reporting that several IT Asset Management \(ITAM\) menu items, including functionality such as Reports and All Applications, were no longer visible within the Flexera One user interface. Multiple customers were affected, impacting their ability to navigate and access portions of the ITAM application.
Technical teams immediately began investigating the issue and identified authentication-related errors affecting the ITAM user interface. During the investigation, teams reviewed infrastructure health, application behavior, and recent platform changes to determine the source of the problem.
The investigation determined that an application configuration change associated with a newly introduced authentication capability had been incorrectly applied to the production environment. The issue became apparent when application instances were refreshed, resulting in authentication-related failures that prevented certain ITAM menu items from loading correctly for affected users.
Technical teams reverted the affected configuration, refreshed the impacted application instances, and validated recovery across the environment. Following these actions, menu functionality was restored, affected customers confirmed recovery, and the incident was resolved on July 12, 2026, at 7:16 PM PDT after validation and monitoring confirmed normal operation had returned.
**Root Cause**
Investigation determined that an application configuration change associated with a new authentication capability was incorrectly applied to the production environment.
When application instances were subsequently refreshed, the incorrect configuration resulted in authentication-related errors within the ITAM user interface. These errors prevented certain navigation components from loading correctly, causing affected users to experience missing menu items until the configuration was corrected and the affected instances were refreshed.
**Remediation Actions**
The following actions were taken during the incident response:
1. Incident Investigation Initiated: Technical teams began investigating after receiving reports from multiple customers regarding missing ITAM menu items.
2. Application Configuration Reviewed: Recent application and configuration changes were reviewed to identify the source of the menu-loading failures.
3. Incorrect Configuration Identified: Technical teams determined that an authentication-related configuration change had been incorrectly applied to the production environment.
4. Configuration Corrected: The affected configuration was removed from the impacted production instances.
5. Application Instances Refreshed: Impacted application instances were refreshed to ensure the corrected configuration was consistently applied across the environment.
6. Recovery Validation Performed: Technical teams validated menu visibility and functionality across the affected environment and confirmed recovery with impacted customers.
**Future Preventative Measures**
Following the incident, corrective measures were implemented to prevent recurrence of the issue and improve detection of similar conditions in the future.
1. Health Check Monitoring Improvements: The existing health check was updated to detect the application behavior associated with this failure condition. The revised monitoring is designed to identify similar menu-loading and authentication-related application failures more effectively and accelerate detection should a similar issue occur in the future.
2. Deployment Process Reinforcement: The incident highlighted the importance of ensuring new authentication-related features are applied only to their intended environments. The deployment approach and expected application process for these changes have been reinforced with the technical team to reduce the risk of similar configuration issues in the future.
Incydent Opis: Badamy obecnie zdegradowaną wydajność wpływającą Spot Ocean ECS dla klientów AWS. Klienci mogą doświadczać znacznego spowolnienia lub opóźnień w dostępie do konsoli lub przy użyciu określonych funkcji Ocean ECS.
Priorytet: P2
Działalność remontowa: Nasze zespoły techniczne aktywnie badają i pracują nad przywróceniem normalnej funkcjonalności. Dostarczymy dalsze aktualizacje w miarę dostępności większej ilości informacji.
monitoring
Nasze dochodzenie wykazało, że degradacja była związana z zdarzeniem zdrowotnym AWS, wpływającym na nasz-wschód -1. AWS od tego czasu poinformował, że problem został rozwiązany, a teraz widzimy oznaki ożywienia po naszej stronie, w tym poprawę wydajności konsoli Spot Ocean ECS i pomyślne zakończenie związanych z nim przepływów pracy.
Środowisko produkcyjne wydaje się teraz stabilne. Nasze zespoły będą kontynuować monitorowanie przez krótki okres walidacji w celu zapewnienia, że wydajność pozostaje stabilna przed oznaczeniem rozstrzygniętego incydentu.
resolved
Od dłuższego czasu monitorujemy środowisko naturalne, a usługi pozostają stabilne, nie obserwując dalszych problemów.
Ten incydent został rozwiązany.
postmortem
* * Opis: * * Spot Ocean - AWS - Ocean ECS Console Performance Degradation
* * Czas: * * 6 lipca 2026, 05: 45 AM PDT do 6 lipca 2026, 07: 53 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W poniedziałek, 6 lipca 2026, o godzinie 05: 45 AM PDT, nasze zespoły zidentyfikowały degradację wydajności wpływającą na Spot Ocean ECS dla klientów AWS. Podczas okna zderzeniowego klienci doświadczyli zwiększonego opóźnienia w dostępie do konsoli Ocean ECS, a niektóre operacje związane z AWS zostały opóźnione lub nie zakończyły się pomyślnie.
Zespoły techniczne natychmiast wszczęły dochodzenie w celu zidentyfikowania źródła problemu. Ponieważ zakłócenie usługi AWS miało miejsce jednocześnie w regionie AWS - na wschód - -1, w dochodzeniu początkowo uznano zarówno zewnętrzne wydarzenie AWS, jak i niedawno ukończone wdrożenie produkcji za potencjalne czynniki przyczyniające się do rozwoju.
Dzięki szczegółowej analizie zespoły stwierdziły, że główną przyczyną wpływu na klienta była niestabilność wprowadzona przez ostatnie wprowadzenie Gateway. Wynikająca z tego degradacja w parametrach bramki wpłynęła na zapotrzebowanie na przetwarzanie i reagowanie w systemie ECS na Oceanie Spot. Podczas gdy równoczesne zakłócenie usługi AWS zwiększyło złożoność dochodzenia, potwierdzono, że nie jest on głównym motorem zderzenia z klientem.
Aby przywrócić obsługę, zespoły wycofały wdrożenie do poprzedniej stabilnej wersji. Po wycofaniu, wydajność platformy powróciła do oczekiwanych poziomów i przepływy pracy klientów wznowiły normalne działanie. Przedłużony okres monitorowania potwierdził trwałą stabilność obsługi przed formalnym rozwiązaniem zdarzenia.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
Incydent został spowodowany przez niestabilność wprowadzoną w rozmieszczeniu Gateway. Dzięki wdrożeniu w ramach usługi Gateway nastąpiła degradacja wydajności, co zmniejszyło jej zdolność do skutecznego rozpatrywania wniosków klientów. Spowodowało to wydłużenie czasu reakcji i okresowe awarie dla operacji konsoli Spot Ocean ECS oraz związanych z AWS przepływów roboczych.
Wracając do poprzedniej stabilnej wersji Gateway przywrócić normalną wydajność platformy i rozwiązać wpływ klienta.
Czynniki wiążące
* Równoległe zakłócenia usługi AWS w regionie us- east-1 wystąpiły w tym samym czasie. Chociaż nie było to przyczyną incydentu, skomplikowało ono wstępne dochodzenie i opóźniło identyfikację podstawowego problemu Gateway.
* Wdrożenie Gateway wymagało dodatkowego czasu ze względu na skalę wdrożenia produkcji, rozszerzając ogólny proces odzyskiwania.
* Operacje związane z tworzeniem zasobów i aktualizacjami miały większy wpływ niż działania związane wyłącznie z ponownym uruchomieniem z powodu zdegradowanej aktywności Gateway.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
* Zespoły techniczne zbadały degradację i zidentyfikowały niedawne rozmieszczenie Wrót jako główne źródło problemu.
* Implementacja Gateway została cofnięta do ostatniej stabilnej wersji, przywracając stabilność usług.
* Wydajność peronu i przepływy robocze zwrócone do klienta zostały zatwierdzone po uruchomieniu.
* Zespoły techniczne ukończyły wydłużony okres monitorowania w celu potwierdzenia stabilnej obsługi przed zamknięciem incydentu.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Ulepszone środki ochronne na potrzeby wdrażania - zespoły inżynieryjne wzmocnią kontrole wdrażania i procesy walidacji w celu zmniejszenia prawdopodobieństwa wystąpienia podobnych problemów związanych z wdrożeniem, mających wpływ na środowisko produkcyjne.
* Wzmocniony monitoring platformy - Dodatkowe monitorowanie i ostrzeganie zostaną wdrożone w celu zapewnienia wcześniejszego wykrywania nieprawidłowego zachowania Gateway, w tym responsibility usług, wykorzystanie zasobów i stabilność aplikacji.
* Ulepszone procedury odzyskiwania - Procedury zwrotu będą usprawniane i regularnie zatwierdzane w celu skrócenia czasu odzyskiwania i poprawy wydajności operacyjnej w czasie zdarzeń związanych z wdrożeniem.
* Proactive Service Health Validation - Syntetyczne kontrole zdrowia zostaną rozszerzone, aby stale potwierdzać krytyczne przepływy pracy użytkowników systemu ECS oceanicznego, co umożliwi wcześniejszą identyfikację degradacji osiąganych wyników.
* Wzmocniony monitoring zależności - Zespoły inżynieryjne będą w dalszym ciągu poprawiać widoczność w zewnętrznych zdarzeniach z zakresu usług w chmurze i zależności od platform, aby umożliwić szybsze rozróżnienie między wewnętrznymi kwestiami platformy a zakłóceniami usług przez strony trzecie podczas przyszłych badań.
Opis incydentu: Zidentyfikowaliśmy problem wpływający na podzbiór usług Flexera One w regionie APAC, który mógł spowodować problemy z dostępem lub niepowodzenia dla niektórych użytkowników. Wpływ był przerywany, a inne regiony nie miały wpływu. Kwestia ta została rozwiązana, a dotknięte nią usługi działają normalnie.
Priorytet: P2
Działalność remontowa: Nasze zespoły techniczne zbadały tę kwestię i odwróciły ostatnią zmianę w celu przywrócenia usługi. Potwierdziliśmy, że usługi, których to dotyczy, funkcjonują normalnie i nadal monitorujemy, aby zapewnić stabilność platformy. Ten incydent został rozwiązany.
postmortem
* * Opis: * * Flexera One - APAC - Problemy z dostępem przerywanym
* * Czas: * * 3 lipca 2026, 11: 20 AM PDT - 3 lipca 2026, 11: 50 AM PDT
* * Podsumowanie zdarzeń * *
W dniu 3 lipca 2026 r., około godziny 11: 20 AM PDT, zidentyfikowano problem dotyczący podzbioru usług Flexera One w środowisku produkcyjnym APAC.
Podczas okna incydentu niektórzy klienci mogli doświadczyć problemów lub niepowodzeń w dostępie do niektórych obszarów platformy Flexera One. Wpływ ten miał charakter nieregularny, ponieważ w czasie incydentu nadal dostępna była zbędna zdolność przewozowa. Inne Flexera Jeden region, w tym NAM i UE, nie miał wpływu.
Zespoły techniczne rozpoczęły natychmiastowe badanie i dokonały przeglądu odnośnych usług i elementów platformy wsparcia w środowisku APAC. W toku dochodzenia stwierdzono, że niedawne zmiany wprowadzone w środowisku APAC przyczyniają się do zaobserwowania przerw w świadczeniu usług.
W ramach wysiłków na rzecz odbudowy, zmiana została odwrócona, a zachowanie służby było monitorowane w celu potwierdzenia odzysku. Po wycofaniu, stabilność usług została przywrócona i klienci byli w stanie uzyskać dostęp do funkcji dotkniętych normalnie. Do około 11: 50 AM PDT usługi funkcjonowały zgodnie z oczekiwaniami i uznano, że incydent został rozwiązany.
Uzasadnienie
* * Root Cause * *
Incydent został spowodowany zmianą konfiguracji w środowisku APAC, która nieumyślnie wpłynęła na komunikację pomiędzy podzbiorem usług platformy a komponentem platformy backend.
W trakcie dochodzenia zespoły techniczne stwierdziły, że zmiana spowodowała, iż niektóre usługi platformy nie były w stanie prawidłowo komunikować się z komponentem dotkniętym chorobą. Doprowadziło to do przerywanych awarii wpływających na podzbiór usług Flexera One w regionie APAC.
Podczas gdy problem ten miał miejsce, co najmniej jedna kapsuła wspierająca usługi, których to dotyczy, pozostała dostępna i nadal obsługiwała ruch. W rezultacie klienci doświadczyli problemów związanych z nieregularnym dostępem, a nie całkowitego braku dostępu do usług.
Uzasadnienie
* * Działania naprawcze * *
Następujące działania zostały podjęte podczas reakcji na incydent:
• Incydent Investigation Initiated: Zespoły techniczne rozpoczęły badanie kwestii przerywanego dostępu wpływających na podzbiór usług Flexera One w regionie APAC.
• Przegląd Platformy Ukończony: Zespoły techniczne dokonały przeglądu odnośnych usług i elementów wspierających platformy w środowisku APAC w celu zidentyfikowania źródła problemu.
• Niedawna zmiana Zidentyfikowana: Dochodzenie wykazało niedawno wdrożoną zmianę, która korelowała z obserwowaną degradacją usług.
• Change Reverted: Zidentyfikowana zmiana została przywrócona w ramach działań łagodzących w celu przywrócenia normalnego zachowania serwisowego.
• Odzyskiwanie Usług zwalidowane: Zespoły techniczne monitorowały zachowanie usługi po cofnięciu i potwierdziły, że naruszona funkcjonalność działa normalnie.
• Monitoring stabilności peronu Kontynuowany: Po odbudowie przeprowadzono dodatkowe monitorowanie w celu sprawdzenia stałej stabilności obsługi przed zamknięciem incydentu.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Incydent ten uwydatnił znaczenie zatwierdzenia zmian platformy w celu zapewnienia identyfikacji niezamierzonych skutków, zanim wpłyną one na dostępność usług.
Na podstawie dochodzenia prowadzone są następujące działania następcze:
• Poprawa walidacji konfiguracji: przegląd i usprawnienie procesów walidacji zmian konfiguracji infrastruktury i platformy, aby pomóc w identyfikacji niezamierzonych skutków przed wprowadzeniem zmian w środowiskach produkcyjnych.
• Poprawa weryfikacji po wdrożeniu: Przegląd procedur weryfikacji po wdrożeniu w celu zapewnienia dostępności i funkcjonowania krytycznych zależności od usług zgodnie z oczekiwaniami po zmianach konfiguracji.
IT Asset Management - APAC Inventory UploadIT Asset Management - EU Inventory Upload
resolved
Opis zdarzenia: Zidentyfikowaliśmy problem wpływający na przetwarzanie zapasów w Flexera One IT Asset Management po wydaniu 2026 R1 w środowiskach APAC i Europy. W rezultacie, niektóre ładunki inwentaryzacyjne nie zostały pomyślnie przetworzone, powodując, że dane inwentaryzacyjne wyświetlane w Flexera One IT Asset Management zostaną opóźnione i nie będą odzwierciedlać najnowszego wprowadzonego wykazu klientów.
Priorytet: P2
Działalność w zakresie odbudowy: Zespoły techniczne zidentyfikowały problem związany z pojemnością mający wpływ na przetwarzanie zapasów oraz przeprowadziły restart ukierunkowanej usługi w regionach dotkniętych skutkami w celu przywrócenia normalnego przetwarzania. Serwis został przywrócony do 24 czerwca 2026, 11: 00 PM PDT, a pliki inwentaryzacyjne są teraz z powodzeniem przetwarzane. Nasze zespoły nadal monitorują platformę, aby zapewnić stabilność. Raport pośmiertny określający przyczynę i środki zapobiegawcze zostanie udostępniony po zakończeniu dochodzenia.
postmortem
* * Opis: * * Flexera One- Zarządzanie aktywami IT - APAC & EU - NDI Inventory Import Assessments
* * Czas: * * 18 czerwca 2026, 09: 00 AM PDT do 25 czerwca 2026, 02: 42 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W środę, 24 czerwca 2026, 11: 35 PM PDT, po uruchomieniu Flexera One IT Asset Management 2026 R1 do australijskich i europejskich środowisk produkcyjnych, nasze zespoły zidentyfikowały problem wpływający na przetwarzanie plików inwentaryzacyjnych NDI. W rezultacie znaczna liczba plików inwentaryzacyjnych nie powiodła się podczas przetwarzania i nie znalazła odzwierciedlenia w danych dotyczących inwentaryzacji klientów, co powoduje, że informacje o zapasach wyświetlane w Flexera One ITAM stają się przestarzałe dla klientów, których to dotyczy.
Zespoły techniczne natychmiast wszczęły dochodzenie i stwierdziły, że problem pojawił się w ramach procesu przetwarzania zapasów wprowadzonego wraz z uwolnieniem 2026 R1. Nieudane pliki inwentaryzacyjne zgromadzone po powtarzających się niepowodzeniach przetwarzania, zapobiegające pomyślnemu ukończeniu aktualizacji inwentarza i przyczyniające się do zwiększenia obciążenia przetwarzania danych usług.
Aby przywrócić obsługę, zespoły techniczne wdrożyły działania naprawcze poprzez odświeżanie usług aplikacji, które mają wpływ na środowisko. W następstwie działań związanych z przywróceniem stanu inwentarza, przetwarzanie zapasów wznowiono pomyślnie, a nowe ładunki inwentarza były przetwarzane zgodnie z oczekiwaniami. Kontynuowane monitorowanie potwierdziło stabilne zachowanie platformy, a incydent został ogłoszony rozwiązany po trwałej walidacji.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
Kwestia ta została spowodowana wadą wprowadzoną w wersji Flexera One IT Asset Management 2026 R1, która wpłynęła na przetwarzanie plików inwentaryzacyjnych NDI. W określonych warunkach pliki inwentaryzacyjne nie mogły być przetwarzane pomyślnie z powodu problemu w ramach procesu uwierzytelniania i przetwarzania, co spowodowało, że pliki zostały odrzucone przed zakończeniem przetwarzania.
W miarę nagromadzenia nieudanych plików zdolność przetwórcza była coraz częściej spożywana przez powtarzające się niepowodzenia, zapobiegając pomyślnemu przetwarzaniu zapasów i opóźniając aktualizacje zapasów dla poszkodowanych klientów.
Czynniki wiążące
* Nieudane pliki inwentaryzacyjne zgromadzone w ramach procesu przetwarzania, zwiększające wykorzystanie zasobów na dotkniętych usług inwentaryzacyjnych.
* Zwiększone obciążenie przetwórcze zmniejszyło pojemność dostępną dla nowych wniosków o przetwarzanie zapasów.
* Problem dotyczył środowisk produkcyjnych w wersji 2026 R1; produkcja w Ameryce Północnej nie miała wpływu, ponieważ nie została jeszcze uruchomiona.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
* Zespoły techniczne zidentyfikowały dotknięty przepływ pracy przetwarzania zapasów i wdrożyły działania naprawcze w celu przywrócenia usługi.
* Usługi aplikacji zostały odświeżone w środowiskach produkcyjnych, które miały wpływ, przywracając normalne przetwarzanie zapasów.
* Przetwarzanie nowych plików inwentaryzacyjnych wznowione pomyślnie po przywróceniu usługi.
* Środowisko pozostawało pod wzmocnionym monitorowaniem w celu zatwierdzenia wydajności przetwarzania i potwierdzenia trwałej odzysku.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Ulepszona walidacja uwolnień - Procedury walidacji uwolnień zostaną wzmocnione w celu uwzględnienia dodatkowych testów końcowych procesów przetwarzania zapasów po wydaniu głównych platform.
* Wzmocniony monitoring przetwarzania - Monitorowanie i ostrzeganie zostaną poddane przeglądowi i rozszerzone, aby zapewnić wcześniejsze wykrycie nieprawidłowych awarii przetwarzania zapasów i nadmiernego gromadzenia plików w kolejkach przetwarzania.
* Oporność operacyjna - Dodatkowe zabezpieczenia zostaną wdrożone w ramach procesu przetwarzania zapasów w celu poprawy odzysku z awarii przetwarzania i zminimalizowania wpływu na klienta w przypadku wystąpienia podobnych warunków w przyszłości.
* Jakość kodu i przegląd Ulepszenia\ (Wykonane\) - W ramach przeglądu po incydencie skorygowano zmieniony kod w celu zapewnienia właściwego postępowania z wadami w komunikacji i nie powodują szerszego wpływu przetwarzania. Ponadto wzmocniono proces opracowywania i przeglądu, aby zapewnić odpowiednią ocenę wyników przeglądu i zajęcie się nim przed zatwierdzeniem przyszłych zmian do wydania.
IT Visibility EUIT Asset Management - EU Login PageIT Asset Management - EU Batch Processing SystemCloud License Management - EUIT Asset Management - EU Business ReportingIT Asset Management - EU Beacon CommunicationIT Asset Management - EU SaaS ManagerIT Asset Management - EU Inventory Upload
investigating
Opis incydentu: Zidentyfikowaliśmy problem wpływający na dostęp logowania do Flexera One w regionie UE. Klienci mogą otrzymywać błędy podczas próby zalogowania się do Flexera One.
Priorytet: P1
Aktywność przywracania: Nasze zespoły techniczne aktywnie badają problem i pracują nad wdrożeniem działań naprawczych w celu przywrócenia normalnej funkcjonalności logowania. Trwają działania w zakresie badań i stabilizacji.
Będziemy nadal uważnie monitorować sytuację i przekazywać dalsze aktualizacje w miarę dalszego postępu.
resolved
Problem został rozwiązany, a funkcjonalność logowania została przywrócona dla dotkniętych klientów. Zespoły techniczne określiły przyczynę problemu i wdrożyły działania naprawcze w celu przywrócenia normalnej eksploatacji. Środowisko pozostaje stabilne, a bieżące monitorowanie potwierdziło skuteczne uwierzytelnianie i dostęp do platformy. Raport pośmiertny zawierający dodatkowe szczegóły zostanie udostępniony po zakończeniu dochodzenia.
postmortem
* * Opis: * * Flexera One - EU - Login Access Diruption
* * Czas: * * 24 czerwca 2026, 12: 41 AM PDT do 24 czerwca 2026, 02: 04 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W środę, 24 czerwca 2026, o godz. 12: 41 PDT, nasze zespoły wykryły problem dotykający klientów w regionie UE. Uszkodzenie uwierzytelniania przez użytkowników podczas próby zalogowania się do Flexera One przy użyciu Single Sign- On\ (SSO\) skutkowało błędami serwera i uniemożliwieniem dostępu do platformy.
Po wykryciu zespoły techniczne natychmiast wszczęły dochodzenie i potwierdziły, że problem ten został odizolowany od procesu uwierzytelniania. Walidacja aplikacji i podstawowych usług platformy wykazała, że cała podstawowa infrastruktura pozostaje zdrowa i operacyjna. Dalsza analiza wykazała, że konto usług wykorzystywane do komunikacji z dostawcą tożsamości stało się niedostępne, powodując niepowodzenie wniosków o uwierzytelnianie.
Konto usługowe zostało niezwłocznie przywrócone, co ponownie ustanowiło normalne przetwarzanie uwierzytelniania i w pełni przywrócony dostęp do klienta. Po odnowieniu środowisko było ściśle monitorowane, a funkcjonalność logowania była kompleksowo potwierdzona w celu zapewnienia stabilności usług. Nie zaobserwowano dodatkowego wpływu na klienta, a incydent został następnie uznany za rozwiązany.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
Kwestia ta została spowodowana niezamierzonym zawieszeniem konta usługowego, które obsługuje uwierzytelnianie pomiędzy Flexera One a dostawcą tożsamości. W związku z tym wnioski o uwierzytelnianie nie mogły być skutecznie rozpatrzone, co uniemożliwiło zainteresowanym klientom w regionie produkcyjnym UE dostęp do platformy za pośrednictwem Single Sign- On (SSO\).
Czynniki wiążące
* Konto usług krytyczne dla procesu uwierzytelniania zostało przypadkowo zawieszone podczas rutynowej czynności sprzątania.
* Zawieszenie zapobiegło pomyślnemu zatwierdzeniu żądań uwierzytelniania, co skutkowało niepowodzeniem logowania klientów, którzy mieli wpływ.
* Kwestia ta została odizolowana od usługi uwierzytelniania i nie miała wpływu na dostępność podstawowej aplikacji lub infrastruktury platformy.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
* Konto usługi dotknięte zostało przywrócone, ponownie ustalając uwierzytelnianie u dostawcy tożsamości.
* Funkcje logowania zostały zatwierdzone po przywróceniu.
* Zespoły inżynieryjne kontynuowały monitorowanie w celu potwierdzenia stabilności platformy i pomyślnego uwierzytelniania klienta.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Zarządzanie rachunkami usług - Wzmocnione zostaną procesy regulujące krytyczne rachunki usług w celu zmniejszenia ryzyka niezamierzonych zmian mających wpływ na usługi produkcyjne.
* Wzmocniony monitoring - Monitoring i ostrzeganie zostaną wzmocnione, aby zapewnić wcześniejsze wykrywanie błędów uwierzytelniania wpływających na przepływ logowania klienta.
* Ulepszenia Procesu Operacyjnego - Nasze zespoły udokumentowały to jako wyciągniętą lekcję i wdrożą ulepszenia procesu w celu zmniejszenia prawdopodobieństwa podobnych incydentów.
Atlas śnieżny - Europa Zachodnia - zakłócenie w obsłudze
Początek 18 czerwca 2026 15:33 UTC · 2h 35m
OutageKrytyczny incydent
Dotknięte komponenty
Snow Atlas - Europe
monitoring
Incydent Opis: Doświadczyliśmy problemu wpływającego na Atlas Śniegu w regionie Europy Zachodniej.
Podczas okna incydentu klienci mogli doświadczyć błędów uniemożliwiających dostęp do platformy i wpływających na jej funkcjonalność.
Priorytet: P1
Funkcja przywracania: Usługa została przywrócona i jest obecnie stabilna. Nasze zespoły techniczne nadal badają zakłócenia mające wpływ na usługi leżące u podstaw tego regionu. Wysiłki koncentrują się na zapewnieniu stabilności i zapobieganiu nawrotom. Będziemy nadal uważnie monitorować i dostarczać aktualizacje w miarę dostępności większej ilości informacji.
resolved
Problem dotykający atlas śnieżny w regionie Europy Zachodniej został rozwiązany, a usługi obecnie działają normalnie. Nasze zespoły techniczne złagodziły niestabilność usług i nadal uważnie monitorują, aby zapewnić trwałą stabilność. W najbliższych dniach przedstawimy szczegółowe sprawozdanie po incydencie, przedstawiające przyczynę i środki zapobiegawcze.
postmortem
* * Opis: * * Atlas śnieżny - Europa Zachodnia - Zakłócenie funkcjonowania
* * Czas: * * 18 czerwca 2026, 07: 00 AM PDT do 18 czerwca 2026, 08: 23 AM PDT
Uzasadnienie
* * Podsumowanie zdarzeń * *
Uzasadnienie
W czwartek, 18 czerwca 2026 r. o godz. 07: 00 PDT, klienci w regionie produkcyjnym Europy Zachodniej doświadczyli zakłóceń w dostępie do Atlasu Śnieżnego. Podczas tego wydarzenia, użytkownicy napotkali HTTP 504 timeout i błędy HTTP 404, które uniemożliwiły dostęp do platformy i wpłynęły na wykorzystanie funkcji Atlasu Śniegu.
Po wykryciu zespoły techniczne natychmiast wszczęły dochodzenie i zidentyfikowały problem w ramach podstawowego komponentu platformy odpowiedzialnego za komunikację między służbami pomocniczymi. Degradacja zakłóciła interakcje między służbami, co doprowadziło do niepowodzenia żądania i tymczasowej niedostępności usług.
Zagrożone komponenty wiadomości zostały przywrócone, dzięki czemu usługi zależne można odzyskać i normalne operacje platformy do wznowienia. Po odzyskaniu, szeroko zakrojone działania w zakresie walidacji potwierdziły, że funkcjonalność usług została w pełni przywrócona. Środowisko utrzymywało się na stabilnym poziomie w ramach wzmocnionego monitorowania, nie zaobserwowano dalszego wpływu na klientów, a zakłócenia w świadczeniu usług zostały formalnie rozwiązane.
Uzasadnienie
* * Root Cause * *
Uzasadnienie
Zakłócenie usługi wynikało z nieoczekiwanej awarii w ramach komponentu platformy bazowej, który ułatwia komunikację między usługami opartymi. Podczas wydarzenia, wiele komponentów wiadomości stał się niedostępny jednocześnie, zapobiegając krytycznej komunikacji między backend usług odpowiedzialnych za przetwarzanie żądań klientów.
Degradacja osłabiła zdolność usług zależnych do wymiany i przetwarzania wniosków, prowadząc do przerw czasowych i awarii trasy. W rezultacie klienci w regionie dotkniętym problemem mieli trudności z dostępem do platformy Atlas Śniegu do czasu przywrócenia komunikacji serwisowej i wznowienia normalnych operacji.
Czynniki wiążące
* Wielokrotne komponenty usługi komunikacyjnej stały się niedostępne w tym samym czasie, zmniejszając zdolność platformy do przetwarzania komunikacji międzyusługowej.
* Usterki komunikacji serwisowej rozpropagowane pomiędzy zależnymi komponentami platformy, w wyniku HTTP 504 timeout i błędów HTTP 404.
* Problem dotyczył wspólnej infrastruktury komunikacyjnej wspierającej środowisko produkcyjne Europy Zachodniej, co doprowadziło do powszechnego wpływu na klientów w regionie.
Uzasadnienie
* * Działania naprawcze * *
Uzasadnienie
* Zespoły techniczne zidentyfikowały komponenty infrastruktury komunikacyjnej i przywróciły normalną obsługę.
* Usługi platformy zależnej odzyskane automatycznie po przywróceniu funkcjonalności wiadomości.
* Funkcjonalność usługi została potwierdzona po odzyskaniu w celu potwierdzenia skutecznego dostępu klienta.
* Wzmocniony monitoring został utrzymany po przywróceniu w celu weryfikacji ciągłej stabilności platformy.
Uzasadnienie
* * Przyszłe środki zapobiegawcze * *
Uzasadnienie
* Przegląd zarządzania problemem - Trwa kompleksowy przegląd w celu dalszej walidacji przyczyny i identyfikacji długoterminowych działań naprawczych w celu zapobiegania nawrotom.
* Wzmocnienie odporności platformy - Możliwości wzmocnienia trwałości infrastruktury komunikacyjnej platformy zostaną ocenione w celu zmniejszenia wpływu niepowodzenia na dostępność usług na poziomie komponentu.
* Poprawa monitorowania i wykrywania - Monitorowanie i ostrzeganie o możliwościach krytycznych komponentów platform zostanie wzmocnione w celu umożliwienia wcześniejszej identyfikacji degradacji oraz przyspieszenia działań w zakresie reagowania i odzysku.