GitHub incident can affect Cycode
- investigating
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
- resolved
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
46 Cycode incidents · luty 2026 — official updates, affected components, duration and resolution details.
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
Customers may experience degraded performance in scans. Pull request and CLI scans may be affected.
The team has identified the root cause of the issue and is working on the solution.
The root cause has been resolved. The system began to stabilize itself, and all the scans are starting to get processed with regular performance.
All scan types except for SAST are fully operational. SAST continues to stabilize and will soon be fully stable.
System should be back to being fully operational.
**Root Cause** The incident was caused by a deployment of one service that ran a database index creation. The team has identified an issue with the way we perform index creations as database migrations. During a deployment the pods with newest image of the service attempted to create an index on a big table. The team has identified that the index creation took 7 minutes. However, during index creation pods were not responsive, and as a result, Kubernetes deemed them as unhealthy pods and attempted to retry those pods after 5 minutes. As a result, because the pod got killed before the index creation was fully completed, the database transaction was rolled back. Then, subsequent pods attempted to create the index again, dying after 5 minutes. This lead to the database being in unhealthy state, and the service was down. The team has rolled back the deployment, and killed all replicas that attempted to create the index. Thanks to that, the service and the database was in healthy state again. **Why safety measures did not help** Cycode provides a safety mechanism that unblocks all Pull Request scans after a specific period of time, giving each scan a maximum duration before the Pull Request is unblocked. However, because the service that is responsible for triggering and completing scans, as well as this safety net, was down, the process couldn't behave as expected. We acknowledge this gap and are working on strengthening this area of our system. **Action items** • The team is actively investigating enhancements and new safety protocols that can be put in place in order to have another safety net preventing Pull Request scans being stuck in case of any incident. • The team is investigating changes to the index creation process.
Badamy problem powodujący ponowne przetworzenie starszych wydarzeń. * * Uderzenie: * * Niektóre przepływy pracy mogą ponownie działać, co może skutkować podwójnymi wpisami. Skany PR mogą być również opóźnione.
Rozwiązaliśmy zaległości w przetwarzaniu spowodowane problemem podczas migracji do Kafki. Problem ten doprowadził do tego, że obok nowych wydarzeń rozpatrywane były starsze wydarzenia, co spowodowało opóźnienia i mogło spowodować aktualizację niektórych naruszeń o przestarzałym statusie. Normalne przetwarzanie zostało przywrócone. Klienci mogą jednak nadal dostrzegać pewne naruszenia o przestarzałym statusie, podczas gdy my identyfikujemy i poprawiamy dane. Skanowanie PR nie było opóźnione ani ponownie przetworzone, a przepływy pracy nie uległy zmianie. Kontynuujemy rekultywację i ściśle monitorujemy system.
Normalne przetwarzanie zostało przywrócone, a incydent jest teraz monitorowany. Niewielka liczba klientów może nadal dostrzec ograniczoną liczbę naruszeń o przestarzałym statusie w wyniku incydentu. Zidentyfikowaliśmy potencjalnie dotknięte środowisko i pracujemy nad poprawą wpływowych zapisów.
System jest w pełni operacyjny. Niewielka liczba klientów może nadal dostrzec ograniczoną liczbę naruszeń o przestarzałym statusie w wyniku incydentu. Zidentyfikowaliśmy potencjalnie dotknięte środowisko i pracujemy nad poprawą wpływowych zapisów.
The platform is now fully operational and processing normally
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Zespół zidentyfikował problem z uszkodzoną wydajnością ze skanowaniem. Mogą wystąpić opóźnienia w uruchamianiu, bieganiu i wykonywaniu skanów. Wszystkie typy skanowania mogą być naruszone (Wyciągnij żądanie i CLI skany, jak również). Zespół zidentyfikował problem nieprawidłowego rozmieszczenia, który należy wkrótce rozwiązać.
Zespół zidentyfikował przyczynę i ją rozwiązał. Widzimy, jak system wraca do stabilności.
System znów jest w pełni operacyjny.
* * Root Cause * * Incydent został spowodowany wdrożeniem jednej usługi, która prowadziła migrację bazy danych. Zespół stwierdził, że migracja ta zawiera wadliwy kod i w rezultacie prowadzi do przeciążenia bazy danych podczas próby wdrożenia usługi. W rezultacie usługa była częściowo obniżona do czasu cofnięcia rozmieszczenia. W tym czasie wszystkie skany były przetwarzane z mniejszą niż oczekiwano wydajnością.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Składnik GitHub: wnioski API Incydent w GitHub: https: / / stspg.io / vr201n49yl53
Składnik GitHub: wnioski API Incydent w GitHub: https: / / stspg.io / vr201n49yl53
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Komponent GitHub: żądania ciągnięcia Incydent w GitHub: https: / / stspg.io / sm1tp7kfm4vj
Komponent GitHub: żądania ciągnięcia Incydent w GitHub: https: / / stspg.io / sm1tp7kfm4vj
Komponent GitHub: żądania ciągnięcia Incydent w GitHub: https: / / stspg.io / sm1tp7kfm4vj
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Zauważyliśmy zdegradowaną wydajność w skanowaniu IAC Pull Request. Rozwiązujemy problem.
Zidentyfikowaliśmy przyczynę powolności i wprowadziliśmy środki zaradcze.
Opóźnienie, które doprowadziło do spowolnienia, prawie się skończyło. Monitorujemy sytuację.
Sprawa została rozwiązana i nadal monitorujemy sytuację.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Składnik GitHub: API Requests, Pull Requests Incydent w GitHub: https: / / stspg.io / j5c80shxqm53
GitHub component: API Requests, Pull Requests Original GitHub incident: https://stspg.io/j5c80shxqm53
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
GitHub komponent: Haki internetowe Incydent w GitHub: https: / / stspg.io / syhr80rth84z
Komponent GitHub: Haki internetowe, żądania ciągnięcia Incydent w GitHub: https: / / stspg.io / syhr80rth84z
Komponent GitHub: Haki internetowe, żądania ciągnięcia Incydent w GitHub: https: / / stspg.io / syhr80rth84z
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Przy * * 1: 41 * * PM EDT, zidentyfikowaliśmy problem powodujący wzrost poziomu błędów podczas przetwarzania wniosku na platformie UI. Kwestia ta została szybko złagodzona, a platforma działa obecnie normalnie. Nasz zespół nadal aktywnie monitoruje platformę, aby zapewnić stabilność obsługi.
Incydent został rozwiązany, a platforma działa normalnie.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Zauważyliśmy, że część skanów CLI Secrets zawodzi. Aktywnie badamy problem.
Zidentyfikowaliśmy, że CLI wersja 3.17.1 wprowadziła błędne zachowanie. Obniżenie wersji CLI do 3.17.0 powinno tymczasowo rozwiązać problem, podczas gdy my nadal rozumiemy i rozwiązujemy przyczynę.
Zastosowano fix i funkcjonalność została w pełni przywrócona; nadal monitorujemy, aby zapewnić stabilność.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Ze względu na zwiększoną ilość skanów, zaobserwowaliśmy opóźnienia w aktualizacjach statusu naruszenia, które obejmują automatyczne rozwiązywanie naruszeń. Źródło nagłego wzrostu zostało złagodzone, a opóźnienie już się zmniejsza. Będziemy monitorować sytuację do czasu powrotu do normalności
Kontynuujemy monitorowanie procesu wykrywania i związanych z tym opóźnień w aktualizacjach statusu naruszenia (w tym autorozdzielczości)
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Zauważyliśmy pogorszenie wydajności w wielu komponentach systemu. Zidentyfikujemy wszystkie dotknięte składniki i przyczynę.
Zauważyliśmy zdegradowaną wydajność w wielu komponentach aplikacji UI. Skanowanie, jak również Pull Request i CLI skany mogą również być naruszone.
Obserwujemy podwyższony czas Redis. Zwiększamy pojemność klastrów Redis w celu złagodzenia skutków i przywrócenia stabilnej wydajności usług
Region odzyskał status i funkcjonuje normalnie. Dokładne monitorowanie wydajności systemu w celu zapewnienia stałej stabilności
System jest teraz w pełni operacyjny. Nie powinno być więcej zepsutych wyników. / Podsumowanie Obserwowaliśmy okres spowolnienia i przerywanych przerw w pracy, mających wpływ na różne funkcje systemowe w regionie UE, w tym interfejs aplikacji i skanowanie wniosku o uruchomienie (PR). Kwestia ta została spowodowana przede wszystkim przez system przetwarzania, który osiąga granice zdolności sieci i pamięci, a nasila go wysoki poziom zautomatyzowanej działalności z jednego źródła. Od tego czasu zmodernizowaliśmy infrastrukturę bazową i wdrożyliśmy zabezpieczenia, aby zapobiec wpływowi na system podobnych działań o wysokim wolumenie. Kwestia ta została w pełni rozwiązana, a wszystkie usługi powróciły do oczekiwanych poziomów wydajności. * * Key Timeline (IDT) * * • * * 13 lipca 2026, 11: 44 IDT * *: Incydent wykryty w wyniku doniesień o powolności w używaniu UI i opóźnieniach w badaniu PR. • * * 13 lipca 2026, 12: 19 IDT * *: Zidentyfikowano wąskie gardła infrastruktury; podjęto decyzję o modernizacji klastra przetwarzania. • * * 13 lipca 2026, 12: 26 IDT * *: Zidentyfikowano i wyłączono zautomatyzowany proces o wysokim wolumenie w celu zmniejszenia natychmiastowego obciążenia. • * * 13 lipca 2026, 13: 09 IDT * *: Ulepszenie infrastruktury zakończone; przepustowość sieci wróciła do normalnego poziomu. • * * 13 lipca 2026, 15: 35 IDT * *: Wszystkie zaległości zostały wyczyszczone, a incydent został oficjalnie rozwiązany. * * Root Cause * * Incydent został wywołany przez kombinację czynników: klaster przetwarzania osiągnął maksymalną przepustowość sieci i pojemność pamięci ze względu na niewystarczającą konfigurację dla obecnego obciążenia pracą. Zostało to dodatkowo napięte przez określony zautomatyzowany przepływ pracy, który generował niezwykle dużą ilość wniosków o aktualizację. Ponadto różnica w konfiguracji gazociągu przetwarzania wiadomości w regionie UE uniemożliwiła systemowi skuteczne obsługę zaległości. * * Akcje podjęte * * • * * Infrastruktura zaktualizowana * *: Klaster przetwarzania został zmodernizowany do typu instancji o dużej przepustowości, aby zapewnić większą przepustowość sieci i pamięć. • * * Disabled High- Volume Source * *: Specyficzny identyfikator klienta odpowiedzialny za nadmierny ruch został tymczasowo wyłączony w celu przywrócenia stabilności systemu. • * * Restaurowane połączenie * *: Zmienione komponenty serwisowe zostały ponownie uruchomione, aby zapewnić ponowne ustanowienie czystych połączeń z ulepszoną infrastrukturą. • * * Zwiększony paralelizm przetwarzania * *: Liczba partycji w danej kolejce wiadomości została zwiększona, aby umożliwić systemowi szybsze przetwarzanie zaległości. * * Action Elements * * • * * Wzmocnienie monitorowania * *: Wdrożenie nowych alarmów do wykorzystania sieci i pamięci w celu wykrycia problemów z przepustowością, zanim będą one wpływać na klientów. • * * Optymalizacja Workflow aktualizacji * *: Zmień proces aktualizacji statusu na żądania partii, znacznie zmniejszając obciążenie systemu przetwarzania. • * * Wdrożenie współczynnika ograniczenia * *: Wprowadzenie zabezpieczeń zapobiegających zużyciu nieproporcjonalnych zasobów systemowych przez pojedyncze źródło. • * * Standaryzuj konfiguracje regionalne * *: Przeprowadzenie audytu w celu zapewnienia spójności ustawień infrastruktury i kolejki komunikatów we wszystkich regionach.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Zidentyfikowaliśmy problem, który może spowodować, że * * niedokładne naruszenie liczy * * w * * niektórych produktów deski rozdzielcze i niestandardowe panele rozdzielcze, które opierają się na danych o naruszeniach (nie wszystkie deski rozdzielcze są naruszone). Rozpoczęliśmy już prace naprawcze, ale to zajmie trochę czasu, aby w pełni zakończyć, i możesz zobaczyć zmiany liczby jak dane są poprawione. Podzielimy się kolejną aktualizacją po zakończeniu naprawy i w pełni przywrócona dokładność danych.
Poczyniliśmy znaczne postępy w korygowaniu niedokładnych przypadków naruszenia przepisów dotyczących niektórych produktów i niestandardowych desek rozdzielczych. • * * Aktualny status: * * Ustawienie zostało pomyślnie zakończone dla przeważającej większości rachunków, a pełna dokładność danych została przywrócona. • * * Kolejne kroki: * * Aktywnie rozwiązujemy tę kwestię w odniesieniu do niewielkiej liczby pozostałych rachunków, których dotyczy.
Funkcjonalność została w pełni przywrócona; nadal monitorujemy, aby zapewnić stabilność.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
Obecnie badamy problem wpływający na rozpoznawalność ryzyka Maestro, regenerację AI ryzyka, regenerację Maestro oraz usługi AI Graph.
Zidentyfikowaliśmy problem z konfiguracją zapory, który wpływał na usługi Maestro AI. Konfiguracja została zaktualizowana, a usługi, których to dotyczy, zostały odzyskane. Monitorujemy sytuację i pracujemy nad dalszą stabilizacją. Niektóre zdegradowane wyniki mogą być nadal obserwowane, podczas gdy my uzupełniamy dodatkowe ulepszenia.
Kwestia dotycząca usług Maestro AI została rozwiązana. Maestro Risk Explorability, Risk AI Remediation, Maestro Remediation i Graph AI są teraz dostępne i działają normalnie. / Podsumowanie 9 lipca 2026 roku klienci korzystający z usługi Maestro w europejskim środowisku produkcyjnym doświadczyli niedostępności usług. Problem rozpoczął się po aktualizacji konfiguracji, która nieumyślnie zmieniła regionalne trasy usługi. Spowodowało to próbę połączenia systemu poprzez ścieżkę sieciową, której brakowało niezbędnych uprawnień, oraz do regionu, w którym określone modele przetwarzania były niedostępne. Kwestia ta została w pełni rozwiązana, a usługi zostały przywrócone wszystkim poszkodowanym klientom. * * Key Timeline (IDT) * * * * * 9 lipca 2026, 12: 02 IDT: * * Incydent został zidentyfikowany i wszczęto dochodzenie. • * * 9 lipca 2026, 12: 07 IDT: * * Publiczne zawiadomienie o przerwie w świadczeniu usług zostało wydane. • * * 9 lipca 2026, 13: 00 IDT: * * Zastosowano ustawienie konfiguracji sieci, przywracając łączność pierwotną. * * * 9 lipca 2026, 13: 39 IDT: * * Usługa została w pełni przywrócona po wdrożeniu wadliwych modeli, a incydent został oznaczony jako rozwiązany. * * Root Cause * * Przerwa w świadczeniu usług została wywołana niedawną aktualizacją procesu uwierzytelniania i konfiguracji. Aktualizacja ta wprowadziła konflikt w tym, w jaki sposób system zidentyfikował swój region operacyjny. W szczególności, zautomatyzowany proces aktualizacji przekroczył ustawienia ręczne, przekierowując ruch do innego regionalnego punktu końcowego. Ta nowa ścieżka została zablokowana brakującą zasadą bezpieczeństwa sieci i próbowała wykorzystać model przetwarzania, który nie był wspierany w tym konkretnym regionie, co doprowadziło do awarii usług. * * Akcje podjęte * * • * * Przywrócone połączenie sieciowe: * * Ręcznie aktualizowane zasady bezpieczeństwa sieci, aby umożliwić bezpieczny ruch poprzez nowy regionalny punkt końcowy. • * * Wdrożony model Fallbacks: * * Skonfigurował system do stosowania alternatywnych modeli przetwarzania w celu zapewnienia natychmiastowej dostępności usług, podczas gdy długoterminowe konfiguracje regionalne zostały dostosowane. • * * Aktualizacja Komunikacji Status: * * Utrzymanie aktualizacji w czasie rzeczywistym dla zainteresowanych stron i klientów w trakcie procesu odzyskiwania. * * Action Elements * * • * * Prewencja konfiguracji standardowej: * * Aktualizacja przepływu pracy wdrożeniowej, aby zapobiec automatycznym procesom z milcząco nadrzędnych krytycznych ustawień środowiska. • * * Kontrola infrastruktury: * * Przeprowadzenie kompleksowego przeglądu zasad bezpieczeństwa sieci we wszystkich regionach w celu zapewnienia spójności i uniknięcia podobnych luk w łączności. • * * Wzmocnienie zautomatyzowanego monitorowania: * * Wdrożenie końcowych kontroli zdrowia i sond syntetycznych w celu automatycznego wykrywania problemów związanych z połączeniami regionalnymi, zanim wpłyną one na użytkowników. • * * Poprawa polityki wdrażania: * * Ustanowienie nowych wytycznych w celu zapewnienia, że zmiany konfiguracji są wdrażane i zatwierdzane w środowiskach podobnych do produkcji częściej w celu zmniejszenia ryzyka aktualizacji "przestarzałych".
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
We are experiencing delays in infrastructure provisioning caused by cloud provider API rate limiting. We are actively investigating the issue with our cloud provider.
Please refer to the AWS Health Status page for details on the related incident: [https://health.aws.amazon.com/health/status](https://health.aws.amazon.com/health/status "https://health.aws.amazon.com/health/status")
Mitigation: We temporarily scaled up the managed node group to get pods scheduled while we wait for AWS to fully resolve the underlying issue.
We are starting to see stabilization and a reduction in API errors. However, we continue to closely monitor the situation.
AWS has confirmed that the issue has been fully mitigated and we are currently not observing any related issues.
* * Badania - Issues with Violations and Custom Dashboards (Produd- US) * * Obecnie badamy problem w naszym środowisku * * Produd- US * * gdzie naruszenia nie są ładowane. W rezultacie niestandardowe panele desek rozdzielczych, które opierają się na danych o naruszeniach, mogą również nie wytworzyć lub wyświetlić błędów. Nasz zespół inżynieryjny aktywnie bada przyczynę, a my dostarczymy aktualizacje tutaj, jak dowiemy się więcej. Przepraszamy za niedogodności.
W odniesieniu do kwestii dotyczących naruszeń i niestandardowych desek rozdzielczych w Prod- USA wprowadzono rozwiązanie. Aktywnie monitorujemy środowisko, aby zapewnić pełne przywrócenie usług.
Podstawowy problem został rozwiązany, a naruszenia i niestandardowe deski rozdzielcze powinny teraz działać normalnie. Nasz zespół aktywnie monitoruje synchronizację danych, aby rozwiązać wszelkie pozostałe rozbieżności z nowszymi naruszeniami. Dostarczymy ostateczną aktualizację po zakończeniu synchronizacji.
Kontynuujemy monitorowanie procesu synchronizacji danych dla nowych naruszeń w UI. Podczas gdy funkcjonalność została przywrócona, może to zająć do * * 6 godzin * *, aby wszystkie ostatnie dane w pełni nadgonić i dokładnie odzwierciedlać. Dostarczymy ostateczną aktualizację po zakończeniu synchronizacji.
Synchronizacja danych jest zakończona, a wszystkie niedawne naruszenia pomyślnie zaludniły się w UI. Przestępstwa i niestandardowe deski rozdzielcze działają normalnie, a incydent jest w pełni rozwiązany. Doceniamy waszą cierpliwość, pracując nad przywróceniem pełnej służby.
Funkcjonalność została w pełni przywrócona; nadal monitorujemy, aby zapewnić stabilność.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.
We have identified the source of an issue and currently deploying the fix. At the same time we scaled our scanning platform up to accelerate scanning
The fix was deployed. The queue is decreasing and we're monitoring it
The system has processed all jobs with higher priorities. There is a queue of lower priority jobs that should not impact overall Cycode scanning performance
**Summary** During the incident, customers experienced significant delays and temporary disruptions across SAST, SCA, CCA, and Secret repository scans and push events. The issue was caused by a surge in reachability scanner jobs that overwhelmed the processing queue, compounded by scanner pods requesting excessive CPU and memory, infrastructure resource limits being reached, and inefficiencies in job prioritization and retry logic. As a result, processing capacity was improperly consumed and a large job backlog accumulated. A series of corrective updates were deployed to stabilize the environment, and the processing environment has since returned to expected performance levels. **Impact** Customers experienced delays for SAST, SCA, CCA, and Secret repository scans and push events, with some requests delayed by several hours and a peak queue size of over 64,000 jobs. Lower priority scans such as Trivy, Syft, and CCA were most affected, though high-priority jobs were eventually processed without further delay. **Key Timeline (IDT)** • **21.06.2026, 17:16 IDT**: A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly. • **22.06.2026, 10:07 IDT**: The issue was identified by an on-call engineer. • **22.06.2026, 12:55 IDT**: We increased the scanning platform resources to process more jobs. • **22.06.2026, 14:10 IDT**: A fix that lowered new reachability scanners was deployed to production. • **22.06.2026, 18:43 IDT**: Existing reachability scanners' priority was lowered. • **23.06.2026, 09:12 IDT**: Scans with higher priority were processed. Only lower priority scans remained, including CCA. • **23.06.2026, 13:51 IDT**: A fix that reduced communication overload to Kubernetes was deployed. The scanning platform started processing scan jobs much faster. • **23.06.2026, 17:34 IDT**: The queue was fully processed. **Root Cause** The issue was triggered by a combination of factors: 1. **Reachability scanner job surge** -- A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly, which led to resource bottlenecks in the cluster and a peak queue size of over 64,000 jobs. 2. **Excessive pod resource requests** -- Due to configuration bugs, scanner pods requested excessive CPU and memory, which prevented efficient scheduling and amplified the resource bottlenecks in the cluster. 3. **Infrastructure resource limits** -- AWS VPC subnet IP and EKS API limits were reached, restricting the cluster's ability to scale and schedule new work. 4. **Job prioritization and retry inefficiencies** -- Inefficiencies in job prioritization and retry logic meant lower priority scans (Trivy, Syft, CCA) competed for capacity and were most affected, while the backlog continued to grow. **Actions Taken** • Increased cluster and node pool capacity. • Fixed job prioritization to deprioritize reachability scans. • Capped resource requests for scanner pods to enable efficient scheduling. • Deployed additional fixes to the scanning platform. • Opened AWS support tickets to address resource limits. • Restored monitoring and logging. • Cleared the job backlog; the queue now processes new jobs as they arrive. **Action Items** • Improve monitoring to better understand the behavior of the processing environment. • Improve scanning optimization and prioritization for all scan types.
**Problem**: SAST (Static Application Security Testing) scans for pull requests were running slowly **Impact**: Some users experienced slow pull request scans potentially delaying code reviews and deployments.
The issue was resolved. The system is fully stable now