GitHub incident can affect Cycode
- investigating
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
- resolved
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
46 incidente Cycode înregistrate începând din februarie 2026, cu actualizări oficiale, componente afectate, durată și informații despre rezolvare.
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
Clienții pot experimenta performanțe degradate în scanări. Cererea de extragere şi scanările CLI pot fi afectate.
The team has identified the root cause of the issue and is working on the solution.
The root cause has been resolved. The system began to stabilize itself, and all the scans are starting to get processed with regular performance.
Toate tipurile de scanare cu excepția SAST sunt pe deplin operaționale. PAST continuă să se stabilizeze și va fi în curând pe deplin stabil.
Sistemul ar trebui să fie din nou complet operațional.
**Root Cause** Incidentul a fost cauzat de implementarea unui serviciu care a condus crearea unui indice al bazei de date. Echipa a identificat o problemă cu modul în care efectuăm creaţiile de index ca migraţii ale bazei de date. În timpul implementării capsulelor cu cea mai nouă imagine a serviciului a încercat să creeze un index pe o masă mare. Echipa a identificat că crearea indexului a durat 7 minute. Cu toate acestea, în timpul creării de păstăi de index nu au fost receptive și, ca urmare, Kubernetes le-a considerat capsule nesănătoase și a încercat să rejudece aceste capsule după 5 minute. Ca urmare, deoarece capsula a fost ucisă înainte ca crearea indicelui să fie completă, tranzacţia de baze de date a fost returnată. Apoi, capsulele ulterioare au încercat să creeze indexul din nou, murind după 5 minute. Acest lucru duce la baza de date fiind în stare nesănătoasă, iar serviciul a fost în jos. Echipa a dat înapoi şi a ucis toate replicile care au încercat să creeze indexul. Datorită acestui fapt, serviciul şi baza de date erau din nou sănătoase. ** De ce măsurile de siguranţă nu au ajutat** Cycode oferă un mecanism de siguranță care deblochează toate Pull Cerere scanează după o anumită perioadă de timp, oferind fiecărei scanări o durată maximă înainte ca cererea Pull să fie deblocată. Cu toate acestea, deoarece serviciul care este responsabil pentru declanșarea și finalizarea scanărilor, precum și această plasă de siguranță, a fost în jos, procesul nu a putut comporta așa cum era de așteptat. Recunoaştem acest decalaj şi lucrăm la consolidarea acestui domeniu al sistemului nostru. **Action items** • Echipa investighează activ îmbunătăţiri şi noi protocoale de siguranţă care pot fi puse în aplicare pentru a avea o altă plasă de siguranţă care împiedică scanarea Pull Cerere fiind blocate în cazul oricărui incident. • Echipa investighează modificările procesului de creare a indicelui.
Traducere automată din actualizarea oficială a incidentului.
Investigăm o problemă care duce la reprocesarea evenimentelor mai vechi. **Impact:** Unele fluxuri de lucru pot rula din nou, ceea ce ar putea duce la alerte duplicate. Scanările PR pot fi de asemenea întârziate.
Am rezolvat problema procesării cauzate de o problemă în timpul unei migraţii Kafka. Problema a dus la procesarea unor evenimente mai vechi, alături de evenimente noi, care au provocat întârzieri și care au actualizat unele încălcări cu un statut depășit. Procesarea normală a fost restabilită. Cu toate acestea, clienții pot vedea încă unele încălcări cu un statut depășit în timp ce identificăm și corectăm înregistrările afectate. Scanările PR nu au fost amânate sau reprelucrate, iar fluxurile de lucru nu au fost afectate. Continuăm remedierea și monitorizarea atentă a sistemului.
Procesarea normală a fost restabilită, iar incidentul este acum în monitorizare. Un număr mic de clienți pot vedea încă un număr limitat de încălcări cu un statut depășit ca urmare a incidentului. Am identificat mediile potențial afectate și lucrăm pentru a corecta înregistrările afectate.
Sistemul este complet operaţional. Un număr mic de clienți pot vedea încă un număr limitat de încălcări cu un statut depășit ca urmare a incidentului. Am identificat mediile potențial afectate și lucrăm pentru a corecta înregistrările afectate.
The platform is now fully operational and processing normally
Traducere automată din actualizarea oficială a incidentului.
Echipa a identificat o problemă cu performanţa degradată cu scanarea. Pot exista întârzieri în pornirea, rularea și completarea scanărilor. Toate tipurile de scanare pot fi afectate (Cerere completă și scanări CLI). Echipa a identificat o problemă cu o defecţiune în desfăşurare, iar problema ar trebui rezolvată în scurt timp.
Echipa a identificat cauza şi a rezolvat-o. Vedem sistemul revenind la stabilitate.
Sistemul este acum din nou complet operațional.
**Root Cause** Incidentul a fost cauzat de o desfăşurare a unui serviciu care a condus o migraţie în baza de date. Echipa a identificat faptul că această migrare conținea cod defectuos și, prin urmare, duce la supraîncărcarea bazei de date atunci când încercați să implementați serviciul. Ca urmare, serviciul a fost parțial în jos până la trimiterea a fost returnat. În acest timp, toate scanările au fost prelucrate cu o performanţă mai mică decât se aştepta.
Traducere automată din actualizarea oficială a incidentului.
Componenta GitHub: Solicitări API Original GitHub incident: https://stspg.io/vr201n49yl53
Componenta GitHub: Solicitări API Original GitHub incident: https://stspg.io/vr201n49yl53
Traducere automată din actualizarea oficială a incidentului.
Componenta GitHub: Solicitări de tragere Original GitHub incident: https://stspg.io/sm1tp7kfm4vj
Componenta GitHub: Solicitări de tragere Original GitHub incident: https://stspg.io/sm1tp7kfm4vj
Componenta GitHub: Solicitări de tragere Original GitHub incident: https://stspg.io/sm1tp7kfm4vj
Traducere automată din actualizarea oficială a incidentului.
Am observat performanţe degradate în scanările de la IaC Pull Cerere. Suntem probleme problema.
Am identificat cauza principală a încetinirilor şi punem în aplicare contramăsurile.
Lungimea care a dus la încetinirea este aproape de peste. Monitorizăm situaţia.
Problema a fost rezolvată și continuăm să monitorizăm situația.
Traducere automată din actualizarea oficială a incidentului.
Componenta GitHub: Solicitări API, Cereri de extragere Original GitHub incident: https://stspg.io/j5c80shxqm53
GitHub component: API Requests, Pull Requests Original GitHub incident: https://stspg.io/j5c80shxqm53
Traducere automată din actualizarea oficială a incidentului.
Componenta GitHub: Original GitHub incident: https://stspg.io/syhr80rth84z
Componenta GitHub: Webhooks, Pull Applications Original GitHub incident: https://stspg.io/syhr80rth84z
Componenta GitHub: Webhooks, Pull Applications Original GitHub incident: https://stspg.io/syhr80rth84z
Traducere automată din actualizarea oficială a incidentului.
La **1:41** PM EDT, am identificat o problemă care cauzează rate ridicate de eroare în timpul procesării cererilor în Platforma UI. Problema a fost atenuată cu promptitudine, iar platforma funcționează în mod normal. Echipa noastră continuă să monitorizeze activ platforma pentru a asigura stabilitatea serviciilor.
Incidentul a fost rezolvat, iar platforma funcţionează normal.
Traducere automată din actualizarea oficială a incidentului.
Am observat o parte din Scanările CLI Secrets eşuând. Suntem în mod activ triaj problema.
Am identificat că versiunea CLI 3.17.1 a introdus comportamentul defectuos. Degradarea versiunii CLI la 3.17.0 ar trebui să rezolve temporar problema în timp ce continuăm să înțelegem și să rezolvăm cauza rădăcină.
A fost aplicat un fix și funcționalitatea este complet restaurată; continuăm să monitorizăm pentru a ne asigura că totul rămâne stabil.
Traducere automată din actualizarea oficială a incidentului.
Din cauza sarcinilor de scanare crescute, am observat întârzieri în actualizările statutului de încălcare care includ auto-rezolvarea încălcărilor. Sursa creşterii bruşte a fost atenuată, iar întârzierea este deja în scădere. Vom continua să monitorizăm situaţia până revenim la normal
Continuăm să monitorizăm procesarea de detectare și întârzierile asociate în actualizarea stării de încălcare (inclusiv auto-rezoluția)
Traducere automată din actualizarea oficială a incidentului.
Am observat performanţe degradate în mai multe componente ale sistemului. Identificăm toate componentele afectate şi identificăm cauza principală.
Am observat o performanță degradată în mai multe componente ale aplicației UI. Scanările, precum și solicitarea Pull și scanările CLI pot fi, de asemenea, afectate.
Observăm rate ridicate de pauză Redis. Suntem scalarea capacitatea de grup Redis pentru a atenua impactul și de a restabili performanța de serviciu stabil
Regiunea și-a revenit și funcționează normal. Monitorizăm îndeaproape performanța sistemului pentru a asigura stabilitatea continuă
Sistemul este acum complet operaţional. Nu ar trebui să mai existe performanţe degradate. ** Summary ** Am observat o perioadă de încetinire și temporizări intermitente care afectează diferite funcții ale sistemului în regiunea UE, inclusiv interfața aplicației și scanările cererii de tragere (PR). Problema a fost cauzată în primul rând de un sistem de prelucrare care a atins limitele rețelei și ale capacității de memorie, exacerbat de un volum ridicat de activitate automată dintr-o singură sursă. De atunci, am modernizat infrastructura de bază și am pus în aplicare garanții pentru a preveni ca activitatea de mare volum similară să afecteze sistemul. Problema este acum pe deplin rezolvată, iar toate serviciile au revenit la nivelurile de performanță preconizate. **Key Timeline (IDT) ** • ** 13 iulie 2026, 11:44 IDT **: Incident detectat în urma raportărilor de încetinire a UI şi întârzieri la scanarea PR. • ** 13 iulie 2026, 12:19 IDT **: Blocajul infrastructurii identificat; decizia luată pentru a actualiza grupul de prelucrare. • ** 13 iulie 2026, 12:26 IDT **: A fost identificat un proces automatizat de mare volum și dezactivat pentru a reduce sarcina imediată. • ** 13 iulie 2026, 13:09 IDT **: Upgrade-ul infrastructurii terminat; retea a revenit la nivele normale. • ** 13 iulie 2026, 15:35 IDT **: Toate backlogs eliminate, și incidentul a fost oficial rezolvată. **Root Cause** Incidentul a fost declanşat de o combinaţie de factori: un grup de procesare a atins lăţimea maximă de bandă a reţelei şi capacitatea de memorie datorită unei configuraţii subdimensionate pentru volumul de muncă curent. Acest lucru a fost în continuare tensionat de un anumit flux de lucru automatizat care a generat un volum neobișnuit de ridicat de cereri de actualizare. În plus, o diferență de configurare a conductei de procesare a mesajelor din regiunea UE a împiedicat sistemul să gestioneze efectiv registrul de date rezultat. ** Actiuni luate ** • ** Infrastructura modernizată**: Grupul de prelucrare a fost actualizat la un tip de instanță de capacitate mai mare pentru a oferi mai multă lățime de bandă și memorie de rețea. • **Disabled High-Volum Source**: Un identificator de client specific responsabil pentru traficul excesiv a fost temporar dezactivat pentru a restabili stabilitatea sistemului. • ** Restaurat Conectivitate**: Componentele de servicii afectate au fost repornite pentru a asigura restabilirea conexiunilor curate la infrastructura modernizată. • **Creşterea paralelismului procesării**: Numărul de partiții din coada de mesaje afectată a fost crescut pentru a permite sistemului să proceseze mai rapid backlog-ul. **Action items** • **Monitorizarea performanței**: Punerea în aplicare a noilor alerte pentru utilizarea rețelei și a memoriei pentru a detecta problemele de capacitate înainte de a avea un impact asupra clienților. • **Optimizează fluxul de lucru actualizat**: Refactor procesul de actualizare a stării la cererile de lot, reducerea semnificativă a sarcinii pe sistemul de prelucrare. • **Limitarea ratei de aplicare**: Introducerea unor garanții pentru a preveni orice sursă unică să consume resurse de sistem disproporționate. • **Standardizarea configuraţiilor regionale**: Desfășurarea unui audit pentru a se asigura că setările de la coadă pentru infrastructură și mesaje sunt coerente în toate regiunile.
Traducere automată din actualizarea oficială a incidentului.
Am identificat o problemă care poate cauza **inexacte contravenții** în **unele** panouri de bord produse și panouri personalizate de bord care se bazează pe date de încălcare (nu toate bordurile de bord sunt afectate). Am început deja munca corectivă, dar va dura timp pentru a finaliza pe deplin, și puteți vedea modificarea numărului ca date este corectată. Vom partaja o altă actualizare odată ce fix a terminat de funcționare și precizia datelor este complet restaurat.
Am făcut progrese semnificative în corectarea numărului de încălcări incorecte care afectează unele tablouri de bord produse și personalizate. • ** Starea actuală:** Fixarea a fost finalizată cu succes pentru marea majoritate a conturilor, iar exactitatea deplină a datelor a fost restabilită. • **Următoarele etape:** Rezolvăm în mod activ problema numărului mic de conturi afectate rămase.
Funcţionalitatea este restabilită complet; continuăm să monitorizăm pentru a ne asigura că totul rămâne stabil.
Traducere automată din actualizarea oficială a incidentului.
Investigăm în prezent o problemă care afectează Explorabilitatea Riscului Maestro, Remediarea Riscului AI, Remediarea Maestro şi Serviciile Grafice AI.
Am identificat o problemă de configurare a firewall-ului care afecta serviciile Maestro AI. Configurația a fost actualizată, iar serviciile afectate au fost recuperate. Continuăm să monitorizăm situaţia şi lucrăm la continuarea stabilizării. Unele performanțe degradate pot fi încă observate în timp ce noi completăm îmbunătățiri suplimentare.
Problema care afectează serviciile Maestro AI a fost rezolvată. Maestro Risk Explorability, Risk AI Remediation, Maestro Remediation, și Graph AI sunt acum disponibile și funcționează în mod normal. ** Summary ** La 9 iulie 2026, clienții care utilizează serviciul Maestro în mediul european de producție au experimentat o perioadă de nefuncționare a serviciilor. Problema a început în urma unei actualizări de configurare care a schimbat accidental rutarea regională a serviciului. Acest lucru a determinat sistemul să încerce conexiunile printr-o cale de rețea care nu aveau permisiunile necesare și către o regiune în care nu erau disponibile modele specifice de prelucrare. Problema a fost rezolvată pe deplin, iar serviciul a fost restaurat tuturor clienților afectați. **Key Timeline (IDT) ** • ** 9 iulie 2026, 12:02 IDT: ** Incidentul a fost identificat şi a fost iniţiată o anchetă. • ** 9 iulie 2026, 12:07 IDT:** Notificarea publică a fost emisă cu privire la întreruperea serviciului. • ** 9 iulie 2026, 13:00 IDT: ** A fost aplicată o fixare de configurare a rețelei, restaurând conectivitatea primară. • ** 9 iulie 2026, 13:39 IDT: ** Serviciul a fost restaurat complet după implementarea modelelor de rezervă, iar incidentul a fost marcat ca rezolvat. **Root Cause** Întreruperea serviciului a fost declanșată de o actualizare recentă a procesului de autentificare și configurare. Această actualizare a introdus un conflict în modul în care sistemul și-a identificat regiunea operațională. Mai exact, un proces de actualizare automată a depășit setările manuale, rutarea traficului către un obiectiv regional diferit. Această nouă cale a fost blocată de o regulă de securitate a rețelei lipsă și a încercat să utilizeze un model de prelucrare care nu a fost susținut în acea regiune specifică, ceea ce a dus la eșecul serviciului. ** Actiuni luate ** • ** Restaurarea conexiunii de rețea:** Actualizarea manuală a normelor de securitate a rețelei pentru a permite asigurarea traficului prin noul obiectiv regional. • ** Modele detaliate:** Configurat sistemul pentru a utiliza modele alternative de prelucrare pentru a asigura disponibilitatea imediată a serviciului, în timp ce configuraţiile regionale pe termen lung au fost ajustate. • ** Comunicaţii de stare actualizate:** Menținerea actualizărilor în timp real pentru părțile interesate și clienți pe parcursul procesului de recuperare. **Action items** • **Standardize Configuration Precedence:** Actualizarea fluxului de lucru de implementare pentru a preveni procesele automatizate să depășească în tăcere setările critice de mediu. • ** Audit de infrastructură:** Să realizeze o revizuire cuprinzătoare a normelor de securitate a rețelelor în toate regiunile pentru a asigura coerența și a preveni lacunele de conectivitate similare. • **Monitorizare automată de performanţă:** Punerea în aplicare a controalelor de sănătate de la un capăt la altul și a sondelor sintetice pentru a detecta automat problemele de conectivitate regională înainte ca acestea să afecteze utilizatorii. • **Îmbunătățirea politicilor de desfășurare:** Să stabilească noi orientări pentru a se asigura că modificările configurației sunt implementate și validate în medii asemănătoare producției mai frecvent pentru a reduce riscul actualizărilor "moderne.".
Traducere automată din actualizarea oficială a incidentului.
We are experiencing delays in infrastructure provisioning caused by cloud provider API rate limiting. We are actively investigating the issue with our cloud provider.
Please refer to the AWS Health Status page for details on the related incident: [https://health.aws.amazon.com/health/status](https://health.aws.amazon.com/health/status "https://health.aws.amazon.com/health/status")
Mitigation: We temporarily scaled up the managed node group to get pods scheduled while we wait for AWS to fully resolve the underlying issue.
We are starting to see stabilization and a reduction in API errors. However, we continue to closely monitor the situation.
AWS has confirmed that the issue has been fully mitigated and we are currently not observing any related issues.
**Investigarea - Probleme cu Violații și Tablouri personalizate (Prod-US) ** În prezent investigăm o problemă în mediul nostru **Prod-US** în care încălcările nu se încarcă. Ca urmare, panourile de bord personalizate care se bazează pe date de încălcare pot, de asemenea, să nu reușească să facă sau să afișeze erori. Echipa noastră de inginerie se uită activ în cauza rădăcină, și vom oferi actualizări aici, așa cum am afla mai multe. Ne cerem scuze pentru deranj.
A fost implementat un fix pentru problemele care afectează încălcări și borduri personalizate în Prod-US. Monitorizăm în mod activ mediul înconjurător pentru a asigura restabilirea completă a serviciilor.
Problema principală a fost rezolvată, iar încălcările și tablourile de bord personalizate ar trebui să funcționeze în mod normal. Echipa noastră monitorizează activ sincronizarea datelor pentru a rezolva orice discrepanțe rămase cu noi încălcări. Vom oferi o actualizare finală odată ce sincronizarea este completă.
Continuăm să monitorizăm procesul de sincronizare a datelor pentru noi încălcări în UI. În timp ce funcționalitatea a fost restaurată, poate dura până la **6 ore** pentru ca toate datele recente să recupereze și să reflecte cu precizie. Vom oferi o actualizare finală odată ce sincronizarea este completă.
Sincronizarea datelor este completă, și toate încălcările recente au populat cu succes în UI. Încălcări și borduri personalizate funcționează normal, iar incidentul este complet rezolvat. Apreciem răbdarea dumneavoastră în timp ce am lucrat pentru a restabili serviciul complet.
Funcţionalitatea este restabilită complet; continuăm să monitorizăm pentru a ne asigura că totul rămâne stabil.
Traducere automată din actualizarea oficială a incidentului.
We have identified the source of an issue and currently deploying the fix. At the same time we scaled our scanning platform up to accelerate scanning
The fix was deployed. The queue is decreasing and we're monitoring it
The system has processed all jobs with higher priorities. There is a queue of lower priority jobs that should not impact overall Cycode scanning performance
**Summary** During the incident, customers experienced significant delays and temporary disruptions across SAST, SCA, CCA, and Secret repository scans and push events. The issue was caused by a surge in reachability scanner jobs that overwhelmed the processing queue, compounded by scanner pods requesting excessive CPU and memory, infrastructure resource limits being reached, and inefficiencies in job prioritization and retry logic. As a result, processing capacity was improperly consumed and a large job backlog accumulated. A series of corrective updates were deployed to stabilize the environment, and the processing environment has since returned to expected performance levels. **Impact** Customers experienced delays for SAST, SCA, CCA, and Secret repository scans and push events, with some requests delayed by several hours and a peak queue size of over 64,000 jobs. Lower priority scans such as Trivy, Syft, and CCA were most affected, though high-priority jobs were eventually processed without further delay. **Key Timeline (IDT)** • **21.06.2026, 17:16 IDT**: A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly. • **22.06.2026, 10:07 IDT**: The issue was identified by an on-call engineer. • **22.06.2026, 12:55 IDT**: We increased the scanning platform resources to process more jobs. • **22.06.2026, 14:10 IDT**: A fix that lowered new reachability scanners was deployed to production. • **22.06.2026, 18:43 IDT**: Existing reachability scanners' priority was lowered. • **23.06.2026, 09:12 IDT**: Scans with higher priority were processed. Only lower priority scans remained, including CCA. • **23.06.2026, 13:51 IDT**: A fix that reduced communication overload to Kubernetes was deployed. The scanning platform started processing scan jobs much faster. • **23.06.2026, 17:34 IDT**: The queue was fully processed. **Root Cause** The issue was triggered by a combination of factors: 1. **Reachability scanner job surge** -- A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly, which led to resource bottlenecks in the cluster and a peak queue size of over 64,000 jobs. 2. **Excessive pod resource requests** -- Due to configuration bugs, scanner pods requested excessive CPU and memory, which prevented efficient scheduling and amplified the resource bottlenecks in the cluster. 3. **Infrastructure resource limits** -- AWS VPC subnet IP and EKS API limits were reached, restricting the cluster's ability to scale and schedule new work. 4. **Job prioritization and retry inefficiencies** -- Inefficiencies in job prioritization and retry logic meant lower priority scans (Trivy, Syft, CCA) competed for capacity and were most affected, while the backlog continued to grow. **Actions Taken** • Increased cluster and node pool capacity. • Fixed job prioritization to deprioritize reachability scans. • Capped resource requests for scanner pods to enable efficient scheduling. • Deployed additional fixes to the scanning platform. • Opened AWS support tickets to address resource limits. • Restored monitoring and logging. • Cleared the job backlog; the queue now processes new jobs as they arrive. **Action Items** • Improve monitoring to better understand the behavior of the processing environment. • Improve scanning optimization and prioritization for all scan types.
**Problem**: SAST (Static Application Security Testing) scans for pull requests were running slowly **Impact**: Some users experienced slow pull request scans potentially delaying code reviews and deployments.
The issue was resolved. The system is fully stable now