GitHub incident can affect Cycode
- investigating
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
- resolved
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
46 Cycode incidents · Şubat 2026 — official updates, affected components, duration and resolution details.
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Customers may experience degraded performance in scans. Pull request and CLI scans may be affected.
The team has identified the root cause of the issue and is working on the solution.
The root cause has been resolved. The system began to stabilize itself, and all the scans are starting to get processed with regular performance.
All scan types except for SAST are fully operational. SAST continues to stabilize and will soon be fully stable.
System should be back to being fully operational.
**Root Cause** The incident was caused by a deployment of one service that ran a database index creation. The team has identified an issue with the way we perform index creations as database migrations. During a deployment the pods with newest image of the service attempted to create an index on a big table. The team has identified that the index creation took 7 minutes. However, during index creation pods were not responsive, and as a result, Kubernetes deemed them as unhealthy pods and attempted to retry those pods after 5 minutes. As a result, because the pod got killed before the index creation was fully completed, the database transaction was rolled back. Then, subsequent pods attempted to create the index again, dying after 5 minutes. This lead to the database being in unhealthy state, and the service was down. The team has rolled back the deployment, and killed all replicas that attempted to create the index. Thanks to that, the service and the database was in healthy state again. **Why safety measures did not help** Cycode provides a safety mechanism that unblocks all Pull Request scans after a specific period of time, giving each scan a maximum duration before the Pull Request is unblocked. However, because the service that is responsible for triggering and completing scans, as well as this safety net, was down, the process couldn't behave as expected. We acknowledge this gap and are working on strengthening this area of our system. **Action items** • The team is actively investigating enhancements and new safety protocols that can be put in place in order to have another safety net preventing Pull Request scans being stuck in case of any incident. • The team is investigating changes to the index creation process.
Eski olayların yeniden işlemesine neden olan bir sorunu araştırıyoruz. **Impact:** Bazı iş akışları tekrar çalıştırılabilir, bu da tekrar uyarılara neden olabilir. PR taramaları da gecikebilir.
Bir Kafka göçü sırasında bir sorundan kaynaklanan işleme gerilogunu çözdük. Sorun, yeni olaylarla birlikte işlendiği eski olaylarla sonuçlandı, bu da gecikmelere neden oldu ve eski bir statüyle bazı ihlalleri güncelledi. Normal işlem restore edilmiştir. Bununla birlikte, müşteriler hala eski bir statü ile bazı ihlalleri görebilir ve etkilenen kayıtları doğrulayabiliriz. PR taramaları gecikmedi veya yeniden işlemedi ve iş akışları etkilenmedi. Sistemi yakından takip ediyoruz.
Normal işlem restore edildi ve olay şimdi izlemede. Küçük bir müşteri sayısı, olayın sonucu olarak eski bir statüyle sınırlı sayıda ihlal görebilir. Potansiyel etkilenen ortamları tespit ettik ve etkilenen kayıtları düzeltmek için çalışıyoruz.
Sistem tamamen operasyoneldir. Küçük bir müşteri sayısı, olayın sonucu olarak eski bir statüyle sınırlı sayıda ihlal görebilir. Potansiyel etkilenen ortamları tespit ettik ve etkilenen kayıtları düzeltmek için çalışıyoruz.
The platform is now fully operational and processing normally
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Ekip, tarama ile degraded performansla bir sorunu tespit etti. Başlangıç, koşma ve taramaları tamamlamak için gecikmeler olabilir. Tüm tarama türleri etkilenebilir (Pull isteği ve CLI taramaları da). Ekip, dağıtımda bir arıza ile ilgili bir sorunu tespit etti ve konu kısa sürede çözülmesi gerekir.
Takım kök nedenini belirledi ve çözdü. Sistemin istikrara geri döndüğünü görüyoruz.
Sistem şimdi tamamen operasyonel olmaya geri döndü.
**Root Cause** Olay, bir veritabanı göçü olan bir hizmetin dağıtımına neden oldu. Ekip, bu göçün hatalı kod içerdiğini ve sonuç olarak hizmeti dağıtmaya çalışırken veritabanı aşırı yüklemesine yol açtığını belirledi. Sonuç olarak, dağıtım yeniden yönlendirilinceye kadar servis kısmen aşağılandı. Bu süre zarfında tüm taramalar beklenen performanstan daha düşük işlendi.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
GitHub bileşeni: API Requests Orijinal GitHub olayı: https://stspg.io/vr201n49yl53
GitHub bileşeni: API Requests Orijinal GitHub olayı: https://stspg.io/vr201n49yl53
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
GitHub bileşeni: Pull Requests Orijinal GitHub olayı: https://stspg.io/sm1tp7kfm4vjj
GitHub bileşeni: Pull Requests Orijinal GitHub olayı: https://stspg.io/sm1tp7kfm4vjj
GitHub bileşeni: Pull Requests Orijinal GitHub olayı: https://stspg.io/sm1tp7kfm4vjj
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
IaC Pull Request taramalarında bozulan performansı fark ettik. Biz sorunu sorun.
Yavaşlıkların kök nedenini tespit ettik ve yerinde karşılamalar koyuyoruz.
Yavaşlığa yol açan gecikme neredeyse bitti. Durumu takip ediyoruz.
Sorun çözüldü ve durumu izlemeye devam ediyoruz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
GitHub bileşeni: API Requests, Pull Requests Orijinal GitHub olayı: https://stspg.io/j5c80shxqm53
GitHub component: API Requests, Pull Requests Original GitHub incident: https://stspg.io/j5c80shxqm53
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
GitHub bileşeni: Webhooks Orijinal GitHub olayı: https://stspg.io/syhr80rth84z
GitHub bileşeni: Webhooks, Pull Requests Orijinal GitHub olayı: https://stspg.io/syhr80rth84z
GitHub bileşeni: Webhooks, Pull Requests Orijinal GitHub olayı: https://stspg.io/syhr80rth84z
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
**1:41 ** PM EDT, Platform UI'de talep işleme sırasında yüksek hata oranlarına neden olan bir sorunu tespit ettik. Sorun derhal azaltıldı ve platform şu anda normal olarak çalışıyor. Ekibimiz, hizmet istikrarı sağlamak için platformu aktif olarak izlemeye devam ediyor.
Olay çözüldü ve platform normalde çalışıyor.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Kuantum Sır taramalarının bir kısmını fark ettik. Sorunu aktif olarak öldürüyoruz.
KURAL17.1'in hata davranışını tanıttığını tespit ettik. Kuantum versiyonunu 3.17.0'a yükseltmek, kök nedenini anlamaya ve çözmeye devam ederken konuyu geçici olarak çözmeli.
Bir düzeltme uygulanır ve işlevsellik tamamen restore edilir; her şeyin istikrarlı kalmasını sağlamak için izlemeye devam ediyoruz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Daha fazla tarama yükü nedeniyle, ihlal durum güncellemelerinde gecikmeleri gözlemledik ve bu da ihlallerin otomatikleştirilmesini içeriyor. Ani artış kaynağı azaltıldı ve gecikme zaten azaldı. Durumu normale kadar takip edeceğiz
Algı işlemeyi izlemeye devam ediyoruz ve ihlal durum güncelleştirmeleri ile ilgili gecikmeler (oto-düşümler dahil)
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Birden çok sistem bileşenlerinde degraded performansı fark ettik. Tüm etkilenen bileşenleri tanımlıyoruz ve kök nedenini tespit ediyoruz.
Uygulama UI'nin birden çok bileşeninde degraded performansı fark ettik. Scans, Pull Request ve CLI taramaları da etkilenebilir.
Yüksek Redis zamanout oranlarını gözlemliyoruz. Redis küme kapasitesinin etkisini azaltmak ve istikrarlı hizmet performansını geri yüklemek için ölçekleniyoruz
Bölge kurtarıldı ve normalde çalışıyor. Sürekli istikrar sağlamak için sistem performansını yakından takip ediyoruz
Sistem şimdi tamamen operasyonel. Daha fazla degraded performans olmamalıdır. **Summary** Uygulama arayüzü ve istek (PR) taramaları dahil olmak üzere AB bölgesinde çeşitli sistem işlevlerini etkileyen yavaşlık ve geçici bir süre gözlemliyoruz. Sorun öncelikle ağ ve hafıza kapasitesi sınırlarına ulaşan bir işlem sistemi tarafından, tek bir kaynaktan yüksek otomatik aktivite hacmiyle tartışılmıştır. Altta yatan altyapıyı yükselttik ve sistemi etkilemeden benzer yüksek hacimli aktiviteyi önlemek için korumaları uygulandık. Sorun şu anda tamamen çözüldü ve tüm hizmetler performans seviyelerini beklemeye geri döndü. **Key Timeline (IDT)** • ** 13 Haziran 2026, 11:44 IDT**: Bu olay, UI yavaşlığı ve PR tarama gecikmelerini takiben tespit edildi. • ** 13 Haziran 2026, 12:19 IDT**: Altyapı şişeck tespit edildi; işlem kümesini yükseltmek için karar verdi. • ** 13 Haziran 2026, 12:26 IDT**: Yüksek hacimli otomatik bir süreçtir ve derhal yükü azaltmak için devre dışı bırakıldı. • ** 13 Temmuz 2026, 13:09 IDT**: Altyapı yükseltme tamamlandı; Network throughput normal seviyelere döndü. • ** 13 Temmuz 2026, 15:35 IDT**: Tüm backloglar temizlendi ve olay resmen çözüldü. **Root Cause** Olay faktörlerin bir kombinasyonu tarafından tetiklendi: Mevcut iş yükleri için büyük ölçekli bir yapılandırma nedeniyle maksimum ağ bant genişliğine ve hafıza kapasitesine ulaştı. Bu, alışılmadık derecede yüksek bir güncelleme talebi üreten belirli bir otomatik iş akışı tarafından daha da gerginleştirildi. Ayrıca, AB bölgesindeki mesaj işleme boru hattında bir yapılandırma farkı, sistemin ortaya çıkan gerilogu etkin bir şekilde kullanmasını engelledi. **Actions Taken ** • **Güncelleştirilmiş Altyapı**: İşleme kümesi daha fazla ağ bant genişliği ve hafıza sağlamak için daha yüksek kapasiteli bir türe yükseltildi. • **Disabled High-Volume Kaynağı**: Aşırı trafikten sorumlu özel bir müşteri tanımlayıcısı sistemi istikrarı geri yüklemek için geçici olarak devre dışı bırakıldı. • **Restored Connectivity**: Etkilenen servis bileşenleri, yükseltilmiş altyapıya yeniden kurulmalarını sağlamak için yeniden kuruldu. • **Increased Processing Paralelism**: Etkilenen mesaj kuyruğundaki bölümler sayısı, sistemin gerilogu daha hızlı işlemesine izin vermek için artırıldı. **Action Elements ** • **Enhance İzleme**: Müşterileri etkilemeden önce kapasite sorunlarını tespit etmek için ağ ve hafıza kullanımı için yeni uyarıları uygulayın. • ** Update Workflow**: Statü güncelleme sürecini toplu taleplere davet etmek, yüklemeyi işlem sisteminde önemli ölçüde azaltır. • **Implement Rate Limiting**: Herhangi bir tek kaynağın sınır dışı edilme sistemi kaynaklarını önlemesini sağlamak. • **Bölgesel Yapılamalar**: altyapı ve mesaj kuyruk ayarlarının tüm bölgelerde tutarlı olmasını sağlamak için bir denetim yapın.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
**inaccurate ihlal sayılarına neden olabilecek bir sorunu tespit ettik **bazı** ihlal verilerine güvenen ürün panoları ve özel pano panelleri (tüm panolar etkilenmez). Zaten düzeltici çalışmaya başladık, ancak tam olarak zaman alacak ve veriler düzeltilmiş olarak sayıların değiştiğini görebilirsiniz. Fix'in tükendiğini ve veri doğruluğunu tamamen restore ettiğini bir kez daha başka bir güncelleme paylaşacağız.
Bazı ürün ve özel panoları etkileyen yanlış ihlal sayılarını düzeltmede önemli ilerlemeler yaptık. • **Current Status:** Fix, hesapların büyük çoğunluğu için başarıyla tamamlandı ve tam veri doğruluğu restore edildi. • **Next Steps:** Kalan etkilenen hesapların küçük sayısı için sorunu aktif olarak çözüyoruz.
Fonksiyonellik tamamen restore edilir; her şeyin istikrarlı kalmasını sağlamak için izlemeye devam ediyoruz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Şu anda Maestro Risk Açıklamasını etkileyen bir mesele araştırıyoruz, Risk AI Remediation, Maestro Remediation ve Graph AI hizmetleri.
Maestro AI hizmetlerini etkileyen bir güvenlik yapılandırma sorunu tespit ettik. Yapı güncellendi ve etkilenen hizmetler geri alındı. Durumu izlemeye devam ediyoruz ve daha stabilizasyon üzerinde çalışıyoruz. Bazı degraded performans hala ek gelişmeler tamamlandığında gözlemlenebilir.
Maestro AI hizmetlerini etkileyen sorun çözüldü. Maestro Risk Explorability, Risk AI Remediation, Maestro Remediation ve Graph AI artık mevcut ve normalde çalışıyor. **Summary** 9 Temmuz 2026'da, Avrupa üretim ortamındaki Maestro hizmeti kullanan müşteriler bir hizmet süresine sahip değildi. Sorun, servisin bölgesel routingini neredeyse değiştirdiği bir yapılandırma güncellemesini takip etmeye başladı. Bu, sistemin gerekli izinlerden yoksun bir ağ yolu ile bağlantı kurmaya ve belirli işleme modellerinin kullanılamadığı bir bölgeye yol açtı. Sorun tamamen çözüldü ve hizmet tüm etkilenen müşterilere restore edildi. **Key Timeline (IDT)** • ** 9 Temmuz 2026, 12:02 IDT:** Olay tespit edildi ve soruşturma başlatıldı. • ** 9 Temmuz 2026, 12:07 IDT:** Kamu bildirimi servis kesintisi ile ilgili yayınlandı. • ** 9 Temmuz 2026, 13:00 IDT:** Bir ağ yapılandırma düzeltmesi uygulandı, birincil bağlantı restore edildi. • ** 9 Temmuz 2026, 13:39 IDT:** Hizmet, model geri çekilmelerini uygulamadan sonra tamamen restore edildi ve olay çözüldü. **Root Cause** Servis kesintisi, kimlik doğrulama ve yapılandırma sürecine son bir güncelleme ile tetiklendi. Bu güncelleme, sistemin işletim bölgesini nasıl tanımladığında bir çatışma tanıttı. Özellikle, otomatik bir güncelleme süreci overrode manuel ayarları, farklı bir bölgesel uç noktası için trafik yok. Bu yeni yol eksik bir ağ güvenlik kuralı tarafından engellendi ve bu özel bölgede desteklenmeyen bir işlem modeli kullanmaya çalıştı, hizmet başarısızlığına yol açtı. **Actions Taken ** • **Restored Network Connectivity:** Manually yeni bölgesel uç noktası aracılığıyla güvenli trafik izin vermek için ağ güvenlik kuralları güncelledi. • **Implemented Model Fallbacks:** Sistemi uzun vadeli bölgesel konfigürasyonlar ayarlandığında acil servis kullanılabilirliğini sağlamak için alternatif işleme modellerini kullanmak için yapılandırın. • **Güncellenen Durum İletişimi:** Kurtarma süreci boyunca paydaşları ve müşteriler için gerçek zamanlı güncellemelerin sürdürülmesi. **Action Elements ** • **Staj Precedence:** Otomatik süreçleri sessiz bir şekilde kritik çevre ayarlarını önlemek için dağıtım akışını güncelleyin. • **Infra yapılandırılmış Denetim:** Tüm bölgelerdeki ağ güvenlik kurallarının tutarlılığı sağlamak ve benzer bağlantı boşluklarını önlemek için kapsamlı bir inceleme yapın. • **Enhance Otomatik Takip:** Kullanıcıların etkisinden önce bölgesel bağlantı sorunlarını otomatik olarak tespit etmek için end-to-end sağlık kontrolleri ve sentetik problar uygulamak. • **İşletme Politikalarını Geliştirmek:** Bu yapılandırma değişikliklerinin dağıtılmasını ve üretim benzeri ortamlarda daha sık "stale" güncelleme riskini azaltmak için yeni kurallar oluşturun.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
We are experiencing delays in infrastructure provisioning caused by cloud provider API rate limiting. We are actively investigating the issue with our cloud provider.
Please refer to the AWS Health Status page for details on the related incident: [https://health.aws.amazon.com/health/status](https://health.aws.amazon.com/health/status "https://health.aws.amazon.com/health/status")
Mitigation: We temporarily scaled up the managed node group to get pods scheduled while we wait for AWS to fully resolve the underlying issue.
We are starting to see stabilization and a reduction in API errors. However, we continue to closely monitor the situation.
AWS has confirmed that the issue has been fully mitigated and we are currently not observing any related issues.
**Investigating - Tartışmalar ve Özel Dashboards (Prod-US)** Şu anda **Prod-US** ortamında ihlallerin yüklenmediğini araştırıyoruz. Sonuç olarak, ihlal verilere güvenen özel pano paneller de hata yapmak veya görüntülemek için başarısız olabilir. Mühendislik ekibimiz aktif olarak kök nedenine bakıyor ve daha fazla öğrendiğimiz gibi burada güncellemeler vereceğiz. Bu rahatsızlıktan özür dileriz.
Bir düzeltme, Prod-US'taki ihlal ve özel panoları etkileyen sorunlar için kullanılmıştır. Hizmetlerin tamamen restore edilmesini sağlamak için ortamı aktif olarak izliyoruz.
Temel konu çözüldü ve ihlaller ve özel panolar artık normal olarak çalışmalıdır. Ekibimiz, yeni ihlallerle kalan ayrımları çözmek için veri senkronizasyonunu aktif olarak izliyor. senkronizasyon tamamlandıktan sonra son bir güncelleme sağlayacağız.
UI'de yeni ihlaller için veri senkronizasyon sürecini izlemeye devam ediyoruz. İşlev restore edilmiş olsa da, tüm son veriler tamamen yakalama ve doğru yansıtacak şekilde **6 saate kadar sürebilir. senkronizasyon tamamlandıktan sonra son bir güncelleme sağlayacağız.
Veri senkronizasyonu tamamlandı ve tüm son ihlaller UI'de başarıyla büyüdü. Çevikler ve özel panolar normalde çalışıyor ve olay tamamen çözülmüş. sabrınızı tam hizmeti geri yüklemek için çalıştık.
Fonksiyonellik tamamen restore edilir; her şeyin istikrarlı kalmasını sağlamak için izlemeye devam ediyoruz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
We have identified the source of an issue and currently deploying the fix. At the same time we scaled our scanning platform up to accelerate scanning
The fix was deployed. The queue is decreasing and we're monitoring it
The system has processed all jobs with higher priorities. There is a queue of lower priority jobs that should not impact overall Cycode scanning performance
**Summary** During the incident, customers experienced significant delays and temporary disruptions across SAST, SCA, CCA, and Secret repository scans and push events. The issue was caused by a surge in reachability scanner jobs that overwhelmed the processing queue, compounded by scanner pods requesting excessive CPU and memory, infrastructure resource limits being reached, and inefficiencies in job prioritization and retry logic. As a result, processing capacity was improperly consumed and a large job backlog accumulated. A series of corrective updates were deployed to stabilize the environment, and the processing environment has since returned to expected performance levels. **Impact** Customers experienced delays for SAST, SCA, CCA, and Secret repository scans and push events, with some requests delayed by several hours and a peak queue size of over 64,000 jobs. Lower priority scans such as Trivy, Syft, and CCA were most affected, though high-priority jobs were eventually processed without further delay. **Key Timeline (IDT)** • **21.06.2026, 17:16 IDT**: A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly. • **22.06.2026, 10:07 IDT**: The issue was identified by an on-call engineer. • **22.06.2026, 12:55 IDT**: We increased the scanning platform resources to process more jobs. • **22.06.2026, 14:10 IDT**: A fix that lowered new reachability scanners was deployed to production. • **22.06.2026, 18:43 IDT**: Existing reachability scanners' priority was lowered. • **23.06.2026, 09:12 IDT**: Scans with higher priority were processed. Only lower priority scans remained, including CCA. • **23.06.2026, 13:51 IDT**: A fix that reduced communication overload to Kubernetes was deployed. The scanning platform started processing scan jobs much faster. • **23.06.2026, 17:34 IDT**: The queue was fully processed. **Root Cause** The issue was triggered by a combination of factors: 1. **Reachability scanner job surge** -- A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly, which led to resource bottlenecks in the cluster and a peak queue size of over 64,000 jobs. 2. **Excessive pod resource requests** -- Due to configuration bugs, scanner pods requested excessive CPU and memory, which prevented efficient scheduling and amplified the resource bottlenecks in the cluster. 3. **Infrastructure resource limits** -- AWS VPC subnet IP and EKS API limits were reached, restricting the cluster's ability to scale and schedule new work. 4. **Job prioritization and retry inefficiencies** -- Inefficiencies in job prioritization and retry logic meant lower priority scans (Trivy, Syft, CCA) competed for capacity and were most affected, while the backlog continued to grow. **Actions Taken** • Increased cluster and node pool capacity. • Fixed job prioritization to deprioritize reachability scans. • Capped resource requests for scanner pods to enable efficient scheduling. • Deployed additional fixes to the scanning platform. • Opened AWS support tickets to address resource limits. • Restored monitoring and logging. • Cleared the job backlog; the queue now processes new jobs as they arrive. **Action Items** • Improve monitoring to better understand the behavior of the processing environment. • Improve scanning optimization and prioritization for all scan types.
**Problem**: SAST (Static Application Security Testing) scans for pull requests were running slowly **Impact**: Some users experienced slow pull request scans potentially delaying code reviews and deployments.
The issue was resolved. The system is fully stable now