GitHub incident can affect Cycode
- investigating
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
- resolved
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
46 Cycode incidents · 2026年2月 — official updates, affected components, duration and resolution details.
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
Customers may experience degraded performance in scans. Pull request and CLI scans may be affected.
The team has identified the root cause of the issue and is working on the solution.
The root cause has been resolved. The system began to stabilize itself, and all the scans are starting to get processed with regular performance.
All scan types except for SAST are fully operational. SAST continues to stabilize and will soon be fully stable.
System should be back to being fully operational.
**Root Cause** The incident was caused by a deployment of one service that ran a database index creation. The team has identified an issue with the way we perform index creations as database migrations. During a deployment the pods with newest image of the service attempted to create an index on a big table. The team has identified that the index creation took 7 minutes. However, during index creation pods were not responsive, and as a result, Kubernetes deemed them as unhealthy pods and attempted to retry those pods after 5 minutes. As a result, because the pod got killed before the index creation was fully completed, the database transaction was rolled back. Then, subsequent pods attempted to create the index again, dying after 5 minutes. This lead to the database being in unhealthy state, and the service was down. The team has rolled back the deployment, and killed all replicas that attempted to create the index. Thanks to that, the service and the database was in healthy state again. **Why safety measures did not help** Cycode provides a safety mechanism that unblocks all Pull Request scans after a specific period of time, giving each scan a maximum duration before the Pull Request is unblocked. However, because the service that is responsible for triggering and completing scans, as well as this safety net, was down, the process couldn't behave as expected. We acknowledge this gap and are working on strengthening this area of our system. **Action items** • The team is actively investigating enhancements and new safety protocols that can be put in place in order to have another safety net preventing Pull Request scans being stuck in case of any incident. • The team is investigating changes to the index creation process.
古いイベントが再処理される問題について調査しています。 **影響:** 一部のワークフローが再び実行される可能性があるため、重複したアラートが発生する可能性があります。 PRスキャンも遅延する場合があります.
カフカマイグレーション中に発生した問題による処理バックログを解決しました。 新規イベントと並行して処理される古いイベントで発生した問題は、遅延を引き起こし、古い状況といくつかの違反を更新した可能性があります。 正常な処理は元通りです。 ただし、影響を受けたレコードを識別し、修正する際、お客様は、古いステータスに違反している場合があります。 PRスキャンの遅延や再処理がされていないため、ワークフローは影響しません。 今後も、システムを再監視し、システムを密接に監視しています.
正常な処理は元通りにされ、事件は監視中です。 少数の顧客は、事件の結果として、未定のステータスと違反の限られた数を見ることができます。 影響力のある環境を特定し、影響を受けた記録を修正する取り組みを行っています.
完全運用体制 少数の顧客は、事件の結果として、未定のステータスと違反の限られた数を見ることができます。 影響力のある環境を特定し、影響を受けた記録を修正する取り組みを行っています.
The platform is now fully operational and processing normally
公式のインシデント更新を自動翻訳しています。
チームは、スキャンで劣化したパフォーマンスの問題を特定しました。 スキャンの開始、実行、および完了に遅れがあります。 すべてのスキャンタイプが影響を受ける可能性があります(PullリクエストとCLIスキャンも)。 チームは、展開中の誤動作の問題を特定し、問題はすぐに解決する必要があります.
チームは根本原因を特定し、解決しました。 システムの安定化が進んでいます.
現在、システムが稼働中に戻りました.
**ルート原因** データベースのマイグレーションを実行した1つのサービスの展開によるインシデントが発生しました。 チームは、このマイグレーションは、サービスを展開しようとすると、障害のあるコードが含まれていることを識別しました。 その結果、デプロイが再変換されるまで、サービスは部分的にダウンされました。 今回は、予想以上の性能で全てのスキャン処理を行いました.
公式のインシデント更新を自動翻訳しています。
GitHubコンポーネント: APIリクエスト GitHubインシデント: https://stspg.io/vr201n49yl53
GitHubコンポーネント: APIリクエスト GitHubインシデント: https://stspg.io/vr201n49yl53
公式のインシデント更新を自動翻訳しています。
GitHubコンポーネント: プルリクエスト GitHubインシデント: https://stspg.io/sm1tp7kfm4vj
GitHubコンポーネント: プルリクエスト GitHubインシデント: https://stspg.io/sm1tp7kfm4vj
GitHubコンポーネント: プルリクエスト GitHubインシデント: https://stspg.io/sm1tp7kfm4vj
公式のインシデント更新を自動翻訳しています。
IaCプルリクエストスキャンで劣化した性能に気付きました。 問題のトラブルシューティング.
根本原因を低さで特定し、対策を講じています.
遅くに導いたラグはほぼ上にあります。 状況を監視しています.
問題は解決され、状況を監視し続けています.
公式のインシデント更新を自動翻訳しています。
GitHubコンポーネント: APIリクエスト、プルリクエスト GitHubインシデント: https://stspg.io/j5c80shxqm53
GitHub component: API Requests, Pull Requests Original GitHub incident: https://stspg.io/j5c80shxqm53
公式のインシデント更新を自動翻訳しています。
GitHubコンポーネント: Webhooks GitHubインシデント: https://stspg.io/syhr80rth84z
GitHubコンポーネント: Webhooks、プルリクエスト GitHubインシデント: https://stspg.io/syhr80rth84z
GitHubコンポーネント: Webhooks、プルリクエスト GitHubインシデント: https://stspg.io/syhr80rth84z
公式のインシデント更新を自動翻訳しています。
**1:41** PM EDT では、プラットフォーム UI でのリクエスト処理中にエラー率が高い問題を特定しました。 問題は速やかに緩和され、プラットフォームは現在正常に動作しています。 当社のチームは、サービスの安定性を確保するためにプラットフォームを積極的に監視しています.
インシデントは解決され、プラットフォームは正常に動作しています.
公式のインシデント更新を自動翻訳しています。
弊社では、CLI シークレットのスキャンが失敗する部分に気付きました。 課題を積極的に捉えています.
CLI バージョン 3.17.1 が不具合の挙動を導入したことを認識しました。 CLI バージョンを 3.17.0 に分解すると、問題が一時的に解決し、根本原因を理解し、解決する必要があります.
修正が適用され、機能が完全に復元されます。すべてのものが安定していることを確認するために、私たちは継続的に監視しています.
公式のインシデント更新を自動翻訳しています。
スキャン負荷の増加に伴い、違反状況の更新の遅延を観察しました。これには、違反の自動解決が含まれます。 急増の発生源は緩和され、遅延は既に減少しています。 私達は私達が常態に戻るまで状況を監視し続けます
検出処理を監視し、違反状況の更新に伴う遅延を監視しています(自動解像度を含む)
公式のインシデント更新を自動翻訳しています。
複数のシステムコンポーネントの劣化性能に気づいたしております。 影響を受けた全てのコンポーネントを識別し、根本原因を特定しています.
アプリケーションUIの複数のコンポーネントで劣化したパフォーマンスに気づいた。 スキャン、およびプルリクエストおよびCLIスキャンも影響を受ける可能性があります.
Redis のタイムアウト率を高めるため、 インパクトを軽減し、安定したサービス性能を回復するためのRedisクラスター容量をスケーリングしています
地域は回復し、正常に動作しています。 継続的な安定性を確保するために、システム性能を監視しています
現在、システムが運用中です。 より劣化した性能はありません。 **概要** アプリケーションインターフェースやプルリクエスト(PR)スキャンなど、EU地域のさまざまなシステム機能に影響する、遅延および断続的なタイムアウトの期間を観察しました。 問題は、主に、ネットワークとメモリ容量の制限に達する処理システムによって引き起こされ、単一のソースから自動化された活動の大量化しました。 私たちは、基礎インフラをアップグレードし、システムに影響するような大量の活動を防ぐための安全対策を実施してきました。 問題は完全に解決され、すべてのサービスは予想される性能レベルに戻ってきました。 **キータイムライン(IDT)** •**7月13日、2026、11:44 IDT**: UIの減速とPRスキャン遅延の次のレポートを検出しました。 •**7月13日、2026、12:19 IDT**: インフラボトルネック特定;処理クラスターをアップグレードするために作られた決定。 •**7月13日、2026、12:26 IDT**: 大量の自動化プロセスが特定され、無効化され、即時負荷を削減しました。 •**7月13日、2026、13:09 IDT**: インフラのアップグレードが完了しました。ネットワークスループットは通常のレベルに戻りました。 •**7月13日、2026、15:35 IDT**: すべてのバックログはクリアされ、インシデントは正式に解決されました。 **ルート原因** インシデントは要因の組み合わせによってトリガーされました。処理クラスターは、現在のワークロードのアンダーサイズの構成により、最大ネットワーク帯域幅とメモリ容量に達しました。 これは、更新リクエストの異常に大量の生成された特定の自動化されたワークフローによってさらに緊張しました。 さらに、EU地域のメッセージ処理パイプラインの構成の違いは、システムが結果のバックログを効果的に処理することを防止しました。 **アクション テイクン** •**アップグレードされたインフラ**: 処理クラスターは、より多くのネットワーク帯域幅とメモリを提供するために、大容量のインスタンスタイプにアップグレードされました。 •**Disabled High-Volume Source**:システム安定性を回復させるために、過度のトラフィックを一時的に無効化した特定のクライアント識別子。 •**Restored Connectivity**:アップグレードされたインフラストラクチャへのクリーンな接続を再確立するために、感染したサービスコンポーネントが再起動されました。 • **増加された処理の並列**: 影響を受けたメッセージキュー内のパーティションの数が増加し、システムがバックログをより迅速に処理できるようにしました。 **アクション項目** •**Enhance Monitoring**: 顧客に影響を与える前に、容量の問題を検出するために、ネットワークとメモリ使用のための新しいアラートを実行します。 •**更新ワークフローの最適化**: ステータス更新プロセスをバッチリクエストに再ファクタリングし、処理システムの負荷を大幅に削減します。 •** 増幅率制限**:システムリソースを消費する任意のソースを防ぐための保護策を導入する。 •**地域構成の標準化**: 監査を実施し、すべての地域でインフラストラクチャとメッセージキューの設定が一貫していることを確認します.
公式のインシデント更新を自動翻訳しています。
私たちは、**some**製品ダッシュボードおよび違反データに依存するカスタムダッシュボードパネル(すべてのダッシュボードが影響されない)で**不正確な違反数を引き起こす可能性がある問題を特定しました。 既に修正作業を始めましたが、完了までに時間がかかり、データが修正されたため、カウント変更が表示されることがあります。 修正が終了し、データの正確性が完全に復元されると、別のアップデートを共有します.
私たちは、いくつかの製品やカスタムダッシュボードに影響を与える不正確な違反のカウントを修正する大きな進歩をしました。 • **現在の状態:** 修正は、大多数のアカウントで正常に完了し、完全なデータ精度が復元されました。 •**次のステップ:** 被災した少数のアカウントの課題を積極的に解決しています.
機能性は完全に復元されます。私たちは、すべてが安定していることを確認するために、モニターを継続しています.
公式のインシデント更新を自動翻訳しています。
現在、Maestro Risk Explorability, Risk AI Remediation, Maestro Remediation,Graph AIサービスに関する問題について調査しています.
Maestro AIサービスに影響を及ぼすファイアウォール構成の問題を特定しました。 構成が更新され、影響を受けたサービスは回復しました。 今後も状況を監視し、さらなる安定化に取り組んでいます。 一部の劣化した性能は、追加改善を完了しながらも観察されることがあります.
Maestro AIサービスに関する問題が解決しました。 Maestro Risk Explorability, Risk AI Remediation, Maestro Remediation, Graph AI が利用可能になりました。 **概要** 2026年7月9日、欧州生産環境でマエストロサービスを利用しているお客様は、サービス不当性を経験しました。 問題は、サービスの地域のルーティングを誤って変更した設定更新後に始まりました。 これにより、必要な権限を欠いたネットワークパスと、特定の処理モデルが利用できなくなった地域への接続を試みるシステムが発生しました。 問題は完全に解決され、サービスはすべての影響を受けた顧客に復元されています。 **キータイムライン(IDT)** • ** 7月 9, 2026, 12:02 IDT:** 事故が特定され、調査が開始されました。 •**7月9日、2026、12:07 IDT:** サービスの中断に関する公開通知が発行されました。 • **7月9日、2026、13:00 IDT:** ネットワーク構成の修正が適用され、第一次接続を復元しました。 • ** 7月 9, 2026, 13:39 IDT:** モデルのフォールバックを実装した後、サービスが完全に復元され、インシデントは解決としてマークされました。 **ルート原因** サービスの中断は、認証と設定プロセスの最近の更新によってトリガーされました。 このアップデートは、システムが動作領域を識別する方法で競合を導入しました。 具体的には、自動更新プロセスは、手動設定をオーバーロードし、異なる地域のエンドポイントへのトラフィックをルーティングします。 この新しいパスは、ネットワークセキュリティルールの欠如によってブロックされ、その特定の領域でサポートされていない処理モデルを使用しようとしました。 **アクション テイクン** •**復元ネットワーク接続:** 手動で更新されたネットワークセキュリティルールは、新しい地域のエンドポイントを介して安全なトラフィックを許可します。 •**モデルフォールバック:** 代替処理モデルを使用して、長期の地域の構成が調整された間、即時のサービス可用性を確保するシステムを設定します。 •**更新されたステータスコミュニケーション:** 回復プロセスを通じて、利害関係者や顧客のためのリアルタイムの更新を維持しました。 **アクション項目** • **構成の優先順位を標準化して下さい:** 導入ワークフローを更新し、自動工程をサイレントに重大な環境設定をオーバーライドしないようにします。 •**インフラ監査:** すべての地域のネットワークセキュリティルールの包括的な見直しを行い、一貫性を確保し、同様の接続ギャップを防止します。 •**Enhance 自動監視:** エンドツーエンドのヘルスチェックと合成プローブを実装し、ユーザーに影響を与える前に自動的に地域の接続の問題を検出します。 •**デプロイメントポリシーの改善:** 設定の変更が展開され、生産的な環境で検証されるようにするための新しいガイドラインを確立し、より頻繁に「stale」の更新のリスクを削減します.
公式のインシデント更新を自動翻訳しています。
We are experiencing delays in infrastructure provisioning caused by cloud provider API rate limiting. We are actively investigating the issue with our cloud provider.
Please refer to the AWS Health Status page for details on the related incident: [https://health.aws.amazon.com/health/status](https://health.aws.amazon.com/health/status "https://health.aws.amazon.com/health/status")
Mitigation: We temporarily scaled up the managed node group to get pods scheduled while we wait for AWS to fully resolve the underlying issue.
We are starting to see stabilization and a reduction in API errors. However, we continue to closely monitor the situation.
AWS has confirmed that the issue has been fully mitigated and we are currently not observing any related issues.
**調査 - 違反とカスタムダッシュボード(Prod-US)の問題** 現在、違反が負荷に失敗する当社の**Prod-US**環境で問題を調査しています。 その結果、侵害データに依存するカスタムダッシュボードパネルは、エラーをレンダリングまたは表示することができません。 当社のエンジニアリングチームは、根本的な原因を積極的に探しています。そして、私たちはもっと学びます。 大変申し訳ございません.
Prod-USの侵害やカスタムダッシュボードに影響を及ぼす問題に対して、修正が展開されました。 サービスを完全に復元できるように、環境を積極的に監視しています.
コアの問題が解決され、違反やカスタムダッシュボードが正常に動作するようになりました。 当社のチームは、データの同期を積極的に監視し、新しい違反で残りの矛盾を解決します。 同期が完了すると最終更新を行います.
データの同期プロセスを監視し、UI の新しい違反を監視しています。 機能が復元されていますが、最新のすべてのデータを最大6時間**まで取得し、正確に把握し、反映することができます。 同期が完了すると最終更新を行います.
データの同期が完了し、すべての最近の違反はUIで正常にポップアップしました。 違反とカスタムダッシュボードは正常に機能しており、インシデントは完全に解決されます。 誠に有難うございます.
機能性は完全に復元されます。私たちは、すべてが安定していることを確認するために、モニターを継続しています.
公式のインシデント更新を自動翻訳しています。
We have identified the source of an issue and currently deploying the fix. At the same time we scaled our scanning platform up to accelerate scanning
The fix was deployed. The queue is decreasing and we're monitoring it
The system has processed all jobs with higher priorities. There is a queue of lower priority jobs that should not impact overall Cycode scanning performance
**Summary** During the incident, customers experienced significant delays and temporary disruptions across SAST, SCA, CCA, and Secret repository scans and push events. The issue was caused by a surge in reachability scanner jobs that overwhelmed the processing queue, compounded by scanner pods requesting excessive CPU and memory, infrastructure resource limits being reached, and inefficiencies in job prioritization and retry logic. As a result, processing capacity was improperly consumed and a large job backlog accumulated. A series of corrective updates were deployed to stabilize the environment, and the processing environment has since returned to expected performance levels. **Impact** Customers experienced delays for SAST, SCA, CCA, and Secret repository scans and push events, with some requests delayed by several hours and a peak queue size of over 64,000 jobs. Lower priority scans such as Trivy, Syft, and CCA were most affected, though high-priority jobs were eventually processed without further delay. **Key Timeline (IDT)** • **21.06.2026, 17:16 IDT**: A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly. • **22.06.2026, 10:07 IDT**: The issue was identified by an on-call engineer. • **22.06.2026, 12:55 IDT**: We increased the scanning platform resources to process more jobs. • **22.06.2026, 14:10 IDT**: A fix that lowered new reachability scanners was deployed to production. • **22.06.2026, 18:43 IDT**: Existing reachability scanners' priority was lowered. • **23.06.2026, 09:12 IDT**: Scans with higher priority were processed. Only lower priority scans remained, including CCA. • **23.06.2026, 13:51 IDT**: A fix that reduced communication overload to Kubernetes was deployed. The scanning platform started processing scan jobs much faster. • **23.06.2026, 17:34 IDT**: The queue was fully processed. **Root Cause** The issue was triggered by a combination of factors: 1. **Reachability scanner job surge** -- A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly, which led to resource bottlenecks in the cluster and a peak queue size of over 64,000 jobs. 2. **Excessive pod resource requests** -- Due to configuration bugs, scanner pods requested excessive CPU and memory, which prevented efficient scheduling and amplified the resource bottlenecks in the cluster. 3. **Infrastructure resource limits** -- AWS VPC subnet IP and EKS API limits were reached, restricting the cluster's ability to scale and schedule new work. 4. **Job prioritization and retry inefficiencies** -- Inefficiencies in job prioritization and retry logic meant lower priority scans (Trivy, Syft, CCA) competed for capacity and were most affected, while the backlog continued to grow. **Actions Taken** • Increased cluster and node pool capacity. • Fixed job prioritization to deprioritize reachability scans. • Capped resource requests for scanner pods to enable efficient scheduling. • Deployed additional fixes to the scanning platform. • Opened AWS support tickets to address resource limits. • Restored monitoring and logging. • Cleared the job backlog; the queue now processes new jobs as they arrive. **Action Items** • Improve monitoring to better understand the behavior of the processing environment. • Improve scanning optimization and prioritization for all scan types.
**Problem**: SAST (Static Application Security Testing) scans for pull requests were running slowly **Impact**: Some users experienced slow pull request scans potentially delaying code reviews and deployments.
The issue was resolved. The system is fully stable now