Nous enquêtons sur les rapports de rendement pour certains services GitHub.
resolved
Cet incident a été résolu. Merci de votre patience et de votre compréhension à l'égard de cette question. Une analyse détaillée des causes profondes sera partagée dès qu'elle sera disponible.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Perturbation avec la révision du code du copilote
Début 4 septembre 2026 à 20:39 UTC · 1h 48m
OutageIncident majeur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
investigating
Certains utilisateurs peuvent subir des défaillances lors de l'utilisation de l'examen du code Copilot. Nous avons identifié la cause profonde et nous travaillons sur une atténuation.
investigating
Nous appliquons les mesures d'atténuation et nous nous attendons au rétablissement dans un délai d'environ 30 minutes.
monitoring
La dégradation a été atténuée. Nous veillons à assurer la stabilité.
resolved
Cet incident a été résolu. Merci de votre patience et de votre compréhension à l'égard de cette question. Une analyse détaillée des causes profondes sera partagée dès qu'elle sera disponible.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec Grok Copilot Modèle fournisseur d'IA
Début 3 septembre 2026 à 14:17 UTC · 2h 54m
IssuesIncident mineur
Composants affectés
Copilot AI Model Providers
investigating
Nous enquêtons sur les rapports de performance dégradée pour Copilot AI Model Providers
investigating
Nous connaissons une disponibilité dégradée pour le modèle Grok 4.6 dans Copilot Chat, VS Code et d'autres produits Copilot. Cela est dû à un problème avec un fournisseur de modèles en amont. Nous travaillons avec eux pour résoudre le problème.
investigating
Le modèle Grok 4.5 a également dégradé la disponibilité. Nous travaillons avec le fournisseur en amont pour résoudre le problème.
investigating
Les problèmes avec notre fournisseur de modèles en amont ont été résolus, et les modèles Grok sont à nouveau disponibles dans les produits Copilot et les surfaces IDE.
Nous continuerons de surveiller pour assurer la stabilité, mais l'atténuation est complète.
resolved
Cet incident a été résolu. Merci de votre patience et de votre compréhension à l'égard de cette question. Une analyse détaillée des causes profondes sera partagée dès qu'elle sera disponible.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Retards dans le traitement des commits
Début 1 septembre 2026 à 15:00 UTC · 1h 1m
IssuesIncident mineur
Composants affectés
Pull Requests
investigating
Nous enquêtons sur les rapports de performance dégradée pour les demandes de tirage
investigating
Les diffuseurs dans la vue PR peuvent être absents pendant plusieurs minutes. Nous enquêtons sur les ressources et les accroissons.
investigating
Le temps de mise à jour des diffs de requêtes de tirage s'est amélioré jusqu'à des seuils normaux.
resolved
Cet incident a été résolu. Merci de votre patience et de votre compréhension à l'égard de cette question. Une analyse détaillée des causes profondes sera partagée dès qu'elle sera disponible.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Taux d'erreur élevé pour les modèles OpenAI fournis par Copilot
Début 31 août 2026 à 09:15 UTC · 42m
IssuesIncident mineur
Composants affectés
Copilot AI Model Providers
investigating
Nous enquêtons sur les rapports de performance dégradée pour Copilot AI Model Providers
investigating
Copilot connaît un taux d'erreurs plus élevé pour les modèles OpenAI, y compris gpt-5.2, gpt-5.3-codex, gpt-5.4, gpt-5.4 et la famille de modèles gpt-5.6. D'autres modèles ne sont pas touchés.
investigating
Un de nos fournisseurs modèles a confirmé un incident à leur fin. Nous leur avons fourni des détails pour aider à cerner le problème. Nous commençons à voir le rétablissement.
monitoring
La dégradation affectant les fournisseurs de modèles d'IA Copilot a été atténuée. Nous veillons à assurer la stabilité.
monitoring
Les problèmes avec notre fournisseur de modèles en amont ont été résolus, et gpt-5.3-codex, gpt-5.4-mini, gpt-5.4-nano, gpt-5.5 et la famille de modèles gpt-5.6 sont de nouveau disponibles dans les produits Copilot et les surfaces IDE.
Nous continuerons de surveiller pour assurer la stabilité, mais l'atténuation est complète.
resolved
Entre 08h37 et 09h41 UTC le 31 août 2026, GitHub Copilot a connu une dégradation touchant plusieurs modèles GPT, dont gpt-5.2, gpt-5.3-codex, gpt-5.4, gpt-5.4-mini, gpt-5.4-nano et la famille gpt-5.6 (Luna, Sol et Terra). Les utilisateurs ont rencontré des taux d'erreur élevés et des réponses en streaming interrompues. D'autres modèles n'ont pas été touchés.
La dégradation a été causée par un problème avec un fournisseur de modèles en amont. Les ingénieurs de GitHub ont détecté le problème au moyen d'une surveillance automatisée, d'avertissements en cours de fabrication pour les modèles touchés et d'une coordination avec le fournisseur. Le service est revenu à la normale après que le fournisseur a mis en place une atténuation.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec les fournisseurs de modèles d'IA Copilot
Début 27 août 2026 à 10:04 UTC · 2h 8m
OutageIncident critique
Composants affectés
Copilot AI Model Providers
investigating
Nous enquêtons sur les rapports de disponibilité dégradée pour les fournisseurs de modèles d'IA Copilot
investigating
Nous connaissons une disponibilité dégradée pour le modèle Kimi K3 dans les produits Copilot et les surfaces IDE. Cela est dû à un problème avec un fournisseur de modèles en amont. Alors que nous travaillons avec eux pour résoudre le problème, nous vous recommandons de choisir un autre modèle ou de sélectionner « Auto » pour continuer à utiliser Copilot.
investigating
Copilot AI Model Providers connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Les problèmes avec notre fournisseur de modèles en amont ont été atténués, et Kimi K3 est à nouveau disponible dans les produits Copilot et les surfaces IDE.
Nous continuerons de surveiller pour assurer la stabilité.
resolved
Le 27 août 2026, entre 09h20 et 12h14 UTC, le service Copilot a subi une dégradation du modèle Kimi K3 en raison d'un problème avec notre fournisseur en amont. Les utilisateurs ont rencontré des taux d'erreur élevés lors de l'utilisation de Kimi K3. Aucun autre modèle n'a été touché.
Le problème a été résolu par une atténuation mise en place par notre fournisseur. GitHub travaille avec notre fournisseur pour améliorer encore la résilience du service afin de prévenir des incidents similaires à l'avenir.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec les actions et les demandes de tirage
Début 26 août 2026 à 22:56 UTC · 1h 30m
IssuesIncident mineur
Composants affectés
Pull RequestsActions
investigating
Nous enquêtons sur les rapports de performance dégradée pour les actions et les demandes de tirage
investigating
Nous enquêtons sur des retards et des délais élevés affectant les opérations de flux de travail Actions déclenchées par des événements de demande de tirage. 20% des opérations ont retardé le démarrage de plus de 5 minutes et jusqu'à 4% des opérations n'ont pas été déclenchées. Nous travaillons activement à l'atténuation et fournirons des mises à jour à mesure que nous en apprendrons davantage.
investigating
Nous avons appliqué des mesures d'atténuation et sommes en train de voir la récupération dans Actions workflow runs et bloqué la requête de tirage fusions. Nous continuons à surveiller la santé soutenue de fusion commit crée avant de résoudre.
investigating
Nous avons confirmé la récupération complète à partir de 23h58 UTC. Actions Les opérations de flux de travail et les fusions de requêtes de tirage fonctionnent normalement. Nous allons maintenant résoudre l'incident tout en continuant à surveiller la santé des services.
monitoring
La dégradation affectant les actions et les demandes de tirage a été atténuée. Nous veillons à assurer la stabilité.
resolved
Le 26 août 2026, de 21h55 UTC à 23h58 UTC, 2,6% des sorties de workflow déclenchées par les requêtes de tirage ont été retardés, l'impact augmentant jusqu'à 25% à son maximum. Certains utilisateurs ont également connu des retards dans la génération de fusion-engagement de requêtes de tirage, les informations de fusion et la disponibilité de boutons de fusion. Actions et demandes de tirage entièrement récupérées à 23h58 UTC; l'incident a été résolu à 00h26 UTC après confirmation du fonctionnement normal.
Les tâches de base qui permettent de tirer les mises à jour des requêtes et de générer des commits de fusion ont été touchées par des temps de sortie atteignant une seule partition de données git. Cela a entraîné un arriéré dans le traitement de fusion-engagement de requêtes de tirage, retardant les flux de travail GitHub Actions de tirage déclenchés et certaines informations de fusion.
Nous avons réduit la charge de travail, déplacé le trafic de l'infrastructure touchée et rétabli la composante de service touchée à un état sain. Ensemble, ces mesures ont permis de résorber l'arriéré et de rétablir des opérations normales.
Nous nous efforçons d'améliorer la détection de la saturation des ressources et d'éliminer l'impact client dans ce scénario en isolant l'impact, en plaçant de meilleures limites sur les rétries et en renforçant la contre-pression pour rendre nos systèmes plus résilients sous charge.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Perturbation avec GitHub Billing
Début 26 août 2026 à 20:40 UTC · 4h 11m
IssuesIncident mineur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
investigating
Nous enquêtons actuellement sur l'augmentation des erreurs avec les services de facturation. Les clients peuvent observer des chargements de pages de budget de facturation défaillants, et les utilisateurs de la CLI Copilot peuvent observer des pannes en début ou en suite de sessions.
investigating
Nous avons appliqué une atténuation pour débloquer l'utilisation de Copilot et avons observé la récupération pour cet impact particulier. Nous continuons d'étudier et d'appliquer des mesures d'atténuation pour la perturbation de la page de facturation pendant la surveillance afin de nous assurer que Copilot reste récupéré.
investigating
Nous continuons de surveiller les mesures d'atténuation que nous avons appliquées pour la perturbation des pages de facturation.
investigating
Notre atténuation se maintient alors que nous continuons d'étudier la cause profonde.
investigating
Notre atténuation continue de se maintenir et les conditions de service demeurent stables. Nous continuons d'étudier la charge de travail concentrée responsable de la question et nous préparons d'autres améliorations préventives. Nous n'avons pas identifié de changement important dans l'impact client depuis la mise à jour précédente. Nous fournirons une autre mise à jour à mesure que l'enquête progressera.
investigating
Aucun changement important depuis la mise à jour précédente. Les conditions de service demeurent stables après l'atténuation, et nous n'avons pas observé d'autres répercussions sur les clients. Nous surveillons activement le service tout en mettant en œuvre des correctifs ciblés pour s'attaquer à la cause fondamentale sous-jacente.
resolved
Le 26 août, 2026, entre 20h40 UTC et 00h51 UTC, le 27 août, GitHub Billing a connu une dégradation de la performance affectant les pages budgétaires de facturation et les sessions de GitHub Copilot CLI. Les clients touchés se sont heurtés à des charges ou des défaillances de pages budgétaires en début ou en fin de session. Nous avons confirmé cet impact pour un petit nombre de clients (<1%).
Cela a été causé par une charge de travail concentrée qui a créé des retards de traitement dans notre couche de stockage des données. Les relevés automatisés ont augmenté la charge et prolongé la dégradation. Nous avons atténué l'incident en rééquilibrant le trafic dans notre infrastructure.
Nous améliorons l'isolement de la charge de travail, le comportement de réessayer et la détection de la charge concentrée pour réduire la probabilité de récidive et raccourcir notre temps pour détecter et atténuer des incidents similaires.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec des actions
Début 26 août 2026 à 15:11 UTC · 2h 50m
OutageIncident critique
Composants affectés
ActionsPages
investigating
Nous enquêtons sur les rapports de disponibilité dégradée pour les actions
investigating
Pages connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Nous avons identifié un problème avec une base de données primaire et nous ne sommes pas sur une réplique immédiatement
investigating
première rupture brièvement amélioré la performance, mais n'a pas complètement atténué, nous avons tronqué le trafic entrant et nous enquêtons sur les problèmes de Vites en amont
investigating
Nous croyons que nous avons identifié et abordé le problème et que nous ramenons le trafic lentement pour nous assurer qu'il ne se reproduise pas. Certains clients continueront de voir des retards au fur et à mesure que nous montons.
investigating
Les pages fonctionnent normalement.
investigating
Nous continuons à observer la reprise et les files d'attente retardées brûlent. Certains clients continueront d'observer des retards accrus jusqu'à ce que tous les travaux tronqués soient terminés - nous nous attendons à cela d'ici une heure.
investigating
Nous continuons à observer la reprise et nous nous attendons à ce que les actions en files d'attente entrantes soient de nouveau normales en moins de 30min. Les travaux se poursuivront à travers le système soumis à des limites de concordance par client.
monitoring
La dégradation affectant les actions a été atténuée. Nous veillons à assurer la stabilité.
monitoring
Toutes les files d'attente entrantes ont été récupérées et Actions fonctionne comme prévu. 3,7 % des emplois assignés aux plus grands coureurs au début de cet incident sont bloqués en attendant l'affectation des coureurs. Ils seront annulés dans l'heure. D'autres coureurs traitent avec succès tous les nouveaux jobs.
resolved
Le 26 août, 2026 de 15:02 à 15:45 UTC, Actions emplois n'a pas commencé. Les 2 heures suivantes jusqu'à 17h40 UTC, les opérations d'actions ont été retardées de plus de 5 minutes car le système a pris du retard. Cet impact a été déclenché par la saturation des écritures à la base de données primaire utilisée par les déclencheurs de traitement de service pour les flux de travail Actions. Le primaire a échoué, mais le système n'a pas complètement récupéré. La saturation a été causée par l'augmentation de la charge maximale quotidienne combinée à un problème en amont dans l'infrastructure de traitement des événements de GitHub, https://www.githubstatus.com/incidents/hcbtzksccj2f, qui a provoqué l'amplification de la charge déjà élevée. Les gaz en aval qui ont été utilisés plus tard pour récupérer ont été réglés ~10% trop haut pour protéger le système.
À 15h45 UTC, le throttling combiné avec les redémarrages de service a récupéré la santé de base du service. Ces gaz ont été progressivement augmentés entre 15:54 et 17:22 pour restaurer le traitement complet du webhook pour les actions. Cette rampe était délibérément lente pour s'assurer que nous n'avons pas re-surmonté le système étant donné que notre étranglement d'origine était maintenant connu pour être mal réglé. La file d'attente des événements de webhook a été complètement brûlée à 17:40 UTC.
3,7 % des emplois les plus performants, ainsi que certains emplois auto-organisés à l'échelle, sont restés bloqués dans la file d'attente ou à attendre pour l'état coureur. Nous avons apporté un changement à des emplois de révocation de la force dans cet état, et ils ont passé à l'échec à 18h40 UTC, environ 50 minutes après l'atténuation des incidents. La libération de ces emplois a également permis d'obtenir des emplois de plus grande envergure.
Les clients utilisant des groupes de convergence ont vu leur impact plus long en raison d'un problème distinct où les coureurs affectés à un sous-ensemble d'emplois déconnectés avant le déploiement de l'atténuation de la révocation de la force, ce qui a empêché l'acquisition des coureurs de progresser et de laisser des emplois dans un état d'attente. Cela a été réglé à 1h00 UTC le 27 août.
Certains tours déclenchés pendant la fenêtre d'incident 15:02-15:45 UTC ont rencontré un bug qui les a laissés en attente même après la récupération du service. Dans le backend, ces runs avaient déjà échoué et vont automatiquement passer à l'état annulé 24 heures après la création. En tant que suivi, nous fixons la cause profonde de cet état en file d'attente et nous améliorons notre capacité d'annuler les courses en vrac.
Plusieurs changements visant à améliorer l'évolutivité générale de cette partie des actions étaient déjà achevés et déployés à la production. Le déploiement de ces changements sera terminé dans les 24 prochaines heures. D'autres travaux visant à améliorer l'échelle, la résilience et la dégradation plus gracieuse des flux de travail Actions sont en vol. Nous prenons également un élément de réparation pour accélérer la compensation des emplois bloqués en attente ou en attente dans des cas similaires futurs.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Perturbation avec certains services GitHub
Début 26 août 2026 à 15:09 UTC · 59m
IssuesIncident mineur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
resolved
Veuillez consulter le résumé combiné de cet incident : https://www.githubstatus.com/incidents/y1t7p9fzrlj2
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Actions retards dans les démarrages
Début 24 août 2026 à 13:33 UTC · 31m
IssuesIncident mineur
Composants affectés
Actions
investigating
Nous enquêtons sur des rapports de performance dégradée pour Actions
investigating
Les échecs lors de la file d'attente et de l'exécution des emplois Actions pour un sous-ensemble de clients sont maintenant résolus. Nous surveillons le rétablissement complet.
monitoring
La dégradation affectant les actions a été atténuée. Nous veillons à assurer la stabilité.
resolved
Le 24 août, 2026, entre 13:33 UTC et 14:04 UTC, 3,8% des actions ont connu des retards de démarrage sur 5 minutes avec 1,25% des actions échouent carrément.
L'incident a été causé par une défaillance du disque sur un noeud hébergeant une des nombreuses instances de service responsables du traitement des événements d'affectation des coureurs. Généralement, les gousses sur les nœuds malsains sont enlevées et remplacées automatiquement sans impact. Dans ce cas, bien que le nœud ait été gravement dégradé et incapable d'effectuer des opérations sur disque, il a continué à envoyer des signaux sains, empêchant le système de déplacer immédiatement ses travaux ailleurs. Au cours de cette période, les événements attribués au composant touché se sont accumulés jusqu'à ce qu'un rééquilibrage automatique soit réorienté vers des composants sains à 13h54 UTC. L'arriéré de la file d'attente a été comblé à 14h00 UTC, et le traitement est retourné à la normale à 14h04 UTC.
Pour éviter une récurrence, nous améliorons la détection et l'assainissement automatisés des nœuds malsains qui ne sont pas complètement hors ligne. Nous renforçons également la résilience au niveau de l'application, de sorte que les consommateurs bloqués sont automatiquement retirés rapidement et leur travail réaffecté sans attendre que le noeud affecté se rétablisse.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Erreurs élevées sur Fable 5 dues au fournisseur en amont
Début 24 août 2026 à 07:12 UTC · 47m
OutageIncident majeur
Composants affectés
Copilot AI Model Providers
investigating
Nous enquêtons sur les rapports de disponibilité dégradée pour les fournisseurs de modèles d'IA Copilot
investigating
Nous connaissons une disponibilité dégradée pour le modèle Fable dans les produits Copilot et les surfaces IDE. Cela est dû à un problème avec le fournisseur de modèles en amont. Alors que nous travaillons avec eux pour résoudre le problème, nous vous recommandons de choisir un autre modèle ou de sélectionner « Auto » pour continuer à utiliser Copilot.
resolved
Le 24 août 2026, entre 06h35 et 07h25 UTC, le service Copilot a subi une dégradation du modèle Claude Fable 5 en raison d'un problème avec notre fournisseur en amont. Les utilisateurs ont rencontré des taux d'erreur élevés lors de l'utilisation de Claude Fable 5, les demandes ayant parfois échoué en milieu de réponse. Aucun autre modèle n'a été touché.
Le problème a été résolu par une atténuation mise en place par notre fournisseur. GitHub travaille avec notre fournisseur pour améliorer encore la résilience du service afin de prévenir des incidents similaires à l'avenir.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Opérations de Git dégradées sur SSH
Début 21 août 2026 à 14:00 UTC · 7m
Pending
resolved
Le 21 août, 2026, entre 14:00 et 14:07 UTC, dotcom Les opérations de Git sur SSH ont été dégradées. Succès Les opérations de Git sur SSH ont chuté de plus de 95 % pendant la fenêtre de pic d'impact, rendant le clone, la récupération ou la poussée sur SSH effectivement indisponible pour la plupart des utilisateurs pendant environ quatre minutes. Les opérations Git sur HTTPS n'ont pas été affectées.
L'incident a été causé par un défaut logiciel dans notre infrastructure d'équilibrage de charge qui a été déclenché par un changement de configuration. Le défaut ne s'est produit que lorsque des connexions ont traversé plusieurs couches de balanceurs de charge exécutant la nouvelle configuration, ce qui signifie qu'il n'a pas été détecté lors des essais canari.
Nous avons atténué l'incident en faisant reculer le changement de configuration.
Nous ajoutons une couverture de régression pour les configurations multicouches d'équilibreur de charge et nous améliorons la surveillance et l'alerte pour les opérations Git sur SSH afin de réduire notre temps pour la détection et l'atténuation de problèmes similaires à l'avenir.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Erreurs intermittentes créant des tâches d'agent
Début 20 août 2026 à 14:43 UTC · 9h 54m
OutageIncident critique
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
investigating
Les utilisateurs peuvent subir des retards lors du démarrage des tâches en utilisant Copilot Cloud Agent. Nous enquêtons activement sur la question et fournirons des mises à jour à mesure que nous en apprendrons davantage.
investigating
Nous avons identifié la composante problématique et nous nous efforçons d'en arriver à un bon exemple. D'autres mises à jour seront fournies lorsque nous effectuerons des mesures d'atténuation.
investigating
Nous rencontrons des problèmes avec les tâches de Copilot Cloud Agent, ce qui a pour conséquence que les tâches nouvellement commencées n'affichent pas correctement les progrès en cours. Ces tâches Copilot Cloud Agent sont toujours en cours d'exécution, mais manquent de visibilité. Nous enquêtons activement sur la question et fournirons des mises à jour à mesure que nous en apprendrons davantage.
investigating
Les utilisateurs connaissent des retards lors du démarrage des tâches en utilisant Copilot Cloud Agent et ne sont pas en mesure de voir l'état de ces tâches. Les tâches de Copilot Cloud Agent sont toujours en cours d'exécution. Nous avons identifié la cause du problème et nous mettons en place des mesures d'atténuation pour rétablir le service à des niveaux normaux. Nous fournirons une autre mise à jour sur la période de rétablissement prévue sous peu.
investigating
Nous voyons des signes de récupération pour la visibilité de l'état des tâches de Copilot Cloud Agent, mais cette récupération est plus lente que prévu. Nous poursuivons des mesures d'atténuation supplémentaires pour accélérer la reprise.
investigating
Nous observons une récupération progressive de la visibilité de l'état des tâches de Copilot Cloud Agent, avec une sortie de session retardée d'environ 1 heure. Nous avons pris des mesures supplémentaires pour accélérer la reprise et continuons de surveiller l'impact.
investigating
Nous continuons d'observer la récupération progressive de la visibilité de l'état des tâches de Copilot Cloud Agent, avec une sortie de session retardée d'environ 1 heure. Nous avons pris des mesures supplémentaires pour accélérer la reprise et continuons de surveiller l'impact.
investigating
Nous continuons d'observer la récupération progressive de la visibilité de l'état des tâches de Copilot Cloud Agent, avec une sortie de session retardée d'environ 1 heure. Nous avons pris d'autres mesures pour accélérer la reprise et nous nous attendons à ce que cette mesure prenne effet d'ici une heure.
investigating
Nous continuons à observer une récupération progressive de la visibilité de l'état des tâches de Copilot Cloud Agent. Les séances continuent d'être retardées d'environ 1 heure à mesure que nos mesures d'assainissement prennent effet.
investigating
Nous assistons à une récupération progressive de la visibilité de l'état des tâches de Copilot Cloud Agent alors que nous déployons une correction pour la cause racine. Le produit de la session reste retardé d'environ une heure pendant que la remise en état se poursuit.
resolved
Entre 13h57 UTC le 20 août et 00h37 UTC le 21 août 2026, certains utilisateurs du Copilot Cloud Agent ont connu des retards de 60 à 90 minutes pour voir l'état et les résultats de leurs tâches d'agent. Les tâches de l'agent elles-mêmes ont continué à fonctionner et à s'achever pendant cette période; seule la visibilité de leur statut a été retardée.
La cause était une panne régionale dans un service de base de données cloud tiers que Copilot utilise pour stocker l'état des tâches d'agent. Nous avons échoué sur la base de données touchée dans une région saine, nous avons augmenté la capacité de traitement pour faire face à l'arriéré et rétabli l'exploitation normale une fois le service sous-jacent récupéré. Aucune donnée n'a été perdue pendant l'incident.
Afin d'éviter la répétition d'incidents similaires, nous supprimons la configuration de la base de données qui nous a rendus vulnérables à cette panne régionale et améliorons nos procédures d'échec de la base de données.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Défauts intermittents dans le groupe de coureurs et les pages de permissions liées aux coureurs
Début 18 août 2026 à 05:02 UTC · 6h 28m
IssuesIncident mineur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
monitoring
Nous enquêtons sur des rapports de non-chargement de groupes de coureurs et des autorisations liées aux coureurs pour les clients utilisant des coureurs plus grands.
monitoring
Nous avons identifié la source d'un problème de communication entre les services Actions et nous travaillons à l'atténuation. Les clients peuvent ne pas charger les groupes de coureurs et les problèmes de permission liés aux coureurs lors de l'utilisation de Grand Runners.
monitoring
Nous avons appliqué une atténuation et voyons des signaux de rétablissement. Nous continuerons de surveiller le rétablissement et de fournir des mises à jour.
resolved
Le 18 août 2026, entre 05:02 UTC et 11:30 UTC, les clients n'ont pas pu consulter ou gérer Actions Runners et Groupes Runner via l'interface utilisateur GitHub et API.
Le problème a été causé par des échecs dans les demandes de backend de lecture des données de coureur et de groupe de coureur. Les échecs ont été causés par un certificat d'authentification expiré unique à ce service. Le certificat avait été mis en rotation dans KeyVault, mais une étape pour permettre son utilisation au moment de l'exécution avait été interrompue afin d'éviter la répétition d'incidents antérieurs déclenchés par cette opération.
L'impact a été atténué par l'achèvement de l'habilitation du nouveau certificat dans le système de moteur. Nous avons ajouté une surveillance supplémentaire à ce certificat et à d'autres. Ce service est également en train d'être remplacé dans le cadre de notre travail de disponibilité et d'échelle, ce qui permet d'aligner ce chemin d'authentification et la gestion secrète sur les modèles de tous les services GitHub.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec des actions
Début 18 août 2026 à 05:02 UTC · 6h 28m
OutageIncident majeur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
resolved
Le 18 août 2026, entre 05h02 UTC et 11h30 UTC, les clients n'ont pas été en mesure d'exécuter des tâches sur Actions Larger Runners et n'ont pas pu consulter ou gérer Actions Runners et Groupes Runner via l'interface utilisateur GitHub et l'API.
Ces problèmes ont été causés par des défaillances dans les requêtes d'arrière-plan qui résolvent les métadonnées essentielles pour le démarrage des flux de travail de Larger Runner et pour la lecture des données des coureurs et des groupes de coureurs. Les échecs ont été causés par un certificat d'authentification expiré unique à ce service. Le certificat avait été remplacé par KeyVault, mais une étape pour permettre son utilisation au moment de l'exécution avait été interrompue afin d'éviter la répétition d'incidents antérieurs déclenchés par cette opération.
Nous avons atténué les problèmes en complétant l'activation du nouveau certificat dans le système de backend. Nous avons ajouté une surveillance supplémentaire à ce certificat et à d'autres. Le service pertinent est également en train d'être remplacé dans le cadre de notre travail de disponibilité et d'échelle, ce qui rend ce chemin d'authentification et la gestion secrète conformes aux modèles de tous les services GitHub.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
investigating
Les demandes d'API connaissent des performances dégradées. Nous continuons d'enquêter.
investigating
Les actions subissent des performances dégradées. Nous continuons d'enquêter.
investigating
Nous constatons un taux d'erreur d'environ 20 % pour de nombreuses expériences, y compris les demandes de tirage, les problèmes et d'autres. Des enquêtes sont en cours et nous afficherons les mises à jour dès qu'elles seront disponibles
investigating
Les demandes de tirage connaissent des performances dégradées. Nous continuons d'enquêter.
investigating
Nous connaissons des taux d'erreur élevés autour de 20% pour les expériences web et le trafic api. Les téléchargements d'archives et les téléchargements de contenu brut de dépôt connaissent un taux d'erreur d'environ 50%. Les enquêtes sont en cours sur la cause fondamentale, et des mises à jour continueront d'être fournies au fur et à mesure de notre enquête.
investigating
Nous connaissons des taux d'erreur élevés autour de 20% pour les expériences web et le trafic api. Les téléchargements d'archives et les téléchargements de contenu brut de dépôt connaissent un taux d'erreur d'environ 50%. L'authentification SAML et OIDC, le SCIM et Team Sync sont également touchés. Les enquêtes sont en cours et nous continuerons de fournir des mises à jour au fur et à mesure que nous découvrirons de plus amples renseignements.
investigating
Copilot connaît une disponibilité dégradée. Nous continuons d'enquêter.
investigating
Les problèmes se dégradent. Nous continuons d'enquêter.
investigating
Les demandes de tirage sont dégradées. Nous continuons d'enquêter.
investigating
La disponibilité des actions est dégradée. Nous continuons d'enquêter.
investigating
Nous connaissons des taux d'erreur élevés autour de 20% pour les expériences web et le trafic api. Les téléchargements d'archives et les téléchargements de contenu brut de dépôt connaissent un taux d'erreur d'environ 50%. L'authentification SAML et OIDC, le SCIM et Team Sync sont également touchés. Nous effectuons actuellement des mesures d'atténuation fondées sur notre enquête jusqu'à présent et nous surveillons les améliorations à apporter.
investigating
Webhooks connaît une disponibilité dégradée. Nous continuons d'enquêter.
investigating
Pages connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Webhooks connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Nous connaissons des taux d'erreur élevés autour de 20% pour les expériences web et le trafic api. Les téléchargements d'archives et les téléchargements de contenu brut de dépôt connaissent un taux d'erreur d'environ 50%. L'authentification SAML et OIDC, le SCIM et Team Sync sont également touchés. Nous effectuons actuellement des mesures d'atténuation et publierons des mises à jour au fur et à mesure des progrès.
investigating
Nous connaissons des taux d'erreur élevés autour de 20% pour les expériences web et le trafic api. Les téléchargements d'archives et les téléchargements de contenu brut de dépôt connaissent un taux d'erreur d'environ 50%. L'authentification SAML et OIDC, le SCIM et Team Sync sont également touchés. Nous travaillons toujours à identifier la cause profonde et continuerons de publier des mises à jour à mesure que nous en apprendrons davantage et que nous effectuerons des mesures d'atténuation.
investigating
Nous avons identifié la composante problématique et pris des mesures correctives. Il y a de forts signes de récupération, mais nous travaillons toujours à restaurer complètement le service, les taux d'erreur restant légèrement élevés. Nous publierons d'autres mises à jour au fur et à mesure que la récupération se poursuivra.
investigating
La dégradation affectant les demandes, les actions, les opérations Git, les questions, les pages, les demandes de tirage et les Webhooks a été atténuée. Nous veillons à assurer la stabilité.
investigating
Git Operations connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Nous avons identifié la composante problématique et pris des mesures correctives, mais nous constatons des répercussions résiduelles sur de nombreux services. Nous continuons d'appliquer des mesures d'atténuation supplémentaires et d'étudier les répercussions restantes.
investigating
Les problèmes se dégradent. Nous continuons d'enquêter.
investigating
Nous avons identifié la composante problématique et avons pris des mesures correctives, mais nous constatons des répercussions résiduelles sous forme de défaillances sporadiques de l'authentification. Nous continuons d'appliquer des mesures d'atténuation supplémentaires et d'étudier les répercussions restantes.
investigating
La dégradation des opérations de Git a été atténuée. Nous veillons à assurer la stabilité.
investigating
Les demandes d'API connaissent une disponibilité dégradée. Nous continuons d'enquêter.
investigating
Les demandes d'API fonctionnent normalement.
investigating
Nous continuons d'étudier les défaillances sporadiques de l'authentification. Nous avons partiellement désactivé les relevés d'authentification et nous avons constaté des améliorations, et nous surveillons l'impact avant d'appliquer pleinement cette atténuation.
investigating
Nous continuons d'étudier les défaillances sporadiques affectant l'authentification Copilot dans certaines applications. L'utilisation du copilote via l'application GitHub CLI et GitHub n'est pas affectée.
investigating
Les problèmes fonctionnent normalement.
investigating
Nous continuons d'appliquer des mesures d'atténuation pour remédier aux défaillances sporadiques de l'authentification Copilot dans certaines applications. Nous attendons une reprise complète dans les 30 prochaines minutes. L'utilisation du copilote via l'application GitHub CLI et GitHub n'est pas affectée.
resolved
Le 17 août, 2026, de 13:28 à 21:15 UTC (7h 47m), GitHub.com a connu des erreurs et des latences élevées à travers les numéros, les demandes de tirage, les API, les actions et le copilote. Au pic, les taux d'erreurs sur le Web et l'API étaient d'environ 20 %, tandis que les téléchargements d'archives et de contenu brut atteignaient environ 50 %. L'authentification SAML/OIDC, le SCIM et Team Sync ont également été touchés, ainsi que les flux de travail Actions dans GHEC avec Data Residency qui dépendent des définitions publiques des étapes de workflow hébergées sur GitHub.com. La plupart des services récupérés par 16:36 UTC comme notre centre de données de Central US ont récupéré; Actions a été dégradé jusqu'à environ 18:03 UTC; et Copilot Token Service entièrement récupéré par 21:02.
Une partie du trafic défaillant a été déplacé du centre des États-Unis vers le nord de la Virginie où il a été desservi avec succès jusqu'à ce que la défaillance du réseau au centre des États-Unis soit débrouillée et résolue. Les réponses différées à un seul paramètre interne ont déclenché un bug de réessayer latent dans le code VS qui a amplifié le trafic d'environ 10x et a causé une récupération retardée pour le service de jeton Copilot.
La cause immédiate de la défaillance a été la saturation du réseau des balanceurs de charge au centre des États-Unis en raison d'un nouveau pic de trafic. À l'origine, cela a été causé par un pod Istio sidecar atteignant ses limites de concurrence et ne pas auto échelle correctement en raison d'une politique mal configurée qui a regardé le service hôte mais pas les limites sidecar. Une défaillance en cascade de plus en plus et finalement quatre nœuds HAProxy ont épuisé leurs limites d'écoulement, dégradant le chemin d'authentification de la passerelle et causant une latence et des défaillances d'authentification généralisées. Le problème a été aggravé par une logique optimiste de ré-essai qui surcharge les balanceurs de charge internes. L'arrêt de HAProxy sur ces noeuds a produit simultanément une récupération immédiate.
L'orage de réessayer dans Northern VA a été corrigé par 1) réduire temporairement la logique de réessayer de passerelle avec un PR et 2) bloquer les demandes de jeton Copilot Token Service à l'arrivée aux balanceurs de charge avec un 403, puis progressivement accélérer le trafic par site pour permettre aux appelants de réussir.
Les défaillances résiduelles d'authentification Copilot se sont poursuivies parce que le client a amplifié le comportement : une opération de jeton échouée pourrait générer de nombreuses requêtes supplémentaires et entrer dans une boucle de réessayer. Le trafic du Copilot Token Service est passé d'un SRP normal de 7-9K à 70-100K. Réduction des retours d'authentification de passerelle et blocage des réponses de déclenchement de réessayer stabilisé Copilot Token Service et la récupération terminée.
Parmi les facteurs qui compliquent la récupération, on peut citer un certain nombre d'attaques à la ferraille sur les paramètres de charge de code.
Pour prévenir la récidive, nos mesures de suivi comprennent :
- Correction des politiques d'échelle automatique pour tenir compte de la proximité et de la capacité des sidecars.
- Vérification de la demande d'Istio, de la concordance et des limites d'échelle entre les services touchés.
- Examiner les limites de réessayer et le comportement de recul entre les passerelles et les clients.
- S'attaquer au comportement de réessayer du code VS qui a amplifié le trafic de jeton Copilot.
- Améliorer la surveillance de la capacité d'équilibrage de la charge et les garanties régionales en cas de défaillance.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Perturbation avec GHEC Team Sync
Début 13 août 2026 à 16:21 UTC · 2h 6m
IssuesIncident mineur
investigating
Nous enquêtons sur les rapports de rendement pour certains services GitHub.
investigating
GHEC Team Sync est actuellement dégradé pour les entreprises ayant des comptes personnels, ce qui entraîne des retards lors de la synchronisation des équipes avec les groupes IdP. Nous avons identifié la cause des retards et nous travaillons sur une atténuation. Nous ferons le point sur nos progrès à 20h00 UTC.
investigating
Nous avons déployé une atténuation. Actuellement, GHEC Team Sync a récupéré pour les entreprises ayant des comptes personnels. Les équipes qui se synchronisent avec les groupes IdP sont revenues à leur cadence normale.
resolved
Le 13 août, 2026, de 15:31:21 UTC à 18:27:55 UTC, la synchronisation de l'équipe GitHub Enterprise Cloud a été dégradée pour les entreprises utilisant des comptes personnels. Les équipes de l'organisation ont connu des retards allant jusqu'à 3 à 13 heures (médiane de 8 heures) lors de la synchronisation avec les groupes IdP, ce qui a retardé les subventions d'accès ou les suppressions pour les utilisateurs de l'entreprise dans 2,8 % des équipes.
Un changement temporaire introduit pour régler une question antérieure en raison de l'utilisation accrue de cette fonction est resté actif après qu'il était prévu de la supprimer, ce qui a entraîné des retards de synchronisation pendant les périodes de volume élevé. Nous avons supprimé le changement temporaire et fourni des ressources supplémentaires pour faire face à l'augmentation du volume.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Incident avec Webhooks
Début 13 août 2026 à 14:45 UTC · 51m
IssuesIncident mineur
Composants affectés
IssuesPackagesPull RequestsWebhooksGit Operations
investigating
Nous enquêtons sur les rapports de performance dégradée pour Webhooks
investigating
Les demandes de tirage connaissent des performances dégradées. Nous continuons d'enquêter.
investigating
Les problèmes se dégradent. Nous continuons d'enquêter.
investigating
Git Operations connaît des performances dégradées. Nous continuons d'enquêter.
investigating
Les paquets connaissent des performances dégradées. Nous continuons d'enquêter.
investigating
Nous enquêtons actuellement sur une brève dégradation du service pour les opérations Git (en particulier les poussées), les problèmes, les demandes de tirage, le registre des paquets et les webhooks entre 14:32 et 14:46 UTC. Nous avons identifié la source de la dégradation et nous étudions des stratégies d'atténuation pour prévenir les récidives.
monitoring
La dégradation affectant les opérations, les problèmes, les paquets, les demandes de tirage et les Webhooks a été atténuée. Nous veillons à assurer la stabilité.
monitoring
Nous avons temporairement désactivé un travail de fond qui a causé l'impact. À l'heure actuelle, l'impact est pleinement atténué.
resolved
Entre 14h24 et 14h53 UTC le 13 août 2026, un travail de fond de routine pour supprimer une organisation a submergé une base de données partagée clé, faisant plusieurs services GitHub à retourner brièvement des erreurs élevées et des réponses plus lentes. La plus touchée a été l'API de gestion de webhook, avec un impact plus faible sur les opérations de Git, les demandes de tirage, les problèmes, les paquets, la connexion et le copilote. L'impact a été résolu seul vers 14h53 UTC une fois le travail terminé; nous avons résolu l'incident à 15h36 UTC.
Les utilisateurs touchés peuvent avoir connu une brève augmentation des erreurs et des réponses plus lentes, principalement lors de la création, de la listage ou de la mise à jour de webhooks, avec des impacts plus faibles pour tirer des requêtes, des problèmes, des paquets et des opérations Git. Les défaillances ont culminé à environ 1% pendant plusieurs minutes autour de 14:37 UTC.
Pour prévenir les incidents futurs, nous avons déjà envoyé une mise à jour qui allume le chemin de suppression plus sûr pour les organisations, ainsi que des plafonds de suppression sur les bases de données. Sur la base de ces changements, nous vérifions tous les travaux de suppression et de nettoyage en vrac qui écrivent dans des bases de données partagées pour éviter des problèmes similaires à l'avenir.
Traduit automatiquement depuis la mise à jour officielle de l'incident.
Erreurs avec le modèle Fable 5 dans le copilote
Début 13 août 2026 à 14:43 UTC · 1h 4m
IssuesIncident mineur
Composants affectés
Copilot AI Model Providers
investigating
Nous enquêtons sur les rapports de performance dégradée pour Copilot AI Model Providers
investigating
Nous connaissons une disponibilité dégradée pour le modèle Fable 5 dans les produits Copilot et les surfaces IDE. Cela est dû à un problème avec un fournisseur de modèles en amont. Alors que nous travaillons avec eux pour résoudre le problème, nous vous recommandons de choisir un autre modèle ou de sélectionner « Auto » pour continuer à utiliser Copilot.
investigating
Nous assistons à une récupération modeste, mais nous vivons toujours une disponibilité dégradée pour le modèle Fable 5 dans les produits Copilot et les surfaces IDE. Cela est dû à un problème avec un fournisseur de modèles en amont. Alors que nous travaillons avec eux pour résoudre le problème, nous vous recommandons de choisir un autre modèle ou de sélectionner « Auto » pour continuer à utiliser Copilot.
investigating
Les problèmes avec notre fournisseur de modèles en amont ont été résolus, et Fable 5 est à nouveau disponible dans les produits Copilot et les surfaces IDE.
Nous continuerons de surveiller pour assurer la stabilité, mais l'atténuation est complète.
resolved
Le 13 août 2026, entre 14h06 et 15h47 UTC, le service Copilot a subi une dégradation du modèle Claude Fable 5 en raison d'un problème avec notre fournisseur en amont. Les utilisateurs ont rencontré des taux d'erreur élevés, atteignant un sommet de 43 % et une moyenne de 12 %. Les utilisateurs qui ont choisi Auto ou modèles alternatifs n'étaient pas touchés.
Le problème a été résolu par une atténuation mise en place par notre fournisseur. GitHub travaille avec notre fournisseur pour améliorer encore la résilience du service afin de prévenir des incidents similaires à l'avenir.
Traduit automatiquement depuis la mise à jour officielle de l'incident.