Badamy raporty o wpływowych wynikach niektórych usług GitHub.
resolved
Ten incydent został rozwiązany. Dziękuję za cierpliwość i zrozumienie, które zajęliśmy się tą kwestią. Szczegółowa analiza przyczyn źródłowych zostanie udostępniona jak tylko będzie dostępna.
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
investigating
Niektórzy użytkownicy mogą doświadczać błędów podczas korzystania z Copilot code review. Zidentyfikowaliśmy przyczynę i pracujemy nad łagodzeniem skutków.
investigating
Stosujemy środki łagodzące i oczekujemy poprawy w ciągu około 30 minut.
monitoring
Degradacja została złagodzona. Monitorujemy, by zapewnić stabilność.
resolved
Ten incydent został rozwiązany. Dziękuję za cierpliwość i zrozumienie, które zajęliśmy się tą kwestią. Szczegółowa analiza przyczyn źródłowych zostanie udostępniona jak tylko będzie dostępna.
Badamy raporty o zdegradowanych wynikach dla Copilot AI Model Providers
investigating
Doświadczamy zdegradowanej dostępności modelu Grok 4.6 w Copilot Chat, VS Code i innych produktach Copilot. Wynika to z problemu z dostawcą modelu wyższego szczebla. Pracujemy z nimi nad rozwiązaniem problemu.
investigating
Model Grok 4.5 również pogorszył dostępność. Pracujemy z dostawcą wyższego szczebla nad rozwiązaniem tej kwestii.
investigating
Zagadnienia z naszym dostawcą modelu wyższego szczebla zostały rozwiązane, a modele Grok są ponownie dostępne w produktach Copilot i powierzchniach IDE.
Będziemy kontynuować monitorowanie w celu zapewnienia stabilności, ale łagodzenie skutków jest zakończone.
resolved
Ten incydent został rozwiązany. Dziękuję za cierpliwość i zrozumienie, które zajęliśmy się tą kwestią. Szczegółowa analiza przyczyn źródłowych zostanie udostępniona jak tylko będzie dostępna.
Badamy raporty o zdegradowanych wynikach dla wniosków o pomoc
investigating
Różnice w widoku PR mogą być nietrwałe przez kilka minut. Badamy i zwiększamy zasoby.
investigating
Czas na aktualizację różnic w żądaniu przyciągnięcia poprawił się do normalnych progów.
resolved
Ten incydent został rozwiązany. Dziękuję za cierpliwość i zrozumienie, które zajęliśmy się tą kwestią. Szczegółowa analiza przyczyn źródłowych zostanie udostępniona jak tylko będzie dostępna.
Podwyższony wskaźnik błędów dla modeli OpenAI dostarczanych przez Copilot
Początek 31 sierpnia 2026 09:15 UTC · 42m
IssuesDrobny incydent
Dotknięte komponenty
Copilot AI Model Providers
investigating
Badamy raporty o zdegradowanych wynikach dla Copilot AI Model Providers
investigating
Copilot doświadcza wyższego wskaźnika błędów dla modeli OpenAI, w tym gpt- 5.2, gpt- 5.3- Codex, gpt- 5.4, gpt- 5.4 oraz rodziny modeli gpt- 5.6. Inne modele nie mają wpływu.
investigating
Jeden z naszych dostawców modeli potwierdził incydent. Podaliśmy im szczegóły, aby pomóc zidentyfikować problem. Zaczynamy dostrzegać powrót do zdrowia.
monitoring
Degradacja wpływająca na Copilot AI Model Providers została złagodzona. Monitorujemy, by zapewnić stabilność.
monitoring
Problemy z naszym dostawcą modelu wyższego szczebla zostały rozwiązane, a gpt- 5.3- kod, gpt- 5.4- mini, gpt- 5.4-nano, gpt- 5.5 oraz rodzina gpt- 5.6 modeli są ponownie dostępne w produktach Copilot i powierzchniach IDE.
Będziemy kontynuować monitorowanie w celu zapewnienia stabilności, ale łagodzenie skutków jest zakończone.
resolved
Między 08: 37 a 09: 41 UTC w dniu 31 sierpnia 2026, GitHub Copilot doświadczył degradacji wpływającej na kilka modeli GPT, w tym gpt- 5.2, gpt- 5.3- Codex, gpt- 5.4, gpt- 5.4- mini, gpt- 5.4- nano i rodzinę gpt- 5.6 (Luna, Sol i Terra). Użytkownicy napotkali podwyższony poziom błędów i przerwali strumieniowanie odpowiedzi. Inne modele nie zostały naruszone.
Degradacja była spowodowana problemem z dostawcą modelu wyższego szczebla. Inżynierowie GitHub wykryli ten problem poprzez zautomatyzowane monitorowanie, wyświetlanie ostrzeżeń w produktach dla dotkniętych modeli i koordynowanie z dostawcą. Usługa wróciła do normy po wdrożeniu przez dostawcę środków łagodzących.
Badamy raporty o zdegradowanej dostępności dla Copilot AI Model Providers
investigating
Doświadczamy zdegradowanej dostępności modelu Kimi K3 w produktach Copilot i powierzchniach IDE. Wynika to z problemu z dostawcą modelu wyższego szczebla. Podczas gdy pracujemy z nimi, aby rozwiązać problem, zalecamy wybór innego modelu lub wybór 'Auto', aby kontynuować korzystanie z Copilot.
investigating
Copilot AI Model Providers doświadcza zdegradowanej wydajności. Kontynuujemy śledztwo.
investigating
Zagadnienia z naszym dostawcą modelu wyższego szczebla zostały złagodzone, a Kimi K3 jest ponownie dostępny w produktach Copilot i powierzchniach IDE.
Będziemy nadal monitorować, aby zapewnić stabilność.
resolved
W dniu 27 sierpnia 2026 r., w okresie od około 09: 20 do 12: 14 UTC, usługa Copilot doświadczyła degradacji modelu Kimi K3 ze względu na problem z naszym dostawcą wyższego szczebla. Użytkownicy napotkali podwyższony poziom błędów podczas korzystania z Kimi K3. Żaden inny model nie został naruszony.
Problem ten został rozwiązany przez złagodzenie wprowadzone przez naszego dostawcę. GitHub współpracuje z naszym dostawcą w celu dalszej poprawy trwałości usługi, aby zapobiec podobnym incydentom w przyszłości.
Badamy raporty o zdegradowanych wynikach działań i wniosków o uruchomienie
investigating
Prowadzimy śledztwo w sprawie zwiększonych opóźnień i przerw czasowych, które wpływają na przepływ pracy działań wywołany przez zdarzenia z zapytaniem. 20% akcji rozpoczęło się później niż 5 minut, a do 4% nie udało się uruchomić. Aktywnie pracujemy nad łagodzeniem skutków zmiany klimatu i będziemy dostarczać aktualizacje, kiedy dowiemy się więcej.
investigating
Zastosowaliśmy środki łagodzące i widzimy ożywienie w operacjach Akcji i zablokowanych połączeniach żądania ciągnięcia. Kontynuujemy monitorowanie dla trwałego zdrowia commit fusion tworzy przed rozwiązaniem.
investigating
Potwierdziliśmy pełną rekonwalescencję od 23: 58 UTC. Przebieg przepływu pracy i połączenia z żądaniami są normalnie obsługiwane. Teraz rozwiążemy ten incydent, monitorując zdrowie służby.
monitoring
Degradacja wpływająca na działania i wnioski o Pull została złagodzona. Monitorujemy, by zapewnić stabilność.
resolved
W dniu 26 sierpnia 2026 r., z 21: 55 UTC do 23: 58 UTC, 2,6% przepływów pracy wywołanych przez zdarzenia prowokujące żądanie przyciągnięcia było opóźnionych, a wpływ wzrasta aż do 25% przy jego szczycie. Niektórzy użytkownicy doświadczyli także opóźnień w generowaniu zleceń typu merge- commit, informacji dotyczących możliwości łączenia oraz dostępności przycisku merge-. Działania i wnioski o wyciąg zostały w pełni odzyskane do 23: 58 UTC; incydent został rozwiązany o 00: 26 UTC po potwierdzeniu normalnej operacji.
Tło zadania, które przetwarzają aktualizacje prośby i generują połączenia, zostały naruszone przez timeout do jednej partycji danych git. Spowodowało to zaległości w przetwarzaniu wniosku o połączenie, opóźnianie procesu wycofywania wywołanego przez GitHub Actions Workflow and some mergeable information.
Zredukowaliśmy obciążenie pracą, przesunęliśmy ruch z dotkniętej infrastruktury i przywróciliśmy dotknięty komponent usługowy do zdrowego stanu. Razem działania te pomogły odciągnąć zaległości i przywrócić normalne operacje.
Pracujemy nad poprawą wykrywania nasycenia zasobów i wyeliminowaniem wpływu na klientów w tym scenariuszu poprzez izolację oddziaływania, lepsze granice na powtórne próby oraz wzmocnienie presji odwrotnej w celu zwiększenia odporności naszych systemów pod obciążeniem.
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
investigating
Obecnie badamy zwiększone błędy w usługach rozliczeniowych. Klienci mogą obserwować nieudaną fakturowanie obciążenia strony budżetowej, a użytkownicy Copilot CLI mogą obserwować błędy rozpoczynające lub kontynuujące sesje.
investigating
Zastosowaliśmy środki łagodzące, aby odblokować użycie Copilot i obserwowaliśmy odzysk dla tego konkretnego uderzenia. Badamy i stosujemy środki łagodzące zakłócenia na stronie rozliczeniowej, a jednocześnie monitorujemy, czy Copilot nie został odzyskany.
investigating
Kontynuujemy monitorowanie łagodzenia, które złożyliśmy w związku z zakłóceniami na stronie rozliczeniowej.
investigating
Nasze środki łagodzące wciąż trwają, a my kontynuujemy śledztwo, by znaleźć przyczynę.
investigating
Nasze środki łagodzące utrzymują się, a warunki pracy pozostają stabilne. Kontynuujemy badanie skoncentrowanego nakładu pracy odpowiedzialnego za tę kwestię i przygotowujemy dodatkowe ulepszenia zapobiegawcze. Od poprzedniej aktualizacji nie zidentyfikowaliśmy istotnej zmiany w wpływie na klienta. Dostarczymy kolejną aktualizację w trakcie śledztwa.
investigating
Brak istotnych zmian od poprzedniej aktualizacji. Warunki świadczenia usług pozostają stabilne po złagodzeniu skutków, a my nie zaobserwowaliśmy żadnych dalszych skutków dla klientów. Aktywnie monitorujemy usługę, wdrażając ukierunkowane poprawki, aby rozwiązać podstawową przyczynę.
resolved
26 sierpnia 2026 r., między 20: 40 UTC a 00: 51 UTC 27 sierpnia, GitHub Billing doświadczyło zdegradowanych wyników wpływających na rozliczanie stron budżetowych i sesji GitHub Copilot CLI. Dotknięci klienci napotkali nieudane obciążenia lub niepowodzenia strony budżetowej podczas uruchamiania lub kontynuowania sesji CLI. Potwierdziliśmy ten wpływ dla niewielkiej liczby klientów (< 1%).
Spowodowało to skoncentrowane obciążenie pracą, które spowodowało opóźnienia przetwarzania w warstwie przechowywania danych. Automatyczne ponowne próby zwiększały obciążenie i wydłużały degradację. Złagodziliśmy ten incydent poprzez przywrócenie równowagi ruchu w naszej infrastrukturze.
Poprawiamy izolację pracy, sprawdzamy zachowanie i wykrywamy skoncentrowany ładunek, aby zmniejszyć prawdopodobieństwo nawrotu i skrócić czas na wykrywanie i łagodzenie podobnych zdarzeń.
Strony doświadczają zdegradowanej wydajności. Kontynuujemy śledztwo.
investigating
Zidentyfikowaliśmy problem z bazą danych i natychmiast nie udaje się do repliki
investigating
pierwsze awarie krótko poprawiła wydajność, ale nie w pełni złagodzić, zahamowaliśmy ruch w drodze i badamy problemy Vitess
investigating
Uważamy, że zidentyfikowaliśmy i zajęliśmy się tym problemem i powoli podnosimy ruch, aby upewnić się, że się nie powtórzy. Niektórzy klienci będą nadal dostrzegać opóźnienia, gdy podniesiemy się.
investigating
Strony działają normalnie.
investigating
Wciąż obserwujemy powrót do zdrowia i płoną opóźnione kolejki. Niektórzy klienci będą nadal dostrzegać coraz większe opóźnienia aż do zakończenia wszystkich zatłoczonych prac - spodziewamy się tego w ciągu następnej godziny.
investigating
Kontynuujemy obserwację powrotu do zdrowia i oczekujemy, że działania przychodzące do kolejki powrócą do normy w < 30min. Prace będą nadal przepływać przez system z zastrzeżeniem limitów konkursowych klienta.
monitoring
Degradacja oddziałująca na działania została złagodzona. Monitorujemy, by zapewnić stabilność.
monitoring
Wszystkie przychodzące kolejki odzyskały moc i działania działają zgodnie z oczekiwaniami. 3.7% miejsc pracy przydzielonych większej liczbie biegaczy na wczesnym etapie tego incydentu utknęło w oczekiwaniu na przydział dla biegaczy. Będą odwołane w ciągu godziny. Inni biegacze z powodzeniem przetwarzają wszystkie nowe miejsca pracy.
resolved
26 sierpnia 2026 z 15: 02 do 15: 45 UTC, Akcje nie rozpoczęły się. Następne 2 godziny do 17: 40 UTC, Działania były opóźnione począwszy od ponad 5 minut, jak system złapany z opóźnionym obciążeniem. Wpływ ten został wywołany nasyceniem zapisu do bazy danych podstawowej wykorzystywanej przez urządzenia do przetwarzania usług dla przepływów roboczych działań. Podstawowy nie powiódł się, ale system nie w pełni odzyskał. Saturacja była spowodowana rosnącym dziennym szczytowym obciążeniem w połączeniu z problemem wyższego szczebla w infrastrukturze przetwarzania zdarzeń firmy GitHub, https: / / www.githubstatus.com / invents / hcbtzksccj2f, co spowodowało wzmocnienie rozrywającego się wysokiego obciążenia. Prądnice, które później były używane do odzyskiwania, zostały ustawione ~ 10% za wysoko, aby chronić system.
O godzinie 15: 45 UTC, w połączeniu z uruchomieniem usługi ponownie odzyskano podstawowe zdrowie usługi. Te przepustnice były stopniowo podnoszone między 15: 54 a 17: 22, aby przywrócić pełne przetwarzanie haków dla akcji. Ta rampa była celowo powolna, aby upewnić się, że nie ponownie prześcignąć system, biorąc pod uwagę nasze pierwotne przepustowość, teraz wiadomo, że jest nieprawidłowo ustawione. Kolejka wydarzeń webhook została całkowicie spalona o 17: 40 UTC.
3,7% miejsc pracy prowadzących działalność na dużą skalę, wraz z kilkoma miejscami pracy w samolotach, pozostało w kolejce lub w stanie "czekania na biegacza". Zrezygnowaliśmy z pracy w tym stanie, a oni zawiedli o 18: 40 UTC, około 50 minut po złagodzeniu incydentów. Zwolnienie tych miejsc pracy również uwolnione hostingowe współzależności dla miejsc pracy dużych biegaczy.
Klienci korzystający z grup kontraktacji odnotowali dłuższy wpływ z powodu odrębnego problemu, w którym biegacze przypisani do podzbioru miejsc pracy odłączyli się przed wdrożeniem środków łagodzących, co uniemożliwiło nabycie przez biegacza nowych miejsc pracy w stanie oczekiwania. Zostało to rozwiązane 27 sierpnia o godzinie 01: 00 UTC.
Niektóre uruchomione podczas okna zdarzenia UTC 15: 02- 15: 45 napotkały błąd, który zostawił je w kolejce nawet po odzyskaniu usługi. W tle, te operacje już nie powiodły się i automatycznie przeniesie się do stanu anulowanego 24 godziny po utworzeniu. Jako kontynuacja, ustalamy przyczynę tego stanu w kolejce i poprawiając naszą zdolność do bulk-cancel dotknięte biegi.
Kilka zmian mających na celu poprawę ogólnej skalowalności tej części działań już zakończono i wprowadzono do produkcji. Wycofanie się z tych zmian nastąpi w ciągu najbliższych 24 godzin. Trwają dalsze prace mające na celu poprawę skali, odporności i pełniejszej degradacji działań. Bierzemy również element naprawczy, aby przyspieszyć oczyszczenie utkniętych miejsc pracy w kolejce lub oczekujących na pracę w podobnych przyszłych przypadkach.
Niepowodzenia podczas stania w kolejce i prowadzenia działań dla podzbioru klientów są obecnie rozwiązywane. Monitorujemy pełną rekonwalescencję.
monitoring
Degradacja oddziałująca na działania została złagodzona. Monitorujemy, by zapewnić stabilność.
resolved
24 sierpnia 2026 r., między 13: 33 UTC a 14: 04 UTC, 3,8% Akcji doświadczyło opóźnień w ciągu 5 minut, a 1,25% Akcji działa bez powodzenia.
Incydent został spowodowany przez awarię dysku na węźle hostującym jeden z wielu instancji serwisowych odpowiedzialnych za przetwarzanie zdarzeń przydziałów runner. Zazwyczaj kapsuły na niezdrowych węzłach są usuwane i wymieniane automatycznie bez uderzenia. W tym przypadku, mimo że węzeł został poważnie zdegradowany i nie mógł wykonać operacji na dysku, nadal wysyłał zdrowe sygnały, uniemożliwiając systemowi natychmiastowe przeniesienie pracy gdzie indziej. W tym okresie zdarzenia przypisane do dotkniętego komponentu nagromadziły się aż do automatycznego przywrócenia równowagi przekierowywanej do zdrowych składników o 13: 54 UTC. Backlog kolejki został wyczyszczony o 14: 00 UTC, a przetwarzanie wróciło do normy do 14: 04 UTC.
Aby zapobiec nawrotom, ulepszamy wykrywanie i automatyczną rekultywację niezdrowych węzłów, które nie są w pełni wyłączone. Wzmacniamy również odporność na stosowanie, tak więc opóźnieni konsumenci są automatycznie usuwani szybko, a ich praca zostaje przeniesiona bez czekania na odzyskanie dotkniętego węzła.
Podwyższone błędy w Fable 5 dzięki dostawcy wyższego szczebla
Początek 24 sierpnia 2026 07:12 UTC · 47m
OutagePoważny incydent
Dotknięte komponenty
Copilot AI Model Providers
investigating
Badamy raporty o zdegradowanej dostępności dla Copilot AI Model Providers
investigating
Doświadczamy zdegradowanej dostępności modelu Fable w produktach Copilot i powierzchniach IDE. Wynika to z problemu z dostawcą modelu wyższego szczebla. Podczas gdy pracujemy z nimi, aby rozwiązać problem, zalecamy wybór innego modelu lub wybór 'Auto', aby kontynuować korzystanie z Copilot.
resolved
24 sierpnia 2026 r., od około 06: 35 do 07: 25 UTC, usługa Copilot doświadczyła degradacji modelu Claude Fable 5 ze względu na problem z naszym dostawcą wyższego szczebla. Użytkownicy napotkali podwyższone poziomy błędów podczas korzystania z Claude Fable 5, przy czym wnioski czasami nie reagują w połowie. Żaden inny model nie został naruszony.
Problem ten został rozwiązany przez złagodzenie wprowadzone przez naszego dostawcę. GitHub współpracuje z naszym dostawcą w celu dalszej poprawy trwałości usługi, aby zapobiec podobnym incydentom w przyszłości.
21 sierpnia 2026, między 14: 00 a 14: 07 UTC, dotcom Operacje git nad SSH zostały zniszczone. Udane Operacje Git nad SSH spadły o ponad 95% w okresie szczytowego okna uderzenia, tworząc klon, pobrać lub przepchnąć SSH skutecznie niedostępne dla większości użytkowników przez około cztery minuty. Operacje Git nad HTTPS nie uległy zmianie.
Incydent został spowodowany wadą oprogramowania w naszej infrastrukturze równoważenia obciążenia, która została wywołana przez zmianę konfiguracji. Wada wystąpiła tylko wtedy, gdy połączenia przechodziły przez wiele warstw balansorów obciążenia uruchamiających nową konfigurację, co oznaczało, że nie została wykryta podczas testów kanaryjskich.
Złagodziliśmy ten incydent cofając zmianę konfiguracji.
Dodamy pokrycie regresji dla wielowarstwowych konfiguracji load- balancer oraz ulepszamy monitorowanie i ostrzeganie operacji Git nad SSH, aby skrócić czas na wykrywanie i łagodzenie podobnych problemów w przyszłości.
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
investigating
Użytkownicy mogą odczuwać opóźnienia podczas uruchamiania zadań przy użyciu Copilot Cloud Agent. Aktywnie badamy tę kwestię i przedstawimy jej aktualizacje, kiedy dowiemy się więcej.
investigating
Zidentyfikowaliśmy problematyczny komponent i pracujemy nad tym, by przełożyć go na zdrowy przypadek. Dalsze aktualizacje zostaną dostarczone w miarę jak będziemy wykonywać ograniczenia.
investigating
Mamy do czynienia z problemami z zadaniami Copilot Cloud Agent, co powoduje, że nowo rozpoczęte zadania nie wyświetlają się poprawnie na bieżąco postęp. Te zadania Copilot Cloud Agent są nadal prawidłowo realizowane, ale brak odpowiedniej widoczności. Aktywnie badamy tę kwestię i przedstawimy jej aktualizacje, kiedy dowiemy się więcej.
investigating
Użytkownicy doświadczają opóźnień podczas uruchamiania zadań przy użyciu Copilot Cloud Agent i nie są w stanie zobaczyć statusu tych zadań. Copilot Cloud Agent zadania są nadal w toku. Zidentyfikowaliśmy przyczynę problemu i wprowadzamy środki łagodzące w celu przywrócenia normalnego poziomu usług. Wkrótce przedstawimy kolejne informacje na temat oczekiwanego czasu powrotu do zdrowia.
investigating
Widzimy oznaki powrotu do zdrowia dla widoczności programu Copilot Cloud Agent, ale ten stan jest wolniejszy niż przewidywano. Prowadzimy dodatkowe działania łagodzące w celu przyspieszenia ożywienia gospodarczego.
investigating
Obserwujemy stopniową rekonwalescencję funkcji Copilot Cloud Agent, przy czym wynik sesji opóźnia się o około 1 godzinę. Podjęliśmy dodatkowe kroki w celu przyspieszenia ożywienia gospodarczego i nadal monitorujemy skutki.
investigating
Kontynuujemy obserwację stopniowej regeneracji funkcji Copilot Cloud Agent, przy czym wynik sesji opóźnia się o około 1 godzinę. Podjęliśmy dodatkowe kroki w celu przyspieszenia ożywienia gospodarczego i nadal monitorujemy skutki.
investigating
Kontynuujemy obserwację stopniowej regeneracji funkcji Copilot Cloud Agent, przy czym wynik sesji opóźnia się o około 1 godzinę. Podjęliśmy dodatkowe kroki w celu przyspieszenia ożywienia gospodarczego i oczekujemy, że nastąpi to w ciągu następnej godziny.
investigating
Kontynuujemy obserwację stopniowej regeneracji funkcji Copilot Cloud Agent. Wyjście z sesji jest nadal opóźnione o około 1 godzinę, gdy nasze działania naprawcze stają się skuteczne.
investigating
Obserwujemy stopniową rekonwalescencję w programie Copilot Cloud Agent. Wyjście sesyjne pozostaje opóźnione o około godzinę, a rekultywacja trwa.
resolved
Między 13: 57 UTC w dniu 20 sierpnia a 00: 37 UTC w dniu 21 sierpnia 2026, niektórzy użytkownicy Copilot Cloud Agent doświadczyli opóźnień do 60 do 90 minut w obserwacji statusu i wyników swoich zadań agenta. W tym czasie agent wykonywał swoje zadania i wykonywał zadania; tylko widoczność ich statusu była opóźniona.
Przyczyną było regionalne przestoje w trzeciej partii chmur usługi bazy danych, że Copilot używa do przechowywania agenta status zadania. Nie udało nam się przejść przez dotkniętą bazę danych do zdrowego regionu, dodaliśmy zdolność przetwarzania do pracy przez zaległości, i przywrócić normalne działanie po odzyskaniu usługi podstawowej. Podczas incydentu nie zgubiono żadnych danych.
Aby zapobiec powtórzeniu się podobnych incydentów, usuwamy konfigurację bazy danych, która sprawiła, że byliśmy narażeni na ten regionalny przestój i poprawiamy procedury przezwyciężania awarii bazy danych.
Nieregularne awarie na stronach grup biegaczy i związanych z bieganiem
Początek 18 sierpnia 2026 05:02 UTC · 6h 28m
IssuesDrobny incydent
investigating
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
monitoring
Prowadzimy śledztwo w sprawie niezaładowania grup biegaczy i uprawnień związanych z bieganiem dla klientów korzystających z większych biegaczy.
monitoring
Zidentyfikowaliśmy źródło problemu komunikacji między służbami ds. działań i pracujemy nad łagodzeniem skutków. Klienci mogą doświadczyć braku załadowania grup biegaczy i problemów związanych z uprawnieniami do startowania podczas korzystania z większych biegaczy.
monitoring
Zastosowaliśmy środki łagodzące i widzimy sygnały regeneracji. Będziemy nadal monitorować odzysk i dostarczać aktualizacje.
resolved
W dniu 18 sierpnia 2026 r., między 05: 02 UTC a 11: 30 UTC, klienci nie byli w stanie przeglądać działań Runners i grup Runner poprzez GitHub UI i API ani zarządzać nimi.
Problem ten został spowodowany niepowodzeniem w próbach dotyczących odczytu danych biegacza i grupy biegaczy. Usterki zostały spowodowane przez wygasły certyfikat uwierzytelniania unikalny dla tej usługi. Certyfikat został obrócony w KeyVault, ale krok w celu umożliwienia użycia w czasie biegu został wstrzymany w celu zapobieżenia nawrotom poprzednich incydentów wywołanych przez tę operację.
Wpływ został złagodzony poprzez ukończenie procesu tworzenia nowego certyfikatu w systemie oparcia. Dodaliśmy dodatkowe monitorowanie do tego i innych certyfikatów. Usługa ta jest również w trakcie zastępowania w ramach naszej pracy w zakresie dostępności i skali, zapewniając tę ścieżkę uwierzytelniania i tajne zarządzanie zgodne z wzorcami we wszystkich usługach GitHub.
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
resolved
W dniu 18 sierpnia 2026 r., między 05: 02 UTC a 11: 30 UTC, klienci nie byli w stanie prowadzić pracy na Akcje Większe Runners i nie byli w stanie oglądać działań Runners i Grupy Runner poprzez GitHub UI i API.
Kwestie te wynikały z błędów w żądaniach dotyczących rozwiązywania istotnych metadanych do rozpoczęcia pracy w ramach programu Larger Runner oraz do odczytu danych dla biegaczy i grup biegaczy. Usterki zostały spowodowane przez wygasły certyfikat uwierzytelniania unikalny dla tej usługi. Certyfikat został obrócony w KeyVault, ale krok w celu umożliwienia użycia w czasie biegu został wstrzymany w celu zapobieżenia nawrotom poprzednich incydentów, które zostały wywołane przez tę operację.
Ułatwiliśmy te kwestie poprzez ukończenie procesu tworzenia nowego certyfikatu w systemie backend. Dodaliśmy dodatkowe monitorowanie do tego i innych certyfikatów. Stosowna usługa jest również w trakcie zastępowania w ramach naszej pracy w zakresie dostępności i skali, dostosowując tę ścieżkę uwierzytelniania i tajne zarządzanie do wzorców we wszystkich usługach GitHub.
Obserwujemy około 20% poziom błędu w wielu doświadczeniach, w tym prośbach o pomoc, problemach i innych. Badania są obecnie w toku i będziemy wysyłać aktualizacje, jak staną się dostępne
investigating
Wyciąganie wniosków ma zdegradowaną wydajność. Kontynuujemy śledztwo.
investigating
Mamy wysoki poziom błędów około 20% dla doświadczeń internetowych i ruchu api. Pobieranie archiwów i pobieranie zawartości surowych repozytoriów ma przybliżony poziom błędu 50%. Badania są w toku do przyczyny, i aktualizacje będą nadal dostarczane w trakcie badania.
investigating
Mamy wysoki poziom błędów około 20% dla doświadczeń internetowych i ruchu api. Pobieranie archiwów i pobieranie zawartości surowych repozytoriów ma przybliżony poziom błędu 50%. Na uwierzytelnianie SAML i OIDC, SCIM i Team Sync również mają wpływ. Badania są w toku i będziemy nadal dostarczać aktualizacje, jak odkrywamy więcej informacji.
investigating
Copilot ma zdegradowaną dostępność. Kontynuujemy śledztwo.
investigating
Kwestie te doświadczają zdegradowanej dostępności. Kontynuujemy śledztwo.
investigating
Prośby o wyciąg doświadczają pogarszonej dostępności. Kontynuujemy śledztwo.
investigating
Działania doświadczają zdegradowanej dostępności. Kontynuujemy śledztwo.
investigating
Mamy wysoki poziom błędów około 20% dla doświadczeń internetowych i ruchu api. Pobieranie archiwów i pobieranie zawartości surowych repozytoriów ma przybliżony poziom błędu 50%. Na uwierzytelnianie SAML i OIDC, SCIM i Team Sync również mają wpływ. Obecnie realizujemy ograniczenia oparte na dotychczasowym dochodzeniu i monitorujemy poprawę.
investigating
Haki internetowe doświadczają zdegradowanej dostępności. Kontynuujemy śledztwo.
investigating
Strony doświadczają zdegradowanej wydajności. Kontynuujemy śledztwo.
investigating
Haki internetowe doświadczają zdegradowanej wydajności. Kontynuujemy śledztwo.
investigating
Mamy wysoki poziom błędów około 20% dla doświadczeń internetowych i ruchu api. Pobieranie archiwów i pobieranie zawartości surowych repozytoriów ma przybliżony poziom błędu 50%. Na uwierzytelnianie SAML i OIDC, SCIM i Team Sync również mają wpływ. Obecnie realizujemy ograniczenia i będziemy publikować aktualizacje w miarę postępów.
investigating
Mamy wysoki poziom błędów około 20% dla doświadczeń internetowych i ruchu api. Pobieranie archiwów i pobieranie zawartości surowych repozytoriów ma przybliżony poziom błędu 50%. Na uwierzytelnianie SAML i OIDC, SCIM i Team Sync również mają wpływ. Nadal pracujemy nad zidentyfikowaniem przyczyny i będziemy nadal publikować aktualizacje, jak dowiedzieć się więcej i wykonać łagodzenie.
investigating
Zidentyfikowaliśmy problematyczny element i podjęliśmy działania naprawcze. Istnieją silne oznaki ożywienia, ale nadal pracujemy nad całkowitym przywróceniem usług, przy czym poziom błędów nadal nieznacznie wzrasta. Będziemy publikować dalsze aktualizacje w miarę dalszego odzyskiwania.
investigating
Degradacja wpływająca na wnioski API, działania, operacje Git, kwestie, strony, żądania ciągnięcia i haki internetowe została złagodzona. Monitorujemy, by zapewnić stabilność.
Zidentyfikowaliśmy problematyczny komponent i podjęliśmy działania naprawcze, ale widzimy rezydualny wpływ wielu usług. Nadal stosujemy dodatkowe ograniczenia i badamy pozostały wpływ.
investigating
Kwestie te doświadczają zdegradowanych wyników. Kontynuujemy śledztwo.
investigating
Zidentyfikowaliśmy problematyczny element i podjęliśmy działania naprawcze, ale widzimy rezydualny wpływ w postaci sporadycznych awarii uwierzytelniających. Nadal stosujemy dodatkowe ograniczenia i badamy pozostały wpływ.
investigating
Degradacja oddziałująca na operacje Git została złagodzona. Monitorujemy, by zapewnić stabilność.
investigating
Wnioski API doświadczają degradacji dostępności. Kontynuujemy śledztwo.
investigating
Wnioski API działają normalnie.
investigating
Nadal badamy usterki uwierzytelniania sporadycznego. Częściowo uszkodziliśmy token uwierzytelniający i dostrzegliśmy poprawę, a przed pełnym zastosowaniem tego ograniczenia obserwujemy skutki.
investigating
Kontynuujemy badanie sporadycznych awarii wpływających na uwierzytelnianie Copilot w niektórych aplikacjach. Korzystanie z kopiarki za pomocą aplikacji GitHub CLI i GitHub nie ma wpływu.
investigating
Problemy funkcjonują normalnie.
investigating
W dalszym ciągu stosujemy środki łagodzące w celu zaradzenia sporadycznym błędom uwierzytelniania Copilot w niektórych aplikacjach. Oczekujemy pełnego wyzdrowienia w ciągu najbliższych 30 minut. Korzystanie z kopiarki za pomocą aplikacji GitHub CLI i GitHub nie ma wpływu.
resolved
W dniu 17 sierpnia 2026, od 13: 28- 21: 15 UTC (7h 47m), GitHub.com doświadczył zwiększonych błędów i opóźnień w całym Issues, Pull Requests, API, Actions i Copilot. Na szczytowym poziomie błędy w sieci web / API wynosiły około 20%, podczas gdy pobieranie plików archiwalnych i raw- content osiągnęło około 50%. Uwierzytelnianie SAML / OIDC, SCIM i Team Sync również zostały naruszone, jak również przepływy pracy Akcji w GHEC z Residency danych, które zależą od publicznych definicji etapu przepływu pracy na GitHub.com. Większość usług odzyskanych przez 16: 36 UTC, jak nasz środkowoamerykańskich danych odzyskanych; Działania zostały zdegradowane do około 18: 03 UTC; a Copilot Token Service całkowicie odzyskane przez 21: 02.
Niektóre z usterek ruchu został przeniesiony z środkowego USA do północnej Wirginii, gdzie był obsługiwany z powodzeniem aż do awarii sieci w środkowym USA został zdebugowany i rozwiązany. Opóźnione odpowiedzi na pojedynczy wewnętrzny punkt końcowy wywołały utajony ponownie błąd w kodzie VS, który zwiększył ruch o około 10x i spowodował opóźniony odzysk dla usługi Copilot Token Service.
Bezpośrednią przyczyną awarii było nasycenie sieci balansorami ładunku w Stanach Zjednoczonych ze względu na nowy szczyt ruchu. Pierwotnie było to spowodowane przez Istio sidecar pod osiągając swoje przeciwstawne granice i nie auto skala poprawnie ze względu na źle skonfigurowaną politykę, która oglądała usługi hosta, ale nie boczne granice. Jedna awaria kaskadowała więcej i ostatecznie cztery węzły HAProxy wyczerpały swoje limity przepływu, degradując ścieżkę auth bramy i powodując powszechne opóźnienie uwierzytelniania i niepowodzenia. Problem ten pogorszył optymistyczna logika ponownego podejścia, która przeciążyła wewnętrzne balansory obciążenia. Przerwanie leczenia HAProxy na tych węzłach spowodowało natychmiastową, rozległą regenerację.
Burza retry w Northern VA została ustalona przez 1) tymczasowo redukując logikę retry bramki retry z PR i 2) blokując przychodzący Copilot Token Service żądań tokena na balansory ładunku z 403, a następnie stopniowo ramping back up ruchu per- site, aby umożliwić dzwoniącym odnieść sukces.
Pozostałe błędy uwierzytelniania Copilot kontynuowane, ponieważ klient ponownie wypróbować zwiększonego obciążenia: nieudana operacja tokena może wygenerować wiele dodatkowych żądań i wprowadzić pętlę ponowną. Copilot Token Service ruchu wzrosła z normalnego 7- 9K RPS do 70- 100K RPS. Ograniczenie ponownych prób uwierzytelniania bramki i zablokowanie retrygujących odpowiedzi ustabilizowało Copilot Token Service i zakończyło odzyskiwanie danych.
Do czynników, które utrudniały rekonwalescencję, należały ataki na kryptoad.
Aby zapobiec nawrotom, nasze działania następcze obejmują:
- Korekcja polityki autoskalowania w celu uwzględnienia współwartości i wydajności sidecar sieci usługowych.
- Kontrola wniosków Istio, wzajemnych i skalowania limitów w odniesieniu do usług, których dotyczą.
- Przeglądanie ograniczeń i wycofywanie się przez bramy i klientów.
- Zajmowanie się powtórnym zachowaniem kodu VS, które wzmocniło ruch tokena Copilot.
- Poprawa monitorowania zdolności przepustowej w zakresie balansowania obciążenia oraz regionalnych zabezpieczeń przed niepowodzeniem.
Badamy raporty o wpływowych wynikach niektórych usług GitHub.
investigating
GHEC Team Sync jest obecnie zdegradowany dla przedsiębiorstw z kontami osobistymi, powodując opóźnienia podczas synchronizowania zespołów z grupami IDP. Zidentyfikowaliśmy przyczynę opóźnień i pracujemy nad łagodzeniem ich skutków. Dostarczymy aktualizację o 20: 00 UTC.
investigating
Zastosowaliśmy środki łagodzące. W tym czasie zespół GHEC Sync odzyskał dla przedsiębiorstw z kontami osobistymi. Zespoły synchronizujące się z grupami IDP powróciły do normalnego składu.
resolved
W dniu 13 sierpnia 2026, od 15: 31: 21 UTC do 18: 27: 55 UTC, synchronizacja zespołu GitHub Enterprise Cloud została zdegradowana dla przedsiębiorstw korzystających z osobistych kont. Zespoły organizacyjne odnotowały opóźnienia do 3 do 13 godzin (mediana 8 godzin) podczas synchronizowania się z grupami IDP, co spowodowało opóźnienia w dotacjach dostępu lub przeprowadzkach dla użytkowników przedsiębiorstw w 2,8% zespołów.
Tymczasowa zmiana wprowadzona w celu rozwiązania poprzedniego problemu z powodu zwiększonego wykorzystania tej funkcji pozostała aktywna po jej usunięciu, powodując opóźnienia synchronizacji w okresach dużej głośności. Usunęliśmy tymczasową zmianę i zapewniliśmy dodatkowe zasoby do obsługi zwiększonej ilości.
Obecnie badamy krótką degradację usług dla operacji Git (szczególnie pchnięć), kwestie, wnioski o ciągnięcie, rejestr pakietów, i haki webhacks między 14: 32 a 14: 46 UTC. Zidentyfikowaliśmy źródło degradacji i badamy strategie łagodzące, aby zapobiec nawrotom.
monitoring
Degradacja mająca wpływ na operacje Git, Issues, Packages, Pull Requests i Webhacks została złagodzona. Monitorujemy, by zapewnić stabilność.
monitoring
Tymczasowo wyłączyliśmy pracę w tle, która spowodowała ten wpływ. W tym czasie wpływ jest w pełni złagodzony.
resolved
Między 14: 24 a 14: 53 UTC w dniu 13 sierpnia 2026, rutynowa praca w tle, aby usunąć organizację przytłoczyła kluczową wspólną bazę danych, co powoduje, że wiele usług GitHub krótko zwrócić wysokie błędy i wolniejsze odpowiedzi. Najbardziej dotknięte było zarządzanie hakiem WWW API, o mniejszym wpływie na operacje Git, wyciągnąć żądania, problemy, pakiety, sign- in i Copilot. Impact oczyszczone na własną rękę o 14: 53 UTC po zakończeniu pracy; rozwiązaliśmy incydent o 15: 36 UTC.
Dotknięci użytkownicy mogli doświadczyć krótkiego wzrostu błędów i wolniejszych reakcji, głównie przy tworzeniu, umieszczaniu w wykazie lub aktualizacji haków internetowych, przy mniejszym wpływie na wyciąganie wniosków, problemów, pakietów i operacji Git. Nieprawidłowości osiągnęły wartość około 1% przez kilka minut około 14: 37 UTC.
Aby zapobiec przyszłym incydentom, wysłaliśmy już aktualizację, która włącza się na bezpieczniejszą ścieżkę usuwania dla organizacji, wraz z pułapkami na usuwaniu przechowywanych w bazach danych. Opierając się na tych zmianach, sprawdzamy wszystkie prace związane z usuwaniem i sprzątaniem ładunków, które zapisują się do wspólnych baz danych, aby zapobiec podobnym problemom w przyszłości.
Badamy raporty o zdegradowanych wynikach dla Copilot AI Model Providers
investigating
Doświadczamy zdegradowanej dostępności modelu Fable 5 w produktach Copilot i powierzchniach IDE. Wynika to z problemu z dostawcą modelu wyższego szczebla. Podczas gdy pracujemy z nimi, aby rozwiązać problem, zalecamy wybór innego modelu lub wybór 'Auto', aby kontynuować korzystanie z Copilot.
investigating
Obserwujemy niewielkie ożywienie, ale wciąż mamy do czynienia z degradowaną dostępnością modelu Fable 5 w produktach Copilot i powierzchniach IDE. Wynika to z problemu z dostawcą modelu wyższego szczebla. Podczas gdy pracujemy z nimi, aby rozwiązać problem, zalecamy wybór innego modelu lub wybór 'Auto', aby kontynuować korzystanie z Copilot.
investigating
Kwestie z naszym dostawcą modelu wyższego szczebla zostały rozwiązane, a Fable 5 jest po raz kolejny dostępny w produktach Copilot i powierzchniach IDE.
Będziemy kontynuować monitorowanie w celu zapewnienia stabilności, ale łagodzenie skutków jest zakończone.
resolved
13 sierpnia 2026 r., między 14: 06 a 15: 47 UTC, służby Copilot doświadczyły degradacji modelu Claude Fable 5 ze względu na problem z naszym dostawcą wyższego szczebla. Użytkownicy napotkali podwyższony poziom błędów, osiągając poziom 43% i średnio 12%. Użytkownicy, którzy wybrali modele automatyczne lub alternatywne, nie ulegli zmianie.
Problem ten został rozwiązany przez złagodzenie wprowadzone przez naszego dostawcę. GitHub współpracuje z naszym dostawcą w celu dalszej poprawy trwałości usługi, aby zapobiec podobnym incydentom w przyszłości.