Sorun tespit edildi ve uygun işlem önlemleri onu ele almak için uygulandı.
monitoring
Sorun başarıyla çözüldü ve hizmet tamamen restore edildi. Servis normalde bu anda çalışıyor.
resolved
Sorun başarıyla çözüldü ve hizmet tamamen restore edildi. Servis normalde bu anda çalışıyor.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Ayrıntılar Dashboard: Gecikmiş Maestro Run Data
Başlangıç 2 Eylül 2026 20:00 UTC · 0m
Pending
resolved
Looker'deki İçgörü paneli, son Maestro'nun çalışmasını engelleyen bir konu yaşadı, panoda ortaya çıktı.
Etkilenen bölgeler: ABD, deniz, IND, CA, AUE,JP ,UK
O zaman zaman zaman çizelgesi
Başlayın: 2 Eylül 2026 saat 00 UTC
Çözüldü: 4 Eylül 2026 16:30'da UTC
Sorun şu anda çözüldü ve İçgörü paneli son Maestro çalıştırılan verileri gösteriyor.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
ABD - Doküman Anlayışı ve IXP - Degraded Performans
Başlangıç 1 Eylül 2026 13:49 UTC · 1h 16m
Pending
Etkilenen bileşenler
Document UnderstandingIXP
investigating
Belge Anlayışı ve ABD'de IXP için sayısallaştırma ve ekstraksiyon raporları araştırıyoruz.
Etkisi: Kullanıcılar yavaşlığı deneyimleyebilir ve başarısız Doküman runtime operasyonlarını anlayabilir.
Ekiplerimiz nedeni tanımlamak için çalışıyor ve soruşturma ilerlemeleri olarak daha fazla ayrıntı paylaşacaktır.
monitoring
Sorunu tespit ettik ve bir mitigation uygulandık. Hizmetler sağlıklı duruma geri döndü ve hizmetleri izliyoruz.
resolved
Bu konu tamamen çözüldü ve hizmetler şimdi istikrarlı. Olayın kısa sürede durumu daha ayrıntılı yayınlayacağız.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
mLS Observer thruough DU - ABD
Başlangıç 31 Ağustos 2026 16:54 UTC · 2h 44m
Pending
Etkilenen bileşenler
Document UnderstandingDocument Understanding
investigating
Şu anda sorunu araştırıyoruz.
identified
Sorunu tespit ettik ve gerekli düzeltmeleri yaptık
monitoring
Sorun azaltıldı ve hizmet şu anda operasyonel. Servis sağlığını yakından takip etmeye ve gerekirse daha fazla harekete geçmeye devam edeceğiz.
resolved
Sorun azaltıldı ve hizmet şu anda operasyonel. Servis sağlığını yakından takip etmeye ve gerekirse daha fazla harekete geçmeye devam edeceğiz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Orkestra - Müşteriler kuyruk eşyasına erişim konusunda sorunlar yaşıyor
Sorun tespit edildi ve ekip aktif olarak bir düzeltme dağıtma üzerinde çalışıyor. Dağıtımın önümüzdeki saatlerde başlamasını bekliyoruz.
monitoring
Lisanslı performansın kök nedenini tespit ettik ve önümüzdeki saatlerde bir düzeltme dağıtma sürecindeyiz. Kullanıcının orijinal klasörüne erişemediği sorguları etkiler. API yüzeyi etkilenmez. CSV ile ihracat bir iş olarak kullanılabilir. Ek güncellemeler karara doğru hareket ettiğimiz gibi sağlanacaktır.
identified
Lisanslı performansın kök nedenini tespit ettik ve önümüzdeki saatlerde bir düzeltme dağıtma sürecindeyiz. Kullanıcının orijinal klasörüne erişemediği sorguları etkiler. API yüzeyi etkilenmez. CSV ile ihracat bir iş olarak kullanılabilir. Ek güncellemeler karara doğru hareket ettiğimiz gibi sağlanacaktır.
identified
Düzeltme şu anda uygulanır. Dağıtımın tüm etkilenen bölgelerde tamamlandıktan kısa bir süre sonra başka bir güncelleme sağlayacağız.
resolved
Düzlem tüm bölgelerde başarıyla dağıtıldı ve konunun çözüldüğünü doğruladık. Servis beklendiği gibi çalışıyor.
postmortem
## Müşteri Etkisi
28 Ağustos - 2026 arasında 3:23 UTC ve 28 Ağustos 2026, 10:57 pm UTC, bir alt müşteri, Orkestrator'daki kuyruk eşya panellerini açtığında hataları yaşadı. Etkilenen yol, kullanıcının, eşyaların yaratıldığı orijinal klasörüne erişemediğinde LINKED kuyrukları için 404 sayfa geri döndü.
Etkisi sadece orkestracı UI etkileşimleri etkiledi ve etkilenen yazılım versiyonunu çalışan tüm bölgelerden geçti. Orkestra uygulama programlama arayüzü erişimi etkilenmedi ve MSN'e kuyruk verilerini ihraç etmek bir iş olarak mevcuttu. Toplam süre yaklaşık 7 saat idi.
## Root neden
Olay, diğer klasörlerden erişilen bağlantılı kuyruklar için orkestracı kullanıcı arayüzünde bir regresyona neden oldu. Regresyon, beklenen bilgileri görüntülemek yerine 404 sayfasına yol açan orijinal klasörün orijinal klasörüne erişemediğinde bağlantılı detayları doğru bir şekilde çözmedi.
# # Tespit
Sorun, orkestra önünde 28 Ağustos'ta 2026'da 3:23 UTC'de otomatik bir olay uyarısıyla tespit edildi.
# # Response
3:31'de UTC 28 Ağustos 2026'da, mühendislik ekibimiz, bir regresyon nedeniyle kuyruk eşya detay panellerine erişemedikçe sorunu tarif etti. 3:41 UTC'de, bir kamu durumu güncelleme, kök nedeninin tespit edildiğini doğruladı, bir düzeltmenin konuşulduğu ve bu uygulama programlama arayüzü erişiminin etkilenmediğini doğruladı.
5:27 UTC'de, kapsamı, kullanıcının orijinal klasörüne erişemediği kuyruklarla bağlantılıydı. 5:29 pm UTC'de, ekip ilk düzeltmenin etkilenen senaryoyu tamamen ele almadığını ve düzeltilmiş bir düzeltmenin geliştirildiğini belirledi. 5:30'da UTC, etkilenen senaryo yeniden üretildi ve düzeltilmiş düzeltme yerel olarak doğrulandı. 5:39 UTC'de, bir durum sayfası güncellemesi, işbaşı olarak belgelenen CSV ihracat.
düzeltilmiş düzeltmenin işe alınması etkilenen bölgelerde devam etti. 10:50 UTC'de, düzeltme her yerde doğrulandı. 10:57 pm UTC'de olay işaretlendi ve hizmetin beklendiği gibi çalıştığını doğrulamak için durum sayfası güncellendi.
## Takip
Formal takip işlemleri, kararda başlatılan post-incident inceleme sürecinde takip edilir.
## Action items
- Bu senaryoyu eklemek için otomatik test vakalarımızı genişletin ve bağlantılı nesneler veya çapraz senaryolarla ilgili diğer benzer senaryolar.
- Daha hızlı bir yanıt süresi için bir bayrakla herhangi bir değişikliği güvenle kapatabiliriz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Orkestra girişleri ABD bölgelerinde görünmez
Başlangıç 27 Ağustos 2026 17:16 UTC · 4h 41m
Pending
Etkilenen bileşenler
Orchestrator
investigating
ABD bölgesinde eksik robot loglarının raporlarını araştırıyoruz. Ekiplerimiz nedeni tanımlamak için çalışıyor ve soruşturma ilerlemeleri olarak daha fazla ayrıntı paylaşacaktır.
identified
Robot girişlerinin gecikdiğini tespit ettik. Robot logları canlı verilere yetişiyor ve kurtarmayı izliyoruz.
monitoring
Logs şimdi gerçek zamanlı olarak beklendiği gibi ortaya çıkıyor ve uygulamayı izlemeye devam edeceğiz.
resolved
Sorun çözüldü ve loglar beklendiği gibi ortaya çıkıyor.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Çözümleri Yönetimi- Japonya - Partial Outage
Başlangıç 25 Ağustos 2026 09:41 UTC · 31m
OutageBüyük çaplı olay
Etkilenen bileşenler
Solutions Management
identified
Japonya bölgesinde Studio Web'de Çözüm Deployment özelliğini etkileyen bir sorunu tespit ettik, çözüm dağıtımlarının başarısız olabileceği yer. Bir düzeltme hazırlanmış ve kısa bir süre içinde gerçekleştirilecektir. Daha fazla bilgi için daha fazla güncelleme sağlayacağız.
monitoring
Fix Japonya bölgesinde başarıyla dağıtıldı ve konu azaltıldı. Çözüm Deployment'in beklendiği gibi çalışmaya devam etmesini sağlamak için hizmeti yakından takip ediyoruz ve ihtiyaç duyulduğu gibi daha fazla güncelleme sağlayacaktır.
resolved
Sorun çözüldü ve Studio Web'deki Deployment Japonya bölgesinde beklendiği gibi çalışıyor. Daha fazla etki gözlemlenmedi.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Singapur - İçgörüler - Partili Outage
Başlangıç 25 Ağustos 2026 03:58 UTC · 56m
OutageBüyük çaplı olay
Etkilenen bileşenler
Insights
investigating
Singapur bölgesindeki İçgörüleri kullanan müşterileri etkileyen bir sorunu araştırıyoruz, panolar yükleyemez ve zaman aralığı hataları gösteremez. Ekiplerimiz kök nedenini tanımlamak için çalışıyor ve daha fazla bilgi mevcut olacak şekilde daha fazla güncelleme sağlayacaktır.
monitoring
Sorun azaltıldı ve panoların beklendiği gibi yüklemeye devam etmesi için Singapur Bölgesindeki İçgörü hizmetlerini yakından takip ediyoruz.
resolved
Sorun çözüldü ve Singapur Bölgesindeki İçgörü servisi beklendiği gibi çalışıyor. Daha fazla etki gözlemlenmedi.
postmortem
## Müşteri Etkisi
25 Ağustos tarihleri arasında 3:42 am UTC ve 25 Ağustos 25, 2026, 4:53 am UTC, Singapur'daki İçgörüleri kullanan müşteriler, İçgörü panjurlarını yüklemektedir. Etkilenen kullanıcılar pano sayfalarını zamanında gördü ya da yüklenmeye başarısız oldu ve sunucu hataları ilgili hizmet talepleri için gözlemlendi. birincil etki, grafikler ve uyarılar da dahil olmak üzere İçgörü erişime yönelikydi. İlgili bir backend servisi de olay sırasında sunucu hataları iade etti, ancak pano erişim nihai karardan önce kurtarıldı.
## Root neden
Olay, İçgörü Servisi tarafından kullanılan altyapıyı etkileyen Singapur'daki bölgesel bir Microsoft hizmet kesintisine atfedildi. Bu kesinti sırasında, İçgörü servisi pano talepleri güvenilir bir şekilde hizmet edemedi, istek zamanları ve sunucu hataları nedeniyle. Hiçbir değişiklik bizim tarafta yapılmadı. Microsoft bölgesel kesintinin çözümlendiği gibi hizmet geri alındı ve Microsoft daha sonra durum sayfasında bir Singapur bölgesel hizmet sorununu bildirdi. Resmi bir kök nedeni analizi, belirli başarısızlık mekanizmasını doğrulamak ve herhangi bir ek koruyucu veya masyon önlemleri tanımlamak için Microsoft'tan talep edilmiştir.
# # Tespit
İçgörü servisi için otomatik sağlık izleme sorunu 25 Ağustos'ta saat 2026'da 3:42 am UTC'de tespit etti. Müşteri etkisi tespit edildikten kısa bir süre sonra yanıt köprü üzerinde doğrulandı.
# # Response
25 Ağustos'ta, 3:58 am UTC'de, Singapur'daki o İçgörü panolarının yüklenemez ve zaman kesinti hataları gösteremeyiz. Cevap sırasında, mühendislik ekibimiz otomatik izlemede sunucu hataları doğruladı, servis tanılarına ulaşmaya çalıştı ve alt altyapıda bir kurtarma prosedürü başlattı.
25 Ağustos'ta, 4:01'de UTC'de, kurtarma prosedürü ilerleme kaydettiğinde, pano yüklemesi birden çok test hesabında doğrulandı. 25 Ağustos'ta 4:37 am UTC, panoları başarıyla onayladıktan sonra izleme olayı taşıdık. Ağustos 25, 2026'da 4:49 am UTC'de bir araya getirilen ve olay 25 Ağustos'ta 4:53 am UTC'de çözüldü.
## Takip
1. Microsoft'tan bir kök talep etmek, içgörüler yükleme sorununu etkileyen Singapur bölgesel kesintiye neden olur.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Singapur - Doküman Anlayışı - Katılımcı Outage
Başlangıç 25 Ağustos 2026 03:44 UTC · 1h 14m
OutageBüyük çaplı olay
Etkilenen bileşenler
Document Understanding
investigating
Müşterilerimizi Singapur bölgesinde Genişletilmiş OCR işlevselliğini kullanarak etkileyen bir sorunu araştırıyoruz. Ekiplerimiz kök nedenini tanımlamak için çalışıyor ve daha fazla bilgi mevcut olacak şekilde daha fazla güncelleme sağlayacaktır.
monitoring
Sorun azaltıldı ve beklendiği gibi çalışmaya devam etmesini sağlamak için hizmeti yakından takip ediyoruz. Daha fazla bilgi için daha fazla güncelleme sağlayacağız.
resolved
Sorun çözüldü ve hizmet beklendiği gibi çalışıyor. Daha fazla etki gözlemlenmedi.
postmortem
## Müşteri Etkisi
25 Ağustos'ta 2026, Belge Anlayışı Hizmetindeki genişletilmiş OCR talepleri yaklaşık 33 dakika boyunca Singapur bölgesinde 500 statü kodu ile başarısız oldu, 03:08 ve 03:41 UTC arasında. Sebep Singapur'da bir Microsoft bölgesel hizmet kesintisi idi. Diğer tüm Dokümanlar işlevselliğini anlamak etkilenmedi ve başka bir bölge etkilenmedi.
## Root neden
Başarısızlık, genişletilmiş OCR kapasitesi tarafından kullanılan kaynakları etkileyen Singapur'daki bölgesel bir Microsoft hizmet kesintisine atılmıştır. Hiçbir değişiklik bizim tarafımızda yapılmadı ve Microsoft daha sonra Singapur bölgesel sorunu yansıtacak kendi statü sayfasını güncelledi. Resmi bir kök nedeni analizi Microsoft'tan talep edilmiştir.
# # Tespit
Doküman Anlama hizmeti için otomatik bir uyarı 25 Ağustos'ta 2026'da 3:13 am UTC. Uyarı hemen kabul edildi ve olay müşteriyi dakikalar içinde kurtarmıştı.
# # Response
The on-call mühendisi, Singapur bölgesine olan etkisini ele aldı. Muhalefetler neden olduğu gibi son bir hizmet güncellemesini reddettiler, aynı güncelleme, altyapımızın dışında bölgesel bir bağımlılık başarısızlığına işaret eden diğer bölgelere de dağıtıldı.
Çünkü başarısızlık Microsoft servisinde ortaya çıktı, UiPath tarafında hiçbir kesinti mevcut veya gerekli değildi. İstekler, Microsoft bağımlılığının iyileştiği 03:41 UTC'de tekrar başarılı olmaya başladı. Yanıtlar olayı sürekli kurtarmayı doğrulamak için açık tuttular: 03:51 UTC'de on dakika temiz trafik onaylandı, olay 04:04 UTC'de İzlemeye taşındı ve daha fazla başarısızlık olmadan 04:59 UTC'de çözüldü.
## Takip
1. Microsoft'tan gelen bir kök neden analizi talep etti, Genişletilmiş OCR bağımlılıklarını etkileyen Singapur bölgesel kesintiler için, recurrence'ın nasıl engellenebileceği de dahil.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Çoklu Bölgeler - UiPath Apps - Partial Outage
Başlangıç 24 Ağustos 2026 10:43 UTC · 1h 12m
OutageBüyük çaplı olay
Etkilenen bileşenler
AppsAppsAppsAppsAppsAppsApps
identified
UiPath Apps kullanan küçük bir müşteriyi etkileyen bir sorun nedenini birden çok bölgede Studio Web hizmetinden aldık. Takımlarımız bir düzeltmeye hazır ve dağıtım etkilenen bölgelerde başlamak üzere. Dağıtımı izlemeye devam edeceğiz ve düzeltmenin etkisi olarak daha fazla güncelleme sağlayacağız.
monitoring
Fix, etkilenen tüm bölgelerde başarıyla dağıtıldı ve konu azaltıldı. Fix'in beklendiği gibi devam etmesini sağlamak için hizmeti yakından takip ediyoruz ve gerektiğinde daha fazla güncelleme sağlayacaktır.
resolved
Sorun çözüldü ve hizmet beklendiği gibi çalışıyor. Daha fazla etki gözlemlenmedi.
postmortem
## Müşteri Etkisi
19 Ağustos 2026 - 2:33 pm UTC ve 24 Ağustos 2026 11:30'da UTC, bir alt müşteri, Studio Web'den gelen UiPath Apps projelerini yükleyemezdi. Etkilenen müşteriler, yavaşlık veya bozulan performans yerine Uygulama projelerinden tam olarak yararlanamaz.
Etki küçük bir müşteri seti ile sınırlıydı, Apps hizmeti Japonya bölgesinde barındırıldı. Toplam müşteri temposu süresi yaklaşık 4 gün ve 21 saat idi.
## Root neden
Kök nedeni, Studio Web ve UiPath Apps arasında bir dağıtım hatasıydı. 19 Ağustos 2026'da Studio Web, bir çerçeve yükseltme dahil AB bölgesinde planlanan bir güncelleme aldı. Çerçeve yükseltmesi içeren UiPath Apps güncelleştirmesi henüz Japonya ölçeği ünitesine dağıtılmamıştı.
Yeni çerçeve versiyonu ile zaten uyumlu olan daha önceki uygulamalar, Japonya dışında tüm bölgelere dağıtıldı, dağıtım ilgili nedenlerle ertelenmişti. Sonuç olarak, Japonya bölgesi hala güncel Studio Web ile uyumlu olmayan eski bir Uygulama versiyonunu yürütüyordu.
# # Tespit
Sorun, 24 Ağustos 2026'da UiPath hesap ekibi aracılığıyla bir müşteri tarafından rapor edildi. Bir olay 10:21 am UTC'de açıldı ve bir halk durumu sayfası bir dakika içinde ilan edildi. Otomatik izleme sorunu tespit etmedi çünkü eşleştirilmiş dağıtım kombinasyonlarını doğruladı; karışık konfigürasyonlar için algılamayı geliştirmek bizim takip planımızın bir parçasıdır.
# # Response
Olayı açmanın birkaç dakika içinde, dağıtım yanlışlığını kök nedeni olarak tespit ettik ve tüm etkilenen bölgelere UiPath Apps update'in dağıtımını hızlandırmaya karar verdik, Studio Web versiyonu ile uyumlu uygulamaları zaten etkilemeye hizmet ettik.
10:43 UTC'de, davanın tanımlanmasını onaylayan bir kamu statüsü güncellemesi yayınladık ve düzeltmenin konuşulduğuydu. 10:52'te UTC, dağıtım kalan bölgeler için ilerlemedeydi, birkaç bölge zaten tamamlandı. 11:30'da UTC'de, düzeltmenin tüm etkilenen bölgelerde dağıtılmasını ve olayı hafiflettiğini doğruladık. 11:55'de UTC, izlemeden sonra daha fazla etki göstermedi, olay çözüldü.
## Takip
1. Uygulama yük başarısızlıklarını tespit etmek için üretim telemetrisinde otomatik uyarı ekleyin, Studio Web versiyonu ile ilişkilendirildi.
2. Düzenli olarak bir Uygulama projesini yürüten sentetik izleme, temsilci müşteri yapılandırmaları ve başarısızlık konusunda uyarılar aracılığıyla Studio Web'den geçti.
3. Sıkıntılı Stüdyo Web ve Uygulamalar değişiklikleri için geri yüklemeyi optimize edin, böylece bağımlı uygulamalar güncelleştirmeleri, yeni Studio Web deneyimi müşteri trafiğine ulaşır.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
ABD - Doküman Anlayışı - Partili Outage
Başlangıç 21 Ağustos 2026 12:37 UTC · 59m
Pending
Etkilenen bileşenler
Document Understanding
monitoring
ABD'de Belge Anlayışı için belge sınıflandırması ve ekstraksiyon için bir düzeltme uygulandı ve şu anda sonuçları takip ediyoruz.
resolved
ABD bölgesinde Belge Anlayışı için belge sınıflandırmasını ve çıkarılmasını etkileyen sorun çözüldü. Bir izleme periyodundan sonra, hizmet normal olarak sağlıklı ve faaliyet göstermektedir.
postmortem
## Müşteri Etkisi
21 Ağustos 2026'da 11:05'de UTC ve 21 Ağustos 2026'da 12:18 pm UTC'de bir alt müşteri, belge sınıflandırması, ekstraksiyon ve sayısallaştırma dahil olmak üzere başarısız Belge operasyonlarını deneyimledi. Kısmi kesintinin tahmini süresi 48 dakika idi. Etki ABD bölgesinde Belge Anlayışı kullanan müşteriler ile sınırlıydı.
## Root neden
Olay, koruyucu bir veritabanı ölçeğinde kırık bir duruma giren depolama veritabanı başarısız konfigürasyonuna neden oldu. Veri tabanı depolama limitine yaklaştıktan sonra ölçeklendi. Operasyon sırasında, ikincil veritabanı ölçeklenemedi, başarısız konfigürasyondan kaldırmaya çalıştı ve veritabanı platformu sağlayıcısı replikasyon bağlantısını bozmak zorunda kaldı. Bu, mevcut olmayan bir durumda başarısız konfigürasyonunu bıraktı, bu veritabanına bağlı olan depolama ve runtime hizmetlerine izin verdi.
# # Tespit
Olay, 21 Ağustos 2026'da 12:10'da kabul edilen Belge Anlayışı hizmetleri için otomatik bir uyarıyla tespit edildi.
# # Response
Müşteri destekli olay ilan edilmeden önce, birincil veritabanı ölçeği tamamlanmış ve veritabanı platformu sağlayıcısının ikincil veritabanı konusu için işbirliği yapıldı. Başarısızlık yapılandırması bozulduktan sonra, servis bağlantısını yönlendirmeyi araştırdık, ancak hizmetin mevcut konfigürasyonunu sağlamak için güvenli, acil bir yol tespit edemedik.
Servis, sağlıksız ikincil veritabanını ortadan kaldırarak ve devre dışı yapılandırmayı yeniden yapılandırarak restore edildi. 21 Ağustos'ta, 12:37'de 2026 UTC'de, düzeltme uygulandı ve izleme devam ediyordu. 1:36 UTC'de, izleme hizmetinin sağlıklı olduğunu doğruladı ve olay çözüldü.
## Takip
1. Veritabanı platform sağlayıcısından bir kök neden analizi talep edin, ikincil veritabanının ölçeklenemeyeceğini ve neden başarısız konfigürasyon remediasyonun neden yenidenplikasyon gerektirdiğini belirlemek.
2. Güncelleme veritabanı, eşleri uyarmak ve bu kadar uyarıları göndermek ve daha önce,% 75 kullanımda daha düşük oy uyarıları ve% 85 kullanımda daha yüksek sesli bir uyarı da dahil olmak üzere hareket eder.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
ABD - Agents - Bazı Müşteriler Claude Sonnet 4.6 kullanırken hata yaşayabilirler
Başlangıç 19 Ağustos 2026 15:08 UTC · 1h 47m
OutageBüyük çaplı olay
Etkilenen bileşenler
Agents
investigating
ABD bölgesinde bazı müşterileri etkileyen bir sorunu araştırıyoruz. Mühendislik ekibimiz sorunu anlamak için aktif olarak çalışıyor ve daha fazla bilgi mevcut olacak şekilde daha fazla güncelleme paylaşacaktır.
monitoring
Sorunu azalttık. Mühendislik ekibimiz aktif olarak sabahtır ve daha fazla bilgi olarak daha fazla güncelleme paylaşacaktır.
monitoring
Sorunu azalttık. Mühendislik ekibimiz aktif olarak izliyor ve daha fazla bilgi mevcut olacak şekilde daha fazla güncelleme paylaşacaktır.
resolved
Sorun çözüldü.
postmortem
## Müşteri Etkisi
19 Ağustos tarihleri arasında 1:36 pm UTC ve 19 Ağustos 2026, 3:53 pm UTC, müşterilerin alt seti, Claude Sonnet 4.6'yı Agents'ta kullanırken hata aldı. Etki yaklaşık 2 saat ve 17 dakika sürdü.
Etki ABD bölgesinde Agents kullanan müşteriler içindi. Hatalar ayrıca Claude Opus 4.6 ve Claude Opus 4.5 için gözlemlendi, bu da daha düşük hacimde kullanılıyor.
---
# # # Root Cause
Planlanan bir altyapı göçünin bir parçası olarak, Agents için yeni bir yapılandırma teslimat sistemine model talep eden platform hizmeti taşıdık.
Yeni yapılandırma kaynağı üç Claude model için routing girişlerini eksikti - Claude Sonnet 4.6, Claude Opus 4.6 ve Claude Opus 4.5. Bu girişler olmadan, hizmet bu modeller için talepler için geçerli bir hedef çözemez ve onları hatalarla reddedebilir. Diğer modeller etkilenmedi ve normalde hizmet etmeye devam etti.
---
# # Tespit
Sorun, ilk etkilenen istekten yaklaşık 1 saat ve 19 dakika sonra 19 Ağustos'ta müşteri kararsızlığı ile tespit edildi. Mühendislik ekibimiz, konuyu belirli Claude modellere taşıdı ve soruşturma başlattı. Halk durumu iletişimi 3:08 pm UTC'de başladı.
Uyarı izlememiz, toplam hata oranlarına dayanmaktadır. Üç etkilenen modele neredeyse tüm istek başarısız olmasına rağmen, bu modeller bölgedeki genel trafik küçük bir payını temsil etti, bu yüzden toplam sinyal uyarı eşlerimizi geçmedi ve konu otomatik olarak yükseltilmedi. Bu aşağıda takip edilen tespit boşluğudur.
---
# # Response
3:25 pm UTC'de, eksik yapılandırma kaynağı nedeni olarak tespit edildi ve bir düzeltme başladı. 3:47 pm UTC'de, düzeltmenin dağıtımı ilerlemedeydi ve hizmet, yapılan değişiklik olarak aktif olarak izlendi.
3:59 UTC'ye göre, servis girişleri sorunu azalttı ve 4:00'te UTC başarısızlık oranı% 0 oranında doğrulandı. Olay 4:40'da UTC'de kısaltıldı ve tam karar 4:55'te saat süren izleme ve müşteri onayından sonra hizmetin beklendiği gibi çalıştığını ilan etti.
---
## Follow-Up
altyapı göçü tüm bölgelerde tamamlandı ve yapılandırma yapılandırması şimdi tek bir kaynaktan çekiyor, bu olayın neden olduğu yanlış eşleşmeyi ortadan kaldırıyor, böylece yeniden kayıt yapamıyor.
Otomatik kontroller her bölgedeki her desteklenen modeli sürekli olarak doğrulamak için tanıtıldı, bu yüzden hemen tespit edilen ve uyarılanmamış bir model tespit edildi - daha düşük bölgeler de dahil.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
[Community] - [Agentic Orchestration] - HITL görev çıktı parametreleri ile ilgili ifade değerlendirmelerinde başarısızlıkların raporları
Başlangıç 18 Ağustos 2026 17:54 UTC · 5h 31m
OutageBüyük çaplı olay
Etkilenen bileşenler
Agentic Orchestration
investigating
Avrupa'daki Asgentic Orkestrasıtron için HITL görev çıktı parametreleri ile ilgili ifade değerlendirmelerindeki başarısızlıkların raporlarını araştırıyoruz.
Etkisi: Kullanıcılar HITL görevlerini tamamlayamayabilir
Sonraki güncelleme: Takımlarımız nedeni ve kapsamı anlamak için çalışıyor ve mevcut olarak güncellemeler paylaşacaktır.
identified
Avrupa'daki topluluk kullanıcıları için HITL görev çıktı parametreleri ile ilgili ifade değerlendirmelerini etkileyen bir kesintiye neden tespit ettik.
Etkisi: Kullanıcılar HITL görev çıktı parametresi kullanarak bir ifadeye sahip olduğunda başarısızlıkları deneyimleyecekler.
Sonraki güncelleme: Takımlarımız nedeni ve kapsamı anlamak için çalışıyor ve mevcut olarak güncellemeler paylaşacaktır.
identified
Biz düzeltmeyi tespit ettik ve karar ilerlemede.
Sonraki güncelleme: Takımlarımız düzeltme üzerinde çalışıyor ve mevcut olarak güncellemeler paylaşacaktır.
monitoring
Düzeltmeyi kullandık ve kararı takip ediyoruz.
Sonraki güncelleme: Takımlarımız kararı izliyor ve mevcut olarak güncellemeler paylaşacaktır.
resolved
Outage çözüldü ve Agentic Orchestration tamamen operasyonel.
Etkisi: Sürekli kullanıcı etkisi yok.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Çoklu Bölgeler - Studio Web & Solutions Mgmt - Kaynak Yapılandırma Ekran Yüklenme
Değişen kaynak özellikleri için kaynak yapılandırma ekranının yüklemediği Studio Web'deki bir sorunun kök nedenini tespit ettik. Bir düzeltme dağıtıyoruz.
identified
Ayaklanmanın işlenmesi ilerlemededir. Dağıtım ilerlemeleri olarak daha fazla güncelleme sağlayacağız.
identified
Düzlem doğrulandı ve kalan tüm bölgelerden dışarı çıktı. Dağıtımı ve kurtarmayı izliyoruz. Sabrınız için teşekkürler.
identified
Rollout, kalan bölgelerde beklendiği gibi ilerliyor. Dağıtımı izlemeye devam ediyoruz. Sabrınız için teşekkür ederiz.
monitoring
Rollout, kalan bölgelerde beklendiği gibi ilerliyor. Dağıtımı izlemeye devam ediyoruz. Sabrınız için teşekkür ederiz.
resolved
Rollout tamamlandı ve konu çözülmeli.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Çoklu Bölgeler - Stüdyo Web - Yeni varlıklar gecikme ile ortaya çıkıyor
Başlangıç 18 Ağustos 2026 05:32 UTC · 6h 25m
Pending
Etkilenen bileşenler
Studio WebStudio WebStudio Web
investigating
Yeni yaratılan varlıkların Studio Web'de görünmesi için yaklaşık bir saat alabileceği bir konuyu araştırıyoruz. Hiçbir veri kaybolmaz ve mevcut varlıklar etkilenmez.
investigating
Sorunu araştırmaya devam ediyoruz ve kök nedenini tanımlamak ve normal işleme süresini geri yüklemek için çalışıyoruz.
investigating
Avrupa, Amerika Birleşik Devletleri ve Japonya'daki bir kiracıyı etkileyen sorunu araştırmaya devam ediyoruz, yeni yaratılan varlıkların Studio Web'de görünmesi bekleniyor. Hiçbir veri kaybolmaz ve mevcut varlıklar etkilenmez.
identified
Nedeni tespit ettik ve Avrupa, Amerika Birleşik Devletleri ve Japonya'daki bir kiracıyı etkileyen konu için bir karar üzerinde çalışıyoruz. Sabrınız için teşekkür ederiz.
monitoring
Sorun azaltıldı ve kısa sürede normale dönmek için işlem süreleri bekliyoruz. Kurtarmayı yakından izliyoruz. Sabrınız için teşekkür ederiz.
resolved
Sorun çözüldü ve işleme zamanı normale döndü. Sabrınız için teşekkür ederiz.
postmortem
## Müşteri Etkisi
18 Ağustos'ta, 5:11'de 2026 UTC ve 18 Ağustos 2026 arasında 11:57 am UTC, UiPath Cloud kiracılarının alt setinde yeni yaratılan varlıklar Studio Web'da görünmeleri beklenenden daha uzun sürebilir. İlk değerlendirme zamanında, yeni yaratılan varlıklar yaklaşık bir saatlik gecikme ile ortaya çıktı. Avrupa, ABD ve Japonya'daki müşteriler etkilendi. Entity yaratımı başarıyla devam etti, hiçbir veri kayboldu ve mevcut varlıklar etkilenmedi.
## Root neden
Sorun, bir kiracıdan alışılmadık derecede yüksek bir varlık yaratma isteğiyle yollandı. Bu istekler, arka uç varlık-indexing hizmetimizden daha fazla olay yarattı, aynı oranda işlem yapabilir, olay işleme kuyruğunda bir backlog oluşturabilir. Çünkü Studio Web, yeni yaratılan varlıkları göstermek için bu hizmete dayanıyor, yeni varlıklar sadece arkalog işlendikten sonra ortaya çıktı.
# # Tespit
Sorun, mühendislik ekibimiz tarafından geç saatler uyarıları ile tespit edildi ve bir olay 18 Ağustos 2026'da UTC olarak ilan edildi. 5:23 UTC'ye göre, analiz son işlenmiş varlığın arkasında yaklaşık bir saat olduğunu doğruladı.
# # Response
5:32'de UTC, Studio Web'deki yeni yaratılan varlıklar için geciken görünürlük için ilk müşteri güncellemesini yayınladık. 6:07 UTC'ye göre, soruşturma, bir kiracıdan alışılmadık yüksek varlık yaratma trafiği tespit etti ve 7:03'de UTC'dir, etkilenen servis için veri tabanı kaynaklarını kurtarmaya yardımcı oluyoruz.
7:59'de UTC, yüksek istek hacminin kaynağı istek göndermeyi bıraktı ve kuyruk tükenmeye başladı. 9:59'da UTC, etkilenen onant için bir veri senkronizasyon süreci başlattık ve 10:31'de UTC, sorunlu kuyruk olayları çok normal işleme daha hızlı yakalayabilirdik. Queue derinliği 8:34'te 95,000 maddeden azalmıştır UTC 11:44 am UTC.
Olay 11:19'da belirgin bir şekilde iyileşmeden sonra belirgin bir şekilde azaltıldı ve 11:57'te düzeltildikten sonra UTC normale döndü.
## Takip
Etkilenen onant için re-trigger veri senkronizasyonu ve onant'ın verileri doğrulanana dek izleme.
İndüklemede varlık kullanımını geliştirin, böylece arkalog bu oranda pes etmeyecektir.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Orchestrator Robot Logs - US
Başlangıç 14 Ağustos 2026 21:24 UTC · 1h 59m
OutageBüyük çaplı olay
Etkilenen bileşenler
Orchestrator
identified
We have identified the cause of the degraded performance impacting Orchestrator in US region and are working on mitigation.
Impact: Users may experience delayed loads and views on Orchestrator Robot logs. Additional updates will be provided as we move toward resolution.
resolved
The issue has been resolved and Orchestrator Robot logs performance has returned to expected levels after degraded performance impacted Robot logs to load in US region.
Impact: No ongoing user impact.
postmortem
## Customer impact
Between August 14, 2026 at 8:54 pm UTC and August 15, 2026 at 2:09 AM UTC, a subset of customers in the US region experienced significant slowness in the Orchestrator Jobs and Logs pages, and robot logs appeared later than expected in the logs view. Performance had substantially recovered by 11:22 PM UTC on August 14, with full recovery confirmed with affected customers at 2:09 AM UTC on August 15.
Automation execution was not affected, jobs continued to be scheduled and to run normally throughout. No log data was lost. Logs continued to be recorded and became visible once the system caught up. Requests did not fail, so no errors were surfaced, pages were slow to load and recent activity appeared missing or delayed. No other region was impacted.
## Root cause
Orchestrator stores and retrieves robot logs using a dedicated search and storage system. Routine maintenance on that system causes data to be redistributed internally across the cluster. Our analysis indicates that a redistribution larger than anticipated consumed capacity that would otherwise have served customer requests, slowing both the retrieval of existing logs and the processing of new ones.
This accounts for the majority, but not the entirety, of the slowdown observed, and analysis of the remaining contributing factor is continuing. Capacity returned to normal without intervention, at which point log visibility and page performance recovered.
## Detection
The issue was surfaced through customer reports of slow Jobs and Logs pages in the US region.
## Response
We posted a status update confirming that we were investigating degraded Orchestrator performance in the US region.
Our engineering team scoped the impact to the US region and narrowed the slowdown to the log storage and search layer. The degradation stemmed from capacity contention that eased as the redistribution completed, and responders monitored the system through recovery.
Page performance and log visibility returned to expected levels over the course of the evening, and recovery was subsequently confirmed with affected customers at 2:09 AM UTC on August 15.
## Follow up
1. We are adding monitoring and alerting on the response times customers experience and on the delay between a robot log being generated and becoming visible, so that degradation of this kind is detected proactively.
2. We are documenting an operational procedure that gives our on-call engineers defined steps to reduce customer impact during this class of degradation.
3. We are changing how routine maintenance on the log storage system is scheduled and paced in the US region so that it does not affect customer-facing performance.
4. We are increasing spare capacity in the log storage system so that internal data movement has room to complete without competing with customer requests.
IXP İletişim Madencilik ABD bölgesinde yüksek hata oranı
Başlangıç 12 Ağustos 2026 15:00 UTC · 0m
Pending
resolved
IXP İletişim Madencilik Madeninde nadiren kullanılan bir model özelliği üzerine bir istek fırtınası, daha geniş IXP API'de senkronize etmek için yeniden deneme döngüsüne neden oldu. Bu, 500 işçi ile başarısız olma taleplerinin uzun süreli taleplerle meşgul olduğuna neden oldu.
Hızlı bir şekilde ölçeklendirmek, yalnızca katkıda bulunan API isteğine sıkı zaman veren bir kod düzeltmesi uygulamakla yapıldı.
İstek fırtınası yaklaşık 15:10 UTC'ye başladı ve otomatik alarmlar tarafından 15:15 UTC tespit etti. Karar 18:15 UTC civarında doğrulandı.
Olay başlangıçta sadece müşterinin isteklerin fırtınasını yapmasına yanlış davrandı, ancak daha sonra daha geniş bir kullanıcı yelpazesini etkilemeleri keşfedildi.
ABD'de bir avuç kullanıcı ile sınırlı olan toplam etki.
postmortem
## Müşteri Etkisi
12 Ağustos 2026'da, yaklaşık 15:10 ve 18:15 UTC arasında, Amerika Birleşik Devletleri bölgesinde İletişim Madencilik (IXP) kullanıcılar geçici istek başarısızlıkları yaşadı.
Olay bölgenin dağıtım birimlerinden biri ile sınırlıydı, kullanıcıların beş ila on dakika boyunca patlamaları gördüğü yerde, taleplerinin% 5-7'si zirvede 5xx hatayla başarısız oldu.
Patlamalar arasında hizmet normal olarak işletilir, tekrarlanan istekler genellikle başarılı oldu ve hiçbir veri kaybedilmedi.
# # # Root Cause
Taleplerin nadiren kullanılan API özelliğine bir fırtına, talep edilen modelin tekrar tekrar tekrar tekrar tekrar tekrarlanmasıyla çakıştı. Her bir yeniden eğitim sınırsız önbellek tahminleri, her isteği çok dakikalık bir hesaplamaya dönüştürür.
API, bu hesaplamayı ne kadar uzun süre bekleyebileceğine dair bir zaman sınırlaması vermedi, bu nedenle bu uzun süreli talepler sürekli olarak tüm istek işleme kapasitelerini işgal etti, ilgili talepleri başarısız olmasına neden oldu. Otomatik ölçeklendirme maksimum kapasiteye hızla ulaştı ve telafi edemedi.
# # Tespit
Otomatik izleme, 15:15 UTC'deki başarısızlıkları tespit etti, etki başladıktan yaklaşık beş dakika sonra ve on-call mühendisini sayfaladı.
Olay başlangıçta sadece istek fırtınasını üreten müşteriye atfedildi, ancak müşteri raporları ve daha fazla soruşturma, başarısızlık patlamaları sırasında daha geniş bir kullanıcı setini gösterdi.
# # Response
The on-call mühendisi, talep edilen tahmin yolundaki sınırsız bekleyişlere izin verdi. Hizmet kapasitesi otomatik örnek yedek tarafından defalarca restore edildi, bir kod düzeltmesi geliştirildi.
Fix, katkıda bulunan talep üzerine sıkı bir zaman harcıyor, böylece diğer talepleri etkilemeden hızlı başarısız oluyor ve yaklaşık 18:00 UTC'de etkilenen bölgeye dağıtıldı ve 18:15 UTC'de karar onaylandı.
## Follow-Up
1. katı zaman ve yük toplama düzeltmesi tüm bölgelere kalıcı ve serbest bırakıldı (13 Ağustos 2026).
2. Talep edilen tahmin hesaplamasında per-client sınırları değerlendirin, böylece tek bir müşterinin kullanımı paylaşılan API'yi bozamaz.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Doküman GXP East ABD Bölgesi'nde Outage Anlamak
Başlangıç 10 Ağustos 2026 14:11 UTC · 14m
Pending
Etkilenen bileşenler
Document UnderstandingDocument Understanding
investigating
GXP East ABD Bölgesi'nde Belge Anlayışında Front-Bitiş Hizmetlerinin Degraded performans etkisini araştırıyoruz.
Etkisi: Kullanıcılar GXP ABD'deki UI'ye eriştiğinde zamanları fark edebilir.
Sonraki güncelleme: Ek güncellemeler daha fazla bilgi mevcut olacak.
resolved
Sorun çözüldü ve Belge Anlayışındaki Front-Bit Servis'in performansı GXP East ABD Bölgesi'ndeki UI'yi yükseltdikten sonra beklenen seviyelere geri döndü.
Etkisi: Sürekli kullanıcı etkisi yok.
postmortem
## Müşteri Etkisi
10 Ağustos 2026'da 13:21 UTC ve 10 Ağustos 2026'da 14:03 UTC'de, müşterilerin alt seti, Belge kullanıcı arayüzüne eriştiğinde, tasarım-zaman deneyimi sağlar. Doküman işleme otomasyonları etkilenmedi.
## Root neden
Kullanıcı arayüzünü Gecikme ABD bölgesine doğru anlamanın arkasındaki hizmetin önceden mevcut bir şekilde inşa edilmesinden manuel bir dağıtım sırasında, dağıtım sürecimiz dağıtım sürecimiz dağıtım işlemine dağıtılıyor. Doküman Anlayış arayüzü, aynı sürüm tanımlayıcısı altında mevcut olan kaynakların dağıtım hizmeti olarak kullanılmasını gerektirir. Çünkü dağıtım süreci bu tanımlayıcıyı değiştirdi, arayüz gerekli kaynakları bulamadı, erişilemez veya zaman kaybetmesine neden oldu.
# # Tespit
Dağıtım bittikten sonra sorun anlarının farkında olduk, manuel dağıtım kontrol listesinin bir parçası olarak manuel doğrulama yoluyla. Kısa bir süre sonra 13:28 UTC'de 10 Ağustos 2026'da tetiklenen otomatik bir uyarı.
# # Response
El dağıtım başarısızlığının nedenini tespit ettikten sonra, mühendislik ekibimiz mevcut gerekli kaynaklarla düzeltilmiş bir güncelleştirme dağıtmaya başladı. Aynı zamanda, operasyonlar ekibi dağıtımın manuel bir geri dönüşü gerçekleştirmek için meşguldü. rollback 14:03 UTC'de tamamlandı, tasarım-zaman deneyimine erişim.
14:11 UTC'de, ABD bölgesinin gecikmiş kullanıcı arayüzünü anlamak için not edilen resmi bir statü güncellemesi yayınladık. 14:15 UTC'ye göre, düzeltilmiş güncelleme tamamlandı ve arayüz doğru yeni bir sürüm ve çalışma ile dağıtıldı.
14:25 UTC'de, olay işaretlendi ve halk statüsü sayfası, Belge Anlayış arayüzü performansının beklenen seviyelere geri döndüğünü doğrulamak için güncellendi.
## Takip
1. Hizmetin önceki versiyonunu geri yüklemek için gereken süreyi azaltırız, böylece başarısız bir dağıtımdan kurtarma daha hızlıdır.
2. Gelecekteki bir durumu önlemek için manuel dağıtım sürecine gelişmeler yapıyoruz, gerekli kaynakların bir ön koşul olarak geçerli olmasını sağlamak için.
Resmî olay güncellemesinden otomatik olarak çevrilmiştir.
Uipath Apps is facing outage in Delayed US region
Başlangıç 8 Ağustos 2026 11:54 UTC · 4h 6m
OutageBüyük çaplı olay
Etkilenen bileşenler
Apps
identified
We have identified the cause of the outage impacting Uipath Apps is facing outage in Delayed US region and are working on a fix.
Impact: Users may continue to be unable to access Uipath Apps and solutions dependent on Uipath Apps.
Team is working on service restoration.
identified
Team is working on service restoration. We will update the status once mitigation is completed.
identified
Team has identified an issue with an underlying resource and is actively working to restore service.
identified
Team has made progress to fix underlying resource issue and is actively working to restore service.
monitoring
Mitigation has been applied and performance is improving for the issue.
We are monitoring closely to ensure stability.
resolved
The mitigation has remained stable, and performance has returned to expected levels. We have confirmed service restoration for UiPath Apps in the Delayed US region and are marking this incident as resolved.
postmortem
## Customer impact
Between 11:20 am UTC and 2:54 pm UTC on August 8, 2026, a subset of customers in the Delayed US region experienced failures accessing UiPath Apps and solutions that depend on UiPath Apps.
Customers may have seen UiPath Apps unavailable or intermittent request failures. The impact lasted approximately 3 hours and 34 minutes.
## Root cause
The incident was caused by database connection saturation following scheduled maintenance performed by our database provider. As application services scaled up, they created additional database connections, which caused new connection attempts to fail and resulted in connection reset errors in UiPath Apps.
## Detection
Automated alerts detected the issue at 11:24 am UTC on August 8, 2026. Application telemetry showed failures beginning at approximately 11:20 am UTC.
## Response
At 11:00 am UTC, scheduled maintenance began automatically. At 11:20 am UTC, requests began failing. At 11:24 am UTC, automated alerts were triggered, and the team began investigating.
At 12:24 pm UTC, database capacity was scaled up as a mitigation. At 1:13 pm UTC, application services were restarted to reduce saturated connection usage and refresh database connections. Connection levels remained elevated, and the database automatically scaled at 1:22 pm UTC and at 2:36 pm UTC.
Following these mitigation efforts, request failures stopped at 2:54 pm UTC. At 3:33 pm UTC, the mitigation was confirmed to be stable, and performance was improving. Full recovery was confirmed at 4:01 pm UTC after performance returned to expected levels.
## Follow up
1. Obtain and review the database provider's root cause analysis explaining what caused the connection issue following their maintenance activity.
2. Implement an application-side limit on database connection creation to prevent connection saturation.
3. We are reviewing the automatic scaling behavior that amplified connection volume during the incident and address any contributing factors.
US Region Document Ingestion Degradation
Başlangıç 6 Ağustos 2026 10:00 UTC · 0m
Pending
resolved
Between 06-08-2026 10:00 UTC and 06-08-2026 13:00 UTC, some organizations in the US region were unable to complete document ingestion. A small number of search requests in the same region were also slow or timed out.
The issue was caused by a capacity constraint affecting ingestion processing in US. Normal performance was restored at 13:00 UTC.
We have monitored the affected environments since recovery and confirm the issue is fully mitigated. Ingestion requests that failed during this window were not retried automatically and will need to be re-submitted. No action is required for search.
postmortem
## Customer impact
Between August 6, 2026 at 10:00 am UTC and 1:00 pm UTC, some organizations in the US region were unable to complete document ingestion in **UiPath Context Grounding**. A small number of search requests in the same region were also slow or timed out.
**Action required:** please re-submit the affected ingestion requests. Ingestion retries a failing request automatically for a limited number of attempts. Once those attempts are exhausted the request is marked failed and is not retried again, so affected documents will not appear in your index until the request is submitted again. Failed requests are listed in the ingestion history for each index.
No action is required for search. Those requests were affected only while the issue was ongoing, and subsequent searches completed normally.
---
## Root cause
A sudden increase in concurrent document ingestion triggered a high number of simultaneous document validation steps, which created a capacity bottleneck on the underlying infrastructure resource beyond its scaling capacity.
Once that resource was saturated, ingestion operations began exceeding their time limits and failing. Automatic retries of the failed operations added further load, which sustained the condition. Search requests served by the same resource were delayed behind the same contention.
---
## Detection
Automated alerts were flagged as the condition developed, and an automated infrastructure resource capacity alert triggered at 10:37 am UTC brought it to the team's attention.
---
## Response
- **10:03 am UTC** — Automated low severity alerts started coming in.
- **10:37 am UTC** — Automated alert for resource capacity issue paged the team.
- **12:23 pm UTC** — As a mitigation step the impacted resource's capacity was increased.
- **12:57 pm UTC** — Ingestion and search operations stopped failing and response times returned to normal.
---
## Follow-up
- **The fix is deployed.** The validation step has been reimplemented to enforce the same limits at a small fraction of the previous cost, so this level of concurrent ingestion now sits well within available capacity. It was released to the affected US region on August 7, ahead of schedule, and reaches all remaining regions by early September.
- **We are improving how quickly we detect issues like this.** We are adding monitoring that tracks whether document ingestion is completing successfully for customers, so problems are identified and acted on directly rather than inferred from underlying system alerts. This will be in place across all regions by the end of August.