Tasas de falla elevadas en la API de informes de errores de EE.UU
- resolved
Entre 19:54 y 20:07 UTC el 15 de agosto, las solicitudes a nuestra API de informes de errores de los EE.UU. (api.honeybadger.io) experimentaron una tasa de falla elevada. Durante esta ventana, la mayoría de las solicitudes para presentar errores y eventos se ordenaron o recibieron respuestas 5xx. Navegador (JavaScript) reportaje de errores, subidas de mapas de origen, aplicación web de Honeybadger, tableros de control, monitoreo de tiempo fijo y nuestra región de la UE no fueron afectados. Lo que sucedió: A partir de las 19:54 UTC, una única fuente comenzó a presentar informes de error aproximadamente 150 veces su tasa normal, con cargas de pago varias veces más grande que la media. Esto duplicó más que el volumen total de datos que llegaban a nuestro nivel de ingestión, que saturaba en un minuto. Debido a que el servicio saturado seguía aceptando conexiones en lugar de devolver errores de forma directa, nuestro autoescalamiento y alerta —que observan respuestas de error— no registraban el problema rápidamente, y la capacidad se añadió más tarde de lo que debería haber sido. Servicio recuperado a 20:07 UTC una vez que la capacidad adicional vino en línea. La mayoría de los informes afectados fueron retrigados con éxito por nuestras bibliotecas cliente cuando se recuperó la API, por lo que la gran mayoría de los datos presentados durante la ventana fue finalmente recibido. No se recibieron informes enviados por bibliotecas sin lógica de reingreso y no se pueden recuperar. Lo que hemos hecho: nuestro nivel de ingestión ahora escala latencia de respuesta además de las tasas de error, por lo que este tipo de saturación se detecta dentro de un minuto o dos en lugar de sólo una vez que aparecen errores. También hemos aumentado la capacidad de referencia del nivel y hemos ampliado nuestras alertas de paging para cubrir fallos que no superan como errores del servidor. Además, estamos añadiendo límites sobre cuántos datos puede presentar una única fuente. Lo sentimos por la interrupción, y por cualquier brecha que haya causado en sus datos de error durante la ventana.
Traducido automáticamente desde la actualización oficial del incidente.