报告 API 错误的美国故障率上升
- resolved
在协调世界时8月15日19:54至20:07之间,向美国错误报告API(api.honybadger.io)的请求失败率上升. 在这一窗口中,大多数提交错误和事件的请求被超时或收到5xx的答复。 浏览器(JavaScript)错误报告,源地图上传,Honeybadger网络应用程序,仪表板,上线监测,以及我们的欧盟区域没有受到影响. 发生的情况:从协调世界时19:54起,一个单一来源开始以大约是其正常速度的150倍提交出错报告,有效载荷比平均数大几倍。 这比达到摄入水平的数据总量翻了一番多, 摄入水平在一分钟内饱和。 由于饱和服务持续接受连接而不是直接返回出错,因此我们的自动缩放和警报——它监视错误反应——没有迅速登记出问题,能力被加起来的时间比它本该晚. 服务在协调世界时20:07恢复,一旦额外的容量上线. 多数受影响的报告在API恢复后被我们的客户端图书馆成功重审,所以在窗口期间提交的绝大多数数据最终都收到. 没有重试逻辑的图书馆发送的报告没有收到,无法收回。 我们所做的: 我们的摄入级现在除了错误率外, 还在反应延迟度上, 所以这种饱和度在一两分钟内被检测出来, 而不是只在错误出现之后。 我们也提高了等级的基线能力,并扩大了我们的呼号警报,以覆盖不作为服务器错误表面的故障. 我们正在额外增加限制 一个单一来源可以提交多少数据。 我们为中断而感到抱歉 也为您在窗口中错误数据 造成的任何漏洞而道歉.
自动翻译自官方事件更新。