Sprites API 部分出局
- investigating
我们意识到一个影响 Sprites 用户子集的问题. 我们正在调查问题的根源.
- monitoring
出错率已经下降。 我们正在继续监测API的健康状况.
- resolved
这一事件已经得到解决.
自动翻译自官方事件更新。
104 Flyio incidents · 2026年4月 — official updates, affected components, duration and resolution details.
我们意识到一个影响 Sprites 用户子集的问题. 我们正在调查问题的根源.
出错率已经下降。 我们正在继续监测API的健康状况.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们在LAX发现一个上游网络问题. 与一些目的地的连接可能会出现延长延迟和包丢失。 我们正与上游合作解决这个问题.
我们与我们的供应商一起进行了一些临时缓解。 然而,由于这一问题的根源在于较大的上游过境提供者,因此,你们可能继续看到受影响区域内部/周边地区存在一些长期性和联系问题。 我们仍然和他们密切合作,解决根源问题.
我们正在更新受影响的区域名单 以包括SJC 因为这似乎是美国西海岸一个更广泛的上游问题.
一项措施已经执行,我们正在监测结果.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们正在调查一个问题 我们API的背景工作 需要背景工作的行动,如创建应用程序,指定IP地址,或创建/更新证书,此时可能失败.
一项措施已经执行,我们正在监测结果.
这一事件已经得到解决.
自动翻译自官方事件更新。
配置更新对位于一个主机子集的Fly Machines的入站HTTP/2流量造成临时故障几分钟. 这一事件后来得到解决。 Postgres的管理依赖于HTTP/2,一些控制平面操作也可能受到影响. 然而,下游的Postgres连接由于不使用HTTP2处理器,因此不太可能受到影响.
自动翻译自官方事件更新。
由于一个上游供应商,我们看到ORD的一个子集主机丢失了~50%的包. ORD中的一些MPG集群因此缓慢地被复制.
重建组织的损失正在改善
这一事件已经得到解决.
自动翻译自官方事件更新。
我们看到Sprite删除工作在协调世界时21:18至22:05之间失败. 这个问题已经得到解决.
自动翻译自官方事件更新。
我们正在调查影响GRU(巴西圣保罗)区域一些东道方的联网问题。 GRU中的一些应用软件可能会有更高的耐久性或包丢失.
GRU的联网工作已经恢复正常,我们不再看到问题。 我们正在继续监测,以确保全面恢复.
我们看到全球联盟的网络问题一再出现。 本区域的一些应用软件可能会出现更长时间或丢失的情况。 我们正与我们的上游网络提供者合作解决.
我们的上游供应商已经实施了一个解决方案。 GRU的网络性能已经恢复正常.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们目前正在调查这一问题.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们正在用我们的线卫网关来调查问题 诸如 " flyctl ssh Cope " 或 " flyctl 代理 " 等一些CLI命令目前可能无法使用。 Apps继续运行.
一项措施已经执行,我们正在监测结果.
我们的测试和监测显示,网关应恢复正常;如果使用 " flyctl ssh control " 仍有问题,请尝试 " flyctl agent " 重新启动 " flyctl " 代理.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们目前在一些地区的服务器上出现了一些衡量滞后。 我们正在提供更多的计量处理案例,以适应积压和追赶.
所有东道主都掌握了衡量标准 我们正在监视情况
现在解决了
自动翻译自官方事件更新。
我们正在调查洛杉矶地区的网络问题。 apps可能经历更长时间或此时无法到达.
上游网络问题已得到解决.
这一事件已经得到解决.
自动翻译自官方事件更新。
一个BGP配置错误导致我们Anycast DNS在没有适当的DNS基础设施的情况下,将路由到一些节点. 这个问题是暂时的,我们从BGP中取出这个节点后立即解决了.
自动翻译自官方事件更新。
我们已经查明一个问题,它给 " flyctl " 的一些行动造成了认证错误。 这些操作以如下错误失败: “ 此端点不再接受遗留的 OAuth 令牌( 从“ fo1 + ” 开始) 。 请使用 Macaroon 代言(从`fm2 `-'开始)。 我们找出了问题,正在解决
已安装了固定装置,不应再发生这种错误。 我们正在监测,以确保完全康复.
这一事件已经得到解决.
自动翻译自官方事件更新。
我们和Ord-0 Fly Kubernetes集群有问题,许多MPG集群未能重启. 我们的MPG团队正在积极开展工作.
我们正在继续调查这一问题.
一项措施已经执行,我们正在监测结果.
这一事件已经得到解决.
自动翻译自官方事件更新。
6PN在YYZ的一些机器之间的网络问题, 推出期间, 在此期间,一些机器无法像其他DB,其他app或MPG集群那样与内部资源交谈.
自动翻译自官方事件更新。
新的机器可能无法在ARN中创建,因为我们缺乏能力.
ARN地区的能力问题已经解决.
自动翻译自官方事件更新。
We are working to recover our secrets service after a failed deployment. Apps continue to run, but it is not possible to create new apps or update secrets at this time.
We have failed over the secrets database to a replica, and the Machines API appears healthy now. We are monitoring for any further issues.
This incident has been resolved.
自动翻译自官方事件更新。
We are currently investigating degraded ipv6 networking on a subset of hosts
We are continuing to investigate this issue.
The issue has been identified and a fix is being implemented.
A fix has been implemented and we are monitoring the results.
We are continuing to monitor for any further issues.
This incident has been resolved.
We are currently investigating app-not-found errors returned by Machines API calls made shortly after creating new applications.
We have identified the issue as failed insertions in a subset of Corrosion batches. These failures trigger retries, which can cause timeouts for other batches.
We’ve applied a mitigation to reduce the impact from Corrosion batch insertion retries and are continuing to monitor while affected nodes catch up.
We’ve deployed an additional mitigation to further reduce Corrosion retry pressure and are seeing improvement; we’re continuing to monitor while remaining affected nodes catch up.
A fix has been implemented and we are monitoring the results
This incident has been resolved.
High CPU pressure on a shared etcd instance is causing lags on MPG creation in the IAD region
Etcd is stable. Services are back to normal.