#3800·redis-py

超时错误和新连接激增

作者: travisofthenorth创建于 2025年10月16日更新于 2026年8月5日

你好。我们的 Redis 缓存集群出现了奇怪的行为,有时在某个节点上会出现超时错误的爆发,同时我们在该节点上看到新连接的巨大飙升。我们还不确定这些事情的发生顺序。集群托管在 AWS 中,通常在相关节点上会同时出现“网络带宽超限”指标。我发出此邮件是因为这些错误很难调试,因此如果这种行为对任何贡献者来说是合理的,可能会帮助我找到正确的方向。我们使用 `socket_connect_timeout` 为 1 秒,`socket_timeout` 为 100 毫秒。我们将 `retry` 设置为以 10 毫秒为基数,上限为 200 毫秒的指数退避,但目前只尝试了单次尝试。我有以下几个问题/想法: * 重试策略是否适用于建立连接,还是仅适用于执行命令? * 客户端是否尝试重新建立连接,如果遇到一定数量的错误?我试图找出我们看到的新连接是否是超时的结果,还是相反。如果错误 **没有** 导致重新连接,客户端是否还有其他尝试重新连接的情况?