Redditbot 目前被 AppSec 封锁,且未被排除在机器人挑战之外
作者: l4rm4nd创建于 2026年9月14日更新于 2026年9月14日
标签kind/enhancementneeds/triage
我想添加什么内容呢? Reddit 链接预览爬虫(redditbot)目前正在被 CrowdSec AppSec 和新的机器人检测功能阻止或挑战。 它目前不包含在 appsec-bot-challenge-exclude-social WAF 配置中。 我想为 Redditbot 添加支持,作为一个合法的社交媒体爬虫,类似于现有的 Twitter/X、LinkedIn、Discord、Pinterest 等服务的排除。 ### 观察到的用户代理 Redditbot 发出的请求使用以下用户代理: Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback) 识别部分似乎是: redditbot/1.0 ### 网络验证 问题在于,与其他受支持的机器人不同,我无法识别 Redditbot 专用的可信 IP 范围,我们可以用于验证。 例如,我们观察到一个请求,其包含以下头部: User-Agent: Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback) X-Forwarded-Host: ... X-Span: ... X-Sampled: 1 X-Trace: ... Traceparent: ... X-Forwarded-Server: ... X-Parent: 0 但是,我不认为这些头部适合作为合法机器人白名单的身份验证/验证机制。 我也不想将广泛的云提供商 IP 范围添加到白名单中,仅仅因为 Redditbot 可能来自这种基础设施。 ## 问题 将 redditbot 添加到 appsec-bot-challenge-exclude-social 配置的推荐方法是什么? 特别是: 1. Redditbot 是否有官方的 IP 范围、ASN、反向 DNS 规范或其他网络属性,CrowdSec 建议使用来验证请求是否确实来自 Reddit? 2. 如果没有可信的网络验证,CrowdSec 是否支持仅基于用户代理的合法机器人定义,适用于 Redditbot? 我推测不会,因为用户代理可以被任何人伪造,从而完全绕过机器人保护。 3. 是否还有其他推荐的机制,可以允许 Reddit 的 URL/链接预览爬虫,而不会削弱 AppSec 机器人保护? 如果有推荐的验证方法,我很乐意贡献一个 reddit.json 定义。 谢谢! ### 为什么需要这样做? 不同于其他社交媒体机器人,Reddit 不包含在 appsec-bot-challenge-exclude-social 列表中。 因此,它被阻止并受到机器人验证挑战。 无法获取博客文章 SEO 内容、图像和排序。
内容来源: crowdsecurity/crowdsec