fetch_page.py 无法获取 JS-hydrated 网站的约 70% 内容 — 建议使用 Playwright 备份方案
作者: getrocketsales创建于 2026年5月9日更新于 2026年5月9日
geo-seo-Claude 的默认页面提取器 (scripts/fetch_page.py) 使用原始请求 + lxml 解析,仅捕获 JS 充分的网站 (Next.js、React、Vue、Astro) 上的 SSR shell。在我审计的一个真实的医疗网站上,这导致工具遗漏了 4 个完整的 Physician JSON-LD 方案、6 个带有凭据的命名提供商,以及约 70% 的正文内容,导致审计分数低于正确值 30 分。由于 requirements.txt 已经引入了 Playwright,而安装程序已经运行了 playwright install chromium,因此修复措施基本上是免费的:检测充分,回退到渲染的提取。问题中包含了一个插入式替换 (~80 行)。
内容来源: zubair-trabzada/geo-seo-claude