爬取错误导致 skipDuplicates 设置为 false
作者: villesau创建于 2020年5月2日更新于 2020年5月12日
看起来,当网站出错时,`self.options.skipDuplicates` 设置为 false,但在当前版本中从未恢复为 true。这样就导致重复的 URL 会被系统爬取。更好的解决方案可能是类似这样的代码:
内容来源: bda-research/node-crawler
看起来,当网站出错时,`self.options.skipDuplicates` 设置为 false,但在当前版本中从未恢复为 true。这样就导致重复的 URL 会被系统爬取。更好的解决方案可能是类似这样的代码:
内容来源: bda-research/node-crawler