冲出150k+ 可靠的Instagram追随者:分批、恢复-误差和浓缩
Scraping 150k+ Instagram followers reliably: batching, resume-on-error, and enrichment
我在巴西经营一个小型的AI/自动调试咨询公司,最近的一个牵头研究项目需要一份公众Instagram简介(约153 000名追随者)的完整后续名单,加上丰富内容(生物、公共电子邮件/电话),以便找到值得联系的商业账户。 拖出一个大小的列表 从来不是一个API呼叫。 Instagram 报告 ~ 153,628 追随者;您逐页得到它们,任何长期提取 Will 最终都会遇到失败的请求. 如果你的管道不能恢复,你从零开始——这既昂贵又慢. 我所建造的管道以Supabase作为数据库,运行在n8n上:batched explain —— 追随者被分批下载,每轮下载最多可达一万个,按时间表,而不是一次巨跑. 重现出错——每个页面光标和计数持续. .
我在巴西经营一个小型的AI/自动调试咨询公司,最近的一个牵头研究项目需要一份公众Instagram简介(约153 000名追随者)的完整后续名单,加上丰富内容(生物、公共电子邮件/电话),以便找到值得联系的商业账户。 拖出一个大小的列表 从来不是一个API呼叫。 Instagram 报告 ~ 153,628 追随者;您逐页得到它们,任何长期提取 Will 最终都会遇到失败的请求. 如果你的管道不能恢复,你从零开始——这既昂贵又慢. 我所建造的管道以Supabase作为数据库,运行在n8n上:batched explain —— 追随者被分批下载,每轮下载最多可达一万个,按时间表,而不是一次巨跑. 重现出错——每页光标和计数持续. 当请求中途失败(在一次运行中,在读了96页之后,有4,782个追随者停止)时,任务记录错误,发电子邮件给我一份状态报告,并在下个周期从同一点接取,而不是重启. 富足通行证——第二个工作流程向被储存的追随者展示情况,并绘制简介细节,标出商业账户和任何公共邮件/电话。 个人/私人账户不返回联系数据,报告将分别计算。 电子邮件报告——每个周期都向我发送一个摘要:概况、追随者报告下载情况、页面阅读情况、批号名称以及发生错误时的具体错误。 对于我使用HikerAPI的Instagram数据层——我首先测试了其他几个选项,它在这个量的定价和利率限制上获得了胜利. 上面的跑步提出了100多项要求, 取舍 / 没有完全完成的 Long 提取有时仍然失败(超时); 恢复逻辑在这个尺度上不是可选的, 无论您使用的 API 是什么 。 早期我在这个堆堆上:到目前为止,它效果很好, 但我仍然在收集更多的数据,然后我叫管道战测试。 我会知道更多的经过 几个完整的150k跟随周期。 浓缩收益不大:大多数个人/私人账户没有公开接触数据,因此计划相应的转换预期。 Takeaway 将大型社会提取作为可重复的批量工作,而不是脚本:坚持光标,批量大小,并报告每个周期. 数据存储器+调度器比刮取API本身更重要. 披露:我是HikerAPI的用户奖励程序的一部分——他们把像这样的帖子记在我的账户上. 分享我的经验.