Baike.dev
Connexion
> 返回资讯列表
news_article.exe
📰

Dégraissage 150k+ Les adeptes d'Instagram de façon fiable : batching, reprise-sur-erreur et enrichissement

Scraping 150k+ Instagram followers reliably: batching, resume-on-error, and enrichment

2026年9月6日4 次浏览来源:Dev.to 阅读原文

J'ai dirigé un petit conseil en intelligence artificielle/automation au Brésil, et un récent projet de recherche en chef avait besoin d'une liste complète d'abonnés d'un profil public Instagram — environ 153 000 abonnés — plus l'enrichissement (bio, courriel public/téléphone) pour trouver des comptes d'affaires à contacter. Le problème Tirer une liste de taille n'est jamais un appel API. Instagram rapporte ~153,628 followers; vous les obtenez page par page, et toute extraction de longue durée SERA une requête échouée éventuellement. Si votre pipeline ne peut pas reprendre, vous recommencez à zéro, ce qui est coûteux et lent. Ce que j'ai construit Le pipeline fonctionne sur n8n avec Supabase comme datastore: Extraction attelée — les abonnés sont téléchargés en lots allant jusqu'à 10 000 par cycle, sur un calendrier, au lieu d'une course géante. Résumez l'erreur — chaque curseur de page et chaque nombre persiste. (...).

J'ai dirigé un petit conseil en intelligence artificielle/automation au Brésil, et un récent projet de recherche en chef avait besoin d'une liste complète d'abonnés d'un profil public Instagram — environ 153 000 abonnés — plus l'enrichissement (bio, courriel public/téléphone) pour trouver des comptes d'affaires à contacter. Le problème Tirer une liste de taille n'est jamais un appel API. Instagram rapporte ~153,628 followers; vous les obtenez page par page, et toute extraction de longue durée SERA une requête échouée éventuellement. Si votre pipeline ne peut pas reprendre, vous recommencez à zéro, ce qui est coûteux et lent. Ce que j'ai construit Le pipeline fonctionne sur n8n avec Supabase comme datastore: Extraction attelée — les abonnés sont téléchargés en lots allant jusqu'à 10 000 par cycle, sur un calendrier, au lieu d'une course géante. Reprendre en cas d'erreur — chaque curseur de page et compte est maintenu. Lorsqu'une requête échoue à mi-course (dans un cas, elle s'arrête à 4 782 followers après 96 pages lues), le travail enregistre l'erreur, m'envoie un rapport d'état, et prend à partir du même point sur le cycle suivant au lieu de redémarrer. Enrichissement pass — un second flux de travail permet aux abonnés stockés et tire les détails de profil, brandissant des comptes commerciaux et tout e-mail/téléphone public dans la bio. Les comptes personnels/privés ne renvoient aucune donnée de contact, que le rapport compte séparément. Rapports d'email — chaque cycle m'envoie un résumé: profil, suiveurs signalés vs. téléchargés, pages lues, nom de lot, et l'erreur exacte si elle s'est produite. Pour la couche de données Instagram j'ai utilisé HikerAPI — j'ai testé quelques autres options d'abord, et il a gagné sur les prix et les limites de taux pour ce volume. Il a géré l'amende de pagination: la course ci-dessus a fait plus de 100 requêtes sans que je gère des sessions ou proxies moi-même. Les compromis / ce qui n'a pas été parfaitement Long extractions échouent toujours parfois (timeouts); la logique de reprise n'est pas facultative à cette échelle, quelle que soit l'API que vous utilisez. Les premiers jours pour moi sur cette pile : jusqu'à présent, ça a bien marché, mais je collecte encore plus de données avant d'appeler la bataille du pipeline. J'en saurai plus après quelques cycles complets. Le rendement d'enrichissement est modeste: la plupart des comptes personnels/privés ne présentent aucune donnée de contact public, ce qui permet de planifier les attentes de conversion en conséquence. Takeaway Traiter les grandes extractions sociales comme un travail de lot récupérable, pas un script : persistez les curseurs, plafonnez les tailles de lot et rapportez chaque cycle. Le datastore + scheduler importe plus que l'API elle-même. Divulgation : Je fais partie du programme de récompenses d'utilisateurs de HikerAPI — ils créditent mon compte pour des postes comme celui-ci. Partager mon expérience réelle.

> 分享: