Guide pour bien choisir son logiciel de web scraping
Le web scraping consiste à extraire automatiquement des données de pages web pour les ranger dans un tableau ou une base : prix de concurrents, annonces, fiches produits, avis, listes d'entreprises. Ce qui demandait autrefois un développeur se fait aujourd'hui avec une extension de navigateur, un outil visuel ou une API, et les outils les plus récents préparent même les pages pour les modèles d'IA.
Voici mon comparatif des outils de web scraping, du gratuit au professionnel, avec les prix relevés chez les éditeurs et, surtout, ce que dit le droit français, que la plupart des guides résument en une phrase.
Les quatre familles d'outils
- Extensions de navigateur : pour extraire un tableau ou une liste depuis la page que vous consultez, sans rien installer d'autre.
- Outils visuels sans code : vous cliquez sur les éléments à récupérer, l'outil parcourt les pages et programme les extractions.
- Plateformes et API : pour les volumes importants, avec gestion des proxies, du rendu JavaScript et des protections anti-robots.
- Bibliothèques pour développeurs : pour construire un scraper sur mesure, en Python le plus souvent.
Les outils de web scraping comparés
Extensions et outils sans code
Instant Data Scraper est une extension Chrome entièrement gratuite, utilisée par un million de personnes ; les données extraites ne quittent pas votre navigateur. Web Scraper, éditeur letton, propose une extension gratuite et une version cloud pour programmer les extractions.
Octoparse est un logiciel de bureau avec une offre cloud, gratuit jusqu'à 10 tâches et 50 000 lignes par mois. Browse AI, éditeur canadien, propose une offre gratuite de 50 crédits par mois. ParseHub est une application de bureau avec une offre gratuite limitée à 200 pages par exécution. Lobstr, éditeur français, propose des scrapers prêts à l'emploi, dans le cloud.
Plateformes et API
Apify, éditeur tchèque, réunit une place de marché de scrapers prêts à l'emploi, les « Actors », et une infrastructure pour exécuter les vôtres. Bright Data et Oxylabs proposent des réseaux de proxies et des API de scraping facturées à l'usage. ScrapingBee, éditeur parisien, et ZenRows, éditeur espagnol, fournissent des API de scraping facturées au crédit. Firecrawl transforme les sites en données prêtes à être utilisées par des modèles d'IA.
Bibliothèques pour développeurs
Scrapy (licence BSD) est un framework Python très répandu pour construire des robots d'exploration, maintenu par Zyte avec plus de 500 contributeurs. Beautiful Soup (licence MIT) sert à analyser le HTML d'une page, souvent en complément d'une bibliothèque de requêtes.
Automatisation LinkedIn : prudence
Des outils de prospection comme PhantomBuster ou Waalaxy automatisent des actions sur LinkedIn. PhantomBuster le reconnaît sur son propre blog : « Any automation on LinkedIn carries account risk » (toute automatisation sur LinkedIn fait courir un risque au compte). LinkedIn interdit le scraping dans ses conditions d'utilisation, et la CNIL a déjà sanctionné une collecte de coordonnées sur LinkedIn (voir plus bas).
Combien coûte un outil de web scraping ?
Prix relevés sur les sites des éditeurs le 25 septembre 2026, en dollars sauf mention contraire :
- Instant Data Scraper, Scrapy, Beautiful Soup : gratuits.
- Web Scraper : extension gratuite ; cloud de 40 $ à 167 $ par mois en annuel (50 $ à 200 $ au mois).
- Octoparse : Standard à 69 $ et Professional à 249 $ par mois, en facturation annuelle.
- Browse AI : gratuit avec 50 crédits par mois ; Personal à 19 $ et Professional à 69 $ par mois en annuel.
- ParseHub : Standard à 189 $ et Professional à 599 $ par mois.
- Apify : 5 $ d'usage offerts ; offres à 19 $, 199 $ et 999 $ par mois, plus l'usage.
- ScrapingBee : 1 000 crédits offerts ; de 19 $ à 599 $ par mois, hors TVA.
- ZenRows : de 16 $ à 456 $ par mois en facturation annuelle.
- Firecrawl : 1 000 crédits gratuits par mois ; de 16 $ à 599 $ par mois en annuel.
- Bright Data et Oxylabs : à l'usage, par exemple à partir de 2,50 $ par Go pour les proxies résidentiels.
Le web scraping est-il légal ?
La réponse courte : l'outil est légal, c'est l'usage qui peut ne pas l'être. Cinq corps de règles se superposent, et la plupart des guides s'arrêtent au premier.
Les données personnelles : public ne veut pas dire libre
Dès que vous collectez des noms, des e-mails ou des profils, le RGPD s'applique. La CNIL le rappelle : ces données, « bien que publiquement accessibles, sont des données personnelles », et elles « ne sont pas librement réutilisables par tout responsable de traitement et ne peuvent être réexploitées à l'insu de la personne concernée ».
Le cas d'école est récent. Le 5 décembre 2024, la CNIL a prononcé une amende de 240 000 euros contre la société Kaspr, « notamment pour avoir collecté sur LinkedIn les coordonnées d'utilisateurs qui avaient pourtant choisi d'en limiter la visibilité ». La CNIL a considéré que masquer ses coordonnées « équivaut à une forme d'opposition ». Elle a aussi relevé une durée de conservation excessive et une information insuffisante des personnes. La société avait jusqu'en juin 2025 pour se mettre en conformité, et la procédure a été close en mars 2026.
Pour la prospection B2B, la CNIL admet l'intérêt légitime quand le message est en rapport avec la profession de la personne, mais celle-ci doit être informée et pouvoir s'opposer.
Les conditions d'utilisation des sites
Beaucoup de plateformes interdisent le scraping. LinkedIn, par exemple, fait promettre à ses membres de ne pas « développer, prendre en charge ou utiliser des logiciels, dispositifs, scripts, robots ou tout autre moyen ou procédé (tels que des robots d'indexation, modules d'extension ou compléments de navigateur, ou toute autre technologie) visant à effectuer du web scraping ». La Cour de justice de l'Union européenne a jugé en 2015 (affaire Ryanair, C-30/14) qu'une base de données non protégée par le droit d'auteur ni par le droit des producteurs peut être protégée par contrat. Violer les conditions d'un site expose donc au minimum à la fermeture du compte, et potentiellement à une action en justice.
Le droit des bases de données
Le producteur d'une base de données a le droit d'interdire l'extraction « de la totalité ou d'une partie qualitativement ou quantitativement substantielle » de son contenu (article L. 342-1 du Code de la propriété intellectuelle). Extraire une partie non substantielle reste permis ; aspirer tout ou l'essentiel d'un annuaire peut être interdit. En 2021, la CJUE (affaire CV-Online Latvia, C-762/19) a précisé qu'un moteur qui copie et indexe une base réalise une extraction, mais que le producteur ne peut l'interdire que si elle porte atteinte à son investissement.
La fouille de textes et de données, et le refus des sites
Le Code de la propriété intellectuelle autorise la fouille de textes et de données (article L. 122-5-3), sur laquelle s'appuient notamment les projets d'IA, mais le titulaire des droits peut s'y opposer, « notamment par des procédés lisibles par machine pour les contenus mis à la disposition du public en ligne ». Pour la CNIL, un projet d'IA qui moissonne le web doit exclure « les sites qui s'opposent clairement au moissonnage par l'intermédiaire des protocoles d'exclusion robots.txt ou de CAPTCHA ». Respecter le fichier robots.txt n'est donc plus une simple politesse.
Le pénal, pour les accès non autorisés
Contourner une protection pour extraire des données relève du Code pénal : l'article 323-3 punit le fait « d'extraire, de détenir, de reproduire, de transmettre, de supprimer ou de modifier frauduleusement les données » d'un système de traitement automatisé de cinq ans d'emprisonnement et de 150 000 € d'amende. Ce texte vise l'accès frauduleux : forcer un espace réservé ou contourner une protection, plutôt que lire une page publique.
En pratique : scrapez des données publiques, non personnelles de préférence, en quantité limitée, en respectant le robots.txt et les conditions du site, et documentez votre base légale si vous collectez des données personnelles.
Comment choisir son outil de web scraping
- Un besoin ponctuel : une extension comme Instant Data Scraper ou Web Scraper suffit pour récupérer un tableau.
- Une veille régulière sans coder : un outil visuel en cloud (Octoparse, Browse AI, Web Scraper Cloud) programme les extractions et vous alerte.
- Des volumes importants ou des sites protégés : une API (ScrapingBee, ZenRows, Apify, Bright Data, Oxylabs) gère l'infrastructure.
- Des données pour l'IA : Firecrawl, ou Apify, qui préparent les pages pour des modèles de langage.
- Une équipe technique : Scrapy et Beautiful Soup, gratuits, pour un contrôle total.
- Dans tous les cas : vérifiez la légalité de la collecte avant l'outil, surtout s'il s'agit de données personnelles.




