Web scraping LinkedIn : est-ce légal et comment faire ?

Dans cet article

  • Le web scraping LinkedIn se situe dans une zone grise juridique entre données publiques et conditions d’utilisation de la plateforme
  • La décision hiQ Labs c/ LinkedIn (2022) a confirmé que le scraping de données publiques n’enfreint pas le CFAA aux États-Unis
  • En Europe, le RGPD impose des limites strictes sur la collecte de données personnelles, même accessibles publiquement
  • Des outils comme PhantomBuster, Waalaxy ou Derrick permettent d’automatiser l’extraction sans coder
  • LinkedIn limite les requêtes à environ 80 profils par jour sur un compte gratuit avant restriction
  • Une approche par API officielle ou Sales Navigator reste la méthode la plus sûre pour un usage professionnel

Depuis que je travaille comme développeur web, je vois régulièrement des clients me demander comment récupérer automatiquement des données depuis LinkedIn. Prospection commerciale, recrutement, veille concurrentielle : les cas d’usage sont nombreux. Mais la question revient systématiquement : le web scraping LinkedIn est-il légal, et comment procéder sans risquer son compte ?

J’ai moi-même exploré ce sujet en profondeur, autant du côté technique que juridique. Entre les décisions de justice américaines, le RGPD européen et les conditions d’utilisation de la plateforme, le paysage n’est pas simple. Dans cet article, je vous donne ma vision de développeur et je partage les méthodes concrètes que j’utilise ou recommande à mes clients.

Qu’est-ce que le web scraping LinkedIn exactement ?

Le web scraping LinkedIn consiste à extraire automatiquement des données depuis la plateforme LinkedIn à l’aide de scripts, d’extensions navigateur ou d’outils dédiés. Contrairement à une copie manuelle, le scraping permet de collecter en masse des informations structurées : noms, postes, entreprises, compétences, adresses e-mail professionnelles.

Pour bien comprendre le principe, je vous invite à lire mon article sur la collecte de données avec le web scraping, qui pose les bases techniques de cette pratique. Le cas de LinkedIn est particulier parce que la plateforme contient des données professionnelles semi-publiques, ce qui crée une tension entre accessibilité et protection de la vie privée.

Les données extraites par scraping sont généralement structurées sous forme de tableaux exploitables
Les données extraites par scraping sont généralement structurées sous forme de tableaux exploitables

Concrètement, le linkedin web scraping peut cibler plusieurs types de données :

  • Profils individuels : nom, titre, expérience professionnelle, formation, compétences
  • Pages entreprise : taille, secteur, localisation, nombre d’employés
  • Offres d’emploi : intitulé de poste, description, salaire estimé, localisation
  • Publications et interactions : posts, commentaires, réactions
  • Résultats de recherche : listes filtrées de profils selon des critères précis

La particularité de LinkedIn par rapport à d’autres plateformes, c’est que certaines données sont visibles sans connexion (profils publics indexés par Google), tandis que d’autres nécessitent un compte authentifié. Cette distinction a des implications juridiques majeures, comme nous allons le voir.

Le scraping LinkedIn est-il légal ? Le cadre juridique décrypté

C’est la question que l’on me pose le plus souvent. Et la réponse honnête, c’est : ça dépend. Le cadre juridique varie selon le pays, le type de données collectées et l’usage qui en est fait.

Aux États-Unis : la décision hiQ Labs

L’affaire hiQ Labs c/ LinkedIn a fait jurisprudence. En 2022, la Cour suprême des États-Unis a confirmé que le scraping de données publiquement accessibles ne viole pas le Computer Fraud and Abuse Act (CFAA). Autrement dit, si un profil LinkedIn est visible sans authentification, son extraction automatique n’est pas un délit fédéral au sens strict.

Cependant, cette décision ne constitue pas un blanc-seing. LinkedIn conserve la possibilité de bloquer techniquement les scrapers et de poursuivre sur d’autres fondements juridiques (concurrence déloyale, violation contractuelle).

En Europe : le RGPD change la donne

En Europe, la situation est plus restrictive. Le Règlement général sur la protection des données (RGPD) s’applique dès lors que vous collectez des données personnelles de résidents européens, même si ces données sont publiquement accessibles. Cela signifie que :

  • Vous devez disposer d’une base légale pour le traitement (intérêt légitime, consentement)
  • Les personnes concernées doivent être informées de la collecte
  • Elles doivent pouvoir exercer leurs droits (accès, rectification, suppression)
  • La collecte doit respecter le principe de minimisation des données

En pratique, scraper massivement des profils LinkedIn à des fins de prospection commerciale sans consentement préalable expose à des sanctions pouvant atteindre 4 % du chiffre d’affaires annuel ou 20 millions d’euros.

Les conditions d’utilisation de LinkedIn

Indépendamment de la loi, les conditions d’utilisation de LinkedIn interdisent explicitement le scraping automatisé. Leur article 8.2 prohibe l’utilisation de bots, crawlers ou tout autre moyen automatisé pour accéder à la plateforme. En cas de violation, LinkedIn peut suspendre ou supprimer définitivement votre compte.

Juridiction Données publiques Données privées Risque principal
États-Unis Généralement autorisé (hiQ Labs) Interdit (CFAA) Poursuites civiles
Union européenne Encadré par le RGPD Strictement encadré Amendes CNIL jusqu’à 20 M€
Conditions LinkedIn Interdit Interdit Suspension de compte

Les principales méthodes pour extraire des données LinkedIn

En tant que développeur, j’identifie quatre grandes approches pour l’extraction de données LinkedIn. Chacune a ses avantages et ses limites.

1. L’API officielle LinkedIn

LinkedIn propose une API officielle avec différents niveaux d’accès. L’API Marketing et l’API Talent Solutions permettent d’accéder à certaines données de manière autorisée. C’est la méthode la plus sûre juridiquement, mais aussi la plus restrictive en termes de données accessibles. L’accès nécessite une candidature auprès de LinkedIn et l’approbation de votre application.

2. Les extensions navigateur

Des outils comme Waalaxy, PhantomBuster ou Derrick fonctionnent comme des extensions Chrome qui extraient les données pendant que vous naviguez sur LinkedIn. Ils simulent le comportement humain pour limiter les risques de détection. C’est l’approche la plus populaire pour le scraping LinkedIn gratuit ou à faible coût.

3. Le scraping par requêtes HTTP directes

Cette méthode consiste à envoyer des requêtes HTTP directement aux serveurs de LinkedIn en reproduisant les en-têtes d’un navigateur classique. Elle nécessite des compétences en développement et une gestion fine des cookies de session. J’explique les fondamentaux de cette approche dans mon guide sur le web scraping avec Python.

4. Les services de scraping managés

Des plateformes comme Bright Data, Apify ou ScrapFly proposent des infrastructures clé en main avec gestion des proxies, rotation d’IP et résolution de CAPTCHAs. Elles facturent généralement au nombre de requêtes ou de profils extraits.

Un développeur configure un script Python pour automatiser l'extraction de profils LinkedIn
Un développeur configure un script Python pour automatiser l’extraction de profils LinkedIn

Quel est le meilleur outil de scraping LinkedIn ?

J’ai testé et comparé les principaux outils du marché. Voici mon analyse détaillée pour vous aider à choisir celui qui correspond à votre besoin.

Outil Type Plan gratuit Prix entrée Limite quotidienne Idéal pour
Waalaxy Extension Chrome Oui (80 invitations/mois) 56 €/mois 80-150 profils Prospection automatisée
PhantomBuster Plateforme cloud Oui (14 jours d’essai) 69 $/mois Configurable Extraction flexible multi-plateformes
Derrick Extension Google Sheets Oui (limité) 49 €/mois 100 profils Export direct en tableur
Bright Data Service managé Essai gratuit 500 $/mois 5 000+ profils Extraction massive B2B
Apify Plateforme cloud 5 $ de crédits 49 $/mois Variable Développeurs, scraping sur mesure
Evaboot Extension Chrome Non 29 €/mois 2 500 profils/mois Export Sales Navigator

Mon avis personnel : pour un usage ponctuel ou une petite équipe commerciale, Waalaxy offre le meilleur rapport simplicité/efficacité. Pour des besoins techniques avancés, PhantomBuster reste la référence grâce à ses “Phantoms” configurables. Si vous travaillez déjà avec Sales Navigator LinkedIn, Evaboot est un excellent complément pour exporter vos listes filtrées.

Pour les développeurs qui souhaitent garder le contrôle total, je recommande de construire votre propre solution. C’est ce que je détaille dans la section suivante.

Scraper LinkedIn avec Python : approche technique

En tant que développeur, je préfère souvent construire mes propres outils. Python est le langage idéal pour le web scraping grâce à son écosystème riche. Si vous débutez, je vous conseille de consulter d’abord mon article sur le scraping web avec Python qui couvre les fondamentaux.

Architecture de base d’un scraper LinkedIn

Voici la structure que j’utilise pour mes projets d’extraction LinkedIn. Le principe repose sur l’utilisation de Selenium ou Playwright pour simuler un navigateur réel, combiné à BeautifulSoup pour parser le HTML retourné.

from playwright.sync_api import sync_playwright
from bs4 import BeautifulSoup
import time
import random
import json

def scrape_linkedin_profile(url, page):
    """Extrait les informations d'un profil LinkedIn."""
    page.goto(url)
    # Attente aléatoire pour simuler un comportement humain
    time.sleep(random.uniform(3, 7))
    
    soup = BeautifulSoup(page.content(), 'html.parser')
    
    name = soup.select_one('h1.text-heading-xlarge')
    headline = soup.select_one('div.text-body-medium')
    
    return {
        'name': name.text.strip() if name else None,
        'headline': headline.text.strip() if headline else None,
        'url': url
    }

def main():
    with sync_playwright() as p:
        browser = p.chromium.launch(headless=False)
        context = browser.new_context(
            viewport={'width': 1920, 'height': 1080},
            user_agent='Mozilla/5.0 (Windows NT 10.0; Win64; x64)...'
        )
        page = context.new_page()
        
        # Connexion manuelle ou via cookies de session
        # ...
        
        profiles = ['https://www.linkedin.com/in/exemple-1/',
                     'https://www.linkedin.com/in/exemple-2/']
        
        results = []
        for profile_url in profiles:
            data = scrape_linkedin_profile(profile_url, page)
            results.append(data)
            # Pause entre chaque profil
            time.sleep(random.uniform(10, 25))
        
        with open('resultats.json', 'w') as f:
            json.dump(results, f, ensure_ascii=False, indent=2)
        
        browser.close()

if __name__ == '__main__':
    main()

Quelques points importants à respecter dans votre code :

  • Délais aléatoires entre chaque requête (10 à 25 secondes minimum)
  • Rotation des user-agents pour varier les empreintes navigateur
  • Gestion des cookies de session plutôt que stockage de mots de passe en clair
  • Limitation stricte du volume : 60 à 80 profils par jour maximum sur un compte standard

Pour aller plus loin dans l’extraction de pages web, mon article dédié au scraping de pages web en Python détaille les techniques avancées de parsing et de gestion des erreurs.

Les erreurs et risques à éviter absolument

Après des années à accompagner des clients sur ces sujets, voici les erreurs que je vois le plus souvent, et qui mènent systématiquement à des problèmes.

Erreurs techniques

  • Scraper trop vite : envoyer des dizaines de requêtes par minute déclenche immédiatement les systèmes anti-bot de LinkedIn. Résultat : blocage temporaire puis permanent du compte
  • Utiliser un seul compte : concentrer toute l’activité de scraping sur un seul compte LinkedIn multiplie les risques de détection
  • Ignorer les pages CAPTCHA : si LinkedIn vous présente un CAPTCHA, c’est un avertissement. Continuer à scraper après un CAPTCHA sans ralentir garantit un blocage
  • Ne pas gérer les erreurs HTTP : un code 429 (Too Many Requests) ou 999 (LinkedIn-specific) signifie que vous devez vous arrêter immédiatement
Un scraping trop agressif peut entraîner la suspension temporaire ou définitive de votre compte LinkedIn
Un scraping trop agressif peut entraîner la suspension temporaire ou définitive de votre compte LinkedIn

Erreurs juridiques

  • Collecter des e-mails personnels : extraire des adresses e-mail personnelles (Gmail, Yahoo) sans consentement est une violation flagrante du RGPD
  • Revendre des données brutes : constituer une base de données de profils LinkedIn pour la revendre est illégal dans la plupart des juridictions européennes
  • Ignorer les demandes de suppression : si une personne vous demande de retirer ses données, vous avez 30 jours maximum pour vous conformer selon le RGPD
  • Ne pas tenir de registre de traitement : la CNIL exige un registre des traitements pour toute collecte de données personnelles

Erreurs stratégiques

  • Scraper sans objectif précis : collecter des milliers de profils “au cas où” est une perte de temps et un risque inutile. Définissez d’abord vos critères de ciblage
  • Négliger la qualité des données : un profil LinkedIn non mis à jour depuis 3 ans n’a aucune valeur pour de la prospection. Filtrez systématiquement

Bonnes pratiques pour un scraping LinkedIn responsable

Si vous décidez de procéder au web scraping LinkedIn malgré les risques, voici les règles que je recommande de suivre pour minimiser les problèmes.

Limiter le volume et la fréquence

LinkedIn surveille activement les comportements anormaux. Voici les seuils que je recommande de ne jamais dépasser :

  • Compte gratuit : maximum 60 à 80 consultations de profils par jour
  • Compte Premium : maximum 100 à 120 consultations par jour
  • Sales Navigator LinkedIn : maximum 150 à 200 consultations par jour
  • Heures d’activité : scrapez uniquement pendant les heures ouvrables (8h-19h) de votre fuseau horaire
  • Week-ends : réduisez le volume de 50 % ou arrêtez complètement

Protéger votre compte

  • Utilisez un compte LinkedIn dédié au scraping, jamais votre compte personnel
  • Complétez le profil à 100 % avec une photo, une description et des connexions réelles
  • “Chauffez” le compte pendant 2 à 3 semaines avant de commencer le scraping
  • Alternez les sessions de scraping avec une navigation manuelle normale

Respecter le RGPD

  • Documentez votre base légale (généralement l’intérêt légitime pour la prospection B2B)
  • N’extrayez que les données strictement nécessaires à votre objectif
  • Prévoyez un mécanisme d’opt-out dans vos communications
  • Définissez une durée de conservation et supprimez les données au-delà

La sécurité des données collectées est également primordiale. Si vous stockez ces données dans le cloud, je vous recommande de consulter mon article sur la sécurité en infonuagique pour mettre en place les mesures appropriées.

Alternatives légales à l’extraction de données LinkedIn

Avant de vous lancer dans le scraping, considérez ces alternatives plus sûres qui peuvent répondre à votre besoin.

Comment extraire les données de votre propre compte LinkedIn

LinkedIn permet à chaque utilisateur de télécharger l’intégralité de ses propres données. Rendez-vous dans Paramètres > Confidentialité des données > Obtenir une copie de vos données. Vous recevrez un fichier ZIP contenant vos connexions, messages, publications et historique de recherche. Cette méthode est parfaitement légale et couvre la plupart des besoins d’extraction LinkedIn personnelle.

Sales Navigator LinkedIn

Pour la prospection commerciale, Sales Navigator reste l’outil officiel le plus puissant. Il permet de créer des listes de prospects avec des filtres avancés (secteur, taille d’entreprise, ancienneté de poste) et d’exporter certaines données. Combiné à un outil comme Evaboot, il offre une extraction semi-automatisée dans un cadre autorisé par LinkedIn.

Les API officielles

Si votre projet nécessite une intégration technique, les API LinkedIn (Marketing, Talent Solutions, Consumer) offrent un accès structuré aux données. L’approbation prend du temps, mais c’est la seule méthode qui élimine tout risque juridique. La gestion de ces intégrations s’inscrit dans une démarche DevOps moderne avec des pipelines de données automatisés et fiables.

Les bases de données B2B tierces

Des services comme Apollo.io, Lusha ou Kaspr agrègent des données professionnelles depuis de multiples sources (dont LinkedIn) et assument la responsabilité juridique de la collecte. Vous payez pour accéder à des données déjà structurées et mises à jour, sans les risques du scraping direct.

À retenir

  • Limitez-vous à 60-80 profils par jour sur un compte gratuit pour éviter la suspension
  • Documentez votre base légale RGPD avant toute collecte de données personnelles
  • Utilisez un compte LinkedIn dédié au scraping, jamais votre profil personnel
  • Privilégiez Sales Navigator ou l’API officielle pour un usage professionnel pérenne
  • Conservez un registre des traitements conforme aux exigences de la CNIL

Questions fréquentes


Est-il possible d’extraire des données web de LinkedIn ?

Oui, il est techniquement possible d’extraire des données web de LinkedIn en utilisant des outils de scraping (extensions navigateur, scripts Python, services managés). Cependant, cette pratique est interdite par les conditions d’utilisation de LinkedIn et encadrée par le RGPD en Europe. Les données publiquement accessibles sans authentification bénéficient d’une certaine tolérance juridique depuis la décision hiQ Labs, mais la collecte de données nécessitant une connexion reste juridiquement risquée.

Est-il possible de scraper LinkedIn ?

Oui, le scraping de LinkedIn est techniquement faisable avec des outils comme PhantomBuster, Waalaxy ou des scripts Python utilisant Selenium ou Playwright. LinkedIn déploie cependant des mesures anti-bot sophistiquées (CAPTCHAs, limitations de requêtes, détection de comportements anormaux). Sur un compte gratuit, vous pouvez raisonnablement consulter 60 à 80 profils par jour avant de déclencher des restrictions. Au-delà, votre compte risque une suspension temporaire ou définitive.

Quel est le meilleur outil de scraping LinkedIn ?

Le meilleur outil dépend de votre profil et de vos besoins. Pour les non-développeurs, Waalaxy offre la meilleure prise en main avec un plan gratuit fonctionnel. Pour les équipes commerciales, PhantomBuster propose la plus grande flexibilité avec ses scénarios automatisés. Pour les développeurs, une solution sur mesure avec Python et Playwright permet un contrôle total. Pour les volumes importants, Bright Data fournit l’infrastructure la plus robuste avec gestion des proxies et rotation d’IP.

Comment puis-je extraire les données de mon compte LinkedIn ?

LinkedIn vous permet d’exporter vos propres données gratuitement. Connectez-vous à LinkedIn, allez dans Paramètres et confidentialité > Confidentialité des données > Obtenir une copie de vos données. Sélectionnez les catégories souhaitées (connexions, messages, profil) et validez. Vous recevrez un e-mail avec un lien de téléchargement sous 24 à 72 heures. Le fichier ZIP contiendra des fichiers CSV exploitables dans Excel ou Google Sheets.

Le scraping LinkedIn gratuit est-il fiable ?

Les outils de scraping LinkedIn gratuit (versions freemium de Waalaxy, PhantomBuster ou extensions open source) fonctionnent mais présentent des limitations significatives : quotas réduits (souvent 80 à 100 profils par mois), fonctionnalités restreintes, absence de support et mises à jour moins fréquentes face aux changements de LinkedIn. Pour un usage ponctuel ou des tests, ils suffisent. Pour une utilisation professionnelle régulière, un abonnement payant offre une fiabilité et une productivité nettement supérieures.

Quelles sont les sanctions en cas de scraping abusif sur LinkedIn ?

Les sanctions varient selon la juridiction. LinkedIn peut suspendre ou supprimer votre compte sans préavis. En Europe, la CNIL peut infliger des amendes allant jusqu’à 20 millions d’euros ou 4 % du chiffre d’affaires annuel. Aux États-Unis, des poursuites civiles pour concurrence déloyale ou violation contractuelle sont possibles. En 2024, plusieurs entreprises européennes ont reçu des mises en demeure de la CNIL pour collecte non autorisée de données LinkedIn.


Damien Roux
Damien Roux

Ingénieur système et expert hébergement web. Fondateur de web-city.fr, il partage guides pratiques, comparatifs objectifs et outils gratuits pour choisir le bon hébergeur et créer son site WordPress.

Scroll to Top