Les différents frameworks de web scraping

GNU/Linux Magazine

HS n°

114

mai 2021

Par

Tag(s)

framework

Web

Scraping

Il ne viendrait à l’idée à personne de nos jours de se lancer dans la récupération de données sur le Web sans s’appuyer sur un framework simplifiant la tâche et évitant de réinventer la roue (carrée). Voyons donc quelques outils indispensables permettant de mener à bien cette tâche.

Avant toute chose, avant de nous lancer dans l’exploration des frameworks de web scraping, nous devons bien comprendre ce qu’est un web scraper. Un web scraper est simplement un programme qui va récupérer automatiquement des données sur le Web. Il n’est pour l’instant nullement question d’un traitement, d’une analyse quelconque des données : la tâche du web scraper est de parcourir le Web à la recherche d’informations. Bien entendu, le parcours ne se fera pas de manière aléatoire et les données récupérées seront ciblées de manière précise... et c’est d’ailleurs là que réside réellement la difficulté du web scraping : les pages web sont en HTML et de nos jours, elles sont générées la plupart du temps depuis des frameworks dont la préoccupation première n’est pas d’obtenir un code clair et structuré. En ajoutant à cela que bon nombre de développeurs web n’ont de développeur que le nom, on obtient une infâme…

La suite est réservée aux abonnés. Il vous reste 98% à découvrir.

Déjà abonné ? Se connecter

Accédez à tous les contenus de Connect en illimité
Découvrez des listes de lecture et des contenus Premium
Consultez les nouveaux articles en avant-première

Envie de lire la suite ? Rejoignez Connect

Je m'abonne maintenant

Les différents frameworks de web scraping

Article rédigé par