Ceci est un projet d'apprentissage du scraping avec Python.
On souhaite éviter d'utiliser scrapy.
Sur un terminal se placer sur un dossier cible.
Puis suivre les étapes suivantes :
- Cloner le dépôt ici présent en tapant:
git clone https://github.com/S0Imyr/Web-scraping.git - Accéder au dossier ainsi créé avec la commande :
cd Web-scraping - Créer un environnement virtuel pour le projet avec
python -m venv envsous windows oupython3 -m venv envsous macos ou linux. - Activez l'environnement virtuel avec
./env/Scripts/activatesous windows ousource env/bin/activatesous MacOS ou Linux. - Installez les dépendances du projet avec la commande
pip install -r requirements.txt
- Exécuter le script en tapant :
python main.py - Les fichiers csv se créent.
- Le téléchargement des images se lancent après.
Dans le dossier Web-scraping, on retrouve un dossier data.
Le fichier Data contient un dossier par catégorie.
Chaque fichier "catégorie" contient :
- un fichier csv au nom de la catégorie
- un dossier images avec les images de tous les livres de la "catégorie".