Passer au contenu principal
Ce tutoriel vous montre comment utiliser l’intégration W&B avec Hugging Face Transformers pour suivre automatiquement les métriques d’entraînement et d’évaluation, les hyperparamètres et les statistiques système lors du fine-tuning d’un modèle. En suivant ce tutoriel, vous apprendrez à visualiser les performances de votre modèle dans le tableau de bord W&B afin de comparer les expériences et d’itérer sur vos modèles en toute confiance. Vous pouvez comparer les hyperparamètres, les métriques de sortie et les statistiques système, comme l’utilisation du GPU, entre vos modèles.

Pourquoi utiliser W&B

Avantages de l’utilisation de W&B
  • Tableau de bord unifié : dépôt central pour toutes les métriques et prédictions de votre modèle.
  • Léger : aucune modification du code n’est nécessaire pour l’intégrer à Hugging Face.
  • Accessible : gratuit pour les particuliers et les équipes universitaires.
  • Sécurisé : tous les projets sont privés par défaut.
  • Fiable : utilisé par des équipes de machine learning chez OpenAI, Toyota, Lyft et bien d’autres.
W&B fonctionne comme GitHub pour les modèles de machine learning. Enregistrez vos expériences de machine learning dans votre tableau de bord privé hébergé. Expérimentez en toute confiance : W&B enregistre toutes les versions de vos modèles, quel que soit l’endroit où vous exécutez vos scripts. Les intégrations légères de W&B fonctionnent avec n’importe quel script Python. Inscrivez-vous pour obtenir un compte W&B gratuit et commencer à suivre et à visualiser vos modèles. Dans le dépôt Hugging Face Transformers, W&B a instrumenté le Trainer pour journaliser automatiquement les métriques d’entraînement et d’évaluation vers W&B à chaque étape de journalisation. Voici un aperçu détaillé du fonctionnement de l’intégration : Hugging Face + W&B Report.

Installez, importez et connectez-vous

Cette section configure l’environnement nécessaire pour exécuter le tutoriel. Installez les bibliothèques Hugging Face et W&B, puis téléchargez le dataset GLUE et le script d’entraînement pour ce tutoriel :
  • Hugging Face Transformers : modèles et datasets de traitement du langage naturel.
  • W&B : suivi des expériences et visualisation.
  • GLUE dataset : dataset de référence pour la compréhension du langage.
  • GLUE script : script d’entraînement de modèle pour la classification de séquences.
Avant de continuer, vous devez vous inscrire pour créer un compte gratuit. Un compte est requis pour envoyer les données de votre run à un tableau de bord W&B.

Ajoutez votre clé API

L’authentification à l’aide de votre clé API associe ce notebook à votre compte W&B, afin que les runs soient enregistrés dans vos projets. Après votre inscription, exécutez la cellule suivante et cliquez sur le lien pour obtenir votre clé API et authentifier ce notebook.
Si vous le souhaitez, vous pouvez définir des variables d’environnement pour personnaliser ce que W&B journalise pendant l’entraînement. Par exemple, vous pouvez journaliser à la fois les gradients et les paramètres en définissant WANDB_WATCH=all. Voir le guide d’intégration Hugging Face pour la liste complète des options.

Entraîner le modèle

Une fois l’environnement configuré et l’authentification terminée, vous êtes prêt à démarrer un run d’entraînement. Ensuite, exécutez le script d’entraînement téléchargé run_glue.py et constatez que l’entraînement est automatiquement suivi dans le tableau de bord W&B. Ce script effectue le fine-tuning de BERT sur le Microsoft Research Paraphrase Corpus — des paires de phrases avec des annotations humaines indiquant si elles sont sémantiquement équivalentes.

Visualisez les résultats dans le tableau de bord

Une fois l’entraînement lancé, vous pouvez surveiller les métriques en temps réel. Cliquez sur le lien affiché par la cellule précédente ou rendez-vous sur wandb.ai pour voir vos résultats s’afficher en direct. Le lien pour voir votre run dans le navigateur apparaît une fois toutes les dépendances chargées. Recherchez la sortie suivante : “wandb: View run at [URL to your unique run]“

Visualisez les performances du modèle

Parcourez les expériences, zoomez sur les résultats intéressants et visualisez des données à forte dimensionnalité.
Tableau de bord des métriques du modèle

Comparez les architectures

Voici un exemple comparant BERT versus DistilBERT. Les graphiques en courbes générés automatiquement montrent comment différentes architectures influencent la précision de l’évaluation tout au long de l’entraînement.
Comparaison BERT versus DistilBERT

Suivre automatiquement les informations clés

Cette section décrit ce que W&B capture automatiquement afin que vous sachiez quelles données sont disponibles dans votre tableau de bord sans configuration supplémentaire. W&B enregistre un nouveau run pour chaque expérience. Voici les informations enregistrées par défaut :
  • Hyperparamètres : W&B enregistre les paramètres de votre modèle dans Config.
  • Métriques du modèle : W&B enregistre les données de séries temporelles des métriques envoyées à Log.
  • Journaux du terminal : W&B enregistre les sorties de la ligne de commande et les affiche dans un onglet.
  • Métriques système : utilisation du GPU et du CPU, mémoire et température.

En savoir plus