Skip to main content
Ce guide vous montre comment déployer un artifact de modèle depuis W&B vers NVIDIA NeMo Inference Microservice (NIM) afin de servir le modèle pour l’inférence à grande échelle. Pour ce faire, utilisez W&B Launch. W&B Launch convertit les artifacts de modèle au format NVIDIA NeMo Model, puis les déploie sur un serveur NIM/Triton en cours d’exécution. Cela vous permet de déployer directement un modèle W&B suivi vers un point de terminaison prêt pour la production, sans conversion manuelle. W&B Launch accepte les types de modèles compatibles suivants :
Le temps de déploiement varie selon le modèle et le type de machine. La configuration de base Llama2-7b prend environ 1 minute sur Google Cloud’s a2-ultragpu-1g.

Démarrage rapide

Suivez ces étapes pour créer une file d’attente Launch, enregistrer le job de déploiement, lancer un agent et soumettre le déploiement.
  1. Créez une file d’attente Launch si vous n’en avez pas encore. La file d’attente définit la manière dont le job s’exécute sur votre machine équipée d’un GPU. Voir l’exemple suivant de configuration de la file d’attente.
    Configuration de la file d’attente Launch dans l’interface W&B
  2. Créez ce job dans votre projet. Cela enregistre le code du job de déploiement dans votre projet W&B afin que Launch puisse l’exécuter.
  3. Lancez un agent sur votre machine équipée d’un GPU. L’agent interroge la file d’attente et exécute le job de déploiement lorsque vous le soumettez.
  4. Soumettez le job Launch de déploiement avec les configurations souhaitées depuis l’interface W&B Launch. Vous pouvez également le soumettre via la CLI.
    Soumission d’un job Launch depuis l’interface W&B Launch
  5. Vous pouvez suivre le processus de déploiement dans l’interface W&B Launch.
    Suivi de la progression du déploiement dans l’interface W&B Launch
  6. Une fois le déploiement terminé, le point de terminaison NIM/Triton sert le modèle et est prêt à recevoir des requêtes d’inférence. Pour tester le modèle, utilisez curl sur le point de terminaison. Le nom du modèle est toujours ensemble.