Le temps de déploiement varie selon le modèle et le type de machine. La configuration de base
Llama2-7b prend environ 1 minute sur Google Cloud’s a2-ultragpu-1g.Démarrage rapide
-
Créez une file d’attente Launch si vous n’en avez pas encore. La file d’attente définit la manière dont le job s’exécute sur votre machine équipée d’un GPU. Voir l’exemple suivant de configuration de la file d’attente.

-
Créez ce job dans votre projet. Cela enregistre le code du job de déploiement dans votre projet W&B afin que Launch puisse l’exécuter.
-
Lancez un agent sur votre machine équipée d’un GPU. L’agent interroge la file d’attente et exécute le job de déploiement lorsque vous le soumettez.
-
Soumettez le job Launch de déploiement avec les configurations souhaitées depuis l’interface W&B Launch. Vous pouvez également le soumettre via la CLI.

-
Vous pouvez suivre le processus de déploiement dans l’interface W&B Launch.

-
Une fois le déploiement terminé, le point de terminaison NIM/Triton sert le modèle et est prêt à recevoir des requêtes d’inférence. Pour tester le modèle, utilisez
curlsur le point de terminaison. Le nom du modèle est toujoursensemble.