Utiliser des modèles Hugging Face

Hugging Face fournit des modèles pré-entraînés, des scripts de réglage et des API de développement qui facilitent le processus de création et de découverte des LLM. Model Garden peut mettre en service des modèles d'embeddings textuels, de conversion texte-vers-image, de génération de texte, et de conversion image textuelle-vers-texte dans HuggingFace.

Options de déploiement pour les modèles Hugging Face

Vous pouvez déployer des modèles Hugging Face compatibles dans Gemini Enterprise Agent Platform ou Google Kubernetes Engine (GKE). L'option de déploiement que vous choisissez peut dépendre du modèle que vous utilisez et du niveau de contrôle que vous souhaitez exercer sur vos charges de travail.

Déployer dans Gemini Enterprise Agent Platform

Gemini Enterprise Agent Platform offre une plate-forme gérée qui permet de créer et de faire évoluer des projets de machine learning sans nécessiter d'expertise MLOps en interne. Vous pouvez utiliser Gemini Enterprise Agent Platform en tant qu'application en aval qui diffuse les modèles Hugging Face. Nous vous recommandons d'utiliser Gemini Enterprise Agent Platform si vous souhaitez bénéficier de fonctionnalités MLOps de bout en bout, de fonctionnalités de ML à valeur ajoutée et d'une expérience sans serveur pour simplifier le développement.

  1. Pour déployer un modèle Hugging Face compatible dans Gemini Enterprise Agent Platform, accédez à Model Garden.

    Accéder à Model Garden

  2. Accédez à la section Open models on Hugging Face (Modèles ouverts sur Hugging Face), puis cliquez sur Show more (Afficher plus).

  3. Recherchez et sélectionnez un modèle à déployer.

  4. Facultatif : Dans le champ Deployment environment (Environnement de déploiement), sélectionnez Gemini Enterprise Agent Platform.

  5. Facultatif : Spécifiez les détails du déploiement.

  6. Cliquez sur Déployer.

Pour commencer, consultez les exemples suivants :

Déployer dans GKE

Google Kubernetes Engine (GKE) est la Google Cloud solution pour les services Kubernetes gérés, qui offre évolutivité, sécurité, résilience et rentabilité. Nous vous recommandons cette option si vous disposez déjà d'investissements Kubernetes, si votre entreprise dispose d'une expertise en MLOps interne ou si vous avez besoin d'un contrôle précis sur des charges de travail d'IA/ML complexes avec une sécurité, des pipelines de données et des ressources uniques et des exigences de gestion des ressources.

  1. Pour déployer un modèle Hugging Face compatible dans GKE, accédez à Model Garden.

    Accéder à Model Garden

  2. Accédez à la section Open models on Hugging Face (Modèles ouverts sur Hugging Face), puis cliquez sur Show more (Afficher plus).

  3. Recherchez et sélectionnez un modèle à déployer.

  4. Pour l'environnement de déploiement, sélectionnez GKE.

  5. Suivez les instructions de déploiement.

Pour commencer, consultez les exemples suivants :

Que signifie "Compatible avec Gemini Enterprise Agent Platform" ?

Nous ajoutons automatiquement les modèles Hugging Face les plus récents et les plus populaires à Model Garden. Ce processus inclut la génération automatique d'une configuration de déploiement pour chaque modèle.

Pour répondre aux préoccupations concernant les failles et le code malveillant, nous utilisons le détecteur de logiciels malveillants Hugging Face pour évaluer la sécurité des fichiers dans chaque dépôt de modèles Hugging Face sur une base quotidienne. Si un dépôt de modèles est signalé comme contenant des logiciels malveillants, nous supprimons immédiatement le modèle de la page de la galerie Hugging Face.

Bien qu'un modèle désigné comme compatible avec Gemini Enterprise Agent Platform signifie qu'il a été testé et qu'il peut être déployé sur Gemini Enterprise Agent Platform, nous ne garantissons pas l'absence de failles ou de code malveillant. Nous vous recommandons d'effectuer vos propres vérifications de sécurité avant de déployer un modèle dans votre environnement de production.

Ajuster les configurations de déploiement pour des cas d'utilisation spécifiques

La configuration de déploiement par défaut fournie avec l'option de déploiement en un clic ne peut pas répondre à toutes les exigences, étant donné la diversité des cas d'utilisation et les priorités variables en termes de latence, de débit, de coût et de précision.

Par conséquent, vous pouvez d'abord tester le déploiement en un clic pour établir une référence, puis ajuster les configurations de déploiement à l'aide du notebook Colab (vLLM, TGI, TEI, HF pytorch) ou du SDK Python. Cette approche itérative vous permet d'adapter le déploiement à vos besoins précis afin d'obtenir les meilleures performances possibles pour votre application spécifique.

Que faire si le modèle souhaité ne figure pas dans Model Garden ?

Si vous recherchez un modèle spécifique qui ne figure pas dans Model Garden, cela signifie qu'il n'est pas compatible avec Gemini Enterprise Agent Platform. Les sections suivantes décrivent le raisonnement et ce que vous pouvez faire.

Pourquoi le modèle n'est-il pas listé ?

Voici les raisons pour lesquelles un modèle peut ne pas figurer dans Model Garden :

  • Il ne s'agit pas d'un modèle tendance : nous privilégions souvent les modèles très populaires et qui suscitent un fort intérêt de la communauté.
  • Il n'est pas encore compatible : le modèle peut ne pas fonctionner avec un conteneur de diffusion compatible. Par exemple, le conteneur vLLM pour les modèles text-generation et image-text-to-text.
  • Tâches de pipeline non compatibles : le modèle comporte une tâche que nous ne prenons pas encore entièrement en charge pour le moment. Nous prenons en charge les tâches suivantes : text-generation, text2text-generation, text-to-image, feature-extraction, sentence-similarity, et image-text-to-text.

Quels choix s'offrent à vous ?

Vous pouvez toujours utiliser des modèles qui ne sont pas disponibles dans Model Garden :

  • Déployez-le vous-même à l’aide du notebook Colab : nous disposons des notebooks Colab suivants : (vLLM, TGI, TEI, HF pytorch), qui offrent la possibilité de déployer des modèles avec des configurations personnalisées. Vous disposez ainsi d'un contrôle total sur le processus.
  • Envoyez une demande de fonctionnalité : collaborez avec votre ingénieur de l'assistance et envoyez une demande de fonctionnalité via Model Garden ou consultez l'assistance Vertex Generative AI pour obtenir de l'aide supplémentaire.
  • Restez informé des mises à jour : nous ajoutons régulièrement de nouveaux modèles à Model Garden. Le modèle que vous recherchez pourra peut-être être disponible à l'avenir. N'hésitez pas à revenir consulter la page régulièrement.