Deep Learning et traitement naturel du Langage - NLP, LLM & Generative AI
Le traitement naturel du langage est un domaine à part entière de l'intelligence artificielle à l'intersection de l'informatique, des mathématiques, de la linguistique et des sciences cognitives. L'objectif est de construire des applications capables d'analyser, de modéliser, de comprendre et d'imiter le langage humain.
Les transformers introduits en 2017 et intégrant des capacités d'attention ont révolutionné ce domaine en offrant une nouvelle méthode pour la compréhension du langage naturel. D'une part, nous pouvons désormais réutiliser de nombreux modèles pré-entrainés extrêmement performants et d'autre part, ils ont contribué à l'IA générative permettant de générer du contenu original à partir de données existantes.
Vous connaissez les principes fondamentaux de l'apprentissage automatique et vous avez déjà mis en œuvre différentes architectures de réseaux de neurones, mais vous souhaitez en savoir plus sur les opportunités proposées par le Machine et le Deep Learning dans le domaine du traitement naturel du langage, cette formation est faite pour vous.
Vous serez capables de pré-traiter des données textuelles et serez en mesure d'implémenter des modèles permettant de les valoriser en TensorFlow ou PyTorch : classification de texte, recherche d'informations, analyse de sentiments, extraction d'informations, traduction, résumé de texte, etc.
- 60 %de travaux pratiques
- 3jours
À qui s’adresse cette formation "Deep Learning et traitement naturel du Langage - NLP, LLM & Generative AI" ?
Data Scientist
Data Analyst
Développeur Description de la formation "Deep Learning et traitement naturel du Langage - NLP, LLM & Generative AI"
Deep Learning et traitement naturel du Langage - NLP, LLM & Generative AI en bref. Cette formation Retengr dure 3 jours, soit 21 heures. Public visé : Data Analyst, Data scientist, Développeur. En inter-entreprises, elle coûte 2 400 € HT par participant. Elle est aussi proposée en intra-entreprise, pour vos équipes.
-
Présentation
Le traitement naturel du langage est un domaine à part entière de l'intelligence artificielle à l'intersection de l'informatique, des mathématiques, de la linguistique et des sciences cognitives. L'objectif est de construire des applications capables d'analyser, de modéliser, de comprendre et d'imiter le langage humain.
Les transformers introduits en 2017 et intégrant des capacités d'attention ont révolutionné ce domaine en offrant une nouvelle méthode pour la compréhension du langage naturel. D'une part, nous pouvons désormais réutiliser de nombreux modèles pré-entrainés extrêmement performants et d'autre part, ils ont contribué à l'IA générative permettant de générer du contenu original à partir de données existantes.
Vous connaissez les principes fondamentaux de l'apprentissage automatique et vous avez déjà mis en œuvre différentes architectures de réseaux de neurones, mais vous souhaitez en savoir plus sur les opportunités proposées par le Machine et le Deep Learning dans le domaine du traitement naturel du langage, cette formation est faite pour vous.
Vous serez capables de pré-traiter des données textuelles et serez en mesure d'implémenter des modèles permettant de les valoriser en TensorFlow ou PyTorch : classification de texte, recherche d'informations, analyse de sentiments, extraction d'informations, traduction, résumé de texte, etc.
Durée : 3 jours, soit 21 heures.
-
Méthode pédagogique
- Composée à 70% de pratique, cette formation utilise des exercices illustrés et didactiques.
- Une évaluation quotidienne de l'acquisition des connaissances de la veille est effectuée.
- Une synthèse est proposée en fin de formation.
- Une évaluation à chaud sera proposée au stagiaire à la fin du cours.
- Un support de cours sera remis à chaque participant comprenant les slides sur la théorie, les exercices.
- Une feuille d'émargement par demi-journée de présence est fournie en fin de formation ainsi qu'une attestation de fin de formation si le stagiaire a bien assisté à la totalité de la session.
- Un suivi et un échange avec les participants seront mis en place quelques jours après la formation.
- Cette formation ne nécessite pas d'avoir recours à une évaluation formalisée des acquis.
-
Objectifs
- Mettre en place un prétraitement efficace d'un jeu de données textuelles
- Maîtriser les architectures de réseaux de neurones récurrents et des transformers
- Comprendre les bases théoriques et pratiques des LLM
- Réutiliser des modèles existants avec du transfer learning
- Comprendre le principe du RAG
- Mesurer la pertinence des modèles mis en œuvre
- Mettre en œuvre des cas concrets pour chaque architecture/solution
-
Audience
- Data Analyst, Data scientist, Développeur
-
Pré-requis
- Connaissance de Python
- Connaissance des librairies scientifiques (scikit-learn, pandas, numpy)
- Connaissance du Deep Learning ou avoir suivi la formation "maîtriser le deep learning" (maîtrise des concepts du machine learning et avoir mis en œuvre différentes architectures de réseaux de neurones : convolutionnels, récurrents, …)
- Connaissance d'un framework Deep Learning TensorFlow ou PyTorch.
-
Le formateur
Le formateur est un expert du domaine qui intervient sur le sujet depuis plusieurs années en formation mais aussi en conseil.
Doté d'une grande qualité d'écoute, sa pédagogie et sa compétence technique vous permettront d'acquérir les compétences visées.
Il saura alterner entre théorie, pratique, et retours d'expérience.
-
Le programme
Introduction
- Les bases de la linguistique
- Introduction au Text Mining / Fouille de texte (Data Mining pour le texte)
- Extraction d'informations
- Recherche d'informations
- Catégorisation du texte
- Résumé du texte
Text Normalisation / Normalisation du texte
- n-grams
- Tokenization
- Stop Word
- Stemming
- Part-Of-Speech (POS) tagging
- Lemmatization
Vectorisation du texte
- Analyse de la fréquence des termes (Counter, TF-IDF, Word vectors)
- Bag of word
- Word Embedding : Word2vec, GloVe, FastText, etc.
- Création d'une pipeline de préprocessing
Les réseaux de neurones récurrents
- Principes fondamentaux des RNN
- LSTM et GRU
- Les approches Encodeur-Decodeur
- Utilisation de connexions résiduelles (skip connections)
L'architecture Transformers
- Seq2Seq
- Attention is All You Need
- Architecture des transformers
- Mécanisme d'attention
- Tokens & Embeddings
Les LLM
- Les familles de modèles : encoder, decoder & encoder-decoder
- Panorama de quelques modèles
- Méthodes d'apprentissage et d'optimisation
- Closed model APIs vs OpenModel weights vs Fully open model
- Coût et empreinte écologique des LLM
- Des LLM vers les SLM
Hugging Face et Keras Hub
- HuggingFace et ses pipelines
- Keras Hub et Kaggle
RAG - Retrieval-Augmented Generation
- Fondements du Retrieval-Augmented Generation (RAG)
- Les bases vectorielles
- Premier pas avec LangChain
- Du RAG avancé vers l'Agentic AI
-
Tarif
2400 € HT
-
Formation à distance
Le distanciel est une modalité que nous pratiquons couramment.
Retengr vous permet aussi de suivre cette formation à distance, sous forme de classe virtuelle (6 participants maximum), avec un formateur expert sur le sujet. La formation se déroule via une connexion en visio conférence (ZOOM, GoogleMeet, Teams ou autres) et vous permet d'alterner théorie et pratique de façon accompagnée ou autonome, le tout dans le respect des objectifs pédagogiques et des évaluations des acquis.
Les émargements, évaluations, attestation de formation, remises des supports de cours et autres documents se feront en ligne.
En ce qui concerne le matériel informatique du participant, il est seulement préconisé un ordinateur et une connexion internet. Nous nous chargeons du reste.
Chaque participant se verra attribuer une Machine Virtuelle qui sera exécutée dans le Cloud d'Amazon. Il disposera alors de la puissance et des outils nécessaires pour le bon déroulement de la formation. Aucune installation de la part du participant n'est requise avant la formation.
Une journée type de formation à distance se décompose de la façon suivante :
Matin :
- 2h de théorie en visioconférence
- 10 à 15 minutes de présentation d'exercices en visio
- 1h de TP en autonomie avec possibilité de solliciter le formateur (partage d'écran à distance pour une assistance efficace).
Après-midi :
- 2h de théorie en visioconférence
- 10 à 15 minutes de présentation d'exercices en visio
- 1h de TP en autonomie avec possibilité de solliciter le formateur (partage d'écran à distance pour une assistance efficace).
Les prochaines dates pour cette formation
Nos clients parlent de ce cours
“Bonnes explications, et gestion agréable du cours, en plus de la dimension d'enseignement qui est très bonne.”
MarionOrange