Comment fonctionne un LLM
Comprenez le fonctionnement d'un LLM, le cœur de l'IA
Qu’est ce qu’un LLM
Un LLM (Large Language Model) est un programme d'intelligence artificielle entraîné sur d'énormes quantités de texte (ou données) pour comprendre et générer du langage exploitable par l’humain.
Concrètement, c'est un système qui, à partir d'un texte donné, prédit le mot (ou fragment de mot) le plus probable pour continuer ce texte. Et c'est en répétant cette opération, mot après mot, qu'il arrive à produire des réponses, des résumés, du code,…
Comment fonctionne un LLM ?
Les grands modèles linguistiques (LLM) reposent sur des méthodes d'apprentissage automatique, notamment le deep learning* (apprentissage profond), qui leur permet d'identifier automatiquement des caractéristiques et des motifs pertinents au sein de vastes ensembles de données textuelles, sans intervention humaine directe dans le processus d'extraction.
Ces modèles sont entraînés sur des quantités massives de textes issus de diverses sources en ligne, selon un apprentissage auto-supervisé : leur objectif est de prédire le mot suivant dans une séquence, l'étiquette d'entraînement étant directement extraite du texte lui-même plutôt qu'annotée par un humain.
Avant tout traitement, le texte d'entrée est segmenté en unités appelées tokens*, chacune étant ensuite convertie en un vecteur numérique que le modèle peut manipuler.
Le fonctionnement interne des LLM s'appuie sur une architecture fondamentale nommée Transformer*. Celle-ci permet, pour chaque token du texte, d'analyser l'ensemble des autres tokens présents dans la séquence (phrase) et d'évaluer leur degré de pertinence relative. Ce mécanisme d'attention permet au modèle de saisir les relations sémantiques et syntaxiques complexes entre les éléments d'une phrase.
Le processus d'entraînement commence par une phase de pré-entraînement à grande échelle, durant laquelle le modèle ajuste ses paramètres internes en apprenant à prédire les mots suivants dans des milliards de phrases qu’il trouve directement sur internet.
Une fois cette étape achevée, le modèle subit un fine-tuning* supervisé, au cours duquel il est entraîné sur des exemples de questions et de réponses rédigés par des humains, afin d'apprendre à produire des réponses pertinentes et cohérentes.
Cette phase est suivie du RLHF (Reinforcement Learning from Human Feedback), une étape d'affinement où les réponses du modèle sont ajustées selon des retours humains, favorisant ainsi les sorties perçues comme utiles, factuelles et appropriées, plutôt que simplement probables d'un point de vue statistique.
Enfin, une fois entraîné, le modèle opère de manière auto-régressive : il génère un token à la fois, l'ajoute à la séquence en cours, puis utilise l'ensemble du contexte mis à jour pour prédire le token suivant. Ce processus itératif se poursuit jusqu'à la production d'une réponse complète.
💡 À noter que chaque modèle a une fenêtre de contexte limitée, exprimée en nombre de tokens, qui couvre à la fois le prompt d'entrée et la réponse générée que le modèle ne doit pas dépasser. Exemple : GPT 5.5 = 1M tokens ; Mistral Large 3 = 256k tokens. *Définitions à retrouver dans le Glossaire - Les 50 mots derrière l’IA → Lexique de l’IA pour briller en société
*Définitions à retrouver dans le Glossaire - Les 50 mots derrière l’IA → Lexique de l’IA pour briller en société
👉 Pour plus d'informations et pour aller plus loin:
Qu'est-ce que l'IA ?
Lexique de l'IA pour briller en société