En novembre 2022, OpenAI a libéré ChatGPT et le monde a changé. Un chatbot qui conversait naturellement, qui pouvait écrire du code, traduire des langues, répondre à des questions complexes. Cela n'a pas été un simple progrès technologique: c'était un saut qualitatif. ChatGPT a atteint 100 millions d'utilisateurs en deux mois, plus rapidement que toute autre application dans l'histoire. Depuis, Anthropic a lancé Claude, Google a lancé Gemini, Meta a lancé Llama. Ces outils (des grands modèles de langage) façonnent maintenant notre relation avec la technologie.

Qu'est-ce qu'un grand modèle de langage ?

Un grand modèle de langage (Large Language Model, LLM) est un réseau de neurones artificiel entraîné sur une quantité massale de texte: généralement des centaines de milliards à des trillions de mots provenant d'Internet, de livres, d'articles. Le modèle apprend à prédire le prochain mot probable dans une séquence de texte basé sur le contexte précédent.

Essence : Un LLM est essentiellement une machine très sophistiquée de prédiction du mot suivant. Malgré cette simplicité conceptuelle, elle démontre une compréhension remarquable du langage et du raisonnement.

« Grand » ne doit pas être ignoré. ChatGPT-3 contient 175 milliards de paramètres (nombres ajustables). GPT-4 en aurait environ 1.7 trillions. Pour mettre cela en perspective : c'est autant de nombres que le nombre de mots dans 5 millions de livres.

Comment les LLM fonctionnent-ils vraiment

L'architecture Transformer

Tous les LLM modernes utilisent une architecture appelée Transformer, introduite en 2017. Le secret du Transformer est un mécanisme appelé « attention ». Alors qu'une phrase est traitée, l'attention permet au modèle de déterminer quels mots antérieurs sont les plus importants pour prédire le mot suivant.

Considérez cette phrase : « La banque rejeta sa demande car elle était insuffisante. » Le modèle doit comprendre que « elle » fait référence à « demande » et non à « banque ». L'attention apprend ces connexions longue-distance.

Prédiction autostringègue

Entraîner un LLM est simple mais brillant. Vous montrez au modèle une phrase et lui demandez de prédire le mot suivant. Par exemple :

  • Entrée : « J'ai mangé une »
  • Réponse correcte : « pomme »

Le modèle en génère une prédiction, vous comparez avec la réponse correcte, et vous ajustez ses poids pour réduire l'erreur. Répétez cela sur des milliards d'exemples, et vous obtenez un modèle qui capture les motifs du langage humain.

Génération par autocomplétion

Lors de l'utilisation, un LLM fonctionne itérativement :

  1. Vous écrivez un prompt (une question ou un début de phrase).
  2. Le modèle prédit le prochain mot le plus probable.
  3. Ce mot est ajouté au contexte.
  4. Le processus se répète mot par mot jusqu'à ce que le modèle décide de s'arrêter ou que vous arrêtiez la génération.

Quand vous regardez ChatGPT générer du texte, chaque mot que vous voyez apparaître a été généré indépendamment via ce processus itératif.

Fine-tuning et alignement

Un LLM entraîné uniquement sur la prédiction du mot suivant peut générer du contenu toxique, inexact, ou inutile. OpenAI et d'autres utilisent une technique appelée RLHF (Reinforcement Learning from Human Feedback) où des humains évaluent les réponses du modèle comme bonnes ou mauvaises, et le modèle est ajusté pour maximiser les bonnes réponses. C'est comment ChatGPT a été rendu plus utile et moins dangereux que son prédécesseur pré-affiné.

Exemples de LLM prominents

GPT-4 (OpenAI)

Le dernier modèle d'OpenAI (au moment de la rédaction). Rapporté comme plus intelligent et plus fiable que GPT-3.5. Peut traiter du texte et des images. Utilisé dans ChatGPT Plus.

Claude (Anthropic)

Développé par Anthropic, en mettant l'accent sur la sécurité et la fiabilité. Entraîné avec une technique appelée Constitutional AI pour être plus honnête et moins biaisé.

Gemini (Google)

La réponse de Google aux modèles d'OpenAI. Entraîné pour être multimodal (texte, images, audio).

Llama (Meta)

Une famille de modèles open-source. Llama 2 a été libéré publiquement, permettant à quiconque d'entraîner et de déployer ses versions.

Capacités émergeantes

Une observation remarquable : à mesure que les LLM augmentent en taille, ils développent des capacités qu'ils n'avaient pas. Ils ne sont pas explicitement programmés pour celles-ci: elles « émergent » simplement de la complexité du modèle et de la richesse des données d'entraînement.

Chaîne de pensée (Chain of thought)

En demandant au modèle d'expliquer son raisonnement étape par étape, il performe mieux sur les tâches de logique. Cela n'était pas attendu. C'est comme si le fait de forcer le modèle à ralentir et à « réfléchir » l'aidait à produire des réponses plus précises.

Contextualisation rapide (Few-shot learning)

Vous pouvez montrer au modèle quelques exemples d'une tâche, et il apprendra à la faire sans entraînement explicite. Par exemple, montrez-lui deux exemples de traduction, et il comprendra et pourra traduire de nouveaux textes.

Composition d'idées

Les LLM peuvent combiner des concepts de manière créative : écrire une ode en style Shakespeare sur la programmation, créer un dialogue entre deux personnages historiques, générer une histoire avec des contraintes spécifiques.

Compréhension du code

Entraînés sur de vastes quantités de code, les LLM peuvent écrire, déboguer, et expliquer du code dans de nombreux langages de programmation.

Observation : Les capacités les plus utiles et les plus surprenantes des LLM émergent sans programmer explicitement. C'est une forme d'apprentissage généralisé impressionnante.

Limitations et problèmes sérieux

Hallucinations

Les LLM peuvent générer du contenu faux ou inexistant avec confiance. Ils pourraient inventer une citation d'une personnalité, créer une étude scientifique fictive, ou affirmer que votre entreprise a remporté un prix qu'elle n'a jamais remporté. Ils ne « savent pas » quand ils ne savent pas. Ils générènt simplement des mots qui « semblent corrects ».

Connaissance obsolète

Un LLM entraîné jusqu'en 2023 ne sait rien des événements en 2024. L'entraînement d'un nouveau modèle est extrêmement coûteux, de sorte que les mises à jour sont infrequentes.

Biais

Si les données d'entraînement contiennent des biais (elles le font), le modèle les hérite. Un LLM peut générer du contenu sexiste, raciste, ou discriminatoire. Même avec l'alignement, certains biais persistent.

Manque de véritable compréhension

Un LLM ne comprend pas ce qu'il dit comme une personne le ferait. Il n'a pas de modèle du monde, pas d'intuition physique, pas d'émotions. Il manipule simplement des motifs textuels appris. Pour des problèmes nécessitant une véritable compréhension ou un raisonnement causal, les LLM sont limités. Voir aussi notre article sur le traitement du langage naturel.

Coût environnemental

Entraîner un grand modèle de langage consomme une quantité énorme d'électricité et de ressources informatiques. Cela a un impact environnemental significatif. Un seul entraînement peut émettre autant de CO2 qu'un vol aller-retour transatlantique pour une centaine de personnes.

Dépendance à quelques acteurs

Quelques organisations (OpenAI, Google, Meta, Anthropic) contrôlent la plupart des LLM puissants. Cela pose des questions sur le pouvoir, la concentration, et l'accès équitable à la technologie. Découvrez plus sur les considérations éthiques.

L'avenir des LLM

Les LLM vont probablement devenir plus puissants, plus spécialisés, et plus intégrés à nos outils quotidiens. Cependant, les défis éthiques, environnementaux, et sociétaux vont nécessiter une attention particulière. Il est probable que nous verrons :

  • Multimodalité améliorée : LLM combinant texte, images, audio, vidéo.
  • Raisonnement amélioré : LLM capable de logique plus complexe.
  • Système avec outils : LLM travaillant avec des calculatrices, des bases de données, le web pour éviter les hallucinations.
  • Efficacité : Des modèles plus petits et plus efficaces, rendant l'IA accessible au-delà des grandes organisations.