Les grands modèles de langage, expliqués

Les grands modèles de langage, souvent abrégés en LLM, se trouvent derrière de nombreux outils d'écriture, de réponse aux questions et d'IA conversationnelle. Ils transforment le texte en tokens et travaillent avec les relations entre ces tokens.

Un grand modèle de langage est un modèle d'apprentissage profond entraîné sur de grandes quantités de données afin de comprendre les invites et de générer du langage naturel et d'autres contenus.

Un LLM prédit le prochain token

Un LLM ne prépare pas une réponse complète avant de commencer à écrire. Il prédit un token, ajoute ce token à la séquence et répète le processus.

La prédiction s'appuie sur les motifs appris pendant l'entraînement et le matériel dans l'invite actuelle. Ce processus peut produire des réponses fluides sans garantir que chaque affirmation soit vraie.

L'application environnante ajoute du contrôle

Le modèle n'est qu'une partie d'une application d'IA. L'application peut ajouter des instructions, fournir des documents métier, limiter les actions disponibles ou demander à une personne d'approuver un résultat.

Ces contrôles modifient les informations que le modèle reçoit et ce qui peut se passer après sa réponse. Ils ne modifient pas le processus de base du prochain token à l'intérieur du modèle.

Termes liés aux grands modèles de langage

Token
Une unité de texte, comme un mot, une partie de mot ou un signe de ponctuation, que le modèle traite.
Transformer
L'architecture de réseau neuronal qui aide un modèle à suivre les relations dans une séquence de texte.
Inference
Le processus d'utilisation d'un modèle entraîné pour produire une réponse à partir d'une nouvelle invite.

Ce qui façonne une réponse de LLM

L'invite

Les instructions et le contexte actuels indiquent au modèle quelle réponse tenter.

L'entraînement

Les motifs appris des données d'entraînement façonnent les mots que le modèle prédit.

La limite de contexte

Le modèle ne peut considérer que le matériel qui tient dans sa fenêtre de contexte.

Questions sur les grands modèles de langage

Il traite une invite et génère une séquence de tokens. Cela prend en charge des tâches telles que la rédaction, la synthèse, la classification de texte et la réponse aux questions.

Un LLM utilise des relations statistiques apprises à partir de données. Son langage fluide ne prouve pas une compréhension humaine ou des connaissances factuelles.

Il prédit du texte probable plutôt que de vérifier chaque affirmation par rapport à une source. Une application peut ajouter des informations fiables et des étapes de révision pour réduire ce risque.

Mettez le langage clair au travail

Les apps Caffeine tournent sur l'Internet Computer, un réseau public conçu pour ça.