Les grands modèles de langage, expliqués
Les grands modèles de langage, souvent abrégés en LLM, se trouvent derrière de nombreux outils d'écriture, de réponse aux questions et d'IA conversationnelle. Ils transforment le texte en tokens et travaillent avec les relations entre ces tokens.
Un grand modèle de langage est un modèle d'apprentissage profond entraîné sur de grandes quantités de données afin de comprendre les invites et de générer du langage naturel et d'autres contenus.
Un LLM prédit le prochain token
Un LLM ne prépare pas une réponse complète avant de commencer à écrire. Il prédit un token, ajoute ce token à la séquence et répète le processus.
La prédiction s'appuie sur les motifs appris pendant l'entraînement et le matériel dans l'invite actuelle. Ce processus peut produire des réponses fluides sans garantir que chaque affirmation soit vraie.
L'application environnante ajoute du contrôle
Le modèle n'est qu'une partie d'une application d'IA. L'application peut ajouter des instructions, fournir des documents métier, limiter les actions disponibles ou demander à une personne d'approuver un résultat.
Ces contrôles modifient les informations que le modèle reçoit et ce qui peut se passer après sa réponse. Ils ne modifient pas le processus de base du prochain token à l'intérieur du modèle.
Termes liés aux grands modèles de langage
- Token
- Une unité de texte, comme un mot, une partie de mot ou un signe de ponctuation, que le modèle traite.
- Transformer
- L'architecture de réseau neuronal qui aide un modèle à suivre les relations dans une séquence de texte.
- Inference
- Le processus d'utilisation d'un modèle entraîné pour produire une réponse à partir d'une nouvelle invite.
Ce qui façonne une réponse de LLM
L'invite
Les instructions et le contexte actuels indiquent au modèle quelle réponse tenter.
L'entraînement
Les motifs appris des données d'entraînement façonnent les mots que le modèle prédit.
La limite de contexte
Le modèle ne peut considérer que le matériel qui tient dans sa fenêtre de contexte.
Questions sur les grands modèles de langage
Il traite une invite et génère une séquence de tokens. Cela prend en charge des tâches telles que la rédaction, la synthèse, la classification de texte et la réponse aux questions.
Un LLM utilise des relations statistiques apprises à partir de données. Son langage fluide ne prouve pas une compréhension humaine ou des connaissances factuelles.
Il prédit du texte probable plutôt que de vérifier chaque affirmation par rapport à une source. Une application peut ajouter des informations fiables et des étapes de révision pour réduire ce risque.
Termes du glossaire associés
Mettez le langage clair au travail
Les apps Caffeine tournent sur l'Internet Computer, un réseau public conçu pour ça.