Large Language Models erklärt

Large Language Models, oft zu LLMs abgekürzt, stehen hinter vielen Schreib-, Frage-Antwort- und konversationellen KI-Tools. Sie wandeln Text in Tokens um und arbeiten mit den Beziehungen zwischen diesen Tokens.

Ein Large Language Model, auf Deutsch großes Sprachmodell, ist ein Deep-Learning-Modell, das auf großen Datenmengen trainiert wurde, damit es Prompts verstehen und natürliche Sprache und andere Inhalte generieren kann.

Ein LLM sagt das nächste Token vorher

Ein LLM bereitet keine vollständige Antwort vor, bevor es zu schreiben beginnt. Es sagt ein Token vorher, fügt dieses Token zur Sequenz hinzu und wiederholt den Prozess.

Die Vorhersage stützt sich auf Muster, die während des Trainings gelernt wurden, und auf das Material im aktuellen Prompt. Dieser Prozess kann flüssige Antworten erzeugen, ohne zu garantieren, dass jede Aussage wahr ist.

Die umgebende Anwendung fügt Kontrolle hinzu

Das Modell ist nur ein Teil einer KI-Anwendung. Die Anwendung kann Anweisungen hinzufügen, Geschäftsdokumente bereitstellen, verfügbare Aktionen einschränken oder eine Person bitten, ein Ergebnis zu genehmigen.

Diese Kontrollen ändern, welche Informationen das Modell erhält und was nach seiner Antwort geschehen kann. Sie verändern nicht den grundlegenden Next-Token-Prozess im Modell.

Begriffe zu Large Language Models

Token
Eine Texteinheit, wie ein Wort, ein Wortteil oder ein Satzzeichen, die ein Modell verarbeitet.
Transformer
Die neuronale Netzwerkarchitektur, die einem Modell hilft, Beziehungen über eine Textsequenz hinweg zu verfolgen.
Inferenz
Der Prozess, ein trainiertes Modell zu verwenden, um aus einem neuen Prompt eine Antwort zu erzeugen.

Was eine LLM-Antwort prägt

Der Prompt

Die aktuellen Anweisungen und der Kontext sagen dem Modell, welche Antwort es versuchen soll.

Das Training

Aus Trainingsdaten gelernte Muster prägen, welche Wörter das Modell vorhersagt.

Die Kontextgrenze

Das Modell kann nur das Material berücksichtigen, das in sein Kontextfenster passt.

Fragen zu Large Language Models

Es verarbeitet einen Prompt und generiert eine Sequenz von Tokens. Dies unterstützt Aufgaben wie Entwürfe erstellen, Zusammenfassen, Texte klassifizieren und Fragen beantworten.

Ein LLM verwendet statistische Beziehungen, die aus Daten gelernt wurden. Seine flüssige Sprache beweist kein menschliches Verständnis oder faktisches Wissen.

Es sagt wahrscheinlichen Text vorher, anstatt jede Behauptung gegen eine Quelle zu prüfen. Eine Anwendung kann vertrauenswürdige Informationen und Prüfschritte hinzufügen, um dieses Risiko zu verringern.

Setzen Sie klare Sprache ein

Caffeine-Apps laufen auf dem Internet Computer, einem dafür gebauten öffentlichen Netzwerk.