大規模言語モデルの説明

大規模言語モデル(LLM)は、多くの文章作成、質問応答、対話型AIツールの背後にあります。テキストをトークンに変換し、それらのトークン間の関係を扱います。

大規模言語モデルは、大量のデータで訓練されたディープラーニングモデルであり、プロンプトを理解して自然言語やその他のコンテンツを生成できます。

LLMは次のトークンを予測する

LLMは書き始める前に完全な回答を準備しません。1つのトークンを予測し、そのトークンをシーケンスに追加し、そのプロセスを繰り返します。

予測は訓練中に学習したパターンと現在のプロンプト内の素材に基づいています。このプロセスは流暢な回答を生成できますが、各記述が真実であることを保証するものではありません。

周辺のアプリケーションが制御を追加する

モデルはAIアプリケーションの一部に過ぎません。アプリケーションは指示を追加したり、ビジネス文書を提供したり、利用可能なアクションを制限したり、結果を承認するよう人に求めたりできます。

これらの制御は、モデルが受け取る情報と応答後に起こり得ることを変更します。モデル内部の基本的な次トークンプロセスを変更するものではありません。

大規模言語モデルの用語

トークン
モデルが処理するテキストの単位。単語、単語の一部、句読点など。
Transformer
テキストのシーケンス全体で関係性を追跡するのに役立つニューラルネットワーク設計。
推論
訓練済みモデルを使用して新しいプロンプトから回答を生成するプロセス。

LLMの応答を形作るもの

プロンプト

現在の指示とコンテキストが、モデルにどのような応答を試みるかを伝えます。

訓練

訓練データから学習したパターンが、モデルが予測する単語を形作ります。

コンテキスト制限

モデルはコンテキストウィンドウに収まる素材のみを考慮できます。

大規模言語モデルに関する質問

プロンプトを処理し、トークンのシーケンスを生成します。これにより、下書き作成、要約、テキスト分類、質問への回答などのタスクをサポートします。

LLMはデータから学習した統計的関係を使用します。流暢な言語は人間の理解や事実的知識を証明するものではありません。

すべての主張をソースと照合するのではなく、可能性の高いテキストを予測します。アプリケーションは信頼できる情報とレビューステップを追加して、そのリスクを軽減できます。

平易な言語を活用する

CaffeineのアプリはInternet Computer上で動きます。そのために作られたパブリックネットワークです。