Modelos de linguagem grandes, explicados

Modelos de linguagem grandes, frequentemente abreviados como LLMs, estão por trás de muitas ferramentas de escrita, resposta a perguntas e IA conversacional. Eles transformam texto em tokens e trabalham com os relacionamentos entre esses tokens.

Um modelo de linguagem grande é um modelo de aprendizado profundo treinado em grandes quantidades de dados para que possa entender prompts e gerar linguagem natural e outros conteúdos.

Um LLM prevê o próximo token

Um LLM não prepara uma resposta completa antes de começar a escrever. Ele prevê um token, adiciona esse token à sequência e repete o processo.

A previsão se baseia em padrões aprendidos durante o treinamento e no material do prompt atual. Esse processo pode produzir respostas fluentes sem garantir que cada afirmação seja verdadeira.

A aplicação ao redor adiciona controle

O modelo é apenas uma parte de uma aplicação de IA. A aplicação pode adicionar instruções, fornecer documentos de negócios, limitar ações disponíveis ou pedir que uma pessoa aprove um resultado.

Esses controles mudam quais informações o modelo recebe e o que pode acontecer depois que ele responde. Eles não alteram o processo básico de próximo token dentro do modelo.

Termos de modelo de linguagem grande

Token
Uma unidade de texto, como uma palavra, parte de uma palavra ou sinal de pontuação, que um modelo processa.
Transformer
O design de rede neural que ajuda um modelo a rastrear relacionamentos ao longo de uma sequência de texto.
Inferência
O processo de usar um modelo treinado para produzir uma resposta a partir de um novo prompt.

O que molda uma resposta de LLM

O prompt

As instruções e o contexto atuais dizem ao modelo qual resposta tentar.

O treinamento

Padrões aprendidos a partir de dados de treinamento moldam quais palavras o modelo prevê.

O limite de contexto

O modelo pode considerar apenas o material que cabe dentro de sua janela de contexto.

Perguntas sobre modelos de linguagem grandes

Ele processa um prompt e gera uma sequência de tokens. Isso suporta tarefas como redigir, resumir, classificar texto e responder perguntas.

Um LLM usa relacionamentos estatísticos aprendidos a partir de dados. Sua linguagem fluente não prova compreensão humana ou conhecimento factual.

Ele prevê texto provável em vez de verificar cada afirmação contra uma fonte. Uma aplicação pode adicionar informações confiáveis e etapas de revisão para reduzir esse risco.

Coloque a linguagem clara para trabalhar

Os apps do Caffeine rodam no Internet Computer, uma rede pública feita para isso.