Modelos de lenguaje grandes, explicados

Los modelos de lenguaje grandes, a menudo abreviados como LLM, están detrás de muchas herramientas de escritura, respuesta a preguntas e IA conversacional. Convierten el texto en tokens y trabajan con las relaciones entre esos tokens.

Un modelo de lenguaje grande es un modelo de aprendizaje profundo entrenado con grandes cantidades de datos para poder comprender instrucciones y generar lenguaje natural y otro contenido.

Un LLM predice el siguiente token

Un LLM no prepara una respuesta completa antes de comenzar a escribir. Predice un token, agrega ese token a la secuencia y repite el proceso.

La predicción se basa en patrones aprendidos durante el entrenamiento y el material en la instrucción actual. Ese proceso puede producir respuestas fluidas sin garantizar que cada afirmación sea verdadera.

La aplicación circundante agrega control

El modelo es solo una parte de una aplicación de IA. La aplicación puede agregar instrucciones, proporcionar documentos empresariales, limitar las acciones disponibles o pedir a una persona que apruebe un resultado.

Esos controles cambian qué información recibe el modelo y qué puede suceder después de que responda. No alteran el proceso básico de siguiente token dentro del modelo.

Términos de modelos de lenguaje grandes

Token
Una unidad de texto, como una palabra, parte de una palabra o signo de puntuación, que un modelo procesa.
Transformer
El diseño de red neuronal que ayuda a un modelo a rastrear relaciones a lo largo de una secuencia de texto.
Inferencia
El proceso de usar un modelo entrenado para producir una respuesta a partir de una nueva instrucción.

Qué determina la respuesta de un LLM

La instrucción

Las instrucciones y el contexto actuales le indican al modelo qué respuesta intentar.

El entrenamiento

Los patrones aprendidos de los datos de entrenamiento determinan qué palabras predice el modelo.

El límite de contexto

El modelo solo puede considerar el material que cabe dentro de su ventana de contexto.

Preguntas sobre modelos de lenguaje grandes

Procesa una instrucción y genera una secuencia de tokens. Esto respalda tareas como redactar, resumir, clasificar texto y responder preguntas.

Un LLM usa relaciones estadísticas aprendidas de los datos. Su lenguaje fluido no demuestra comprensión humana ni conocimiento factual.

Predice texto probable en lugar de verificar cada afirmación contra una fuente. Una aplicación puede agregar información confiable y pasos de revisión para reducir ese riesgo.

Pon el lenguaje claro a trabajar

Las apps de Caffeine corren en Internet Computer, una red pública creada para esto.