Modelos de lenguaje grandes, explicados
Los modelos de lenguaje grandes, a menudo abreviados como LLM, están detrás de muchas herramientas de escritura, respuesta a preguntas e IA conversacional. Convierten el texto en tokens y trabajan con las relaciones entre esos tokens.
Un modelo de lenguaje grande es un modelo de aprendizaje profundo entrenado con grandes cantidades de datos para poder comprender instrucciones y generar lenguaje natural y otro contenido.
Un LLM predice el siguiente token
Un LLM no prepara una respuesta completa antes de comenzar a escribir. Predice un token, agrega ese token a la secuencia y repite el proceso.
La predicción se basa en patrones aprendidos durante el entrenamiento y el material en la instrucción actual. Ese proceso puede producir respuestas fluidas sin garantizar que cada afirmación sea verdadera.
La aplicación circundante agrega control
El modelo es solo una parte de una aplicación de IA. La aplicación puede agregar instrucciones, proporcionar documentos empresariales, limitar las acciones disponibles o pedir a una persona que apruebe un resultado.
Esos controles cambian qué información recibe el modelo y qué puede suceder después de que responda. No alteran el proceso básico de siguiente token dentro del modelo.
Términos de modelos de lenguaje grandes
- Token
- Una unidad de texto, como una palabra, parte de una palabra o signo de puntuación, que un modelo procesa.
- Transformer
- El diseño de red neuronal que ayuda a un modelo a rastrear relaciones a lo largo de una secuencia de texto.
- Inferencia
- El proceso de usar un modelo entrenado para producir una respuesta a partir de una nueva instrucción.
Qué determina la respuesta de un LLM
La instrucción
Las instrucciones y el contexto actuales le indican al modelo qué respuesta intentar.
El entrenamiento
Los patrones aprendidos de los datos de entrenamiento determinan qué palabras predice el modelo.
El límite de contexto
El modelo solo puede considerar el material que cabe dentro de su ventana de contexto.
Preguntas sobre modelos de lenguaje grandes
Procesa una instrucción y genera una secuencia de tokens. Esto respalda tareas como redactar, resumir, clasificar texto y responder preguntas.
Un LLM usa relaciones estadísticas aprendidas de los datos. Su lenguaje fluido no demuestra comprensión humana ni conocimiento factual.
Predice texto probable en lugar de verificar cada afirmación contra una fuente. Una aplicación puede agregar información confiable y pasos de revisión para reducir ese riesgo.
Términos relacionados del glosario
Pon el lenguaje claro a trabajar
Las apps de Caffeine corren en Internet Computer, una red pública creada para esto.