대규모 언어 모델 설명
대규모 언어 모델은 흔히 LLM으로 줄여 부르며, 많은 작문, 질의응답, 대화형 AI 도구의 기반이 됩니다. 텍스트를 토큰으로 변환하고 토큰 간의 관계를 다룹니다.
대규모 언어 모델은 대량의 데이터로 학습된 딥러닝 모델로, 프롬프트를 이해하고 자연어 및 기타 콘텐츠를 생성할 수 있습니다.
LLM은 다음 토큰을 예측합니다
LLM은 작성을 시작하기 전에 완전한 답변을 준비하지 않습니다. 하나의 토큰을 예측하고, 그 토큰을 시퀀스에 추가한 다음, 이 과정을 반복합니다.
예측은 학습 중에 배운 패턴과 현재 프롬프트의 자료를 바탕으로 이루어집니다. 이 과정은 유창한 답변을 생성할 수 있지만 각 진술이 사실임을 보장하지는 않습니다.
주변 애플리케이션이 제어를 추가합니다
모델은 AI 애플리케이션의 한 부분일 뿐입니다. 애플리케이션은 지시사항을 추가하고, 비즈니스 문서를 제공하고, 사용 가능한 작업을 제한하거나, 결과를 승인하도록 사람에게 요청할 수 있습니다.
이러한 제어는 모델이 받는 정보와 응답 후 발생할 수 있는 일을 변경합니다. 모델 내부의 기본적인 다음 토큰 프로세스를 변경하지는 않습니다.
대규모 언어 모델 용어
- 토큰
- 모델이 처리하는 텍스트 단위로, 단어, 단어의 일부 또는 구두점이 될 수 있습니다.
- 트랜스포머
- 모델이 텍스트 시퀀스 전체에서 관계를 추적하도록 돕는 신경망 설계입니다.
- 추론
- 학습된 모델을 사용하여 새로운 프롬프트로부터 답변을 생성하는 과정입니다.
LLM 응답을 형성하는 요소
프롬프트
현재 지시사항과 맥락이 모델에게 어떤 응답을 시도할지 알려줍니다.
학습
학습 데이터에서 배운 패턴이 모델이 예측하는 단어를 형성합니다.
맥락 제한
모델은 맥락 윈도우 내에 들어가는 자료만 고려할 수 있습니다.
대규모 언어 모델에 대한 질문
프롬프트를 처리하고 토큰 시퀀스를 생성합니다. 이는 초안 작성, 요약, 텍스트 분류, 질문 답변과 같은 작업을 지원합니다.
LLM은 데이터에서 학습한 통계적 관계를 사용합니다. 유창한 언어가 인간의 이해나 사실적 지식을 증명하지는 않습니다.
출처와 대조하여 모든 주장을 확인하기보다는 가능성 높은 텍스트를 예측합니다. 애플리케이션은 신뢰할 수 있는 정보와 검토 단계를 추가하여 이러한 위험을 줄일 수 있습니다.
관련 용어집
명확한 언어를 업무에 활용하세요
Caffeine 앱은 이를 위해 만들어진 퍼블릭 네트워크인 Internet Computer 위에서 실행됩니다.