AI 기본 개념 · 레이어 2 · 초급

LLM(거대언어모델)이란?

읽는 데 약 7분 · C-06

ChatGPT와 LLM은 같은 말일까요?

많은 사람이 ChatGPT와 LLM을 같은 의미로 사용하지만, 정확히 비유하자면 ChatGPT는 '자동차'이고 LLM은 그 자동차를 움직이는 '엔진'입니다.

🚗
ChatGPT / Claude
사용자가 타고 경험하는
완성된 서비스·제품
=
⚙️
LLM (거대언어모델)
그 서비스를 구동시키는
핵심 엔진

LLM(Large Language Model, 거대언어모델)은 인간의 언어를 이해하고 생성할 수 있도록 엄청난 양의 텍스트 데이터를 학습한 거대한 AI 모델입니다. 과거에도 번역이나 맞춤법 검사를 위한 언어 모델은 있었지만, 앞에 '거대(Large)'라는 수식어가 붙으면서 AI는 완전히 새로운 차원의 지능을 갖게 되었습니다.

1. "거대하다"의 진짜 의미 — 파라미터(Parameter)

LLM에서 '거대(Large)'하다는 것은 물리적 크기가 아니라, 모델 내부를 구성하는 파라미터(매개변수)의 수가 천문학적으로 많다는 뜻입니다.

C-03에서 배운 것처럼, 파라미터는 뉴런들을 연결하는 가중치(Weight)의 총개수입니다. 인간의 뇌로 치면 뇌세포를 연결하는 시냅스와 같습니다. 파라미터가 많을수록 AI가 세상의 복잡한 지식과 규칙을 더 세밀하게 기억하고 계산할 수 있습니다.

언어 모델 파라미터 수의 진화
초기 언어 모델
~수천만 개
GPT-2 (2019)
15억 개
GPT-3 (2020)
1,750억
1,750억 개
GPT-4 (2023)
수조 개 (추정)
~1조+
파라미터 1,750억 개 = 소설 책 약 1,000권 분량의 텍스트를 동시에 "기억"하는 수준의 연결.
GPT-4의 정확한 파라미터 수는 공개되지 않았으나 수조 개로 추정됩니다.

2. 인터넷 전체를 읽어내는 AI의 교육 — 사전학습(Pre-training)

수천억 개의 파라미터를 어떻게 학습시킬까요? 사람이 일일이 정답을 알려줄 수 없기 때문에, 모델은 세상에 존재하는 거의 모든 텍스트를 스스로 읽어내는 과정을 거칩니다. 이를 사전학습(Pre-training)이라고 합니다.

"마치 아이가 수천 권의 책을 읽으면서 세상의 이치를 깨닫듯, LLM은 인터넷 전체를 읽으며 언어의 패턴과 세상의 지식을 동시에 배웁니다."

3. 현대 LLM의 설계도 — GPT의 의미

우리가 흔히 아는 GPT(Generative Pre-trained Transformer)는 OpenAI가 만든 LLM의 이름이자, 현대 언어 AI의 구조를 완벽하게 설명하는 약자입니다.

G
Generative · 생성형
분류에 그치지 않고, 문맥에 맞는 새로운 텍스트를 만들어냅니다.
→ C-05 생성형 AI 참조
P
Pre-trained · 사전학습
특정 작업 전에 대규모 데이터로 언어의 전반적인 구조를 미리 학습했습니다.
→ 이번 아티클 2번 참조
T
Transformer · 트랜스포머
어텐션 메커니즘으로 단어 간 관계를 파악하는 혁신적인 신경망 구조입니다.
→ C-04 어텐션 참조

현재 시장의 주요 LLM들은 모두 이 GPT와 유사한 아키텍처를 기반으로 합니다.

OpenAI · GPT-4o / o3 Anthropic · Claude 3.5 / 4 Google · Gemini 2.0 Meta · Llama 3 xAI · Grok Mistral · Mixtral

4. 크면 클수록 더 똑똑해진다 — 스케일링 법칙(Scaling Law)

AI 연구자들은 LLM 개발 중 단순하지만 놀라운 법칙을 발견했습니다. 바로 스케일링 법칙(Scaling Law)입니다.

스케일링 법칙 — 세 가지를 늘리면 성능이 향상된다
🧠
모델 크기
파라미터 수를 늘릴수록
📚
학습 데이터
더 많은 텍스트를 학습할수록
💻
컴퓨팅 파워
더 많은 GPU를 사용할수록
AI 성능이 수학적으로 예측 가능한 수준으로 지속 향상
이 법칙 때문에 구글·마이크로소프트·아마존·메타 등 빅테크 기업들이 조 단위 투자로 AI 데이터센터와 슈퍼컴퓨터를 구축하고 있습니다.

창발적 능력(Emergent Abilities) — 가르치지 않았는데 생겨난 능력

스케일링 법칙에서 가장 놀라운 발견은, 모델 크기를 일정 수준 이상으로 키웠을 때 연구자들이 전혀 의도하지 않은 새로운 능력들이 갑자기 나타났다는 것입니다.

수학 풀기
언어 번역만 학습시켰는데, 어느 규모 이상이 되자 스스로 수학 문제를 풀기 시작했습니다.
코드 작성
일반 텍스트 학습만으로 프로그래밍 코드를 작성하고 디버깅하는 능력이 생겨났습니다.
유머 이해
농담의 맥락을 이해하고, 문화적 뉘앙스가 담긴 유머에 적절히 반응하기 시작했습니다.
다단계 추론
단순 질답을 넘어 여러 단계의 논리를 거쳐 결론을 도출하는 추론 능력이 나타났습니다.

일반 언어 모델 vs LLM — 한눈에 비교

특징 기존 언어 모델 (LM) 거대언어모델 (LLM)
파라미터 수 수백만 ~ 수천만 개 수백억 ~ 수조 개 이상
학습 데이터 특정 분야의 제한된 텍스트 인터넷에 존재하는 거의 모든 텍스트
주요 능력 단순 번역, 맞춤법 검사, 스팸 분류 복잡한 추론, 창작, 코딩, 맥락적 대화
창발적 능력 없음 (가르친 것만 수행) 있음 (가르치지 않은 작업도 스스로 수행)
비유 동네 도서관 사서 전 세계 모든 지식을 흡수한 대학자

핵심 요약

  • LLM은 ChatGPT·Claude 같은 서비스를 구동하는 핵심 '엔진'. 인간의 언어를 이해·생성하는 거대한 신경망입니다.
  • 파라미터가 수백억~수조 개에 달해 '거대(Large)'라는 이름이 붙었습니다. 파라미터가 많을수록 더 정교한 지식을 담을 수 있습니다.
  • 사전학습(Pre-training): 인터넷의 방대한 텍스트를 읽으며 다음 단어 예측 방식으로 언어·지식·추론을 스스로 습득합니다.
  • GPT는 Generative(생성형) + Pre-trained(사전학습) + Transformer(트랜스포머)의 약자로, 현대 LLM의 설계 원리를 담고 있습니다.
  • 스케일링 법칙: 모델 크기·데이터·컴퓨팅을 늘릴수록 성능이 향상되며, 일정 규모 이상에서 창발적 능력이 나타납니다.