본문으로 건너뛰기
AIDevOps
  • Learn
  • Learning Paths
  • Practice
  • Open Source
  • Books
  • Engineering

    AI DevOpsAI 서비스 개발·운영 전체 지도LLMOpsLLM 배포·평가·관측실전 프로젝트AI Agent 프로젝트 실습

    Knowledge

    Docs기술 문서 모음Blog엔지니어링 아티클Plogger개발 기록 피드

    Validate

    Certification3단계 역량 인증 · 준비 중
AI Models
LlamaMistralGemmaDeepSeekQwen
🧠 AI Core
AI 입문 & 로드맵ML FundamentalsLLM Fundamentals|Python AIC++|PyTorchTensorFlowJAX
🤖 AI 실전 개발
AI 실전 입문 & 로드맵Hugging FaceLangChainLlamaIndexLLMOps|LangGraphMCPMulti-AgentAgent Evaluation
🧠 AI Agent 개발
금융 AI AgentLLM API 서버주식 투자 AgentAIOps AI Agent교육 AI Agent코딩 AI Agent
🌱 Spring Cloud
Spring 입문 & 로드맵Spring Cloud GatewaySpring BootJava|Spring AISpring SecuritySpring BatchSpring JPA
🐳 DevOps
DevOps 입문 & 로드맵LinuxDockerCI/CD|Kubernetes 기본K8s 심화/실무PrometheusGrafana
🧱 인프라
인프라 입문 & 로드맵NginxRedis
☁️ 클라우드
클라우드 입문 & 로드맵AWSGCPAzureNCPCloudflare
🎨 Frontend
Frontend 입문 & 로드맵JavaScriptTypeScript|ReactNext.js|VueNuxt
📱 Mobile
Mobile 입문 & 로드맵KotlinAndroidFlutter
⚙️ Backend
Backend 입문 & 로드맵Python 기본FastAPIDjangoFlask|CGoGinNode.js
💾 Database
DB 입문 & 로드맵공통 SQLOracleMySQLPostgreSQL|MongoDB벡터 DB
🧪 검증
k6JMeternGrinder
AIDevOps

Engineering AI. From Code to Production.
AI와 AI Agent를 개발하고 운영하기 위한 엔지니어링 학습 플랫폼

Learn

  • 전체 가이드
  • Learning Paths
  • Practice
  • Books

Resources

  • AI DevOps
  • LLMOps
  • 실전 프로젝트
  • Docs
  • Blog
  • Plogger
  • Open Source
  • Certification (준비 중)

Start Here

  • AI Core 로드맵
  • AI 실전 개발 로드맵
  • Spring Cloud 로드맵
  • DevOps 로드맵
  • 인프라 로드맵

 

  • 클라우드 로드맵
  • Frontend 로드맵
  • Mobile 로드맵
  • Backend 로드맵
  • Database 로드맵
© 2026 AI DevOps Korea. All rights reserved.
이용약관개인정보처리방침Sitemaptestforge.kr
  1. Home
  2. Learn
  3. AI Core
  4. LLM Fundamentals
LLM 핵심 개념 가이드

🧠 LLM Fundamentals 완전 가이드

Visitors

LLM 발전사부터 Transformer 구조, 토크나이제이션, 사전학습·파인튜닝, 임베딩과 RAG, 디코딩 전략, 환각, 모델 지형도, 평가, Agent, 안전성까지 — LLM을 다루기 전에 알아야 할 모든 핵심 개념을 쉽지만 깊이 있게 정리합니다.

  • Beginner · 입문
  • 업데이트 2026.09.11
  • 약 16분 읽기
  • 13개 섹션
  • 예제 코드 5개

포함된 Learning Path

이 가이드는 아래 경로의 한 단계입니다. 앞뒤 순서와 함께 학습해보세요.

  • AI Foundations →
LLM 동작 원리 이해Transformer 구조프롬프트 엔지니어링 기초AI Agent/RAG 개발 사전 지식LLM 평가와 안전성

목차

0 / 15
  1. 가이드 사용법
  2. 구조 다이어그램
  3. LLM 발전사
  4. Transformer 구조
  5. 토크나이제이션
  6. 사전학습과 파인튜닝
  7. 모델 크기와 양자화
  8. Context Window와 임베딩
  9. 디코딩 전략
  10. 프롬프트 엔지니어링 기본
  11. 환각과 한계
  12. 주요 모델 지형도
  13. 평가와 벤치마크
  14. Agent와 Tool Use
  15. 안전성과 정렬
목차 15개 섹션
  1. 가이드 사용법
  2. 구조 다이어그램
  3. LLM 발전사
  4. Transformer 구조
  5. 토크나이제이션
  6. 사전학습과 파인튜닝
  7. 모델 크기와 양자화
  8. Context Window와 임베딩
  9. 디코딩 전략
  10. 프롬프트 엔지니어링 기본
  11. 환각과 한계
  12. 주요 모델 지형도
  13. 평가와 벤치마크
  14. Agent와 Tool Use
  15. 안전성과 정렬

가이드 사용법

읽는 방향

LLM Fundamentals를 실무 흐름으로 이해하기

LLM 발전사부터 Transformer 구조, 토크나이제이션, 사전학습·파인튜닝, 임베딩과 RAG, 디코딩 전략, 환각, 모델 지형도, 평가, Agent, 안전성까지 — LLM을 다루기 전에 알아야 할 모든 핵심 개념을 쉽지만 깊이 있게 정리합니다. 이 가이드는 개념을 나열하기보다, 실제 프로젝트에서 판단해야 하는 순서대로 내용을 따라갈 수 있게 구성했습니다.

핵심 관점

AI / LLM 시스템

모델과 프롬프트만 보지 않고, 데이터 흐름, 평가, 배포 이후의 운영 지표까지 한 번에 연결해서 봅니다.

LLM 동작 원리 이해Transformer 구조프롬프트 엔지니어링 기초AI Agent/RAG 개발 사전 지식LLM 평가와 안전성

구조 다이어그램

글로 읽은 내용을 머릿속에 오래 남기려면 먼저 흐름을 그림으로 잡는 편이 좋습니다. 아래 두 그림은 LLM Fundamentals를 학습할 때 계속 되돌아볼 수 있는 기준 지도입니다.

학습 흐름

다이어그램 렌더링 중…

아키텍처 관점

다이어그램 렌더링 중…

LLM은 어떻게 여기까지 왔나

LLM Fundamentals를 처음 펼칠 때는 세부 명령보다 큰 그림이 먼저입니다. 이 섹션에서는 앞으로 배울 개념들이 어떤 문제를 풀기 위해 등장했는지부터 잡아봅니다.

언어를 다루는 딥러닝은 RNN/LSTM에서 출발했습니다. 문장을 한 단어씩 순서대로 읽으며 은닉 상태에 정보를 누적하는 방식이었지만, 문장이 길어지면 앞부분 정보를 잊어버리고 순차 처리라 병렬화가 어려워 대규모 학습에 한계가 있었습니다. 2017년 논문 "Attention Is All You Need"가 제안한 Transformer는 순서대로 읽는 대신 문장 전체를 한 번에 놓고 단어 간 관계를 병렬로 계산하는 방식으로 이 한계를 돌파했고, 이후 GPT·BERT 같은 모델이 이 구조 위에 대규모 데이터를 얹으며 오늘날의 LLM으로 이어졌습니다.
시기이정표핵심 변화
~2016RNN / LSTM 기반 번역·언어모델순서대로 처리, 장거리 의존성에 취약
2017Transformer 등장 ("Attention Is All You Need")병렬 처리 가능, Self-Attention으로 장거리 관계 포착
2018~2019BERT / GPT-2대규모 사전학습 + 미세조정 패러다임 정착
2020GPT-3파라미터 수를 크게 늘리며 few-shot 능력이 급격히 향상(스케일링 법칙)
2022~ChatGPT / RLHF 정렬단순 텍스트 완성을 넘어 대화·지시 이행 능력 확보
2023~오픈소스 LLM 확산(LLaMA 등), 멀티모달·Agent누구나 로컬에서 LLM 구동, 도구 사용·에이전트로 확장

Tip

"스케일링 법칙(scaling law)"이란 모델 크기·데이터량·연산량을 함께 늘리면 성능이 예측 가능하게 향상된다는 경험적 법칙입니다 — 최근 LLM 발전의 핵심 동력 중 하나입니다.

Transformer 구조

여기서는 Transformer 구조을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

오늘날 거의 모든 LLM은 2017년 논문 "Attention Is All You Need"의 Transformer 구조를 기반으로 합니다. 핵심은 Self-Attention — 문장 안의 각 단어가 다른 모든 단어와의 관련도를 계산해 문맥을 반영하는 메커니즘입니다. 직관적으로는 대명사 "그것"을 읽을 때, 앞 문장에서 이 단어가 가리키는 대상이 무엇인지 다른 모든 단어를 훑어보며 관련도(가중치)를 매기는 과정이라고 생각하면 됩니다. 구현상으로는 각 단어를 Query(내가 찾는 것)·Key(내가 가진 것)·Value(실제 전달할 정보) 세 벡터로 변환한 뒤, Query와 Key의 유사도로 가중치를 구해 Value를 가중합하는 연산입니다.
attention_intuition.pyPYTHON
import torch
import torch.nn.functional as F

def simple_attention(Q, K, V):
    # Q, K, V: (seq_len, d_k)
    scores = Q @ K.T / (K.shape[-1] ** 0.5)   # 유사도 계산 + 스케일링
    weights = F.softmax(scores, dim=-1)       # 관련도를 확률처럼 정규화
    return weights @ V                        # 가중합으로 문맥 정보를 섞음

seq_len, d_k = 4, 8
Q = torch.randn(seq_len, d_k)
K = torch.randn(seq_len, d_k)
V = torch.randn(seq_len, d_k)
context = simple_attention(Q, K, V)
print(context.shape)   # torch.Size([4, 8]) — 각 토큰이 문맥을 반영한 벡터로 갱신됨
구성요소역할
Self-Attention (Q·K·V)각 토큰이 문장 내 다른 토큰과의 관련도(가중치)를 계산해 정보를 섞음
Multi-Head AttentionAttention을 여러 개 병렬로 두어 서로 다른 관점(문법, 의미 등)의 관계를 포착
Feed-Forward LayerAttention 결과를 비선형 변환해 표현력을 높임
Positional Encoding단어의 순서 정보를 모델에 주입(Attention 자체는 순서를 모름)
Decoder-only (GPT류)이전 토큰들만 보고 다음 토큰을 예측 — 대부분의 LLM 챗봇 구조

Tip

GPT, Claude, LLaMA 등 대부분의 대화형 LLM은 Encoder-Decoder가 아닌 Decoder-only Transformer입니다 — "다음 토큰이 뭘까"를 반복해서 예측하는 구조입니다.

토크나이제이션

여기서는 토크나이제이션을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

LLM은 글자를 직접 보지 않고 토큰(token) 단위로 처리합니다. 대부분의 LLM은 BPE(Byte Pair Encoding) 계열 알고리즘으로 자주 등장하는 문자 조합을 하나의 토큰으로 병합해 어휘를 구성합니다. 예를 들어 "learning"이라는 단어는 통째로 하나의 토큰일 수도, "learn"과 "ing" 두 개로 쪼개질 수도 있습니다 — 학습 데이터에서의 등장 빈도에 따라 어휘 사전이 통계적으로 결정되기 때문입니다.
tokenize_demo.pyPYTHON
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("gpt2")

text = "AI Agent는 LLM 기반으로 도구를 호출합니다"
tokens = tokenizer.tokenize(text)
ids    = tokenizer.encode(text)

print(tokens)         # 단어가 아니라 서브워드 단위로 쪼개짐
print(len(ids))       # 토큰 개수 — 한글은 영어보다 토큰을 더 많이 소모하는 경향
print(tokenizer.decode(ids))   # 다시 원문으로 복원
방식단위장단점
단어 단위whole word직관적이지만 어휘 사전이 매우 커지고 신조어에 취약
글자 단위character어휘 사전은 작지만 문장이 매우 길어져 비효율적
서브워드 (BPE 등)subwordLLM의 표준 — 어휘 크기와 시퀀스 길이의 균형점

Tip

한국어는 영어보다 같은 의미를 표현하는 데 더 많은 토큰을 소모하는 경우가 많습니다 — API 비용·Context Window 설계 시 감안해야 합니다.

사전학습과 파인튜닝

여기서는 사전학습과 파인튜닝을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

LLM은 보통 여러 단계를 거쳐 만들어집니다. 방대한 텍스트로 "다음 토큰 예측"을 학습하는 사전학습(pre-training), 지시를 따르도록 조정하는 지도 파인튜닝(SFT), 그리고 사람의 선호에 맞춰 정렬하는 단계가 이어집니다.
lora_concept.pyPYTHON
# LoRA 핵심 아이디어: 원본 가중치 W는 고정하고,
# 작은 두 행렬 A, B의 곱(저랭크 행렬)만 학습해 W에 더한다.
#   W_new = W_frozen + (A @ B) * scale
#
# 원본 가중치가 4096x4096 = 1600만 파라미터라면
# LoRA는 랭크 r=8 기준 4096x8 + 8x4096 = 약 6.5만 파라미터만 학습
# -> 전체 파인튜닝 대비 메모리·저장공간을 수백 배 절약

from peft import LoraConfig, get_peft_model

config = LoraConfig(r=8, lora_alpha=16, target_modules=["q_proj", "v_proj"])
model = get_peft_model(base_model, config)
model.print_trainable_parameters()   # 전체 대비 학습 파라미터 비율 확인
단계목적데이터 규모
사전학습 (Pre-training)언어의 일반적 패턴·지식 습득수천억~수조 토큰
지도 파인튜닝 (SFT)지시를 따르는 형태로 응답 스타일 조정수만~수십만 예시
RLHF (인간 피드백 강화학습)사람이 선호하는 답변 방향으로 강화학습사람이 매긴 선호 순위 데이터
DPO (직접 선호 최적화)RLHF와 비슷한 목표를 별도 보상모델 없이 더 단순하게 달성선호 순위 데이터(RLHF보다 가볍게 학습)
경량 파인튜닝 (LoRA / QLoRA)전체 가중치 대신 소수의 추가 파라미터만 학습해 적은 자원으로 특화수백~수천 예시

Tip

"모델을 파인튜닝해야 하나, 프롬프트로 해결해야 하나"라는 질문에는 대개 프롬프트/RAG를 먼저 시도하고, 그래도 안 되는 반복적 스타일·포맷 문제에만 파인튜닝을 고려하는 것이 비용 효율적입니다.

모델 크기와 양자화

모델 크기와 양자화은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

모델 크기(파라미터 수)가 커질수록 일반적으로 성능은 높아지지만, 메모리·연산 비용도 함께 커집니다. 양자화(quantization)는 가중치의 정밀도(예: 32비트 → 4비트)를 낮춰 메모리 사용량을 줄이는 기법으로, 노트북 한 대에서도 큰 모델을 돌릴 수 있게 해줍니다.
형식/기법설명
FP16 / BF16학습·추론에 흔히 쓰는 16비트 부동소수점(원본 정밀도의 절반)
INT8 / INT4 양자화가중치를 8비트·4비트 정수로 근사해 메모리를 추가로 절반~1/4까지 절감
GGUFllama.cpp 계열에서 쓰는 양자화 모델 파일 포맷 — 로컬 CPU/GPU 추론에 널리 사용
GPTQ / AWQ정확도 손실을 최소화하며 4비트급으로 양자화하는 대표적 알고리즘

Tip

  • 파라미터 수(7B, 70B 등)는 모델 성능의 대략적인 지표일 뿐이며, 학습 데이터 품질·정렬 방식에 따라 작은 모델이 더 실용적인 경우도 많습니다.
  • 양자화는 정밀도를 낮추는 대신 속도·메모리 효율을 얻는 트레이드오프입니다 — 로컬/엣지 환경에서 LLM을 돌릴 때 특히 중요합니다.

Context Window와 임베딩

Context Window와 임베딩은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

Context Window는 모델이 한 번에 참고할 수 있는 최대 토큰 수입니다. 이 한계를 넘어서는 지식을 다루려면 임베딩(텍스트를 벡터로 변환) 기반 검색으로 관련 내용만 골라 Context에 넣는 RAG(Retrieval-Augmented Generation) 방식을 씁니다. RAG는 모델이 모든 것을 외우게 하는 대신, 필요할 때 참고 자료를 찾아 함께 건네주는 오픈북 시험과 비슷한 접근입니다.
개념설명
Context Window한 번의 요청에 모델이 참고할 수 있는 토큰 총량(프롬프트+응답)
임베딩 (Embedding)텍스트를 의미가 반영된 고정 길이 벡터로 변환한 것
코사인 유사도두 임베딩 벡터의 방향이 얼마나 비슷한지로 의미적 유사도를 계산
벡터 검색질문 임베딩과 가장 가까운 문서 임베딩을 찾아 관련 문서를 추림
RAG벡터 검색으로 찾은 문서를 프롬프트에 포함시켜 최신·전문 지식을 보완

Tip

Context Window가 크다고 무조건 좋은 것은 아닙니다 — 관련 없는 내용이 많이 섞이면 오히려 답변 품질이 떨어지는 "lost in the middle" 현상이 보고되어 있습니다. 임베딩/벡터 검색은 vectordb·langchain·llamaindex 가이드에서 더 깊이 다룹니다.

디코딩 전략: 같은 모델도 다르게 말하는 이유

여기서는 디코딩 전략: 같은 모델도 다르게 말하는 이유을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

LLM은 매 스텝마다 "다음 토큰일 확률 분포"를 출력할 뿐, 어떤 토큰을 실제로 고를지는 디코딩 전략이 결정합니다. 같은 모델이라도 이 설정에 따라 답변의 일관성과 창의성이 크게 달라집니다.
decoding_params.pyPYTHON
from openai import OpenAI
client = OpenAI()

resp = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[{"role": "user", "content": "짧은 시를 써줘"}],
    temperature=0.9,   # 높을수록 창의적·다양한 표현
    top_p=0.95,        # 상위 95% 확률 질량 내에서만 샘플링
)
print(resp.choices[0].message.content)
전략/파라미터설명효과
Greedy Decoding매 스텝 가장 확률 높은 토큰만 선택일관되지만 반복적이고 단조로운 답변
Temperature확률 분포를 얼마나 평평하게/뾰족하게 만들지 조절낮으면 결정적, 높으면 다양하고 무작위적
Top-k확률 상위 k개 토큰 중에서만 샘플링너무 낮은 확률의 이상한 토큰 배제
Top-p (nucleus)누적 확률이 p가 될 때까지의 토큰 후보군에서 샘플링상황에 따라 후보군 크기가 유연하게 조절됨
Beam Search여러 후보 경로를 동시에 유지하며 전체적으로 가장 그럴듯한 문장을 탐색번역 등 정답이 비교적 명확한 과제에 유리

Tip

사실 기반 답변(코드 생성, 데이터 추출)에는 temperature를 0~0.3 정도로 낮게, 창의적인 글쓰기에는 0.7~1.0 정도로 높게 설정하는 것이 일반적인 출발점입니다.

프롬프트 엔지니어링 기본

여기서는 프롬프트 엔지니어링 기본을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.

같은 모델이라도 프롬프트를 어떻게 구성하느냐에 따라 결과 품질이 크게 달라집니다. 아래는 가장 기본이 되는 패턴들입니다.
prompt_patterns.pyPYTHON
SYSTEM_PROMPT = "당신은 정확한 사실만 답하는 어시스턴트입니다. 모르면 모른다고 답하세요."

FEW_SHOT_EXAMPLES = """
질문: 2 + 2는?
답변: 4

질문: 지구에서 가장 가까운 행성은?
답변: 금성입니다.
"""

def build_prompt(question: str) -> str:
    return f"{FEW_SHOT_EXAMPLES}\n질문: {question}\n답변:"
패턴설명예시
Zero-shot예시 없이 바로 질문"이 리뷰의 감정을 분류해줘: ..."
Few-shot몇 개의 입력-출력 예시를 함께 제공예시 2~3개 + 새 질문
Chain-of-Thought (CoT)단계별로 생각을 풀어서 답하도록 유도"단계별로 생각해봐"
역할 지정 (System Prompt)모델의 역할·제약을 대화 시작에 고정"당신은 코드 리뷰어입니다..."
ReAct (추론+행동)생각(Reasoning)과 도구 호출(Acting)을 번갈아 반복Agent가 검색 도구를 쓰며 추론을 이어가는 패턴

Tip

"단계별로 생각해봐"라는 한 문장을 추가하는 것만으로도 정답률이 눈에 띄게 오르는 경우가 많습니다 — Chain-of-Thought 프롬프팅의 힘입니다.

환각(Hallucination)과 LLM의 한계

환각(Hallucination)과 LLM의 한계은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

LLM은 사실을 "검색"하는 것이 아니라 학습한 패턴을 바탕으로 가장 그럴듯한 다음 토큰을 "생성"합니다. 그래서 존재하지 않는 논문·API·사실을 마치 진짜인 것처럼 자신 있게 만들어내는 환각(hallucination) 현상이 구조적으로 발생할 수 있습니다.
한계설명완화 방법
환각 (Hallucination)그럴듯하지만 사실이 아닌 내용을 생성RAG로 근거 문서 제공, 출처 인용 요구, 낮은 temperature
최신 정보 부재학습 데이터 수집 시점(knowledge cutoff) 이후 정보를 모름웹 검색 도구·RAG로 실시간 정보 보강
수치·연산 취약큰 수의 정확한 계산이나 정밀한 카운팅에 약함계산기·코드 실행 도구에 위임(Tool Use)
일관성 부족같은 질문도 표현을 바꾸면 다른 답을 줄 수 있음temperature를 낮추거나 여러 번 샘플링해 다수결

Tip

"LLM의 답변은 항상 검증이 필요한 초안"이라는 태도로 시스템을 설계하세요 — 특히 의료·법률·금융처럼 오답의 비용이 큰 도메인에서는 출처 인용을 강제하거나 사람의 최종 확인 단계를 반드시 두어야 합니다.

주요 모델 지형도: 무엇을 언제 고를까

주요 모델 지형도: 무엇을 언제 고를까은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

LLM 생태계는 크게 API로만 제공되는 폐쇄형(closed) 모델과, 가중치를 내려받아 직접 구동할 수 있는 오픈소스(open-weight) 모델로 나뉩니다. 각각 장단점이 뚜렷하므로 프로젝트 요구사항에 맞춰 고르면 됩니다.
구분대표 모델특징
폐쇄형 APIGPT (OpenAI), Claude (Anthropic), Gemini (Google)최고 수준 성능, 인프라 관리 불필요, 데이터가 외부로 전송됨
오픈소스/오픈웨이트LLaMA (Meta), Mistral, Qwen, Gemma자체 호스팅 가능, 파인튜닝 자유도 높음, 인프라·운영 부담은 직접 감당

Tip

  • 데이터 민감도가 높거나(내부 문서, 개인정보) 비용을 예측 가능하게 통제해야 한다면 오픈소스 자체 호스팅을, 최고 성능과 빠른 개발 속도가 우선이라면 API 기반을 우선 검토하세요.
  • 실제 모델을 huggingface 가이드에서 불러와 추론해보고, langchain·llamaindex 가이드로 넘어가면 자연스럽게 이어집니다.

LLM 평가와 벤치마크

LLM 평가와 벤치마크은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

"이 모델이 저 모델보다 좋다"를 말하려면 기준이 필요합니다. LLM 평가는 크게 표준화된 벤치마크 점수와, 실제 태스크에 맞춘 커스텀 평가로 나뉩니다.
벤치마크/방법측정 대상
MMLU57개 과목에 걸친 다지선다 문제로 폭넓은 지식·추론 능력 측정
HumanEval함수 설명을 보고 실제로 동작하는 코드를 작성하는 능력 측정
HellaSwag문맥에 자연스럽게 이어지는 문장을 고르는 상식 추론 능력 측정
LLM-as-a-Judge다른 강력한 LLM에게 응답 품질을 채점하게 하는 평가 방식
사람 평가 (Human Eval)실제 사용자·전문가가 응답을 직접 비교·평가

Tip

범용 벤치마크 순위가 높다고 내 서비스에서도 잘 동작한다는 보장은 없습니다 — 실제 서비스 시나리오를 반영한 소규모 평가셋(골든셋)을 직접 만들어 정기적으로 회귀 테스트하는 것이 가장 신뢰할 수 있는 방법입니다.

Agent와 Tool Use: LLM이 행동하기 시작할 때

Agent와 Tool Use: LLM이 행동하기 시작할 때은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

기본 LLM은 텍스트만 주고받지만, 함수/도구 호출(Function Calling) 기능을 결합하면 검색·계산·DB 조회 같은 외부 행동을 스스로 판단해 수행하는 Agent가 됩니다. 앞서 본 ReAct 패턴(생각→행동→관찰을 반복)이 이 Agent 동작의 기본 루프입니다.
개념설명
Function/Tool Calling모델이 "이 도구를 이럴 때 부르면 된다"는 스키마를 보고 호출할 도구와 인자를 스스로 결정
ReAct 루프생각(Reasoning) → 도구 호출(Acting) → 결과 관찰(Observation)을 반복하며 목표에 접근
멀티에이전트역할이 다른 여러 Agent가 협업 또는 검토하며 하나의 작업을 수행
MCP (Model Context Protocol)모델이 외부 도구·데이터 소스와 표준화된 방식으로 연결되도록 하는 개방형 프로토콜

Tip

Agent 설계·구현의 구체적인 코드는 langgraph, langchain, huggingface 가이드에서 이어서 다룹니다 — 이 가이드에서는 "왜 이런 구조가 필요한지"의 개념만 잡고 넘어가면 충분합니다.

안전성과 정렬(Alignment)

안전성과 정렬(Alignment)은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.

강력한 모델일수록 유해한 답변·편향된 판단·악용 가능성도 함께 커집니다. 정렬(alignment)은 모델의 행동을 사람의 의도와 가치에 맞추는 과정 전체를 가리킵니다.
개념설명
RLHF사람이 매긴 선호 순위를 보상 신호로 삼아 강화학습으로 모델을 정렬
Constitutional AI사람의 개입을 줄이고 모델 스스로 원칙(헌법)에 따라 답변을 자기 비평·수정하도록 학습
Red Teaming모델의 취약점·유해 응답을 의도적으로 유도해 사전에 발견하고 보완
가드레일 (Guardrails)입출력 필터링, 금지 주제 차단 등 애플리케이션 레벨의 안전 장치

Tip

  • 정렬은 한 번 학습하면 끝나는 것이 아니라 새로운 우회 시도(jailbreak)가 계속 발견되는 지속적인 과정입니다 — 서비스에 LLM을 넣을 때는 모델 자체의 안전장치에만 의존하지 말고 애플리케이션 레벨의 가드레일을 함께 두세요.
  • 여기까지가 LLM의 기초 체력입니다. 이제 huggingface·langchain·llamaindex·langgraph 가이드로 넘어가 실제로 모델을 불러오고 Agent/RAG를 구축해보세요.
← 이전 가이드ML Fundamentals다음 가이드 →Python AI