L2 중급
첫 챕터 시작 →
AI 컴퓨팅·시스템 기초
LLM 추론을 이해하기 위한 메모리·정밀도·가속기·병목의 연결 지도.
LLM 추론·AI 인프라 · 1/3 로드맵 1개 모듈에서 사용10챕터
1부(部)
88분총 분량
챕터
01시스템 계층과 요청 흐름
02bit, byte, parameter, tensor
03FP32, FP16, BF16, INT8, INT4
04CPU, GPU, NPU
05compute-bound, memory-bound, 데이터 이동
06RAM, VRAM, cache, bandwidth
07GPU, node, rack, interconnect
08latency, throughput, concurrency
09사양표와 시스템 구성도 읽기
99부록
개요
"모델이 GPU에 올라간다", "KV 캐시가 메모리를 쓴다", "throughput이 높다" —
이 문장들을 시스템 관점에서 읽는 힘을 기르는 개념 bridge 과정입니다.
이 안내서는 무엇인가
이 과정은 개념을 정직하게 연결하는 안내서입니다. 코드 실습서가 아니라, 여러 시스템 개념(비트·정밀도·가속기·병목·메모리·토폴로지·지표)을 하나의 지도로 잇고, 스펙·구성도·수치를 읽는 힘을 기르는 것이 목표입니다.
핵심 태도는 하나입니다. "숫자를 외우는 대신, 어떤 컴포넌트 경계·워크로드 조건이 있어야 그 주장이 성립하는지"를 설명한다. 그래서 이 안내서는 "GPU가 빠르다"라고 말하지 않고, "어떤 실행 조건·워크로드에서 그런가"를 묻습니다.
이 과정에서 얻는 것
- 한 LLM 요청이 시스템 계층(API → 스케줄러 → 워커 → 가속기 → 메모리)을 지나는 여정을 control path와 data path로 나눠 읽기
- 파라미터 수·비트 폭으로 storage 하한을 계산하고, 그것을 런타임 메모리 전체와 구분하기
- 정밀도·양자화가 무엇을 줄이고 무엇을 바꾸는지 절충으로 읽기
- CPU·GPU·NPU를 우열이 아니라 실행 조건으로 비교하기
- compute-bound / memory-bound를 연산 강도(operational intensity) 관점에서 판단하기
- 사양표에서 peak·measured·calculated·inferred를 분류하고, 지지되지 않는 결론을 표시하기
이 과정에서 얻지 못하는 것 (범위 밖)
GPU 커널 직접 구현, 클러스터 운영 실습(lab), 특정 가속기 구매 추천, 프로덕션 사이징, 튜닝 레시피, 안전·운영 처방, 성능 보증 — 이것들은 다루지 않습니다. 이 과정은 후속 과정 "LLM 추론 시스템의 원리"를 위한 개념 bridge입니다.
대상과 선수지식
- 대상: L2 중급. LLM의 토큰·attention 원리는 접했지만, "모델이 GPU에 올라간다"류의 문장을 시스템 관점에서 해석하기 어려운 학습자.
- 선수지식(전제): 프로세스·프로그램 실행의 기본, 숫자·자료구조의 기본, 클라이언트/서버·HTTP의 기본, 토큰·Transformer·추론의 기본 언어. 본문에서 처음 쓸 때 짧게 상기시키되, 깊은 설명은 선수 과정으로 미룹니다.
세 묶음 지도
이 안내서의 9개 장은 세 묶음으로 나뉩니다. 각 묶음의 용어는 다음 묶음에서 재사용됩니다.
CODE
① 숫자와 표현 ② compute와 memory ③ 분산·지표·증거
(무엇을 담나) (어디서 막히나) (어떻게 읽나)
02 bit·byte 04 CPU·GPU·NPU 07 GPU·node·rack
·parameter·tensor 05 compute/memory-bound ·interconnect
03 정밀도 06 RAM·VRAM·cache·bandwidth 08 latency·throughput
(FP32…INT4) ·concurrency
09 사양표 읽기
01 시스템 계층과 요청 흐름 ← 전체를 잇는 척추(01장)
요청 여정 개요도
이 안내서 전체의 척추는 하나의 LLM 요청이 시스템 계층을 통과하는 여정입니다. 각 장은 이 여정에 등장하는 요소를 하나씩 확대합니다.
flowchart LR
REQ[요청 도착]:::req --> API[API·스케줄러]:::req
API --> WORKER[워커 프로세스]:::compute
WORKER --> ACC[가속기<br/>GPU/NPU]:::hw
ACC --> MEM[메모리 계층<br/>VRAM·cache]:::mem
ACC -.분산 시.-> IC[인터커넥트<br/>NVLink·network]:::hw
MEM --> OUT[토큰 생성]:::result
IC --> OUT
OUT --> METRIC[지표로 관측<br/>TTFT·throughput]:::result
classDef req fill:#fef9c3,stroke:#ca8a04,color:#713f12
classDef compute fill:#dbeafe,stroke:#2563eb,color:#1e3a8a
classDef mem fill:#ede9fe,stroke:#7c3aed,color:#4c1d95
classDef hw fill:#cffafe,stroke:#0891b2,color:#164e63
classDef result fill:#dcfce7,stroke:#16a34a,color:#14532d
- 02·03장은 이 여정에서 "무엇이 흐르는가"(비트·파라미터·정밀도)를 확대합니다.
- 04·05·06장은 "어디서 막히는가"(가속기·병목·메모리)를 확대합니다.
- 07·08·09장은 "여러 대로 커지면·어떻게 관측·증명하는가"(토폴로지·지표·사양표)를 확대합니다.
장 지도 표
| 장 | 핵심 연결 (앞 장과 어떻게 잇는가) | 이 장이 답하는 질문 |
|---|---|---|
| 01 · 시스템 계층과 요청 흐름 | (시작) 전체 지도를 편다 | 한 요청은 어떤 계층을 지나며, control path와 data path는 무엇인가? |
| 02 · bit, byte, parameter, tensor | 01의 data path에 "무엇이 흐르나"를 채운다 | 파라미터를 담는 데 최소 얼마의 storage가 필요한가? 그게 실제 메모리인가? |
| 03 · 정밀도 (FP32…INT4) | 02의 "비트 폭"을 선택지로 연다 | 정밀도를 낮추면 무엇을 얻고 무엇을 바꾸는가? |
| 04 · CPU, GPU, NPU | 02·03이 흐르는 "가속기"를 연다 | 이름의 우열이 아니라, 어떤 실행 조건이 이들을 가르는가? |
| 05 · compute/memory-bound | 04의 가속기가 "어디서 막히나" | 무엇이 성능 상한을 정하는가 — 연산인가 데이터 이동인가? |
| 06 · RAM, VRAM, cache, bandwidth | 05의 "데이터 이동"이 지나는 메모리 계층 | capacity·bandwidth·latency는 어떻게 다르고, KV 캐시는 어디 사나? |
| 07 · GPU, node, rack, interconnect | 06 밖으로 — 여러 대로 커지면 | 디바이스 밖 토폴로지와 collective 비용은 무엇인가? |
| 08 · latency, throughput, concurrency | 01~07을 "어떻게 관측하나" | 지표를 어떻게 정의하고 측정 계약을 어떻게 쓰나? |
| 09 · 사양표와 구성도 읽기 | 01~08의 종합 — 증거를 읽는다 | 공개 수치에서 peak/measured/calculated/inferred를 어떻게 가르나? |
학습법
- 각 장은 같은 순서를 따릅니다: 비유로 직관 → 정확한 정의 → (있으면) 계산 → 조건 명시 → 표 정리 → 요약 → 지지하지 않는 결론 → 확인 문제.
- 콜아웃 박스를 눈여겨보세요: 📌 핵심 / ⚠️ 흔한 오해 / 🔬 증거 읽기 / ⚖️ 절충(tradeoff).
- 처음 보는 약어·기호·단위는 본문 첫 등장 자리에서 풀어 설명합니다. 놓쳤다면 부록의 기초 시스템·수학 용어 사전과 주제 고유 용어집에서 찾을 수 있습니다. (둘은 역할이 다릅니다 — 아래 "용어집 안내" 참조.)
- 계산이 나오면 직접 따라 해보세요. 특히 "storage 하한"과 "런타임 메모리 전체"의 구분에 주의하세요. 하한은 실제 사용량이 아닙니다.
- 각 장 끝의 "지지하지 않는 결론"은 이 안내서의 정체성입니다. 그 장 내용으로 말할 수 없는 것을 확인하세요.
용어집 안내 (두 종류)
- 주제 고유 용어집: compute-bound, operational intensity, KV 캐시처럼 이 분야에서만 특별한 뜻을 갖는 용어.
- 기초 시스템·수학 용어 사전: 부동소수점, 대역폭, 병렬/직렬, 캐시·계층처럼 여러 분야에 걸친 일반 용어. 각 항목에 "처음 등장 장" 링크가 붙습니다.
확인일·버전 고정(pinning) 안내
이 안내서는 원리와 사양을 다르게 취급합니다.
- 원리는 안정적입니다. 비트·바이트, 정밀도의 의미, compute/memory-bound의 개념, 메모리 계층, 지표의 정의 — 이것들은 정확히 설명합니다.
- 버전·제품 의존적인 것(구체적 가속기 사양·수치, 라이브러리 버전·기본값, 인터커넥트 대역폭, 최신 제품명)은 확인일·버전·출처를 명시하거나, 확인 불가면
unknown으로 남깁니다.
이 판본의 제작 조건 (확인일: 2026-01, 웹 검색: 불가):
이 판본은 오프라인 환경에서 제작되어 실제 제품의 최신 사양을 웹 검색으로 확인할 수 없었습니다. 따라서 하드웨어 예시는 모두 가상(架空)의 조건 명시 예시로 제시합니다(예: "가속기 A: peak 300 TFLOP/s @ BF16"). 이는 원리를 가르치기 위한 것이며, 특정 실제 제품의 사양이 아닙니다. 실제 수치가 필요하면 각 벤더의 공식 사양(PRIMARY)을 확인일과 함께 직접 확인하세요.
목차
- 01 · 시스템 계층과 요청 흐름
- 02 · bit, byte, parameter, tensor
- 03 · FP32, FP16, BF16, INT8, INT4
- 04 · CPU, GPU, NPU (다음 묶음)
- 05 · compute-bound, memory-bound, 데이터 이동 (다음 묶음)
- 06 · RAM, VRAM, cache, bandwidth (다음 묶음)
- 07 · GPU, node, rack, interconnect (다음 묶음)
- 08 · latency, throughput, concurrency (다음 묶음)
- 09 · 사양표와 시스템 구성도 읽기 (다음 묶음)
- 부록 (다음 묶음)
제작 상태: 1묶음(INDEX·01·02·03) 작성 중. 이후 묶음은 확인 후 이어서 제작합니다.