분산 LLM·AI 인프라
병렬화·통신·PD 분리·라우팅·SLO를 근거 기반 기술 브리프로 종합.
LLM 추론·AI 인프라 · 3/3 로드맵 1개 모듈에서 사용챕터
개요
L3 심화 · 개념 과정 — 단일 추론 엔진의 원리를 다중 GPU·노드·서빙 계층으로 확장하고, 공개 자료의 컴포넌트·조건을 추적해 근거 기반 기술 브리프를 쓰는 힘을 기른다.
이 안내서는 코드 실습서가 아니다. 여러 분산 시스템 개념을 정확히 잇고, 무엇이 나뉘고(shard) / 복제되고(replicate) / 통신되는가(collective) 를 분리하며, 서로 다른 조건의 수치를 직접 비교할 수 있는지 판정하고, 근거·인과·unknown이 분리된 기술 브리프를 만드는 것이 목표다.
이 과정의 위치 — 3부작의 마지막
① AI 컴퓨팅·시스템 기초 (bit·정밀도·compute/memory·메모리·인터커넥트·지표)
↓
② LLM 추론 시스템의 원리 (request·prefill/decode·KV 캐시·scheduler·양자화·벤치마크 조건)
↓
③ 분산 LLM·AI 인프라 ← 지금 여기 (병렬화·통신·PD 분리·라우팅·SLO → 근거 기반 기술 브리프)
이 과정은 앞 두 과정의 언어를 전제한다. 기초 용어(bit·정밀도·compute-bound/memory-bound·KV 캐시·batching·양자화·추론 지표 등)는 재정의하지 않고 "선수 과정 참조"로 처리한다. 여기서 새로 푸는 것은 여러 device·node·service가 연결될 때 생기는 병렬화·통신·라우팅·SLO 문제다.
이 과정이 다루는 것 / 다루지 않는 것
다룬다 — 인터커넥트, 텐서/파이프라인/데이터/시퀀스/컨텍스트/전문가(MoE) 병렬화, 통신-연산 오버랩, prefill-decode 분리(PD disaggregation), KV 전송·계층화, 라우팅·로드밸런싱·오토스케일링, SLO·capacity planning, 추론 엔진·서빙 계층 비교, 공개 배포 사례 읽기, 하드웨어 비교, 비용·성능·전력 주장 검증, 1차 자료에서 구성도 재구성, 그리고 이 모두를 근거 기반 기술 브리프로 종합하는 것.
다루지 않는다 (범위 밖) — GPU 클러스터 설치·운영 lab, CUDA 커널 구현, 벤더 제품 추천, 프로덕션 사이징, 튜닝 처방, 성능·운영 준비 보증. 이 안내서에 등장하는 엔진·서빙 계층·하드웨어·배포 사례는 개념 축과 조건을 설명하기 위한 재료일 뿐, 추천·점수·보증이 아니다.
네 묶음 지도
이 과정의 17장은 네 묶음으로 나뉜다. 앞 묶음의 state·metric·source label이 뒤 묶음에서 재사용된다.
| 묶음 | 장 | 핵심 질문 |
|---|---|---|
| ① 병렬화·통신 | 01–06 | 단일 GPU로 왜 부족하고, 무엇을 어떻게 나누며, 그 대가로 어떤 통신이 생기는가? |
| ② 서비스 경로·SLO | 07–10 | 요청이 서비스가 될 때 어떤 경로·계약이 필요하고, 무엇을 분리해야 하는가? |
| ③ 엔진·서빙·사례·하드웨어 경계 | 11–14 | 엔진 층과 서빙 층, 장치들을 어떤 안정 축으로 비교하고 섞지 않는가? |
| ④ 정량 주장·최종 종합 | 15–17 | 비용·성능·전력 주장을 어떤 조건으로 읽고, 어떻게 근거 기반 브리프로 종합하는가? |
장 지도 (17장)
| 장 | 제목 | 핵심 질문 |
|---|---|---|
| 01 | 단일 GPU로 부족해지는 이유 | capacity·single-request latency·traffic capacity 한계를 어떤 분산 전략이 각각 푸는가? |
| 02 | PCIe, NVLink, InfiniBand, Ethernet | link·fabric·software(NCCL) scope를 어떻게 나누고, 명목 대역폭과 실효 통신을 어떻게 구분하는가? |
| 03 | Tensor parallelism | tensor를 어디서 shard/replicate하고 어떤 collective가 생기는가? |
| 04 | Pipeline·data·sequence·context parallelism | 여러 병렬 축이 무엇을 나누고 어떤 통신을 요구하는가? |
| 05 | MoE와 expert parallelism | total vs activated 파라미터, expert all-to-all은 무엇을 분리하는가? |
| 06 | Communication-compute overlap | 오버랩은 왜 byte 제거가 아니라 조건부 스케줄인가? |
| 07 | Prefill-decode disaggregation | phase 분리가 줄이는 간섭 vs 새로 만드는 비용은? |
| 08 | KV 전송과 계층화 | KV의 ownership·lifetime·tier·backpressure, 전송 vs 재계산은? |
| 09 | Routing·load balancing·autoscaling | 세 control loop의 입력·출력·시간축은 어떻게 다른가? |
| 10 | SLO와 capacity planning | goodput·tail·saturation·headroom으로 어떻게 capacity 계약을 쓰는가? |
| 11 | vLLM·SGLang·TensorRT-LLM 비교 | 엔진을 어떤 안정 개념 축으로 비교하고 서빙 층과 어떻게 분리하는가? |
| 12 | NVIDIA Dynamo와 llm-d | 서빙 층의 control/data path와 engine 경계는 어디인가? |
| 13 | DeepSeek·Kimi 공개 배포 사례 읽기 | 보고서가 밝힌 것(explicit) vs production unknown, owner-reported 경계는? |
| 14 | GPU·NPU·추론 하드웨어 비교 | 장치 이름이 아니라 어떤 안정 축(memory·kernel·software·topology·power)으로 비교하는가? |
| 15 | 비용·성능·전력 주장에 필요한 조건 | unit economics와 energy·speedup의 분모를 어떻게 고정하는가? |
| 16 | 1차 자료에서 시스템 구성도 재구성 | data/control path·trust boundary·failure domain을 어떻게 표시하고 explicit·inferred·unknown을 어떻게 구분하는가? |
| 17 | 근거 기반 기술 브리프 | 하나의 주장에 근거표·조건표·적용 경계·추가 검증을 어떻게 결합하는가? |
부록 — 병렬화 축 비교표(나눔/복제/통신), collective 통신 패턴 정리, SLO·capacity 계약 템플릿, 엔진 vs 서빙 층 경계 체크리스트, 비용·성능·전력 주장 감사 체크리스트, 구성도 재구성 워크시트, 근거 기반 기술 브리프 템플릿, 주제 고유 용어집, 기초 분산·시스템 용어 사전.
안내서 전체의 척추 — 하나의 배포를 확장하기
이 안내서는 누적 코드 프로젝트 대신, 하나의 배포 시나리오를 척추로 삼는다. 01장에서 "단일 엔진이 capacity·latency·traffic 세 방향으로 한계에 부딪히는" 지점을 분리하고, 이후 각 장에서 그 배포에 병렬화·통신·PD 분리·라우팅·SLO를 한 겹씩 얹는다. 마지막 17장에서 그 배포에 대한 근거 기반 기술 브리프를 완성한다.
flowchart TD
A["단일 엔진<br/>(1 GPU, 1 replica)"] -->|"capacity 한계"| B["모델 병렬화<br/>TP·PP (03·04장)"]
A -->|"traffic 한계"| C["복제 + 라우팅<br/>DP·load balancing (04·09장)"]
A -->|"latency 간섭"| D["PD 분리<br/>prefill/decode (07장)"]
B --> E["다중 노드<br/>인터커넥트·collective (02장)"]
C --> E
D --> F["KV 전송·계층화 (08장)"]
E --> G["서빙 계층<br/>Dynamo·llm-d (12장)"]
F --> G
G --> H["SLO·capacity 계약 (10장)"]
H --> I["근거 기반 기술 브리프 (17장)"]
classDef request fill:#fff3c4,stroke:#d4a017,color:#000
classDef compute fill:#cfe2ff,stroke:#2563eb,color:#000
classDef memory fill:#e9d8fd,stroke:#7c3aed,color:#000
classDef comm fill:#ffe0b2,stroke:#e07b00,color:#000
classDef serving fill:#c4f1f4,stroke:#0891b2,color:#000
classDef metric fill:#d1f0d1,stroke:#16a34a,color:#000
class A compute
class B,E compute
class C request
class D,F memory
class G serving
class H,I metric
학습법
- 순서대로 읽되, 묶음 단위로 소화하라. 각 묶음(①→②→③→④)은 앞 묶음의 개념 위에 쌓인다. 한 묶음을 끝낼 때마다 "이 배포에 무엇이 한 겹 더해졌는가"를 스스로 정리하라.
- 처음 보는 약어·기호는 본문 풀이에서 먼저 찾고, 없으면 기초 분산·시스템 용어 사전(부록)에서, 그보다 더 기초적인 용어(bit·정밀도·KV 캐시 등)는 선수 과정을 참조하라.
- 주제 고유 용어집(expert parallelism·KV tiering 등)과 기초 용어 사전(collective·샤딩·큐·백프레셔 등)은 역할이 다르다. 전자는 이 과정의 주인공 개념을, 후자는 어디서나 쓰이는 일반 분산 용어를 다룬다.
- 콜아웃을 신호로 삼아라. 📌 핵심 / ⚠️ 경계 혼동 주의(층·축 섞지 않기) / 🔬 증거 읽기(출처 등급·주장 유형) / ⚖️ 절충(줄이는 것 vs 새 비용) 은 이 과정의 네 가지 사고 습관에 대응한다.
- 확인 문제는 최소 하나가 "이 주장의 조건/분모는 무엇인가" 또는 "이 두 수치를 직접 비교할 수 있는가" 유형이다. 개념 암기가 아니라 경계·조건·비교 가능성 판정을 연습하기 위한 것이다.
확인일·버전 고정(pinning) 안내
이 안내서는 두 종류의 지식을 구분한다.
- 원리 (병렬화 축이 무엇을 나누는가, collective의 개념, PD 분리·KV 전송의 존재 이유, SLO·capacity의 정의) — 상대적으로 안정적. 이 부분은 정확히 설명한다.
- 버전·제품 의존적 사실 (엔진·서빙 계층 컴포넌트·버전·commit, 하드웨어 사양·대역폭, 특정 배포 보고서 수치, 최신 제품명) — 웹 검색으로 확인하고 canonical URL·버전·확인일을 명시한다. 확인 못 한 것은
unknown.
본 안내서의 사실 확인 기준일: 2026-07-20. 이후 엔진·서빙 계층·하드웨어는 빠르게 바뀐다. 각 장의 🔬 박스와 근거표에 명시된 확인일·버전을 기준으로 읽고, 최신 사실은 canonical URL에서 다시 확인하라. 이 안내서는 원리 학습이 목적이며, 특정 엔진·서빙 계층·하드웨어를 추천·보증하지 않는다.
이 안내서에서 쓰는 증거 어휘 (모든 장 공통)
출처 등급
- PRIMARY — 원 논문·공식 문서·저장소·제품 사양. owner 보고가 곧 독립 재현은 아님에 유의.
- REPRODUCTION — 조건·코드·결과를 공개한 독립 재현. 실제 재실행 여부와 원 조건 일치를 별도 기록.
- SECONDARY — 해설·맥락. 핵심 아키텍처·성능·비용 주장의 단독 근거로 쓰지 않는다.
주장 유형 (출처 등급과 별개 축이다)
- measured — 공개 조건의 관측
- vendor-reported — owner·vendor가 밝힌 기능·사양
- calculated — 식·입력을 남긴 산술
- inferred — 자료를 연결한 제한된 해석
각 근거 항목에는 canonical URL · version/commit(또는 unknown) · 확인일 · supports / conditions / does-not-support 를 붙인다.
학습 결과 (이 과정을 마치면)
- 단일 엔진이 capacity·latency·traffic 세 방향으로 한계에 부딪히는 지점을 분리하고, 각 방향을 어떤 분산 전략이 푸는지 말할 수 있다.
- 임의의 병렬화 축에 대해 무엇이 shard / replicate / collective 통신되는가를 표로 분리할 수 있다.
- 추론 엔진 층과 서빙 층, 라우팅·로드밸런싱·오토스케일링의 서로 다른 축을 섞지 않고 설명할 수 있다.
- 아키텍처·성능·비용 주장을 출처 등급 × 주장 유형으로 읽고, 각 근거에 메타데이터를 붙일 수 있다.
- 서로 다른 조건의 수치가 직접 비교 가능한지 판정하고, 분모가 다르면 비교 불가임을 명시할 수 있다.
- 공개 배포 보고서에서 explicit / inferred / unknown을 분리하고 owner-reported 경계를 보존할 수 있다.
- 하나의 기술 주장에 대해 근거표·조건표·적용 경계·추가 검증을 결합한 근거 기반 기술 브리프를 쓸 수 있다.
시작하기 → 01. 단일 GPU로 부족해지는 이유
참조 도구 → 부록 (병렬화 비교표·collective 정리·SLO 템플릿·경계/감사 체크리스트·구성도 워크시트·브리프 템플릿·용어집 2종)