본문 바로가기
L3 심화

분산 LLM·AI 인프라

병렬화·통신·PD 분리·라우팅·SLO를 근거 기반 기술 브리프로 종합.

LLM 추론·AI 인프라 · 3/3 로드맵 1개 모듈에서 사용
18챕터
1부(部)
3시간총 분량
첫 챕터 시작 →

챕터

개요

L3 심화 · 개념 과정 — 단일 추론 엔진의 원리를 다중 GPU·노드·서빙 계층으로 확장하고, 공개 자료의 컴포넌트·조건을 추적해 근거 기반 기술 브리프를 쓰는 힘을 기른다.

이 안내서는 코드 실습서가 아니다. 여러 분산 시스템 개념을 정확히 잇고, 무엇이 나뉘고(shard) / 복제되고(replicate) / 통신되는가(collective) 를 분리하며, 서로 다른 조건의 수치를 직접 비교할 수 있는지 판정하고, 근거·인과·unknown이 분리된 기술 브리프를 만드는 것이 목표다.

이 과정의 위치 — 3부작의 마지막

CODE
① AI 컴퓨팅·시스템 기초        (bit·정밀도·compute/memory·메모리·인터커넥트·지표)
        ↓
② LLM 추론 시스템의 원리       (request·prefill/decode·KV 캐시·scheduler·양자화·벤치마크 조건)
        ↓
③ 분산 LLM·AI 인프라  ← 지금 여기  (병렬화·통신·PD 분리·라우팅·SLO → 근거 기반 기술 브리프)

이 과정은 앞 두 과정의 언어를 전제한다. 기초 용어(bit·정밀도·compute-bound/memory-bound·KV 캐시·batching·양자화·추론 지표 등)는 재정의하지 않고 "선수 과정 참조"로 처리한다. 여기서 새로 푸는 것은 여러 device·node·service가 연결될 때 생기는 병렬화·통신·라우팅·SLO 문제다.

이 과정이 다루는 것 / 다루지 않는 것

다룬다 — 인터커넥트, 텐서/파이프라인/데이터/시퀀스/컨텍스트/전문가(MoE) 병렬화, 통신-연산 오버랩, prefill-decode 분리(PD disaggregation), KV 전송·계층화, 라우팅·로드밸런싱·오토스케일링, SLO·capacity planning, 추론 엔진·서빙 계층 비교, 공개 배포 사례 읽기, 하드웨어 비교, 비용·성능·전력 주장 검증, 1차 자료에서 구성도 재구성, 그리고 이 모두를 근거 기반 기술 브리프로 종합하는 것.

다루지 않는다 (범위 밖) — GPU 클러스터 설치·운영 lab, CUDA 커널 구현, 벤더 제품 추천, 프로덕션 사이징, 튜닝 처방, 성능·운영 준비 보증. 이 안내서에 등장하는 엔진·서빙 계층·하드웨어·배포 사례는 개념 축과 조건을 설명하기 위한 재료일 뿐, 추천·점수·보증이 아니다.

네 묶음 지도

이 과정의 17장은 네 묶음으로 나뉜다. 앞 묶음의 state·metric·source label이 뒤 묶음에서 재사용된다.

묶음핵심 질문
① 병렬화·통신01–06단일 GPU로 왜 부족하고, 무엇을 어떻게 나누며, 그 대가로 어떤 통신이 생기는가?
② 서비스 경로·SLO07–10요청이 서비스가 될 때 어떤 경로·계약이 필요하고, 무엇을 분리해야 하는가?
③ 엔진·서빙·사례·하드웨어 경계11–14엔진 층과 서빙 층, 장치들을 어떤 안정 축으로 비교하고 섞지 않는가?
④ 정량 주장·최종 종합15–17비용·성능·전력 주장을 어떤 조건으로 읽고, 어떻게 근거 기반 브리프로 종합하는가?

장 지도 (17장)

제목핵심 질문
01단일 GPU로 부족해지는 이유capacity·single-request latency·traffic capacity 한계를 어떤 분산 전략이 각각 푸는가?
02PCIe, NVLink, InfiniBand, Ethernetlink·fabric·software(NCCL) scope를 어떻게 나누고, 명목 대역폭과 실효 통신을 어떻게 구분하는가?
03Tensor parallelismtensor를 어디서 shard/replicate하고 어떤 collective가 생기는가?
04Pipeline·data·sequence·context parallelism여러 병렬 축이 무엇을 나누고 어떤 통신을 요구하는가?
05MoE와 expert parallelismtotal vs activated 파라미터, expert all-to-all은 무엇을 분리하는가?
06Communication-compute overlap오버랩은 왜 byte 제거가 아니라 조건부 스케줄인가?
07Prefill-decode disaggregationphase 분리가 줄이는 간섭 vs 새로 만드는 비용은?
08KV 전송과 계층화KV의 ownership·lifetime·tier·backpressure, 전송 vs 재계산은?
09Routing·load balancing·autoscaling세 control loop의 입력·출력·시간축은 어떻게 다른가?
10SLO와 capacity planninggoodput·tail·saturation·headroom으로 어떻게 capacity 계약을 쓰는가?
11vLLM·SGLang·TensorRT-LLM 비교엔진을 어떤 안정 개념 축으로 비교하고 서빙 층과 어떻게 분리하는가?
12NVIDIA Dynamo와 llm-d서빙 층의 control/data path와 engine 경계는 어디인가?
13DeepSeek·Kimi 공개 배포 사례 읽기보고서가 밝힌 것(explicit) vs production unknown, owner-reported 경계는?
14GPU·NPU·추론 하드웨어 비교장치 이름이 아니라 어떤 안정 축(memory·kernel·software·topology·power)으로 비교하는가?
15비용·성능·전력 주장에 필요한 조건unit economics와 energy·speedup의 분모를 어떻게 고정하는가?
161차 자료에서 시스템 구성도 재구성data/control path·trust boundary·failure domain을 어떻게 표시하고 explicit·inferred·unknown을 어떻게 구분하는가?
17근거 기반 기술 브리프하나의 주장에 근거표·조건표·적용 경계·추가 검증을 어떻게 결합하는가?

부록 — 병렬화 축 비교표(나눔/복제/통신), collective 통신 패턴 정리, SLO·capacity 계약 템플릿, 엔진 vs 서빙 층 경계 체크리스트, 비용·성능·전력 주장 감사 체크리스트, 구성도 재구성 워크시트, 근거 기반 기술 브리프 템플릿, 주제 고유 용어집, 기초 분산·시스템 용어 사전.

안내서 전체의 척추 — 하나의 배포를 확장하기

이 안내서는 누적 코드 프로젝트 대신, 하나의 배포 시나리오를 척추로 삼는다. 01장에서 "단일 엔진이 capacity·latency·traffic 세 방향으로 한계에 부딪히는" 지점을 분리하고, 이후 각 장에서 그 배포에 병렬화·통신·PD 분리·라우팅·SLO를 한 겹씩 얹는다. 마지막 17장에서 그 배포에 대한 근거 기반 기술 브리프를 완성한다.

flowchart TD
    A["단일 엔진<br/>(1 GPU, 1 replica)"] -->|"capacity 한계"| B["모델 병렬화<br/>TP·PP (03·04장)"]
    A -->|"traffic 한계"| C["복제 + 라우팅<br/>DP·load balancing (04·09장)"]
    A -->|"latency 간섭"| D["PD 분리<br/>prefill/decode (07장)"]
    B --> E["다중 노드<br/>인터커넥트·collective (02장)"]
    C --> E
    D --> F["KV 전송·계층화 (08장)"]
    E --> G["서빙 계층<br/>Dynamo·llm-d (12장)"]
    F --> G
    G --> H["SLO·capacity 계약 (10장)"]
    H --> I["근거 기반 기술 브리프 (17장)"]

    classDef request fill:#fff3c4,stroke:#d4a017,color:#000
    classDef compute fill:#cfe2ff,stroke:#2563eb,color:#000
    classDef memory fill:#e9d8fd,stroke:#7c3aed,color:#000
    classDef comm fill:#ffe0b2,stroke:#e07b00,color:#000
    classDef serving fill:#c4f1f4,stroke:#0891b2,color:#000
    classDef metric fill:#d1f0d1,stroke:#16a34a,color:#000

    class A compute
    class B,E compute
    class C request
    class D,F memory
    class G serving
    class H,I metric

학습법

  • 순서대로 읽되, 묶음 단위로 소화하라. 각 묶음(①→②→③→④)은 앞 묶음의 개념 위에 쌓인다. 한 묶음을 끝낼 때마다 "이 배포에 무엇이 한 겹 더해졌는가"를 스스로 정리하라.
  • 처음 보는 약어·기호는 본문 풀이에서 먼저 찾고, 없으면 기초 분산·시스템 용어 사전(부록)에서, 그보다 더 기초적인 용어(bit·정밀도·KV 캐시 등)는 선수 과정을 참조하라.
  • 주제 고유 용어집(expert parallelism·KV tiering 등)과 기초 용어 사전(collective·샤딩·큐·백프레셔 등)은 역할이 다르다. 전자는 이 과정의 주인공 개념을, 후자는 어디서나 쓰이는 일반 분산 용어를 다룬다.
  • 콜아웃을 신호로 삼아라. 📌 핵심 / ⚠️ 경계 혼동 주의(층·축 섞지 않기) / 🔬 증거 읽기(출처 등급·주장 유형) / ⚖️ 절충(줄이는 것 vs 새 비용) 은 이 과정의 네 가지 사고 습관에 대응한다.
  • 확인 문제는 최소 하나가 "이 주장의 조건/분모는 무엇인가" 또는 "이 두 수치를 직접 비교할 수 있는가" 유형이다. 개념 암기가 아니라 경계·조건·비교 가능성 판정을 연습하기 위한 것이다.

확인일·버전 고정(pinning) 안내

이 안내서는 두 종류의 지식을 구분한다.

  • 원리 (병렬화 축이 무엇을 나누는가, collective의 개념, PD 분리·KV 전송의 존재 이유, SLO·capacity의 정의) — 상대적으로 안정적. 이 부분은 정확히 설명한다.
  • 버전·제품 의존적 사실 (엔진·서빙 계층 컴포넌트·버전·commit, 하드웨어 사양·대역폭, 특정 배포 보고서 수치, 최신 제품명) — 웹 검색으로 확인하고 canonical URL·버전·확인일을 명시한다. 확인 못 한 것은 unknown.

본 안내서의 사실 확인 기준일: 2026-07-20. 이후 엔진·서빙 계층·하드웨어는 빠르게 바뀐다. 각 장의 🔬 박스와 근거표에 명시된 확인일·버전을 기준으로 읽고, 최신 사실은 canonical URL에서 다시 확인하라. 이 안내서는 원리 학습이 목적이며, 특정 엔진·서빙 계층·하드웨어를 추천·보증하지 않는다.

이 안내서에서 쓰는 증거 어휘 (모든 장 공통)

출처 등급

  • PRIMARY — 원 논문·공식 문서·저장소·제품 사양. owner 보고가 곧 독립 재현은 아님에 유의.
  • REPRODUCTION — 조건·코드·결과를 공개한 독립 재현. 실제 재실행 여부와 원 조건 일치를 별도 기록.
  • SECONDARY — 해설·맥락. 핵심 아키텍처·성능·비용 주장의 단독 근거로 쓰지 않는다.

주장 유형 (출처 등급과 별개 축이다)

  • measured — 공개 조건의 관측
  • vendor-reported — owner·vendor가 밝힌 기능·사양
  • calculated — 식·입력을 남긴 산술
  • inferred — 자료를 연결한 제한된 해석

각 근거 항목에는 canonical URL · version/commit(또는 unknown) · 확인일 · supports / conditions / does-not-support 를 붙인다.

학습 결과 (이 과정을 마치면)

  1. 단일 엔진이 capacity·latency·traffic 세 방향으로 한계에 부딪히는 지점을 분리하고, 각 방향을 어떤 분산 전략이 푸는지 말할 수 있다.
  2. 임의의 병렬화 축에 대해 무엇이 shard / replicate / collective 통신되는가를 표로 분리할 수 있다.
  3. 추론 엔진 층서빙 층, 라우팅·로드밸런싱·오토스케일링의 서로 다른 축을 섞지 않고 설명할 수 있다.
  4. 아키텍처·성능·비용 주장을 출처 등급 × 주장 유형으로 읽고, 각 근거에 메타데이터를 붙일 수 있다.
  5. 서로 다른 조건의 수치가 직접 비교 가능한지 판정하고, 분모가 다르면 비교 불가임을 명시할 수 있다.
  6. 공개 배포 보고서에서 explicit / inferred / unknown을 분리하고 owner-reported 경계를 보존할 수 있다.
  7. 하나의 기술 주장에 대해 근거표·조건표·적용 경계·추가 검증을 결합한 근거 기반 기술 브리프를 쓸 수 있다.
시작하기01. 단일 GPU로 부족해지는 이유
참조 도구부록 (병렬화 비교표·collective 정리·SLO 템플릿·경계/감사 체크리스트·구성도 워크시트·브리프 템플릿·용어집 2종)