본문 바로가기

부록

본문을 관통한 도구들을 한자리에 모았습니다. 필요할 때 펼쳐 쓰는 참조용입니다.

A. 지표 정의 요약표 (14장)

지표이벤트집계분모관점
TTFT도착→첫 토큰(큐·네트워크 포함)요청별→평균/P99사용자
ITL인접 토큰 간격원시 간격 모아 분포간격 수사용자(부드러움)
TPOT첫 토큰 이후 생성요청 내 평균출력 토큰 수(첫 제외)사용자
E2E latency도착→마지막 토큰요청별→평균/P99사용자
throughput처리 토큰/요청합계경과 시간(초)시스템
goodputSLO 만족 요청통과분만 계수경과 시간(초)시스템×품질
원칙: 두 시스템을 비교하려면 이벤트·집계·분모·측정 도구가 같아야 한다.

B. KV 캐시 계산 워크시트 (05장)

한 요청 한 시퀀스의 KV 하한:

CODE
KV_하한 ≈ 2 × L × H_kv × d_h × T × b

  2     = key + value
  L     = 레이어 수
  H_kv  = KV head 수 (MHA=query head 수, MQA=1, GQA=그룹 수, MLA≈잠재차원으로 대체)
  d_h   = head 차원
  T     = 토큰 수 (프롬프트 + 생성, 계속 증가)
  b     = 요소당 바이트 (FP16=2, INT8=1, FP8/FP4=…)

채우기 표 (값은 모델 config·dtype에서 확인; 모르면 unknown):

기호내 모델 값
L레이어 수____
H_kvKV head 수____
d_hhead 차원____
T컨텍스트 길이____
bdtype 바이트____
⚠️ 흔한 실수
결과는 하한입니다. 실제 할당은 블록 단위·예약·단편화로 더 큽니다(09장). 동시 요청 N개면 대략 ×N.

C. 주장 유형 · 출처 등급 치트시트 (본문 전체)

출처 등급

  • PRIMARY: 원 논문·공식 문서·저장소. owner 공개 ≠ 독립 검증.
  • REPRODUCTION: 조건·코드·결과를 공개한 독립 재현. 저장소 존재 ≠ 재실행 성공.
  • SECONDARY: 해설·맥락. 핵심 성능/품질 주장의 단독 근거로 쓰지 않음.

주장 유형

  • measured: 공개 조건에서의 관측. → 조건(8축, 15장) 확인.
  • vendor-reported: owner·vendor의 기능·사양 보고. → 독립 재현 여부 확인.
  • calculated: 공개 입력·식의 산술. → 입력·식·"하한 여부" 확인.
  • inferred: 자료를 연결한 해석. → 전제와 반례 확인.

D. 개념 경계 체크리스트 — "이 말로 말할 수 없는 것"

각 장의 '지지하지 않는 결론'을 한자리에:

  • prefill/decode 성격(02) → 병목 단정 불가(하드웨어·배치 필요, 03).
  • "decode는 memory-bound"(03) → 배치 커지면 이동, 항상 참 아님.
  • 가중치 크기(04) → 필요 VRAM·사이징 판정 불가.
  • KV 하한(05) → 동시 요청 수·실제 할당 단정 불가.
  • attention 변형(06) → 모델 품질 우열 판정 불가(owner ablation 조건부).
  • 배치↑(07) → 처리량↑ 항상 아님(포화점).
  • continuous batching·PagedAttention(08·09) → 성능 우열은 measured 필요.
  • prefix caching(10) → "항상 이득·항상 안전" 불가(워크로드·격리).
  • 양자화(11) → "항상 빠름·품질 그대로" 불가.
  • speculative/MTP(12) → "항상 빠름" 불가(수용률·MoE·배치1), MTP≠추론 가속 자동.
  • vLLM 구조(13) → 성능 우열·정확한 버전 명칭 단정 불가.
  • 지표(14) → 이름만으로 비교 불가.
  • 벤치마크(15) → 불완전 표의 직접 순위 거부.

E. 주제 고유 용어집 (이 분야 용어)

본문에 처음 등장할 때 풀이한 이 분야 특유의 용어들입니다. (일반 시스템·수학 용어는 F 참조 — 역할이 다릅니다.)
용어한 줄 뜻처음 등장
추론(inference)학습된 모델을 고정한 채 입력→출력01
tokenization텍스트↔토큰 id 변환02
prefill프롬프트 전체를 한 번에 처리하는 phase02
decode토큰을 하나씩 순차 생성하는 phase02
KV 캐시앞 토큰의 key/value 저장·재사용02·05
MHA/MQA/GQA/MLAattention의 KV 표현 방식들06
static batch통째로 시작·종료하는 배치07
continuous batchingiteration마다 재구성하는 배치08
admission/preemption/allocation스케줄링의 세 결정08
chunked prefill긴 prefill을 조각내 끼워넣기08
PagedAttentionKV를 블록으로 나눠 관리09
논리/물리 블록·블록 테이블KV 블록의 가상↔실제 매핑09
prefix caching동일 접두 prefill 재사용10
양자화(quantization)더 적은 bit로 표현11
speculative decodingdraft-verify-accept 가속12
MTP여러 미래 토큰 예측 학습 목표12
TTFT/ITL/TPOT/goodput추론 지표들14
SLO서비스 수준 목표14

F. 기초 시스템·수학 용어 사전 (일반 용어)

E와 달리, 여기 있는 것은 이 분야 전용이 아닌 일반 시스템·수학 용어입니다. 본문에서 처음 쓸 때 짧게 상기시켰고, 깊은 설명은 선수 과정의 몫입니다.
용어한 줄 뜻처음 등장
bit / 정밀도숫자를 표현하는 최소 단위 / 표현의 촘촘함04
부동소수점(FP32/16, BF16)실수를 근사 표현하는 방식04
정수형(INT8/4)정수 표현, 양자화에 사용04·11
대역폭(bandwidth)단위 시간당 옮길 데이터 양03
지연(latency)한 작업이 끝나기까지의 시간03·14
처리량(throughput)단위 시간당 처리량03·14
동시성(concurrency)동시에 다루는 요청 수05·07
compute-bound/memory-bound연산/메모리 대역폭이 병목인 상태03
메모리 계층(RAM/VRAM/캐시)속도·용량이 다른 저장 층04
병렬(TP/PP/DP)텐서/파이프라인/데이터 병렬13
행렬/벡터다차원 수 배열(연산의 기본 단위)05
단편화(fragmentation)조각나 못 쓰는 공간04·09
백분위(P95/P99)하위 95%/99% 경계값14

G. 출처 읽기 가이드

성능·품질 주장을 만났을 때의 5단계(15장 요약):

  1. 유형 판별: measured / vendor-reported / calculated / inferred?
  2. 조건 점검: model·quality·workload·hardware·software·precision·metric·SLO 8축이 명시됐나?
  3. 지표 점검: 이벤트·집계·분모가 못 박혀 있나?
  4. 등급 점검: PRIMARY만인가, REPRODUCTION이 있나? owner 단독이 아닌가?
  5. 판정: 조건 충족 → "이 조건에서 참"으로 조건부 수용 / 결측 → 보류·질문 / 어긋남 → 직접 순위 거부.
두 좌우명: "owner 공개 ≠ 독립 검증", "저장소 존재 ≠ 재현 성공."

확인일·버전

  • 웹 확인일: 2026-07-20.
  • vLLM 관련 서술은 V1 아키텍처(2025-01 재설계 이후) 기준의 사례이며, 명칭·기본값은 버전 의존적입니다. 확인 못 한 항목은 본문에서 unknown으로 표시했습니다.
처음으로: 00 · INDEX