부록
본문에서 기른 태도를 바로 꺼내 쓰는 도구 모음입니다. 워크시트·체크리스트·템플릿·두 종류의 용어집·참조표로 구성됩니다.
A. storage / 메모리 계산 워크시트
A-1. 가중치 storage 하한 (02장)
CODE
[입력] P = 파라미터 수 (개) = ____________ w = 비트 폭 (bit/parameter) = ______ ← 정밀도가 결정(03장) [식] storage_하한(byte) = P × w / 8 [산술] = ____________ byte = ____________ GB (÷ 10^9, 10진) = ____________ GiB (÷ 1024^3, 2진) [⚠️ 잊지 말 것] 이 값은 "가중치만"의 "하한". 실제 런타임 메모리는 더 큼.
A-2. 런타임 메모리 점검 (02·06장) — 하한 ≠ 실제
CODE
런타임 메모리 전체 ≈
가중치(A-1의 하한)
+ 활성값(activation) … 계산 중간 산물
+ KV 캐시 … 요청 길이·동시성에 비례해 증가(06장)
+ 작업 버퍼·오버헤드·단편화
[판단]
"가속기 메모리 X GB에 이 모델이 들어가는가?"
→ 가중치 하한만 보고 판단 금지.
→ 워크로드(요청 길이·동시 요청 수)를 정해야 KV 캐시 자리를 가늠 가능.
→ 확정은 measured로.
B. 정밀도 비교표 (03장) — 순위표 아님
| 라벨 | 비트 폭 | storage 하한(상대) | 얻는 것 | 바꾸는(잃을 수 있는) 것 |
|---|---|---|---|---|
| FP32 | 32 | 1.0× | 넓은 범위 + 높은 해상도 | 메모리·대역폭 부담 큼 |
| FP16 | 16 | 0.5× | 메모리·대역폭 절반, 높은 해상도 | 범위 좁음(오버/언더플로 위험) |
| BF16 | 16 | 0.5× | 메모리·대역폭 절반, FP32급 범위 | 해상도 FP16보다 낮음 |
| INT8 | 8 | 0.25× | 메모리·대역폭 1/4, 정수 연산 이점 가능 | 양자화 손실 가능, 스케일·보정 필요 |
| INT4 | 4 | 0.125× | 메모리·대역폭 1/8 | 손실 더 클 수 있음, 품질 영향 워크로드마다 다름 |
숨은 전제: 속도 이득은 하드웨어·커널이 그 dtype을 지원할 때만 실현. 품질 영향은 measured로 확인.
C. 지표 측정 계약 템플릿 (08장)
CODE
[무엇을] 지표명 = ____________ (TTFT? ITL/TPOT? output tokens/s? 개별/집계?) [조건] 모델 __________ 정밀도 ______ 하드웨어 __________ SW 버전 ______ [워크로드] 입력 길이 ______ 출력 길이 ______ 요청률(도착 속도) ______ [동시성] concurrency = ______ (고정/변화) [분모] "초당 토큰"의 분모 = ______ (한 요청 / 전체 합산 / 시간 창) [집계] 평균 / 중앙값 / p95 / p99 중 ______ [peak여부] 이론 peak / 실측(measured) 중 ______ [비교 규칙] 같은 성격·같은 조건끼리만 비교. 분모·concurrency가 다르면 비교 불가.
D. "이름 우열로 줄 세우지 않기" 체크리스트 (04장)
가속기·정밀도·제품을 비교하려 할 때 스스로 점검:
- [ ] 비교 대상의 워크로드를 명시했는가? (없으면 우열 비교 성립 안 함)
- [ ] 실행 모델을 봤는가? (순차·분기 vs 대량 병렬)
- [ ] 메모리(용량·대역폭·지연)를 나눠 봤는가?
- [ ] 소프트웨어 지원(커널·라이브러리·dtype)을 확인했는가? ← 자주 잊힘
- [ ] 비교한 수치가 peak인가 measured인가? 같은 성격끼리 비교했는가?
- [ ] "X가 Y보다 낫다"를 조건부 문장으로 다시 쓸 수 있는가?
E. 사양표 읽기 체크리스트 (09장)
- [ ] 각 수치를 peak / measured / calculated / inferred로 분류했는가?
- [ ] peak 수치로 실제 순위를 만들지 않았는가?
- [ ] 출처 등급(PRIMARY/REPRODUCTION/SECONDARY)과 주장 유형을 따로 봤는가?
- [ ] PRIMARY라도 vendor-reported·peak일 수 있음을 감안했는가?
- [ ] measured 수치에 조건(워크로드·분모·집계·동시성)이 붙어 있는가?
- [ ] 구성도에서 없는 것(대기·오버헤드·워크로드)을 있다고 읽지 않았는가?
- [ ] 확인 못 한 수치·버전을
unknown으로 남겼는가?
F. 주제 고유 용어집
이 분야에서 특별한 뜻을 갖는 용어. (일반 용어는 G 참조.)
| 용어 | 한 줄 뜻 | 처음 등장 |
|---|---|---|
| control path / data path | 결정을 나르는 흐름 / 무거운 데이터가 흐르는 흐름 | 01장 |
| prefill / decode | 입력 전체 처리 국면 / 토큰을 하나씩 잇는 국면 | 01장 |
| parameter | 학습으로 정해진 모델의 숫자값 하나(=weight) | 02장 |
| tensor | 같은 dtype 숫자들을 다차원 격자에 담은 배열 | 02장 |
| storage 하한 | 가중치만 담는 최소 바이트 = P×w/8 (런타임 전체 아님) | 02장 |
| dtype / 정밀도 | 숫자 하나를 몇 bit·어떤 형식으로 담는지의 규칙 | 03장 |
| 양자화(quantization) | 실수값을 더 적은 비트의 이산 격자에 대응 | 03장 |
| 실행 모델(execution model) | 코어 수·병렬성을 조직하는 방식 | 04장 |
| compute-bound / memory-bound | 연산이 병목 / 데이터 이동이 병목 | 05장 |
| operational intensity(연산 강도) | FLOP / byte. 병목 성격을 가름 | 05장 |
| FLOP / FLOPS | 연산 횟수 / 초당 연산 속도 | 05장 |
| KV 캐시 | 이미 계산한 토큰 상태를 저장·재사용(소프트웨어 관리) | 06장 |
| prefix 캐시 | 요청들이 공유하는 앞부분 계산을 재사용 | 06장 |
| interconnect | 가속기·노드를 잇는 연결 통로의 통칭 | 07장 |
| collective / all-reduce | 여러 디바이스가 함께하는 통신 / 값을 모아 공유 | 07장 |
| TTFT | 첫 토큰까지의 시간 | 08장 |
| ITL / TPOT | 토큰 간 지연 / 출력 토큰당 시간 | 08장 |
| throughput / goodput | 단위 시간당 처리량 / 그중 조건 만족분 | 08장 |
| concurrency | 동시에 처리 중인 요청 수 | 08장 |
| 측정 계약 | 지표를 무엇을·어떻게·어떤 분모로 쟀는지의 명세 | 08장 |
| peak / measured / calculated / inferred | 이론 상한 / 실측 / 계산 / 해석 | 09장 |
| 출처 등급(PRIMARY/REPRODUCTION/SECONDARY) | 근거의 출처 성격 | 09장 |
G. 기초 시스템·수학 용어 사전
여러 분야에 걸친 일반 용어. (주제 고유 용어는 F 참조.) 역할이 다릅니다: F는 이 분야 특유어, G는 배경 지식어.
| 용어 | 한 줄 풀이 | 처음 등장 |
|---|---|---|
| bit / byte | 정보 최소 단위(0/1) / 8 bit | 02장 |
| 부동소수점(floating point) | 부호×가수×2^지수 꼴로 소수를 담는 표현 | 03장 |
| 지수 / 가수(exponent / mantissa) | 범위를 넓히는 비트 / 해상도를 촘촘히 하는 비트 | 03장 |
| 정수(integer) 표현 | 정해진 간격의 정수만 담는 표현 | 03장 |
| 병렬 / 직렬(parallel / serial) | 동시에 여러 개 / 차례로 하나씩 | 04장 |
| 병목(bottleneck) | 가장 느린 단계가 전체 속도를 정함 | 05장 |
| 대역폭(bandwidth) | 단위 시간당 실어 나르는 데이터 양(byte/s) | 06장 |
| 지연(latency) | 요청 후 첫 반응·완료까지의 시간 | 06장 |
| 용량(capacity) | 담을 수 있는 총량(byte) | 06장 |
| 캐시 / 계층(cache / hierarchy) | 자주 쓰는 것을 가까이 둠 / 빠름·작음~느림·큼의 단계 | 06장 |
| 온칩(on-chip) | 프로세서 칩 안에 있음(칩 밖보다 빠름) | 06장 |
| 부하 / 큐(load / queue) | 처리할 일의 양 / 대기 줄 | 01장 |
| 평균 / 중앙값 / p95·p99 | 대푯값들 / 상위 지연(꼬리) 지표 | 08장 |
H. 단위·접두어 참조표 (02장)
H-1. bit와 byte
CODE
1 byte (B) = 8 bit (b) 표기: 소문자 b = bit, 대문자 B = byte 대역폭 흔한 표기: GB/s(초당 바이트) vs Gb/s(초당 비트) → 8배 차이. 확인 필수.
H-2. 10진 접두어 vs 2진 접두어
| 10진(SI) | 값 | 2진(IEC) | 값 |
|---|---|---|---|
| KB | 10³ B = 1,000 | KiB | 2¹⁰ B = 1,024 |
| MB | 10⁶ B | MiB | 2²⁰ B |
| GB | 10⁹ B | GiB | 2³⁰ B |
| TB | 10¹² B | TiB | 2⁴⁰ B |
CODE
주의: 자료에서 "GB"라 써 놓고 실제로는 2진(GiB)을 뜻하는 경우가 흔함.
GB vs GiB는 약 7% 차이. 계산에서 어느 쪽인지 매번 밝힐 것.
I. 확인일·버전 고정 안내 (재수록)
이 판본의 제작 조건 (확인일: 2026-01, 웹 검색: 불가):
이 판본은 오프라인 환경에서 제작되어 실제 제품의 최신 사양을 웹 검색으로 확인할 수 없었습니다. 따라서 하드웨어 예시는 모두 가상(架空)의 조건 명시 예시입니다(예: "가속기 A: peak 300 TFLOP/s @ BF16"). 이는 원리를 가르치기 위한 것이며 특정 실제 제품의 사양이 아닙니다. 실제 수치가 필요하면 각 벤더의 공식 사양(PRIMARY)을 확인일과 함께 직접 확인하세요.
원리는 안정적(비트/바이트, 정밀도의 의미, compute/memory-bound, 메모리 계층, 지표 정의)이지만, 버전·제품 의존 수치(가속기 사양, 라이브러리 기본값, 인터커넥트 대역폭, 최신 제품명)는 확인일·출처와 함께 봐야 하며, 확인 불가한 것은unknown으로 남깁니다.
← INDEX로 돌아가기