15. 벤치마크 주장 비판하기
핵심 질문
- 성능·품질 벤치마크 주장을 볼 때, 어떤 조건들을 확인해야 그 순위를 믿을 수 있는가?
- 불완전한 결과표의 직접 순위를 언제 거부해야 하는가?
목표
- model·quality·workload·hardware·software·precision·metric·SLO 조건 축으로 주장을 판정한다.
- "조건이 빠진 순위표"를 다루는 원칙을 세운다.
여정의 끝 — 증거를 읽는 힘
이 장은 안내서의 정체성이 집약되는 곳입니다. 지금까지 배운 모든 개념(prefill/decode·KV·배칭·양자화·speculative·지표)은 결국 "이 주장을 믿어도 되는가"를 판단하기 위한 재료였습니다. 벤치마크 주장은 대개 "A가 B보다 X배 빠르다/좋다"는 형태로 오지만, 그 문장은 여러 숨은 조건 위에서만 성립합니다.
여덟 개의 조건 축
어떤 성능·품질 주장을 만나면, 다음 축들이 명시됐는지 점검합니다. 하나라도 비면 순위의 의미가 약해집니다.
| 축 | 물어야 할 것 | 빠지면 생기는 착시 |
|---|---|---|
| model | 어떤 모델·크기·아키텍처(MHA/GQA/MLA 06장)? | 아키텍처가 KV·속도를 바꿈 |
| quality | 속도만 봤나, 품질은 유지됐나? | 양자화·speculative로 속도만 얻고 품질 손실 은폐(11·12장) |
| workload | 프롬프트·출력 길이 분포, 접두 반복률(10장)? | 짧은/반복 워크로드에 유리하게 세팅 |
| hardware | 어떤 가속기·메모리 대역폭(03장)? | 연산:대역폭 비율이 병목을 바꿈 |
| software | 엔진·버전·설정·기본값(13장)? | 버전마다 동작·성능 상이 |
| precision | dtype·양자화 방식(04·11장)? | 저정밀로 속도↑ 품질↓ 비교 불공정 |
| metric | 이벤트·집계·분모(14장)? | 같은 이름 다른 정의 |
| SLO | 어떤 지연 예산에서? goodput인가 raw인가(14장)? | raw throughput만 보면 꼬리 지연 은폐 |
flowchart TB
C[벤치마크 주장<br/>'A가 B보다 X배']:::danger --> Q{8개 축이<br/>명시됐나?}:::ctrl
Q -->|모두 명시·공정| ACC[조건부로 수용<br/>'이 조건에서 참']:::result
Q -->|일부 결측| PART[신뢰도↓<br/>결측 축을 물음]:::comp
Q -->|핵심 결측·불공정| REJ[직접 순위 거부]:::danger
classDef danger fill:#ffc9c9,stroke:#e03131,color:#000;
classDef ctrl fill:#c3fae8,stroke:#0ca678,color:#000;
classDef comp fill:#d0ebff,stroke:#1971c2,color:#000;
classDef result fill:#d3f9d8,stroke:#2f9e44,color:#000;
불완전한 결과표의 직접 순위를 언제 거부하나
핵심 원칙: 결과표에 빈칸(결측)이 있거나 조건이 어긋나면, 그 표의 숫자를 세로로 줄 세워 "1등"을 뽑는 행위를 거부합니다. 구체적으로:
- 비교 대상들의 조건이 다를 때 — 예: A는 FP16, B는 INT4로 쟀는데 속도만 비교 → precision 축이 어긋나 순위 무의미.
- 핵심 축이 통째로 빠졌을 때 — 예: 품질(quality) 열이 없이 속도만 있는 표 → "빠르다"가 "좋다"를 뜻하지 못함.
- 지표 정의가 불명확할 때 — 예: TTFT의 집계·분모(14장)가 안 밝혀짐 → 같은 이름이 다른 값.
- owner 단독 근거일 때 — 재현(REPRODUCTION) 없이 vendor 표만 있음 → 유리한 조건 가능성.
📌 핵심
거부는 "틀렸다"가 아니라 "아직 판정 불가"순위를 거부한다는 것은 "그 시스템이 나쁘다"가 아니라, "이 표만으로는 순위를 매길 수 없다"는 뜻입니다. 결측 축을 물어 채우면 조건부로 수용할 수 있습니다. 이 태도가 지어내기(fabrication)와 성급한 단정을 동시에 피합니다.
🔬 증거 읽기 — 종합
- 출처 등급을 매기세요: PRIMARY(원 논문·공식)인가, REPRODUCTION(독립 재현)인가, SECONDARY(해설)인가. 핵심 성능/품질 주장을 SECONDARY 단독으로 받지 마세요.
- 주장 유형을 표시하세요: measured / vendor-reported / calculated / inferred. "X배 빠르다"가 measured면 조건을, calculated면 입력·식을, vendor-reported면 독립 재현 여부를 확인.
- owner 공개 ≠ 독립 검증, 저장소 존재 ≠ 재현 성공. 이 둘을 항상 구분하세요.
실전 체크리스트 (요약)
주장을 만나면 순서대로:
- 이건 measured/vendor/calculated/inferred 중 무엇인가?
- 8개 축(model·quality·workload·hardware·software·precision·metric·SLO)이 명시됐나?
- 지표는 이벤트·집계·분모가 못 박혀 있나(14장)?
- 출처 등급은? owner 단독인가, 독립 재현이 있나?
- 빠진 축이 있으면 → 순위 보류, 결측을 물음. 어긋난 축이 있으면 → 직접 순위 거부.
📌 핵심
- 벤치마크 주장은 model·quality·workload·hardware·software·precision·metric·SLO 여덟 축의 조건 위에서만 성립.
- 축이 어긋나거나 핵심이 빠진 불완전한 표의 직접 순위는 거부 — "판정 불가"이지 "나쁨"이 아니다.
- 출처 등급과 주장 유형을 함께 매겨, owner 단독·재현 부재를 경계.
- 이 판정력이 안내서 전체가 겨냥한 "증거를 읽는 힘"이다.
🔎 이 장의 '지지하지 않는 결론'
- 이 장은 "어떤 시스템이 최고"라고 말하지 않습니다 — 판정의 방법을 줄 뿐입니다.
- 조건이 갖춰진 벤치마크라도 당신의 워크로드로 그대로 옮길 수 있다고 단정하지 않습니다 — workload 축이 다르면 결과도 다릅니다.
✍️ 확인 문제
- 여덟 조건 축 중 넷을 골라, 각 축이 빠질 때 생기는 착시를 한 줄씩 쓰세요.
- (조건 유형) "A 엔진이 B보다 2배 빠르다"는 표를 받았습니다. 이 순위를 거부해야 하는 상황과 조건부로 수용할 수 있는 상황을 각각 하나씩 구성하세요.
- "owner 공개 = 검증됨"이 왜 틀렸는지, 출처 등급과 주장 유형으로 설명하세요.
다음: 부록 — 정의표·워크시트·치트시트·용어집·출처 읽기 가이드.