← 추론 메모리 해설로 돌아가기
AN INTERACTIVE EXPLAINER

문맥이 길어지면,
메모리는 얼마나 늘어날까?

전체 문맥을 보관하는 일반적인 KV 캐시의 원시 저장량을 계산합니다.
아래 기본값은 설명용 가상 구조이며 실제 모델의 사양이 아닙니다.

원시 KV 저장량 · 계산값1.00 GiB

1,073,741,824 bytes

가중치·작업 공간·메타데이터·할당 여유는 제외합니다. 실제 장치의 메모리 사용량과 다릅니다.

무엇을 계산하나요?

KV bytes = 2 × L × Hkv × D × T × B × S

K와 V 두 종류를 모든 레이어와 토큰에 대해 보관한다고 가정합니다. GiB는 2³⁰ bytes, 즉 1,073,741,824 bytes입니다. T에는 입력 토큰과 지금까지 생성한 토큰을 포함합니다. 시퀀스 길이가 다르면 각 시퀀스의 토큰 수를 합산해야 합니다.

어떤 조건에서 쓰나요?

레이어별 KV 헤드와 차원이 같고, 전체 문맥을 저장하며, 시퀀스 간 캐시를 공유하지 않는 구조를 가정합니다. GQA 모델에서는 쿼리 헤드 수가 아니라 KV 헤드 수를 넣으세요. 가중치를 양자화했다고 캐시의 바이트 수까지 자동으로 바뀌지는 않습니다.

슬라이딩 윈도, 압축된 잠재 캐시, 혼합 구조, 캐시 공유·오프로딩에는 별도 계산이 필요합니다. 이 결과로 장비 구매나 최대 동시 사용자를 확정할 수 없습니다.

근거와 재현

Transformers의 K·V 캐시 구조와 GQA 논문을 참고했습니다. 식과 제한 조건은 추론 메모리 해설에서 자세히 설명합니다.

계산 예시 JSON 내려받기 ↓

공식 확인일: 2026.10.05. 입력값은 브라우저 안에서만 계산하며 서버에 전송하지 않습니다.