개념 해설/컴퓨팅 인프라
LLM 추론에서 메모리가 병목이 되는 이유
모델 파일 크기만으로 실행 가능성을 판단할 수 없는 이유를 가중치, KV 캐시, 메모리 대역폭으로 설명한다. 문맥 길이와 동시 요청의 영향을 계산기로 확인한다.
반도체, 메모리, 클라우드. 소프트웨어의 가능성과 비용을 결정하는 기반 기술을 들여다봅니다.
추론 메모리를 가중치와 KV 캐시로 나눠 이해한 뒤, HBM과 Roofline으로 용량과 속도의 차이를 읽어 보세요. 계산 도구로 문맥 길이의 영향도 확인할 수 있습니다.
모델 파일 크기만으로 실행 가능성을 판단할 수 없는 이유를 가중치, KV 캐시, 메모리 대역폭으로 설명한다. 문맥 길이와 동시 요청의 영향을 계산기로 확인한다.
HBM의 용량과 대역폭은 서로 다른 제약이다. Roofline 계산으로 GPU 연산 성능과 메모리 이동의 관계를 분석하고, 배치·KV 캐시·FlashAttention이 병목을 바꾸는 조건을 설명한다.
더 강한 모델이 곧 더 좋은 업무 제품은 아니다. 에이전트의 구조, 업무 연결, 완료 기준, 재시도 비용을 연결해 제품 경쟁력의 축적 지점을 분석한다.
벡터 검색에 키워드 검색과 reranker를 더할 때 무엇이 좋아지고 무엇이 남는지 분석한다. RRF를 직접 계산하고 후보 누락·권한 필터·평가 지표를 구분해 설계 기준을 제시한다.
입력 한도가 늘어나면 검색은 필요 없어질까. RAG, 긴 문맥, 장기 기억의 차이를 문서 갱신·권한·비용·답변 근거라는 네 기준으로 분석한다.
허용하면 Google Analytics로 페이지 조회와 글 저장·목차 이용을 측정합니다. 검색어와 계산 입력값은 보내지 않습니다. 처리 방식 보기