KV Cache는 LLM 추론 속도를 결정하는 핵심 메커니즘으로, 이전 토큰의 키-값을 저장해 중복 계산을 피한다. KV Cache가 왜 필요한지, 어떻게 동작하는지, 메모리 관리 방식까지 추론 최적화의 기초를 다진다.KV Cache가 필요한 이유Transformer 기반 LLM은 각 토큰을 생성할 때 이전 모든 토큰의 어텐션을 다시 계산한다. "안녕하세요"를 생성할 때 5번째 토큰은 1~4번째 토큰 각각과 어텐션을 계산하고, 6번째 토큰은 1~5번째와 다시 계산한다. 컨텍스트가 길어질수록 이 중복 계산량은 폭발적으로 증가한다.KV Cache는 이 문제를 근본적으로 해결한다. 첫 번째 토큰에서 계산된 키와 값 벡터를 메모리에 캐싱하고, 다음 토큰 생성 시 이미 계산된 값을 재사용하는 것이다. 각 디코딩 ..