728x90

전체 글 48

03-01-kv-cache-explained

KV Cache는 LLM 추론 속도를 결정하는 핵심 메커니즘으로, 이전 토큰의 키-값을 저장해 중복 계산을 피한다. KV Cache가 왜 필요한지, 어떻게 동작하는지, 메모리 관리 방식까지 추론 최적화의 기초를 다진다.KV Cache가 필요한 이유Transformer 기반 LLM은 각 토큰을 생성할 때 이전 모든 토큰의 어텐션을 다시 계산한다. "안녕하세요"를 생성할 때 5번째 토큰은 1~4번째 토큰 각각과 어텐션을 계산하고, 6번째 토큰은 1~5번째와 다시 계산한다. 컨텍스트가 길어질수록 이 중복 계산량은 폭발적으로 증가한다.KV Cache는 이 문제를 근본적으로 해결한다. 첫 번째 토큰에서 계산된 키와 값 벡터를 메모리에 캐싱하고, 다음 토큰 생성 시 이미 계산된 값을 재사용하는 것이다. 각 디코딩 ..

카테고리 없음 2026.07.03

02-02-arxiv-online-scheduling

LLM 추론에서 KV Cache를 활용하는 Online Scheduling 기법에 대한 최신 arXiv 연구를 정리합니다. 메모리 효율성과 처리량 향상을 위한 핵심 알고리즘을 분석하고 실무 적용 가능성을합니다. 특히 동적 워크로드 환경에서 어떻게 최적의 스케줄링 결정을 내리는지 상세히 살펴봅니다. 이 연구는 실제 프로덕션 환경에서의 LLM 서빙 시스템 설계에 중요한 시사점을 제공하며, 기존 정적 배치 처리 방식의 한계를 극복하는 새로운 접근법을 제시합니다.KV Cache 기반 스케줄링의 배경대형 언어 모델 추론 시 반복적인 계산 문제를 해결하기 위해 KV Cache가 도입되었습니다. 이전 시퀀스의 키-값 벡터를 캐싱하여 중복 계산을 피할 수 있지만, 캐시 메모리 관리와 요청 스케줄링이 새로운 과제로 부상..

카테고리 없음 2026.07.03

02-01-ttft-tpot-throughput

LLM 추론 성능을 평가할 때 TTFT, TPOT, Throughput이라는 세 가지 핵심 지표를 정확히 이해해야 합니다. 각 지표의 정확한와 최적화 방향을 정리하고, 실제 서비스에서 어떻게 활용되는지 살펴봅니다. 단순히 빠른 모델을 선택하는 것을 넘어, 이 세 지표의 트레이드오프를 이해하면 사용자 경험과 시스템 효율성 모두를 최적화할 수 있습니다. 특히 대규모 프로덕션 환경에서는 이 세 가지 지표 사이의 균형을 찾는 것이 관리의 핵심이며, 서비스 특성에 따라 어느 지표를 우선해야 하는지가 달라집니다.TTFT란 무엇인가TTFT는 Time to First Token의 약자로, 사용자가 질의를 보내고 첫 번째 토큰을 받기까지 걸리는 시간입니다. LLM 서빙에서 가장 체감 속도에 영향을 주는 지표 중 하나이며..

카테고리 없음 2026.06.30

01-02-arxiv-kv-cache-scheduling

KV Cache 제약 조건 하에서 LLM 스케줄링이 어떻게 변화하는지 arXiv 논문을 읽으며 실무에 바로 적용할 수 있는 스케줄링 전략을 정리한다. Online Scheduling, KV Cache Management, LLM Serving의 세 가지 핵심 논점을 다룬다.KV Cache 제약과 LLM 스케줄링의 근본적 문제LLM 추론에서 KV Cache는 필수적이지만, GPU 메모리는 유한하다. 배치 크기가 커질수록 KV Cache가 점유하는 메모리가 증가하고, 결국 새로운 요청을 처리할 공간이 없어진다. 이 때문에 전통적인 FIFO 스케줄링은 GPU 활용률을 크게 떨어뜨린다.arXiv에 공개된 여러 논문에서 이 문제를 풀기 위해 Cache-aware 스케줄링을 제안한다. 핵심 아이디어는 간단하다. K..

카테고리 없음 2026.06.30

H100, H200, B200, L40S GPU 비용 비교: LLM 서빙에 가장 효율적인 GPU는?

H100, H200, B200, L40S 중 어떤 GPU가 LLM 서빙에 가장 비용 효율적일까요? GPU별 가격, 메모리, 처리량을 기준으로 실제 서빙 비용을 계산합니다. 이 글은 LLM 추론 최적화 시리즈의 3편입니다.1편: LLM 추론 최적화 완벽 가이드2편: vLLM vs TensorRT-LLM vs SGLang 비교 LLM 서빙 GPU 선택의 기준GPU를 선택할 때 고려해야 할 핵심 요소는 다섯 가지입니다:HBM 용량: 모델 크기 + KV 캐시를 감당할 수 있는가메모리 대역폭: 디코딩 단계에서 메모리 바운드 워크로드의 성능을 결정연산 성능 (FLOPS): 프리필 단계의 처리량을 결정특수 기능: FP8, FP4 등 저정밀도 연산 지원 여부가격: 구매 비용 또는 시간당 클라우드 비용 GPU 스펙 비교..

카테고리 없음 2026.06.28

vLLM vs TensorRT-LLM vs SGLang: 2026 LLM 서빙 엔진 비교

vLLM, TensorRT-LLM, SGLang 중 어떤 LLM 서빙 엔진을 선택해야 할까요? 처리량, 지연 시간, 설정 난이도, GPU 호환성을 기준으로 세 프레임워크를 깊이 있게 비교합니다. 이 글은 LLM 추론 최적화 시리즈의 2편입니다.1편: LLM 추론 최적화 완벽 가이드3편: GPU별 LLM 서빙 비용 비교 (예정) 세 프레임워크 한눈에 보기LLM 서빙 엔진은 단순히 모델을 로드하고 추론을 실행하는 것 이상을 해야 합니다. 동시 요청 처리, 메모리 관리, 배칭, 양자화, 분산 추론까지 모두 지원해야 합니다. 현재 가장 널리 쓰이는 세 가지 엔진의 핵심 차이를 정리합니다. vLLM: 범용성의 승자개발: UC Berkeley 연구진이 주도, 오픈소스 커뮤니티 중심핵심 기술: PagedAttenti..

카테고리 없음 2026.06.28

LLM 추론 최적화 완벽 가이드: KV 캐시부터 양자화까지

LLM 추론 최적화는 AI 모델을 프로덕션에 배포하는 모든 엔지니어가 직면하는 핵심 과제입니다. 본 글에서는 KV 캐시, 배칭, 어텐션 최적화, 양자화까지 추론 성능을 결정하는 전체 요소를 체계적으로 정리합니다. 이 글은 LLM 추론 최적화 시리즈의 1편입니다.DeepSeek V4 분석: 1.6조 파라미터 MoE 구조와 비용 (관련 글)SonicMoE: H100 64대로 96대 성능을 내는 MoE 학습 최적화 (관련 글)2편: vLLM vs TensorRT-LLM vs SGLang 비교 (예정)3편: GPU별 LLM 서빙 비용 비교 (예정) LLM 추론이 어려운 이유LLM 추론은 일반적인 딥러닝 추론과 본질적으로 다릅니다. 핵심 차이는 자기 회귀적 생성(autoregressive generation)입니..

카테고리 없음 2026.06.28

2026년 AI가 대체하는 직업과 새로 생기는 직업 BEST 10

2026년, AI는 더 이상 미래의 기술이 아닙니다. 지금 이 순간도 AI가 인간의 일자리를 바꾸고 있습니다. GPT-5, Gemini 2.5, Claude 4, DeepSeek V4 같은 초거대 AI 모델이 등장하면서, 사라지는 직업과 새로 생기는 직업의 경계가 빠르게 움직이고 있습니다.이 글에서는 2026년 기준 AI가 대체하는 직업, 새로 만들어내는 직업, 그리고 인간이 절대 AI에게 넘길 수 없는 영역까지 정리했습니다. 취업 준비생, 이직을 고민하는 직장인, AI 시대에 대비하려는 모든 분에게 필요한 정보입니다.AI가 대체하는 직업 BEST 10AI가 가장 먼저 대체하는 것은 반복적이고 규칙이 정해된 일입니다. 2026년 현재, 다음 직업들은 AI가 인간보다 빠르고 정확하게 수행하고 있습니다.1...

카테고리 없음 2026.06.19

DeepSeek V4 공개: 1.6조 파라미터 MoE, 100만 토큰 컨텍스트… Apache 2.0으로 완전 오픈소스

4월 24일, DeepSeek가 다시 한번 세상을 놀라게 했다. V4 프로와 V4 플래시 두 버전을 동시에 공개하며, 오픈소스 AI 역사에서 또 하나의 이정표를 세운 것이다. 공개와 동시에 Hugging Face에 모델 가중치가 업로드됐고, API도 바로 열렸다. 놀라운 것은 같은 날 OpenAI가 GPT-5.5를 출시했다는 점이다. DeepSeek는 의도적으로 충격적인 타이밍을 선택했다. 대체 이 모델은 어떤 혁신을 가져왔고, 우리 개발자들에게 어떤 변화를 가져올지 지금부터 자세히 살펴보겠다. 두 가지 모델, 전혀 다른 포지셔닝 DeepSeek V4는 두 가지 변형으로 등장했다. 이 두 모델은 각각의 설계 철학과 타깃 시장이 완전히 다르다. V4 프로는 1조 6천억 개의 총 파라미터를 가지되, 실제로 ..

Tech 2026.05.05

클라우드 없이 AI가 폰 속에서 작동하는 시대가 왔다

보안은 더 강력하게, 속도는 더 빠르게. 내 손안의 AI가 클라우드의 족쇄를 풀고 독립을 선언했습니다. 2026년 스마트폰 시장의 화두는 성능 지표가 아니다. 바로 '온디바이스 AI'가 얼마나 똑똑하냐는 것이다. 데이터를 서버로 보내지 않고 장치 내부에서 즉시 처리함에 따라 개인 정보 유출 우려는 사라졌고, 비행기 안에서도 실시간 동시통역과 고난도 사진 편집이 가능해졌다. 삼성 갤럭시 'AI 라이브러리': 사소한 습관까지 기억하는 학습력 2026년형 갤럭시 시리즈는 사용자의 수면 상태, 이동 경로, 업무 패턴을 학습하여 다음 행동을 예측한다. 아침에 눈을 뜨면 AI가 '어제 늦게 주무셨으니 커피 전문점에 들를 수 있도록 미리 사이렌 오더를 켤까요?'라고 묻는 식이다. 이 모든 개인화 학습은 외부 서버가 ..

Tech 2026.05.05
728x90