LLM Serving & Optimization
개인 스터디 기록
7개의 글 게시됨Posts
-
studyhardwareai-chip-architectures
AI 칩 여섯 개를 같은 기준으로 읽어봤다 — NVIDIA, TPU, AMD, Cerebras, Trainium, Groq →
-
studyllm-servingaws-trainium
Trainium에서 vLLM 서빙하기: 병목은 가속기가 아니었다 →
-
studyllm-serving
2.4T 파라미터 MoE 서빙: 8-GPU 한 노드 vs 16-GPU 두 노드 →
-
studyllm-serving
B300 GPU 16장에서 2.4조 파라미터 MoE, 병목은 어디였나 →
-
studyllm-serving
4비트가 늘 빠른 건 아니었다: L4 한 장에서 찾은 양자화 교차점 →
-
studyllm-serving
append 한 줄이 페타바이트가 되기까지: KV Cache는 왜 결국 스토리지로 내려갔나 →
-
studyllm-serving
GPT를 200줄의 순수 Python으로? Karpathy의 microGPT 뜯어보기 →
subscribe via RSS