Austin Kim's Blog
LLM Serving & Optimization

개인 스터디 기록

7개의 글 게시됨

Posts

  • Sep 19, 2026studyhardwareai-chip-architectures

    AI 칩 여섯 개를 같은 기준으로 읽어봤다 — NVIDIA, TPU, AMD, Cerebras, Trainium, Groq →

  • Sep 12, 2026studyllm-servingaws-trainium

    Trainium에서 vLLM 서빙하기: 병목은 가속기가 아니었다 →

  • Sep 1, 2026studyllm-serving

    2.4T 파라미터 MoE 서빙: 8-GPU 한 노드 vs 16-GPU 두 노드 →

  • Aug 28, 2026studyllm-serving

    B300 GPU 16장에서 2.4조 파라미터 MoE, 병목은 어디였나 →

  • Aug 22, 2026studyllm-serving

    4비트가 늘 빠른 건 아니었다: L4 한 장에서 찾은 양자화 교차점 →

  • Aug 16, 2026studyllm-serving

    append 한 줄이 페타바이트가 되기까지: KV Cache는 왜 결국 스토리지로 내려갔나 →

  • Aug 8, 2026studyllm-serving

    GPT를 200줄의 순수 Python으로? Karpathy의 microGPT 뜯어보기 →

subscribe via RSS

Austin Kim's Blog

  • Austin Kim's Blog

    개인 스터디 기록