|
Kaggle TPU Lab: 무료 Kaggle TPU에서 320B 크기의 GLM-5.3-Flash을 서빙하는 코딩 에이전트용 API 레시피 저장소
|
|
0
|
142
|
9월 17, 2026
|
|
E-P-D 분리 서빙: 비전 인코더를 떼어내 TTFT를 최대 93% 줄이는 조건과 오히려 느려지는 조건 (feat. NVIDIA Dynamo)
|
|
0
|
208
|
9월 10, 2026
|
|
NVIDIA Model Optimizer: 모델을 경량화하여 vLLM / TensorRT / SGLang 등의 추론 서버용 배포용 체크포인트를 만드는 프로젝트
|
|
0
|
234
|
9월 2, 2026
|
|
vLLM.KR Community Meetup (8월) 참가자를 모집합니다!
|
|
0
|
424
|
8월 6, 2026
|
|
vLLM.KR Community Meetup (8월)에서 발표하실 연사분을 모십니다!
|
|
6
|
383
|
8월 5, 2026
|
|
MiniMax, 영상과 음향을 함께 만드는 33B 옴니모달 모델 H3 웨이트 공개 (단, 한국 사용 금지🫠)
|
|
1
|
2168
|
8월 4, 2026
|
|
local-llm: 최신 LLM을 로컬에서 직접 돌리는 GPU 하드웨어 구성 가이드
|
|
1
|
9785
|
7월 19, 2026
|
|
하드웨어 인식 동적 추측 디코딩(DSD): 배치 크기에 맞춰 초안 토큰 수를 조절하는 추론 최적화 (feat. Cohere)
|
|
0
|
138
|
7월 12, 2026
|
|
vLLM Hook: vLLM에 배포된 모델의 내부 상태를 관찰하고 제어하는 플러그인
|
|
1
|
1373
|
7월 9, 2026
|
|
vLLM Semantic Router가 공개한, 모델 API 안에서 협업하는 마이크로 에이전트 (feat. Looper)
|
|
0
|
246
|
7월 1, 2026
|
|
Mooncake: Kimi를 떠받치는 KVCache 중심 분리형 LLM 서빙 플랫폼
|
|
0
|
469
|
6월 30, 2026
|
|
1조 파라미터 규모로 에이전틱 강화학습을 수행하는 prime-rl 0.6.0의 최적화 총정리 (feat. Prime Intellect)
|
|
0
|
199
|
6월 29, 2026
|
|
DiffusionGemma: vLLM이 네이티브로 지원하는 최초의 디퓨전 언어 모델(dLLM)
|
|
0
|
2072
|
6월 11, 2026
|
|
tiny-vllm: C++와 CUDA로 vLLM을 직접 구현하며 배우는 LLM 추론 엔진
|
|
0
|
3922
|
6월 1, 2026
|
|
vllm 에 rust frontend 로 전처리 성능 향상
|
|
0
|
327
|
5월 27, 2026
|
|
vLLM.KR Community Meetup (5월) 참가자를 모집합니다!
|
|
0
|
674
|
5월 19, 2026
|
|
Club-3090: RTX 3090 GPU에서 vLLM, llama.cpp, SGLang으로 LLM을 서빙하는 커뮤니티 레시피 모음
|
|
0
|
513
|
5월 4, 2026
|
|
Xiaomi, 1.02T 파라미터 오픈소스 MoE 추론 모델 MiMo-v2.5 및 MiMo-v2.5-Pro 출시
|
|
1
|
367
|
5월 1, 2026
|
|
vLLM.KR Community Meetup (5월)에서 발표하실 연사분을 모십니다!
|
|
2
|
554
|
4월 29, 2026
|
|
DFlash: 블록 확산(Block Diffusion) 기반으로 LLM 추론 속도를 높이는 오픈소스 라이브러리 (feat. Z.ai)
|
|
0
|
840
|
4월 24, 2026
|
|
vLLM Recipes 개편 - 모델+하드웨어 조합별 설정을 딸각 한방으로
|
|
0
|
370
|
4월 23, 2026
|
|
[GN⁺] 월 $20 스택으로 월매출 $10K 회사를 여러 개 운영하는 법
|
|
0
|
416
|
4월 14, 2026
|
|
rvLLM: Rust로 처음부터 구현한 고성능 LLM 추론 엔진, vLLM 완전 대체제
|
|
1
|
6883
|
4월 3, 2026
|
|
LLM 추론 엔진 이해하기: Nano-vLLM 내부 살펴보기 - 2부 (Understanding LLM Inference Engines: Inside Nano-vLLM (Part 2))
|
|
0
|
572
|
3월 3, 2026
|
|
LLM 추론 엔진 이해하기: Nano-vLLM 내부 살펴보기 - 1부 (Understanding LLM Inference Engines: Inside Nano-vLLM (Part 1))
|
|
0
|
1373
|
3월 3, 2026
|
|
vLLM팀, 실시간 음성 상호작용 등, 옴니모달(Omni-Modality) 모델 서빙을 위한 vLLM-Omni 공개
|
|
0
|
905
|
12월 22, 2025
|
|
TileRT: LLM의 연산을 Tile 단위 작업으로 분해하여 실행하는 초저지연(Ultra-Low Latency) 런타임
|
|
0
|
364
|
11월 26, 2025
|
|
리벨리온과 스퀴즈비츠와 함께 하는 오프라인 vLLM Hands-on 워크샵💻에 초대합니다.
|
|
0
|
963
|
10월 5, 2025
|
|
vLLM Semantic Router: 지능형 LLM 라우팅을 위한 차세대 아키텍처
|
|
0
|
2055
|
9월 24, 2025
|
|
8/19(화) 저녁, 한국에서 열리는 첫번째 vLLM meetup에 함께 해주세요!
|
|
5
|
1187
|
8월 19, 2025
|