|
Rapid-MLX: Apple Silicon 맥에서 로컬 LLM을 OpenAI 호환 서버로 띄우는 추론 엔진
|
|
0
|
239
|
8월 5, 2026
|
|
하드웨어 인식 동적 추측 디코딩(DSD): 배치 크기에 맞춰 초안 토큰 수를 조절하는 추론 최적화 (feat. Cohere)
|
|
0
|
119
|
7월 12, 2026
|
|
OpenAI와 Broadcom이 공개한 첫 자체 LLM 추론 전용 칩 Jalapeño (feat. Celestica)
|
|
0
|
156
|
6월 25, 2026
|
|
MOSS-TTS-Local-Transformer-v1.5, 로컬 서빙에 최적화된 48kHz 스트리밍 TTS 모델 (feat. SGLang-Omni)
|
|
0
|
233
|
6월 22, 2026
|
|
DiffusionGemma: vLLM이 네이티브로 지원하는 최초의 디퓨전 언어 모델(dLLM)
|
|
0
|
2022
|
6월 11, 2026
|
|
Apple Core AI 공개, 애플 실리콘용 온디바이스 AI 추론 스택과 PyTorch 변환 도구 coreai-torch
|
|
0
|
252
|
6월 10, 2026
|
|
Gemma Gem: Google의 Gemma 4 모델을 WebGPU로 브라우저에서 완전히 실행하는 온디바이스 AI 어시스턴트 크롬 확장
|
|
0
|
909
|
4월 11, 2026
|