|
Cerebras, 웨이퍼 3장을 한 랙에 담은 Nexus 아키텍처로 GPU 대비 최대 30배 빠른 추론이 가능한 CS-4 출시
|
|
0
|
177
|
8월 20, 2026
|
|
Rapid-MLX: Apple Silicon 맥에서 로컬 LLM을 OpenAI 호환 서버로 띄우는 추론 엔진
|
|
0
|
249
|
8월 5, 2026
|
|
하드웨어 인식 동적 추측 디코딩(DSD): 배치 크기에 맞춰 초안 토큰 수를 조절하는 추론 최적화 (feat. Cohere)
|
|
0
|
119
|
7월 12, 2026
|
|
OpenAI와 Broadcom이 공개한 첫 자체 LLM 추론 전용 칩 Jalapeño (feat. Celestica)
|
|
0
|
157
|
6월 25, 2026
|
|
MOSS-TTS-Local-Transformer-v1.5, 로컬 서빙에 최적화된 48kHz 스트리밍 TTS 모델 (feat. SGLang-Omni)
|
|
0
|
246
|
6월 22, 2026
|
|
DiffusionGemma: vLLM이 네이티브로 지원하는 최초의 디퓨전 언어 모델(dLLM)
|
|
0
|
2038
|
6월 11, 2026
|
|
Apple Core AI 공개, 애플 실리콘용 온디바이스 AI 추론 스택과 PyTorch 변환 도구 coreai-torch
|
|
0
|
261
|
6월 10, 2026
|
|
Gemma Gem: Google의 Gemma 4 모델을 WebGPU로 브라우저에서 완전히 실행하는 온디바이스 AI 어시스턴트 크롬 확장
|
|
0
|
912
|
4월 11, 2026
|