|
Mixture-of-Kittens: Cursor가 새로 공개한 NVL72용 MoE 학습 메가커널
|
|
0
|
123
|
8월 7, 2026
|
|
DiffusionGemma 기술 문서 리뷰: 자기회귀 Gemma 4를 이산 확산 모델로 변환한 초고속 텍스트 생성에 대한 연구
|
|
0
|
256
|
8월 6, 2026
|
|
DeepSeek-V4-Flash 정식 버전 출시, 성능은 좋아지면서 가격은 낮아진 모델 (Task당 약 $0.027)
|
|
0
|
257
|
8월 6, 2026
|
|
Instella-MoE: AMD Instinct GPU에서 처음부터 학습한 완전 오픈 16B MoE 모델
|
|
0
|
138
|
8월 4, 2026
|
|
Qwen, Max 계열 최초로 가중치를 공개하는 2.4T 규모 플래그십 모델 Qwen3.8-Max 출시 및 공개 예정
|
|
0
|
393
|
8월 3, 2026
|
|
Kimi K3 모델 가중치 및 기술 문서 공개: 2.8T 오픈 모델의 아키텍처와 학습 레시피 심층 분석
|
|
0
|
508
|
7월 29, 2026
|
|
Agents-A1: 모델 크기 대신, 생각하는 능력을 확장해 1T급 성능에 도달한 35B 에이전트 모델
|
|
0
|
385
|
7월 22, 2026
|
|
Kimi K3, Moonshot AI가 공개한 세계 첫 3T급 오픈 웨이트 모델 (전체 가중치 공개는 7월 27일 예정)
|
|
0
|
6542
|
7월 18, 2026
|
|
하드웨어 인식 동적 추측 디코딩(DSD): 배치 크기에 맞춰 초안 토큰 수를 조절하는 추론 최적화 (feat. Cohere)
|
|
0
|
111
|
7월 12, 2026
|
|
Tencent, 295B 규모(활성 21B)의 오픈소스 MoE 추론 및 에이전트 모델 Hy3 공개
|
|
0
|
419
|
7월 8, 2026
|
|
1조 파라미터 규모로 에이전틱 강화학습을 수행하는 prime-rl 0.6.0의 최적화 총정리 (feat. Prime Intellect)
|
|
0
|
188
|
6월 29, 2026
|
|
TileKernels: DeepSeek AI가 공개한, LLM 연산을 위한 고성능 TileLang 기반 GPU 커널 라이브러리
|
|
0
|
168
|
6월 24, 2026
|
|
MAI-Thinking-1 기술 보고서: 데이터 파이프라인부터 RL 인프라까지, 프런티어 모델 학습의 전 과정을 해부한 '힐 클라이밍 머신' (feat. Microsoft AI)
|
|
0
|
398
|
6월 8, 2026
|
|
JetBrains, AI 워크플로를 위한 오픈소스 MoE 모델 Mellum 2 공개
|
|
0
|
359
|
6월 3, 2026
|
|
Cohere Command A+: 엔터프라이즈 에이전트 워크로드를 위한 오픈 MoE 모델
|
|
0
|
441
|
5월 21, 2026
|
|
Xiaomi, 1.02T 파라미터 오픈소스 MoE 추론 모델 MiMo-v2.5 및 MiMo-v2.5-Pro 출시
|
|
1
|
348
|
5월 1, 2026
|
|
DeepSeek, 100만 토큰 컨텍스트를 효율적으로 지원하는 MoE 모델 DeepSeek-V4-Pro 및 DeepSeek-V4-Flash 공개
|
|
0
|
974
|
4월 25, 2026
|
|
Kimi-K2: 에이전트형 인공지능을 위한 최신 MoE LLM (feat. Moonshot AI)
|
|
0
|
1279
|
7월 13, 2025
|
|
MoD(Mixture-of-Depths): Transformer 기반 언어 모델 연산 최적화를 위한 접근법, 그리고 MoDE(MoD+MoE)
|
|
0
|
2814
|
4월 7, 2024
|