|
Reef: 에이전트가 서비스되는 동안 모델 가중치와 하네스를 계속 갱신하는 지속 학습 인프라
|
|
0
|
122
|
9월 7, 2026
|
|
OpenEnv 프로젝트 소개: 에이전트 강화학습 환경의 공통 인터페이스가 되기까지 (feat. Meta, Hugging Face)
|
|
0
|
141
|
9월 4, 2026
|
|
EnvHarness: 정적인 벤치마크 환경을 에이전트의 약점에 맞춰 재구성하는 래퍼 계층에 대한 연구
|
|
0
|
97
|
9월 1, 2026
|
|
강화학습으로 양자 오류 정정(QEC)을 제어하는 연구: Willow에서 계산을 멈추지 않는 실시간 보정
|
|
0
|
98
|
8월 22, 2026
|
|
AgentENV: Kimi K3의 강화학습을 구동하는 셀프호스팅 에이전트 샌드박스 런타임
|
|
0
|
183
|
8월 10, 2026
|
|
Awesome Systematic Trading: 퀀트 트레이딩을 위한 라이브러리 및 전략 논문 모음
|
|
0
|
524
|
7월 31, 2026
|
|
LLaDA2.2: 레벤슈타인(Levenshtein) 편집 기법을 도입하여 에이전트 작업을 지원하는 확산 언어 모델(Diffusion LM)
|
|
0
|
213
|
7월 30, 2026
|
|
ENPIRE: 코딩 에이전트가 실제 로봇 정책을 스스로 개선하는 물리적 자율연구 (feat. NVIDIA)
|
|
0
|
136
|
7월 27, 2026
|
|
feyn, 답변 전 DB를 먼저 살펴보는 text-to-SQL 모델 SQRL 공개 (feat. Chonkie)
|
|
0
|
226
|
7월 23, 2026
|
|
Agents-A1: 모델 크기 대신, 생각하는 능력을 확장해 1T급 성능에 도달한 35B 에이전트 모델
|
|
0
|
448
|
7월 22, 2026
|
|
Error Diffusion: 역전파 없이 Dale의 원리를 지키는 이중 스트림 신경망 (feat. Sakana AI)
|
|
0
|
230
|
7월 21, 2026
|
|
확산 언어 모델(Diffusion LLM)의 개념과 동작에 대한 연구 정리: LLaDA에서 DiffusionGemma까지
|
|
0
|
1134
|
7월 20, 2026
|
|
Inkling: Thinking Machines Lab가 처음으로 공개하는 975B 멀티모달 MoE 모델
|
|
0
|
158
|
7월 17, 2026
|
|
OpenAI, 프롬프트 인젝션 방어력을 스스로 끌어올리는 자동화 레드팀 모델 GPT-Red 공개
|
|
0
|
186
|
7월 17, 2026
|
|
World of ClaudeCraft: 브라우저에서 돌아가는 오픈소스 MMO이자 에이전트 강화학습 환경
|
|
0
|
920
|
7월 15, 2026
|
|
GRAIL: 3D 에셋과 비디오 생성으로 만든 휴머노이드의 이동-조작 데이터 (feat. NVIDIA)
|
|
0
|
176
|
7월 8, 2026
|
|
SONIC: 모션 트래킹을 초대규모로 확장한 휴머노이드 전신 제어 모델 (feat. NVIDIA)
|
|
0
|
290
|
7월 8, 2026
|
|
ICML 2026에서 우수 논문상과 Test of Time상을 수상한 10편의 논문 소개
|
|
0
|
6700
|
7월 6, 2026
|
|
Memora: 추상화와 구체성을 함께 잡는 에이전트의 장기 기억 구조에 대한 연구 (feat. Microsoft Research)
|
|
0
|
487
|
7월 5, 2026
|
|
All RL Algorithms from Scratch: 18가지 강화학습 알고리즘을 밑바닥부터 구현한 교육용 저장소
|
|
0
|
1263
|
7월 5, 2026
|
|
Feedback Distillation: LLM 피드백 증류로 Lean 정리 증명 학습하기 (feat. Meta FAIR)
|
|
0
|
166
|
7월 2, 2026
|
|
1조 파라미터 규모로 에이전틱 강화학습을 수행하는 prime-rl 0.6.0의 최적화 총정리 (feat. Prime Intellect)
|
|
0
|
199
|
6월 29, 2026
|
|
Ornith-1.0: 스캐폴드를 스스로 학습하는 에이전트 코딩 LLM (feat. DeepReinforce)
|
|
0
|
3576
|
6월 28, 2026
|
|
SIA(Self-Improving AI): 하네스와 모델 가중치를 함께 진화시키는 자기 개선 AI 에이전트 루프에 대한 연구 (feat. Hexo Labs)
|
|
0
|
228
|
6월 27, 2026
|
|
OpenGame: 프롬프트 하나로 플레이 가능한 웹 게임을 끝까지 만드는 오픈소스 에이전트 프레임워크
|
|
0
|
1123
|
6월 27, 2026
|
|
Qwen-AgentWorld: 에이전트 환경을 시뮬레이션하는 언어 세계 모델 연구 (feat. Qwen)
|
|
0
|
1342
|
6월 25, 2026
|
|
HarnessX: 에이전트 하네스를 실행 트레이스로 진화시키는 연구 (feat. Xiaomi)
|
|
0
|
866
|
6월 19, 2026
|
|
VibeThinker-3B: 3B 파라미터로 프론티어급 추론에 도달한 소형 언어 모델 (feat. Weibo AI)
|
|
3
|
3252
|
6월 18, 2026
|
|
Thinking Without Words: 자연어가 아닌 추상 토큰 사전(codebook)을 활용하는 지연 추론(Latent Reasoning)에 대한 연구 (feat. Abstract CoT)
|
|
0
|
189
|
6월 17, 2026
|
|
MAI-Thinking-1 기술 보고서: 데이터 파이프라인부터 RL 인프라까지, 프런티어 모델 학습의 전 과정을 해부한 '힐 클라이밍 머신' (feat. Microsoft AI)
|
|
0
|
434
|
6월 8, 2026
|