dpo
| 글 | 댓글 | 조회수 | 활동 | |
|---|---|---|---|---|
| DPO로 텍스트 퇴화 줄이기: 모델의 실패 출력을 거부 쌍으로 쓰는 방법에 대한 연구 (feat. DharmaOCR) |
|
0 | 176 | 6월 7, 2026 |
| RLHF Book: 인간 피드백 기반 강화학습(RLHF)과 사후 학습(Post-training) 전반을 다루는 오픈소스 교재 및 코드 라이브러리 |
|
1 | 413 | 5월 4, 2026 |
| AnalyticsVidhya가 선정한 NeurIPS 2023의 주목할만한 논문 6+5편 |
|
0 | 693 | 12월 27, 2023 |
| [GN] 2023년은 오픈 LLM의 해 |
|
0 | 350 | 12월 21, 2023 |
| [TLDR] 오늘의 AI 뉴스, 2023-08-25: 메타, 코드 라마 출시 🦙, 허깅 페이스, 2억 3,500만 달러 투자 💰, 동영상 생성 벤치마크 📹 |
|
0 | 639 | 8월 26, 2023 |