evaluation
| 글 | 댓글 | 조회수 | 활동 | |
|---|---|---|---|---|
| WANDR, 리서치 에이전트의 넓고 깊은 탐색 능력을 평가하는 벤치마크 (feat. Perplexity) |
|
0 | 89 | 7월 23, 2026 |
| EdgeBench: 실제 환경에서 에이전트의 학습 속도를 측정하는 벤치마크 (feat. ByteDance Seed) |
|
0 | 110 | 7월 4, 2026 |
| FrontierCode: 정확성을 넘어 "병합 가능한 코드 품질"을 측정하는 벤치마크 (feat. Cognition) |
|
0 | 144 | 6월 12, 2026 |
| ChainReason: Ethereum과 DeFi 작업에서 LLM 추론 능력을 다섯 가지 축으로 평가하는 벤치마크 |
|
0 | 135 | 5월 10, 2026 |
| CAPTURE: Multimodal LLM(LVLM)의 이미지 캡션 생성 성능 평가 지표 (벤치마크 & 평가 데이터셋) |
|
0 | 753 | 9월 5, 2024 |