|
에이전트 개발 6개월에서 2주로, Lyft와 Vodafone과 LATAM의 프로덕션 고객경험 에이전트 운영기 (feat. LangChain)
|
|
0
|
191
|
8월 26, 2026
|
|
WANDR, 리서치 에이전트의 넓고 깊은 탐색 능력을 평가하는 벤치마크 (feat. Perplexity)
|
|
0
|
148
|
7월 23, 2026
|
|
EdgeBench: 실제 환경에서 에이전트의 학습 속도를 측정하는 벤치마크 (feat. ByteDance Seed)
|
|
0
|
116
|
7월 4, 2026
|
|
FrontierCode: 정확성을 넘어 "병합 가능한 코드 품질"을 측정하는 벤치마크 (feat. Cognition)
|
|
0
|
170
|
6월 12, 2026
|
|
ChainReason: Ethereum과 DeFi 작업에서 LLM 추론 능력을 다섯 가지 축으로 평가하는 벤치마크
|
|
0
|
142
|
5월 10, 2026
|
|
CAPTURE: Multimodal LLM(LVLM)의 이미지 캡션 생성 성능 평가 지표 (벤치마크 & 평가 데이터셋)
|
|
0
|
758
|
9월 5, 2024
|