|
멀티에이전트 시스템의 실패 패턴: AI 에이전트 군집의 쏠림, 담합, 목표 충돌에 대한 Anthropic의 연구
|
|
0
|
207
|
8월 13, 2026
|
|
Mistral, 추론 시점에 정책을 바꾸는 3B 규모의 멀티모달 안전성 분류 모델 Shieldstral 공개
|
|
0
|
147
|
8월 6, 2026
|
|
GRAM: 좋게도 나쁘게도 사용할 수 있는 이중용도(Dual-Use) 지식만 떼어내는 모듈형 사전학습 기반 접근 제어 기법에 대한 연구 (feat. Anthropic)
|
|
0
|
142
|
7월 29, 2026
|
|
Anhtropic의 에이전트형 비정렬(Agentic Misalignment)에 대한 최신 연구: 에이전트의 네 가지 정렬 실패 사례
|
|
0
|
193
|
7월 22, 2026
|
|
Value Axes: 모델과 언어에 따라 달라지는 Claude의 가치관에 대한 연구 (feat. Anthropic)
|
|
0
|
132
|
7월 21, 2026
|
|
LLM의 로봇 제어 능력은 무엇이 좌우하는가: Anthropic의 Embody 벤치마크 분석
|
|
0
|
232
|
7월 15, 2026
|
|
장시간의 실제 업무를 통해 컴퓨터 사용 에이전트(CUA)를 평가하는 OSWorld 벤치마크 2.0 공개
|
|
0
|
105
|
7월 1, 2026
|
|
Code World Model Preparedness Report: Meta 32B 코드 모델 사전 안전성 평가
|
|
0
|
115
|
6월 24, 2026
|
|
Anthropic, 역대 가장 강력한 모델 Claude Fable 5와 사이버 방어용 Mythos 5 공개
|
|
6
|
3814
|
6월 10, 2026
|
|
AgingBench: 배포된 AI 에이전트의 노화를 측정하는 종단 신뢰성 벤치마크에 대한 연구 (feat. UT Austin)
|
|
0
|
170
|
6월 1, 2026
|
|
Teaching Claude Why: 행동이 아닌 "이유"를 가르치는 정렬 학습 (feat. Anthropic)
|
|
0
|
302
|
5월 12, 2026
|
|
Anthropic이 제시하는, 신뢰할 수 있는 AI 에이전트 구축을 위한 실천 원칙: 에이전트의 4가지 구성 요소와 다층 방어 전략 (feat. Anthropic)
|
|
0
|
920
|
4월 13, 2026
|
|
LLM 내부의 감정 개념과 기능적 감정: Claude Sonnet 4.5의 감정 표상이 협박, 보상 해킹, 아부에 미치는 인과적 영향 (feat. Anthropic)
|
|
0
|
300
|
4월 13, 2026
|
|
생성형 AI의 구성 요소 (The Building Blocks of Generative AI)
|
|
0
|
1928
|
7월 29, 2023
|