|
Path to Astra, OpenAI의 Critical 사이버보안 임계선을 넘은 첫 모델 Astra에 대한 발표
|
|
0
|
237
|
9월 3, 2026
|
|
Anthropic, Claude Fable 5.1과 Mythos 5.1 출시: 과학 벤치마크 2배와 캐시 읽기 75% 인하
|
|
0
|
290
|
9월 2, 2026
|
|
멀티에이전트 시스템의 실패 패턴: AI 에이전트 군집의 쏠림, 담합, 목표 충돌에 대한 Anthropic의 연구
|
|
0
|
324
|
8월 13, 2026
|
|
Mistral, 추론 시점에 정책을 바꾸는 3B 규모의 멀티모달 안전성 분류 모델 Shieldstral 공개
|
|
0
|
160
|
8월 6, 2026
|
|
GRAM: 좋게도 나쁘게도 사용할 수 있는 이중용도(Dual-Use) 지식만 떼어내는 모듈형 사전학습 기반 접근 제어 기법에 대한 연구 (feat. Anthropic)
|
|
0
|
155
|
7월 29, 2026
|
|
Anhtropic의 에이전트형 비정렬(Agentic Misalignment)에 대한 최신 연구: 에이전트의 네 가지 정렬 실패 사례
|
|
0
|
235
|
7월 22, 2026
|
|
Value Axes: 모델과 언어에 따라 달라지는 Claude의 가치관에 대한 연구 (feat. Anthropic)
|
|
0
|
148
|
7월 21, 2026
|
|
LLM의 로봇 제어 능력은 무엇이 좌우하는가: Anthropic의 Embody 벤치마크 분석
|
|
0
|
255
|
7월 15, 2026
|
|
장시간의 실제 업무를 통해 컴퓨터 사용 에이전트(CUA)를 평가하는 OSWorld 벤치마크 2.0 공개
|
|
0
|
121
|
7월 1, 2026
|
|
Code World Model Preparedness Report: Meta 32B 코드 모델 사전 안전성 평가
|
|
0
|
131
|
6월 24, 2026
|
|
Anthropic, 역대 가장 강력한 모델 Claude Fable 5와 사이버 방어용 Mythos 5 공개
|
|
6
|
3912
|
6월 10, 2026
|
|
AgingBench: 배포된 AI 에이전트의 노화를 측정하는 종단 신뢰성 벤치마크에 대한 연구 (feat. UT Austin)
|
|
0
|
172
|
6월 1, 2026
|
|
Teaching Claude Why: 행동이 아닌 "이유"를 가르치는 정렬 학습 (feat. Anthropic)
|
|
0
|
312
|
5월 12, 2026
|
|
Anthropic이 제시하는, 신뢰할 수 있는 AI 에이전트 구축을 위한 실천 원칙: 에이전트의 4가지 구성 요소와 다층 방어 전략 (feat. Anthropic)
|
|
0
|
938
|
4월 13, 2026
|
|
LLM 내부의 감정 개념과 기능적 감정: Claude Sonnet 4.5의 감정 표상이 협박, 보상 해킹, 아부에 미치는 인과적 영향 (feat. Anthropic)
|
|
0
|
315
|
4월 13, 2026
|
|
생성형 AI의 구성 요소 (The Building Blocks of Generative AI)
|
|
0
|
1937
|
7월 29, 2023
|