|
OpenAI, 신규 모델 Astra의 예상치 못한 사이버 보안 위험성에 개발 속도를 늦추고 안전장치를 재정비 중
|
|
0
|
41
|
8월 19, 2026
|
|
AI 가치 정렬 논문 94편 중 79%는 가치를 정의하지 않는다: 정렬 연구의 암묵적 가치 이론 분석
|
|
0
|
119
|
8월 15, 2026
|
|
멀티에이전트 시스템의 실패 패턴: AI 에이전트 군집의 쏠림, 담합, 목표 충돌에 대한 Anthropic의 연구
|
|
0
|
221
|
8월 13, 2026
|
|
Anhtropic의 에이전트형 비정렬(Agentic Misalignment)에 대한 최신 연구: 에이전트의 네 가지 정렬 실패 사례
|
|
0
|
195
|
7월 22, 2026
|
|
Value Axes: 모델과 언어에 따라 달라지는 Claude의 가치관에 대한 연구 (feat. Anthropic)
|
|
0
|
132
|
7월 21, 2026
|
|
J-space: LLM 내부에 창발한 글로벌 워크스페이스와 이를 읽는 Jacobian Lens (feat. Anthropic)
|
|
0
|
630
|
7월 7, 2026
|
|
OpenAI, Codex의 Auto-review 모드 공개: 별도의 에이전트가 샌드박스 경계의 행동을 자동으로 심사 (feat. GPT-5.4 Thinking)
|
|
0
|
864
|
5월 12, 2026
|
|
Teaching Claude Why: 행동이 아닌 "이유"를 가르치는 정렬 학습 (feat. Anthropic)
|
|
0
|
304
|
5월 12, 2026
|
|
Anthropic, 오픈소스 정렬 평가 도구 Petri를 Meridian Labs에 기증하며 Petri 3.0 공개
|
|
0
|
209
|
5월 9, 2026
|
|
OpenAI, GPT-5.1부터 GPT-5.5까지 확산된 '고블린' 말투에 대한 분석 결과 공개
|
|
0
|
783
|
5월 4, 2026
|
|
Alignment Whack-a-Mole: LLM 파인튜닝이 정렬을 우회하여 저작권 도서의 그대로 기억을 활성화하는 메커니즘에 대한 연구
|
|
0
|
169
|
5월 3, 2026
|
|
LLM 내부의 감정 개념과 기능적 감정: Claude Sonnet 4.5의 감정 표상이 협박, 보상 해킹, 아부에 미치는 인과적 영향 (feat. Anthropic)
|
|
0
|
300
|
4월 13, 2026
|