interpretability
| 글 | 댓글 | 조회수 | 활동 | |
|---|---|---|---|---|
| 스코어 스무딩(Score Smoothing): 확산 모델의 창의성이 어디서 오는지에 대한 Google Research의 연구 |
|
0 | 129 | 7월 27, 2026 |
| Jacobian Lens: 언어 모델 내부 표현을 어휘 토큰으로 읽어내는 해석 도구 |
|
0 | 184 | 7월 22, 2026 |
| vLLM Hook: vLLM에 배포된 모델의 내부 상태를 관찰하고 제어하는 플러그인 |
|
1 | 1305 | 7월 9, 2026 |
| J-space: LLM 내부에 창발한 글로벌 워크스페이스와 이를 읽는 Jacobian Lens (feat. Anthropic) |
|
0 | 579 | 7월 7, 2026 |
| Qwen-Scope: Sparse Autoencoder로 LLM 내부를 해석하고 제어하는 Qwen 팀의 오픈소스 도구 |
|
0 | 424 | 5월 5, 2026 |
| LLM 내부의 감정 개념과 기능적 감정: Claude Sonnet 4.5의 감정 표상이 협박, 보상 해킹, 아부에 미치는 인과적 영향 (feat. Anthropic) |
|
0 | 292 | 4월 13, 2026 |