Diffusion transformer 생각보다 어렵네요.

모델 구현해서 코랩 a100으로 학습돌리는중인데

확실히 dit 논문에서 다뤘전 쟁점처럼 sigma에 따른 loss 튐현상 발생이 눈에 띄내요. stable noise 예측보다 velocity 예측이다보니 덜튀긴하는데도 확실히 눈에 띕니다

파라미터도 550M 수준이라 이미지 100~200장 돌리면 이미지 그대로 나오는 과적합 나오고 500장부터 표준화를 못잡아서 구도가 안나와 오일페인팅 현상이 나오더군요

Layer 쪽도 text cross attn이 과도하게 죽는 현상이 여러번 발생해서 model 재설계 여러번 했네요;

데이터셋도 변경해서 지금은 480만 이미지 로 학습돌리고있는데 120만장에서 어느정도 눈코입 머리카락 몸 등 구도는 나오는게 보이고 있긴한데 확실히 어렵네요

연구용이지만 model 공유드려요~

3개의 좋아요

우와, 대단하십니다. :+1:

저는 주로 LLM/VLM으로 외부 상황을 인식/이해하는 것들을 주로 하다보니 생성 분야는 문외한에 가까운데, 그래도 12k -> 600k -> 1.2M -> 1.8M 으로 가면서 점차 구체화(?)되어가는걸보니 신기하고 그렇네요. +_+

모쪼록 성공적인 학습 및 실험 기원합니다! :folded_hands: