모델 구현해서 코랩 a100으로 학습돌리는중인데
확실히 dit 논문에서 다뤘전 쟁점처럼 sigma에 따른 loss 튐현상 발생이 눈에 띄내요. stable noise 예측보다 velocity 예측이다보니 덜튀긴하는데도 확실히 눈에 띕니다
파라미터도 550M 수준이라 이미지 100~200장 돌리면 이미지 그대로 나오는 과적합 나오고 500장부터 표준화를 못잡아서 구도가 안나와 오일페인팅 현상이 나오더군요
Layer 쪽도 text cross attn이 과도하게 죽는 현상이 여러번 발생해서 model 재설계 여러번 했네요;
데이터셋도 변경해서 지금은 480만 이미지 로 학습돌리고있는데 120만장에서 어느정도 눈코입 머리카락 몸 등 구도는 나오는게 보이고 있긴한데 확실히 어렵네요
연구용이지만 model 공유드려요~