이전에 올린 DiT 관련 파이프라인 공유드립니다.
img 계열 쪽은 UNet에서 DiT로 넘어가면서 요즘 워낙 좋은 모델들이 계속 나오다 보니, 사실 큰 의미는 없을 수도 있지만 혹시 pretraining이나 모델 구조 같은 게 궁금하신 분들은 참고하세요.
제가 알기로는 최근 Vision-Language-Action 쪽도 DiT 계열로 넘어가서, dataset을 img(vision)를 src로 action을 tgt로 삼아 velocity를 예측하는 방식(즉 sigma에 따른 velocity를 예측해서 action을 복원)으로 접근하는 경우가 있는 걸로 알고 있습니다. 다만 이쪽은 아직 분야가 완전히 정립된 건 아니라 확실친 않네요.