|
UEmbed: 디코더 전용 모델에서 희소 검색과 밀집 검색을 통합한 멀티모달 임베딩 연구
|
|
0
|
55
|
8월 14, 2026
|
|
JoyAI-Video-Edit: 자연어 지시로 실시간 영상 스트림을 편집하는 자기회귀 디퓨전 모델
|
|
0
|
147
|
8월 10, 2026
|
|
SeedRealtime: ByteDance Seed의 보면서 듣고 말하는 전이중(Full-Duplex) 모델
|
|
0
|
174
|
8월 8, 2026
|
|
Mistral, 추론 시점에 정책을 바꾸는 3B 규모의 멀티모달 안전성 분류 모델 Shieldstral 공개
|
|
0
|
144
|
8월 6, 2026
|
|
Thinking Machines Lab, 4분의 1 크기로 Inkling에 필적하는 Inkling-Small 공개
|
|
0
|
205
|
8월 5, 2026
|
|
MiniMax, 영상과 음향을 함께 만드는 33B 옴니모달 모델 H3 웨이트 공개 (단, 한국 사용 금지🫠)
|
|
1
|
1617
|
8월 4, 2026
|
|
SimpleMem: LLM 에이전트의 장기 기억을 압축해 토큰을 최대 30배 줄이는 메모리 프레임워크
|
|
0
|
348
|
8월 3, 2026
|
|
GOT-OCR2.0: 문서와 수식, 표, 악보를 하나의 모델로 인식하는 End-to-End OCR 모델
|
|
0
|
294
|
7월 26, 2026
|
|
Vidu S1: Shengshu가 공개한 음성으로 실시간 제어하는 무한 길이 대화형 영상 생성 모델 (및 이에 대한 연구)
|
|
0
|
159
|
7월 21, 2026
|
|
Inkling: Thinking Machines Lab가 처음으로 공개하는 975B 멀티모달 MoE 모델
|
|
0
|
151
|
7월 17, 2026
|
|
Google, 피부 질환 이해를 돕는 AI 도구 연구 공개 (feat. JAMA Dermatology)
|
|
0
|
193
|
6월 19, 2026
|
|
Dnotitia, 검열을 제거하고 한국어를 강화한 Qwen 3.5/3.6 기반 오픈 LLM 패밀리 DNA 3.0 공개
|
|
0
|
748
|
6월 5, 2026
|
|
Google, 인코더 없이 노트북에서 실행하는 통합 멀티모달 모델 Gemma 4 12B 공개
|
|
0
|
4810
|
6월 4, 2026
|
|
Cohere Command A+: 엔터프라이즈 에이전트 워크로드를 위한 오픈 MoE 모델
|
|
0
|
446
|
5월 21, 2026
|
|
Google DeepMind, 자연어 대화로 영상을 편집하고 생성하는 모델 Gemini Omni 출시
|
|
0
|
621
|
5월 21, 2026
|
|
Jina AI, 텍스트와 이미지, 오디오, 비디오를 하나의 임베딩 공간에 담는 jina-embeddings-v5-omni 공개
|
|
0
|
311
|
5월 13, 2026
|
|
RAG-Anything: 텍스트, 이미지, 표, 수식을 아우르는 멀티모달 올인원 RAG 프레임워크 (feat. HKUDS)
|
|
0
|
6021
|
5월 5, 2026
|
|
LLaDA2.0-Uni: 마스크 토큰 예측 패러다임으로 멀티모달 이해와 생성을 통합한 확산 언어 모델에 대한 연구
|
|
0
|
204
|
4월 27, 2026
|
|
Gemma Multimodal Fine-Tuner: Apple Silicon Mac에서 PyTorch와 MPS로 Gemma 4 멀티모달 모델을 파인튜닝하는 오픈소스 도구
|
|
0
|
539
|
4월 10, 2026
|
|
BidirLM, 기존의 LLM을 오픈소스 옴니모달 양방향 인코더(Omni-modal Bidirectional Encoder)로 변환하는 레시피와 모델 공개
|
|
0
|
207
|
4월 9, 2026
|
|
AMD Developer Cloud 사용 후기(LLM finetune Multi-task Agent)
|
|
0
|
283
|
10월 23, 2025
|
|
Qwen3-VL: Alibaba Qwen팀이 공개한 더 선명한 시각, 더 깊은 생각, 더 넓은 행동이 가능한 Multimodal LLM
|
|
0
|
3977
|
9월 30, 2025
|
|
[K-AI 밋업 D-17] LG AI연구원, Upstage, SK텔레콤, NC AI와 함께하는 K-AI FriendliAI 서울 밋업 - 10/16(목) 18시
|
|
0
|
134
|
9월 29, 2025
|
|
Llama-Scan: ollama의 멀티모달 모델을 활용하여 로컬에서 PDF를 텍스트로 변환하는 도구
|
|
0
|
1089
|
8월 19, 2025
|
|
FastVLM: 고해상도에서도 빠르고 정확하게 동작하는 시각-언어 모델(VLM) 구현에 대한 연구 (feat. Apple)
|
|
0
|
2000
|
7월 27, 2025
|
|
[2025/06/23 ~ 29] 이번 주에 살펴볼 만한 AI/ML 논문 모음
|
|
0
|
715
|
6월 30, 2025
|
|
퀄컴AI혁신프로그램 (신청기한: 2025/4/16 오후 3:59)
|
|
0
|
202
|
2월 13, 2025
|
|
muGen, 멀티모달/멀티채널 AI 서비스 구축 및 배포를 위한 프레임워크
|
|
0
|
268
|
11월 14, 2024
|
|
[서울대학교병원] Multimodal AI4TB Challenge 2024 글로벌 개최 안내 (참가신청 ~11/18)
|
|
0
|
149
|
11월 8, 2024
|
|
Whiteboard-of-Thought(WoT), Multimodal LLM을 위한 시각적 CoT(Chain-of-Thought)에 대한 연구
|
|
0
|
295
|
10월 25, 2024
|