multimodal
multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #91
텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)
★ 1,136+18최근 7일 스타 변화 - #92
앱을 위한 셀프 코딩 시스템 — Cordova용 Alan AI SDK
★ 1,132+0최근 7일 스타 변화 - #93
SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.
★ 1,118+143최근 7일 스타 변화 - #94★ 1,110+5최근 7일 스타 변화
- #95
텍스트 전용 DeepSeek Harness agent를 위한 비전 기능: 내장 무료 비전 체인(키 불필요) + 픽셀 수준 비전 도구(Q&A, 그라운딩, 자르기, 픽셀 차이, 색상, OCR, SVG 추적, 누끼, 스크린샷). 명령어 하나로 설치, Python 불필요, 이미지 작업이 일반적인 도구 호출 작업처럼 작동합니다.
★ 1,089+64최근 7일 스타 변화 - #96★ 1,088+1최근 7일 스타 변화
- #97★ 1,084+2최근 7일 스타 변화
- #98
[ICLR'24 스포트라이트] 중영 양국어 멀티모달 대형 모델 시리즈(채팅 및 페인트) | CPM 기반 모델 기반 중영 양국어 멀티모달 대형 모델 시리즈
★ 1,061-1최근 7일 스타 변화 - #99
비전, 오디오, 언어 모달리티를 아우르는 범용 표현 모델. 논문: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0최근 7일 스타 변화 - #100
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: 대규모 언어 모델이 포인트 클라우드를 이해하도록 역량 강화
★ 1,054+2최근 7일 스타 변화 - #101
"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval" 공식 구현체
★ 1,032+1최근 7일 스타 변화 - #102
멀티모달 사고의 연쇄(Multimodal Chain-of-Thought) 추론: 종합 조사
★ 1,025+2최근 7일 스타 변화 - #103★ 1,017+38최근 7일 스타 변화
- #104
벡터 검색 및 LLM을 활용한 멀티모달 AI, RAG, 에이전트 리소스, 예제 및 튜토리얼
★ 973-1최근 7일 스타 변화 - #105★ 968+64최근 7일 스타 변화
- #106★ 902+4최근 7일 스타 변화
- #107
CVPR 2025의 가장 흥미롭고 영향력 있는 논문들을 엄선하여 모아둔 저장소입니다. 🔥 [논문 + 코드 + 데모]
★ 895+1최근 7일 스타 변화 - #108★ 889+0최근 7일 스타 변화
- #109★ 881-1최근 7일 스타 변화
- #110
⚡ FastAPI, Playwright 및 OpenAI 호환 멀티모달 모델로 구축된 자체 호스팅 가능한 YesCaptcha 호환 캡차 솔버.
★ 869+4최근 7일 스타 변화 - #111
단순하고 통합된 멀티모달 모델 학습 엔진. 슬림하고 유연하며 대규모 커스텀 및 확장을 위해 구축되었습니다.
★ 825+0최근 7일 스타 변화 - #112
[TMLR 2025🔥] 비전 분야의 자기회귀 모델(autoregressive models)에 대한 서베이.
★ 808+1최근 7일 스타 변화 - #113★ 803+0최근 7일 스타 변화
- #114
PyTorch를 이용한 대조 학습(Contrastive Learning) 모델 훈련
★ 802+0최근 7일 스타 변화 - #115
로컬 모니터링 + AI 비전 — 데이터 수집 및 분석을 위한 구조화된 이벤트 출력을 지원하는 LAN 기반 스마트폰 구동 AI 모니터링 프레임워크
★ 770+10최근 7일 스타 변화 - #116
멀티모달 및 대형 언어 모델 관련 논문 목록, 개인적인 필요에 따라 일일 arxiv에서 읽은 논문을 기록하는 용도로만 사용됩니다.
★ 761+1최근 7일 스타 변화 - #117
[ECCV 2024] InstructIR: 인간의 지시를 따르는 고품질 이미지 복원 기술입니다.
★ 741+0최근 7일 스타 변화 - #118
Paddle 멀티모달 통합 및 탐색 도구. 엔드투엔드 대규모 멀티모달 사전 학습 모델 및 디퓨전 모델 툴박스를 포함한 주요 멀티모달 작업을 지원하며, 높은 성능과 유연성을 제공합니다.
★ 723-1최근 7일 스타 변화 - #119★ 689+1최근 7일 스타 변화
- #120
VLM2Vec / MMEB (ICLR 2025), VLM2Vec-V2 / MMEB-V2 (TMLR 2026), MMEB-V3 (COLM 2026) 관련 코드를 포함하는 저장소입니다.
★ 682+2최근 7일 스타 변화