vision-language-model
vision-language-model 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31★ 1,309+0최근 7일 스타 변화
- #32
민주화된 멀티모달 학습을 위한 완전 오픈 프레임워크
★ 1,195+1최근 7일 스타 변화 - #33
이 시리즈는 NLP와 컴퓨터 비전의 기초부터 최신 비전 언어 모델(VLM)까지의 여정으로 여러분을 안내합니다.
★ 1,179+0최근 7일 스타 변화 - #34★ 1,153-25최근 7일 스타 변화
- #35
텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)
★ 1,136+18최근 7일 스타 변화 - #36★ 979-1최근 7일 스타 변화
- #37
[CVPR 2024 🔥] 객체 세분화 마스크와 매끄럽게 통합된 자연어 응답을 생성할 수 있는 최초의 모델인 GLaMM(Grounding Large Multimodal Model)
★ 967+0최근 7일 스타 변화 - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: 통합 시각 표현을 통해 대규모 언어 모델에 이미지 및 비디오 이해 능력 부여
★ 941+0최근 7일 스타 변화 - #39
CVPR 2025의 가장 흥미롭고 영향력 있는 논문들을 엄선하여 모아둔 저장소입니다. 🔥 [논문 + 코드 + 데모]
★ 895+1최근 7일 스타 변화 - #40★ 874+0최근 7일 스타 변화
- #41
[dsh] 순수 텍스트 모델을 위한 강력한 비주얼 툴박스: 무료 설치 및 사용, 이미지 붙여넣기로 즉시 인식, 다중 이미지 Q&A, 스크린샷에서 프론트엔드 UI 복원 등 | 에이전트 비전 툴킷을 위한 DeepSeek Harness 네이티브 통합: 이미지 Q&A, 롱 스크린샷 OCR, UI 복원, 그라운딩, 픽셀 차이, 아티팩트 및 웹 UI
★ 856+17최근 7일 스타 변화 - #42★ 834+1최근 7일 스타 변화
- #43★ 833+4최근 7일 스타 변화
- #44★ 832+0최근 7일 스타 변화
- #45
LLM/VLM 등 거대 모델 시대의 로보틱스 분야와 관련된 3D Vision 논문 큐레이션 목록 (awesome-computer-vision에서 영감을 받았으며 논문, 코드, 관련 웹사이트 포함)
★ 821+2최근 7일 스타 변화 - #46
CLIP과 같은 비전-언어 모델을 위한 프롬프트 및 어댑터 학습 방법 모음
★ 797+1최근 7일 스타 변화 - #47
[ICLR 2026] Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model 공식 구현
★ 726+5최근 7일 스타 변화 - #48★ 678+0최근 7일 스타 변화
- #49★ 641+0최근 7일 스타 변화
- #50★ 606—최근 7일 스타 변화
- #51
🎉 PILOT: 사전 학습된 모델 기반의 지속적 학습 툴박스
★ 601+3최근 7일 스타 변화 - #52
[CVPR 2026] SpatialVID: 공간 주석이 포함된 대규모 비디오 데이터셋
★ 600+1최근 7일 스타 변화 - #53
VQAScore를 사용하여 텍스트-이미지/비디오/3D 모델을 평가합니다.
★ 600+0최근 7일 스타 변화 - #54★ 586+0최근 7일 스타 변화
- #55
LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.
★ 577+0최근 7일 스타 변화 - #56
Cambrian-S: 비디오 내 공간 초감각(Spatial Supersensing)을 향하여
★ 567-1최근 7일 스타 변화 - #57
챗봇 아레나가 멀티모달을 만나다! Multi-Modality Arena는 이미지를 입력으로 사용하여 비전-언어 모델을 나란히 비교하고 벤치마킹할 수 있게 해줍니다. MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 등 다양한 모델을 지원합니다!
★ 566+0최근 7일 스타 변화 - #58
Flame은 UI 디자인 목업을 고품질 React 코드로 변환하도록 설계된 오픈소스 멀티모달 AI 시스템. 비전-언어 모델링, 자동화된 데이터 합성 및 구조화된 학습 워크플로우를 활용하여 디자인과 프론트엔드 개발 간의 격차를 해소
★ 562+0최근 7일 스타 변화 - #59
Counting Anything 논문을 위한 코드 및 구현 가이드라인. 프로젝트 페이지: https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2최근 7일 스타 변화