본문으로 건너뛰기
buildradar
Sign in
토픽 · vision-language-model

vision-language-model

vision-language-model 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 59개
  • prismer@NVlabs

    "Prismer: A Vision-Language Model with Multi-Task Experts"의 구현체입니다.

    1,309+0최근 7일 스타 변화
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    민주화된 멀티모달 학습을 위한 완전 오픈 프레임워크

    1,195+1최근 7일 스타 변화
  • vlms-zero-to-hero@SkalskiP

    이 시리즈는 NLP와 컴퓨터 비전의 기초부터 최신 비전 언어 모델(VLM)까지의 여정으로 여러분을 안내합니다.

    1,179+0최근 7일 스타 변화
  • doc7@magicrew

    시각적 이해를 통해 문서를 AI 학습용 Markdown으로 변환

    1,153-25최근 7일 스타 변화
  • 텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)

    1,136+18최근 7일 스타 변화
  • VisRAG@OpenBMB

    VLM을 활용한 파싱 없는 RAG

    979-1최근 7일 스타 변화
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] 객체 세분화 마스크와 매끄럽게 통합된 자연어 응답을 생성할 수 있는 최초의 모델인 GLaMM(Grounding Large Multimodal Model)

    967+0최근 7일 스타 변화
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: 통합 시각 표현을 통해 대규모 언어 모델에 이미지 및 비디오 이해 능력 부여

    941+0최근 7일 스타 변화
  • CVPR 2025의 가장 흥미롭고 영향력 있는 논문들을 엄선하여 모아둔 저장소입니다. 🔥 [논문 + 코드 + 데모]

    895+1최근 7일 스타 변화
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: 원하는 곳에 집중하는 CLIP 모델

    874+0최근 7일 스타 변화
  • dsh-vision-toolkit@Anionex

    [dsh] 순수 텍스트 모델을 위한 강력한 비주얼 툴박스: 무료 설치 및 사용, 이미지 붙여넣기로 즉시 인식, 다중 이미지 Q&A, 스크린샷에서 프론트엔드 UI 복원 등 | 에이전트 비전 툴킷을 위한 DeepSeek Harness 네이티브 통합: 이미지 Q&A, 롱 스크린샷 OCR, UI 복원, 그라운딩, 픽셀 차이, 아티팩트 및 웹 UI

    856+17최근 7일 스타 변화
  • VoxPoser@huangwl18

    VoxPoser: 언어 모델을 이용한 로봇 조작용 조합형 3D 밸류 맵

    834+1최근 7일 스타 변화
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: 컴퓨터 사용 에이전트를 위한 오픈 파운데이션입니다.

    833+4최근 7일 스타 변화
  • MINT-1T@mlfoundations

    🍃 MINT-1T: 1조 개의 토큰으로 구성된 멀티모달 인터리브 데이터셋

    832+0최근 7일 스타 변화
  • LLM/VLM 등 거대 모델 시대의 로보틱스 분야와 관련된 3D Vision 논문 큐레이션 목록 (awesome-computer-vision에서 영감을 받았으며 논문, 코드, 관련 웹사이트 포함)

    821+2최근 7일 스타 변화
  • CLIP과 같은 비전-언어 모델을 위한 프롬프트 및 어댑터 학습 방법 모음

    797+1최근 7일 스타 변화
  • X-VLA@2toinf

    [ICLR 2026] Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model 공식 구현

    726+5최근 7일 스타 변화
  • OmniVinci@NVlabs

    OmniVinci는 시각, 오디오, 언어를 공동으로 이해하기 위한 범용 모달 LLM입니다.

    678+0최근 7일 스타 변화
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    641+0최근 7일 스타 변화
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606최근 7일 스타 변화
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: 사전 학습된 모델 기반의 지속적 학습 툴박스

    601+3최근 7일 스타 변화
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: 공간 주석이 포함된 대규모 비디오 데이터셋

    600+1최근 7일 스타 변화
  • t2v_metrics@linzhiqiu

    VQAScore를 사용하여 텍스트-이미지/비디오/3D 모델을 평가합니다.

    600+0최근 7일 스타 변화
  • Groma@FoundationVision

    [ECCV2024] 로컬라이즈된 시각적 토큰화를 갖춘 접지형 멀티모달 대규모 언어 모델

    586+0최근 7일 스타 변화
  • LLaVA-Mini@ictnlp

    LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.

    577+0최근 7일 스타 변화
  • cambrian-s@cambrian-mllm

    Cambrian-S: 비디오 내 공간 초감각(Spatial Supersensing)을 향하여

    567-1최근 7일 스타 변화
  • Multi-Modality-Arena@OpenGVLab

    챗봇 아레나가 멀티모달을 만나다! Multi-Modality Arena는 이미지를 입력으로 사용하여 비전-언어 모델을 나란히 비교하고 벤치마킹할 수 있게 해줍니다. MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 등 다양한 모델을 지원합니다!

    566+0최근 7일 스타 변화
  • Flame-Code-VLM@Flame-Code-VLM

    Flame은 UI 디자인 목업을 고품질 React 코드로 변환하도록 설계된 오픈소스 멀티모달 AI 시스템. 비전-언어 모델링, 자동화된 데이터 합성 및 구조화된 학습 워크플로우를 활용하여 디자인과 프론트엔드 개발 간의 격차를 해소

    562+0최근 7일 스타 변화
  • count-anything@Mengqi-Lei

    Counting Anything 논문을 위한 코드 및 구현 가이드라인. 프로젝트 페이지: https://mengqi-lei.github.io/count-anything-projectpage/

    539+2최근 7일 스타 변화
← 토픽 목록으로