본문으로 건너뛰기
buildradar
Sign in
토픽 · vision-language

vision-language

vision-language 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
18
총 스타
35,353
평균 스타
1,964
비중
0.00%

같은 리포지토리에 vision-language 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 vision-language 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • GroundingDINO@IDEA-Research

    [ECCV 2024] 논문 "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"의 공식 구현체입니다.

    10,536+19최근 7일 스타 변화
  • Chinese-CLIP@OFA-Sys

    중국어 교차 모달 검색 및 표현 생성을 달성하는 CLIP의 중국어 버전

    6,001+2최근 7일 스타 변화
  • OFA@OFA-Sys

    OFA (ICML 2022) 공식 저장소. 논문: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0최근 7일 스타 변화
  • Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.

    1,961+1최근 7일 스타 변화
  • AdvancedLiterateMachinery@AlibabaResearch

    고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.

    1,835+1최근 7일 스타 변화
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT는 비디오에 대한 의미 있는 대화를 생성할 수 있는 비디오 대화 모델입니다. LLM의 기능과 시공간 비디오 표현에 맞게 조정된 사전 훈련된 시각 인코더를 결합합니다. 또한 비디오 기반 대화 모델을 위한 엄격한 '정량적 평가 벤치마킹'을 소개합니다.

    1,507+1최근 7일 스타 변화
  • awesome-japanese-llm@llm-jp

    일본어 LLM 모음 - Overview of Japanese LLMs

    1,428+1최근 7일 스타 변화
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: 그래프 시각적 질의응답 기반 자율주행

    1,340+2최근 7일 스타 변화
  • ONE-PEACE@OFA-Sys

    비전, 오디오, 언어 모달리티를 아우르는 범용 표현 모델. 논문: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0최근 7일 스타 변화
  • TinyLLaVA_Factory@TinyLLaVA

    소규모 대형 멀티모달 모델 프레임워크

    1,004+1최근 7일 스타 변화
  • calvin@mees

    CALVIN - 장기 로봇 조작 작업을 위한 언어 조건부 정책 학습 벤치마크

    983+9최근 7일 스타 변화
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: 원하는 곳에 집중하는 CLIP 모델

    874+0최근 7일 스타 변화
  • Open-GroundingDino@longzw1997

    Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection 논문의 서드파티 구현체입니다.

    846+2최근 7일 스타 변화
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Phi-3 및 LLaMA-3로 LLaVA 확장 (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0최근 7일 스타 변화
  • daclip-uir@Algolzw

    [ICLR 2024] 범용 이미지 복원을 위한 비전-언어 모델 제어. NTIRE 2024 챌린지 5위 수상

    817+1최근 7일 스타 변화
  • SEED@AILab-CVC

    SEED-LLaMA (ICLR 2024) 공식 구현체

    641+0최근 7일 스타 변화
  • RemoteCLIP@ChenDelong1999

    원격 탐사를 위한 비전 언어 파운데이션 모델 RemoteCLIP 공식 저장소 (IEEE TGRS)

    591+3최근 7일 스타 변화
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    588최근 7일 스타 변화
← 토픽 목록으로