vision-language
vision-language 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 vision-language 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 vision-language 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
[ECCV 2024] 논문 "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"의 공식 구현체입니다.
★ 10,536+19최근 7일 스타 변화 - #2
중국어 교차 모달 검색 및 표현 생성을 달성하는 CLIP의 중국어 버전
★ 6,001+2최근 7일 스타 변화 - #3
OFA (ICML 2022) 공식 저장소. 논문: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2,557+0최근 7일 스타 변화 - #4
Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.
★ 1,961+1최근 7일 스타 변화 - #5
고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.
★ 1,835+1최근 7일 스타 변화 - #6
[ACL 2024 🔥] Video-ChatGPT는 비디오에 대한 의미 있는 대화를 생성할 수 있는 비디오 대화 모델입니다. LLM의 기능과 시공간 비디오 표현에 맞게 조정된 사전 훈련된 시각 인코더를 결합합니다. 또한 비디오 기반 대화 모델을 위한 엄격한 '정량적 평가 벤치마킹'을 소개합니다.
★ 1,507+1최근 7일 스타 변화 - #7
일본어 LLM 모음 - Overview of Japanese LLMs
★ 1,428+1최근 7일 스타 변화 - #8★ 1,340+2최근 7일 스타 변화
- #9
비전, 오디오, 언어 모달리티를 아우르는 범용 표현 모델. 논문: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0최근 7일 스타 변화 - #10
소규모 대형 멀티모달 모델 프레임워크
★ 1,004+1최근 7일 스타 변화 - #11★ 983+9최근 7일 스타 변화
- #12★ 874+0최근 7일 스타 변화
- #13
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection 논문의 서드파티 구현체입니다.
★ 846+2최근 7일 스타 변화 - #14★ 842+0최근 7일 스타 변화
- #15
[ICLR 2024] 범용 이미지 복원을 위한 비전-언어 모델 제어. NTIRE 2024 챌린지 5위 수상
★ 817+1최근 7일 스타 변화 - #16★ 641+0최근 7일 스타 변화
- #17
원격 탐사를 위한 비전 언어 파운데이션 모델 RemoteCLIP 공식 저장소 (IEEE TGRS)
★ 591+3최근 7일 스타 변화 - #18★ 588—최근 7일 스타 변화