multimodal-large-language-models
multimodal-large-language-models 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 multimodal-large-language-models 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 multimodal-large-language-models 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
:sparkles::sparkles: 멀티모달 대규모 언어 모델의 최신 발전 동향
★ 17,996+2최근 7일 스타 변화 - #2
Mobile-Agent: 강력한 GUI 에이전트 패밀리
★ 9,157+9최근 7일 스타 변화 - #3
StarVector는 벡터화를 코드 생성 작업으로 변환하는 SVG 생성 기초 모델입니다. 비전-언어 모델링 아키텍처를 사용하여 시각 및 텍스트 입력을 모두 처리하고 놀라운 정밀도로 고품질 SVG 코드를 생성합니다.
★ 4,567+6최근 7일 스타 변화 - #4
LLaMA-Omni는 Llama-3.1-8B-Instruct 기반의 저지연 고품질 엔드투엔드 음성 상호작용 모델로, GPT-4o 수준의 음성 기능 구현을 목표로 합니다.
★ 3,147+1최근 7일 스타 변화 - #5★ 2,933+0최근 7일 스타 변화
- #6★ 2,532-1최근 7일 스타 변화
- #7
mPLUG-DocOwl: 문서 이해를 위한 모듈식 멀티모달 대형 언어 모델
★ 2,411+0최근 7일 스타 변화 - #8★ 2,014+1최근 7일 스타 변화
- #9
[ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs (RPG)
★ 1,844+0최근 7일 스타 변화 - #10
Seed1.5-VL은 범용 멀티모달 이해 및 추론 능력을 향상시키기 위해 설계된 비전-언어 파운데이션 모델로, 60개의 공개 벤치마크 중 38개에서 최고 수준(SOTA)의 성능을 달성했습니다.
★ 1,586+0최근 7일 스타 변화 - #11★ 1,514+2최근 7일 스타 변화
- #12
멋진 통합 멀티모달 모델 모음
★ 1,314+1최근 7일 스타 변화 - #13★ 1,303-1최근 7일 스타 변화
- #14
Audio Flamingo의 PyTorch 구현: 고급 오디오 이해 언어 모델 시리즈
★ 1,184+2최근 7일 스타 변화 - #15★ 1,058+2최근 7일 스타 변화
- #16★ 1,053+0최근 7일 스타 변화
- #17
멀티모달 사고의 연쇄(Multimodal Chain-of-Thought) 추론: 종합 조사
★ 1,025+2최근 7일 스타 변화 - #18
의료 영상 분야의 멀티모달 학습 응용 사례 모음
★ 975+1최근 7일 스타 변화 - #19★ 889+1최근 7일 스타 변화
- #20★ 791+2최근 7일 스타 변화
- #21
LLaVA-Plus: 플러그인을 통해 기술을 학습하고 사용하는 대규모 언어 및 비전 어시스턴트
★ 770+0최근 7일 스타 변화 - #22★ 706+0최근 7일 스타 변화
- #23★ 702+0최근 7일 스타 변화
- #24
개인 프로젝트: MPP-Qwen14B 및 MPP-Qwen-Next(Qwen-LM 기반 다중 모달 파이프라인 병렬 처리). 비디오/이미지/다중 이미지 SFT 및 대화를 지원하며, RTX3090/4090 24GB 환경에서 8B/14B LLaVA 스타일 MLLM을 학습할 수 있습니다.
★ 687+1최근 7일 스타 변화 - #25★ 678+1최근 7일 스타 변화
- #26
Woodpecker: 멀티모달 대규모 언어 모델을 위한 환각 현상 교정 도구
★ 650+1최근 7일 스타 변화 - #27★ 640+0최근 7일 스타 변화
- #28
LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.
★ 577+0최근 7일 스타 변화 - #29★ 577+1최근 7일 스타 변화
- #30
Cambrian-S: 비디오 내 공간 초감각(Spatial Supersensing)을 향하여
★ 567-1최근 7일 스타 변화