본문으로 건너뛰기
buildradar
Sign in
토픽 · multimodal-large-language-models

multimodal-large-language-models

multimodal-large-language-models 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
32
총 스타
66,902
평균 스타
2,091
비중
0.00%

같은 리포지토리에 multimodal-large-language-models 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 multimodal-large-language-models 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • :sparkles::sparkles: 멀티모달 대규모 언어 모델의 최신 발전 동향

    17,996+2최근 7일 스타 변화
  • MobileAgent@X-PLUG

    Mobile-Agent: 강력한 GUI 에이전트 패밀리

    9,157+9최근 7일 스타 변화
  • star-vector@joanrod

    StarVector는 벡터화를 코드 생성 작업으로 변환하는 SVG 생성 기초 모델입니다. 비전-언어 모델링 아키텍처를 사용하여 시각 및 텍스트 입력을 모두 처리하고 놀라운 정밀도로 고품질 SVG 코드를 생성합니다.

    4,567+6최근 7일 스타 변화
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni는 Llama-3.1-8B-Instruct 기반의 저지연 고품질 엔드투엔드 음성 상호작용 모델로, GPT-4o 수준의 음성 기능 구현을 목표로 합니다.

    3,147+1최근 7일 스타 변화
  • VideoPipe@sherlockchou86

    CV 모델 및 mLLM 기반의 크로스 플랫폼 비디오 구조화(비디오 분석) 프레임워크

    2,933+0최근 7일 스타 변화
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: GPT-4o 수준의 실시간 비전 및 음성 상호작용 지향

    2,532-1최근 7일 스타 변화
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 문서 이해를 위한 모듈식 멀티모달 대형 언어 모델

    2,411+0최근 7일 스타 변화
  • cambrian@cambrian-mllm

    Cambrian-1은 비전 중심 설계가 적용된 멀티모달 LLM 패밀리입니다.

    2,014+1최근 7일 스타 변화
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs (RPG)

    1,844+0최근 7일 스타 변화
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL은 범용 멀티모달 이해 및 추론 능력을 향상시키기 위해 설계된 비전-언어 파운데이션 모델로, 60개의 공개 벤치마크 중 38개에서 최고 수준(SOTA)의 성능을 달성했습니다.

    1,586+0최근 7일 스타 변화
  • Ovis@ATH-MaaS

    시각 및 텍스트 임베딩을 구조적으로 정렬하도록 설계된 새로운 멀티모달 대형 언어 모델(MLLM) 아키텍처입니다.

    1,514+2최근 7일 스타 변화
  • 멋진 통합 멀티모달 모델 모음

    1,314+1최근 7일 스타 변화
  • VideoChat@Henry-23

    외형과 음성을 맞춤 설정할 수 있고 음성 복제를 지원하며 대화 지연 시간이 3초에 불과한 실시간 음성 대화형 디지털 휴먼.

    1,303-1최근 7일 스타 변화
  • Audio Flamingo의 PyTorch 구현: 고급 오디오 이해 언어 모델 시리즈

    1,184+2최근 7일 스타 변화
  • SLAM-LLM@X-LANCE

    대형 언어 모델을 활용한 음성, 언어, 오디오, 음악 처리 프레임워크

    1,058+2최근 7일 스타 변화
  • Bunny@BAAI-DCAI

    경량 멀티모달 모델 패밀리.

    1,053+0최근 7일 스타 변화
  • Awesome-MCoT@yaotingwangofficial

    멀티모달 사고의 연쇄(Multimodal Chain-of-Thought) 추론: 종합 조사

    1,025+2최근 7일 스타 변화
  • 의료 영상 분야의 멀티모달 학습 응용 사례 모음

    975+1최근 7일 스타 변화
  • NEO@EvolvingLMMs-Lab

    NEO 시리즈: 기본 원칙부터 설계된 네이티브 비전-언어 모델입니다.

    889+1최근 7일 스타 변화
  • Video-MME@MME-Benchmarks

    [CVPR 2025] Video-MME: 비디오 분석 분야 멀티모달 LLM을 위한 최초의 종합 평가 벤치마크

    791+2최근 7일 스타 변화
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: 플러그인을 통해 기술을 학습하고 사용하는 대규모 언어 및 비전 어시스턴트

    770+0최근 7일 스타 변화
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: 롱 비디오 이해를 위한 촘촘한 토큰에서 희소 메모리로의 전환

    706+0최근 7일 스타 변화
  • unicom@deepglint

    대규모 시각 표현 모델

    702+0최근 7일 스타 변화
  • MPP-LLaVA@Coobiw

    개인 프로젝트: MPP-Qwen14B 및 MPP-Qwen-Next(Qwen-LM 기반 다중 모달 파이프라인 병렬 처리). 비디오/이미지/다중 이미지 SFT 및 대화를 지원하며, RTX3090/4090 24GB 환경에서 8B/14B LLaVA 스타일 MLLM을 학습할 수 있습니다.

    687+1최근 7일 스타 변화
  • OmniVinci@NVlabs

    OmniVinci는 시각, 오디오, 언어를 공동으로 이해하기 위한 범용 모달 LLM입니다.

    678+1최근 7일 스타 변화
  • Woodpecker@VITA-MLLM

    Woodpecker: 멀티모달 대규모 언어 모델을 위한 환각 현상 교정 도구

    650+1최근 7일 스타 변화
  • Liquid@FoundationVision

    (IJCV 채택) Liquid: 확장 가능하고 통합된 멀티모달 생성 언어 모델.

    640+0최근 7일 스타 변화
  • LLaVA-Mini@ictnlp

    LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.

    577+0최근 7일 스타 변화
  • Vitron@SkyworkAI

    NeurIPS 2024 논문: 이해, 생성, 세분화, 편집을 위한 통합 픽셀 레벨 Vision LLM

    577+1최근 7일 스타 변화
  • cambrian-s@cambrian-mllm

    Cambrian-S: 비디오 내 공간 초감각(Spatial Supersensing)을 향하여

    567-1최근 7일 스타 변화
← 토픽 목록으로