본문으로 건너뛰기
buildradar
Sign in
토픽 · mllm

mllm

mllm 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
36
총 스타
92,155
평균 스타
2,560
비중
0.00%

같은 리포지토리에 mllm 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 mllm 태그가 달린 리포지토리예요.

  • unilm@microsoft

    다양한 태스크, 언어, 모달리티 전반에 걸친 대규모 자기지도 학습 사전 훈련

    22,203+9최근 7일 스타 변화
  • Agent-S@simular-ai

    Agent S: 인간처럼 컴퓨터를 사용하는 오픈 agentic 프레임워크

    12,219+26최근 7일 스타 변화
  • MobileAgent@X-PLUG

    Mobile-Agent: 강력한 GUI 에이전트 패밀리

    9,157+19최근 7일 스타 변화
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: 구조화된 실내 모델링을 위한 대형 언어 모델 학습

    4,726+8최근 7일 스타 변화
  • MagicQuill@robbyant-research

    [CVPR'25] 논문 공식 구현 - MagicQuill: 지능형 인터랙티브 이미지 편집 시스템

    3,691+3최근 7일 스타 변화
  • Chain-of-Thought 프롬프팅부터 OpenAI o1 및 DeepSeek-R1까지 🍓

    3,681+6최근 7일 스타 변화
  • NExT-GPT@NExT-GPT

    ICML 2024 논문 NExT-GPT(Any-to-Any Multimodal Large Language Model)를 위한 코드 및 모델

    3,634-3최근 7일 스타 변화
  • Eagle@NVlabs

    Eagle: 데이터 중심 전략을 적용한 최첨단 비전-언어 모델

    3,511+46최근 7일 스타 변화
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 상호작용을 위한 종합 멀티모달 시스템

    2,925+0최근 7일 스타 변화
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 문서 이해를 위한 모듈식 멀티모달 대형 언어 모델

    2,411+0최근 7일 스타 변화
  • cambrian@cambrian-mllm

    Cambrian-1은 비전 중심 설계가 적용된 멀티모달 LLM 패밀리입니다.

    2,014+1최근 7일 스타 변화
  • 🚀🚀🚀 유용한 공개 YOLO 객체 검출 시리즈 프로젝트 및 관련 객체 검출 데이터셋 모음

    1,783+0최근 7일 스타 변화
  • Sa2VA@bytedance

    Pixel-LLM 코드베이스 공식 저장소: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (LSVOS 1위 솔루션)

    1,666+0최근 7일 스타 변화
  • Rex-Omni@IDEA-Research

    [CVPR2026] 다음 지점 예측을 통한 모든 것 감지.

    1,570+9최근 7일 스타 변화
  • 155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.

    1,310+4최근 7일 스타 변화
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    민주화된 멀티모달 학습을 위한 완전 오픈 프레임워크

    1,195+3최근 7일 스타 변화
  • Bunny@BAAI-DCAI

    경량 멀티모달 모델 패밀리.

    1,053+0최근 7일 스타 변화
  • OpenEMMA@taco-group

    Waymo의 EMMA 모델을 허용적인 라이선스로 재구현한 오픈소스 OpenEMMA

    951+0최근 7일 스타 변화
  • NEO@EvolvingLMMs-Lab

    NEO 시리즈: 기본 원칙부터 설계된 네이티브 비전-언어 모델입니다.

    888+0최근 7일 스타 변화
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: 지능형 사진 보정 에이전트를 통한 인간의 예술적 창의성 해방

    862+1최근 7일 스타 변화
  • Osprey@CircleRadon

    [CVPR2024] "Osprey: Pixel Understanding with Visual Instruction Tuning" 코드

    843+0최근 7일 스타 변화
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 spotlight] "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving" 공식 구현

    828+6최근 7일 스타 변화
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: 임의의 이미지를 4K 초고해상도로 변환하는 에이전트. 어떤 이미지든 완벽한 4K로 마법처럼 복원해 주는 지능형 컴퓨터 비전 에이전트

    819+0최근 7일 스타 변화
  • LLM, VLM, VLA, AIGC 관련 데이터셋 및 애플리케이션을 다루는 우수한 공개 프로젝트 모음

    814+0최근 7일 스타 변화
  • Scene graph 생성 및 응용 관련 논문 목록 저장소입니다.

    724+5최근 7일 스타 변화
  • MPP-LLaVA@Coobiw

    개인 프로젝트: MPP-Qwen14B 및 MPP-Qwen-Next(Qwen-LM 기반 다중 모달 파이프라인 병렬 처리). 비디오/이미지/다중 이미지 SFT 및 대화를 지원하며, RTX3090/4090 24GB 환경에서 8B/14B LLaVA 스타일 MLLM을 학습할 수 있습니다.

    686+0최근 7일 스타 변화
  • SenseNova-Vision@OpenSenseNova

    통합 멀티모달 생성을 위한 Vision

    674+20최근 7일 스타 변화
  • Woodpecker@VITA-MLLM

    Woodpecker: 멀티모달 대규모 언어 모델을 위한 환각 현상 교정 도구

    649+1최근 7일 스타 변화
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: 멀티모달 거대 언어 모델을 통한 설명 가능한 이미지 위조 탐지 및 위치 파악

    623+2최근 7일 스타 변화
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: 지시어 튜닝을 통한 멀티모달 감정 인식 및 추론

    616-1최근 7일 스타 변화
← 토픽 목록으로