본문으로 건너뛰기
buildradar
Sign in
토픽 · multimodal

multimodal

multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 148개
  • 텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)

    1,136+18최근 7일 스타 변화
  • 앱을 위한 셀프 코딩 시스템 — Cordova용 Alan AI SDK

    1,132+0최근 7일 스타 변화
  • sglang-omni@sgl-project

    SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.

    1,118+143최근 7일 스타 변화
  • MOVA@OpenMOSS

    MOVA: 확장 가능하고 동기화된 비디오-오디오 생성을 향하여

    1,110+5최근 7일 스타 변화
  • dsh-vision-router@ysr666

    텍스트 전용 DeepSeek Harness agent를 위한 비전 기능: 내장 무료 비전 체인(키 불필요) + 픽셀 수준 비전 도구(Q&A, 그라운딩, 자르기, 픽셀 차이, 색상, OCR, SVG 추적, 누끼, 스크린샷). 명령어 하나로 설치, Python 불필요, 이미지 작업이 일반적인 도구 호출 작업처럼 작동합니다.

    1,089+64최근 7일 스타 변화
  • Aria@rhymes-ai

    오픈 멀티모달 네이티브 MoE인 Aria의 코드베이스

    1,088+1최근 7일 스타 변화
  • XrayGLM@WangRongsheng

    🩺 흉부 X선 사진을 판독하는 최초의 중국어 다중 모달 의료 대형 모델

    1,084+2최근 7일 스타 변화
  • VisCPM@OpenBMB

    [ICLR'24 스포트라이트] 중영 양국어 멀티모달 대형 모델 시리즈(채팅 및 페인트) | CPM 기반 모델 기반 중영 양국어 멀티모달 대형 모델 시리즈

    1,061-1최근 7일 스타 변화
  • ONE-PEACE@OFA-Sys

    비전, 오디오, 언어 모달리티를 아우르는 범용 표현 모델. 논문: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1,060+0최근 7일 스타 변화
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: 대규모 언어 모델이 포인트 클라우드를 이해하도록 역량 강화

    1,054+2최근 7일 스타 변화
  • CLIP4Clip@ArrowLuo

    "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval" 공식 구현체

    1,032+1최근 7일 스타 변화
  • Awesome-MCoT@yaotingwangofficial

    멀티모달 사고의 연쇄(Multimodal Chain-of-Thought) 추론: 종합 조사

    1,025+2최근 7일 스타 변화
  • tongflow@tong-io

    TongFlow — 멀티모달 GenAI 스튜디오

    1,017+38최근 7일 스타 변화
  • vectordb-recipes@lancedb

    벡터 검색 및 LLM을 활용한 멀티모달 AI, RAG, 에이전트 리소스, 예제 및 튜토리얼

    973-1최근 7일 스타 변화
  • verl-omni@verl-project

    디퓨전 및 옴니 모델을 위한 멀티모달 RL 학습 프레임워크

    968+64최근 7일 스타 변화
  • rag-time@microsoft

    RAG Time: RAG 마스터를 위한 5주 학습 여정

    902+4최근 7일 스타 변화
  • CVPR 2025의 가장 흥미롭고 영향력 있는 논문들을 엄선하여 모아둔 저장소입니다. 🔥 [논문 + 코드 + 데모]

    895+1최근 7일 스타 변화
  • NEO@EvolvingLMMs-Lab

    NEO 시리즈: 기본 원칙부터 설계된 네이티브 비전-언어 모델입니다.

    889+0최근 7일 스타 변화
  • AnyGPT@OpenMOSS

    "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling" 논문 코드

    881-1최근 7일 스타 변화
  • ohmycaptcha@shenhao-stu

    ⚡ FastAPI, Playwright 및 OpenAI 호환 멀티모달 모델로 구축된 자체 호스팅 가능한 YesCaptcha 호환 캡차 솔버.

    869+4최근 7일 스타 변화
  • lmms-engine@EvolvingLMMs-Lab

    단순하고 통합된 멀티모달 모델 학습 엔진. 슬림하고 유연하며 대규모 커스텀 및 확장을 위해 구축되었습니다.

    825+0최근 7일 스타 변화
  • [TMLR 2025🔥] 비전 분야의 자기회귀 모델(autoregressive models)에 대한 서베이.

    808+1최근 7일 스타 변화
  • papermage@allenai

    과학 논문 관련 NLP 및 CV 연구를 지원하는 라이브러리

    803+0최근 7일 스타 변화
  • contrastors@nomic-ai

    PyTorch를 이용한 대조 학습(Contrastive Learning) 모델 훈련

    802+0최근 7일 스타 변화
  • 로컬 모니터링 + AI 비전 — 데이터 수집 및 분석을 위한 구조화된 이벤트 출력을 지원하는 LAN 기반 스마트폰 구동 AI 모니터링 프레임워크

    770+10최근 7일 스타 변화
  • 멀티모달 및 대형 언어 모델 관련 논문 목록, 개인적인 필요에 따라 일일 arxiv에서 읽은 논문을 기록하는 용도로만 사용됩니다.

    761+1최근 7일 스타 변화
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: 인간의 지시를 따르는 고품질 이미지 복원 기술입니다.

    741+0최근 7일 스타 변화
  • PaddleMIX@PaddlePaddle

    Paddle 멀티모달 통합 및 탐색 도구. 엔드투엔드 대규모 멀티모달 사전 학습 모델 및 디퓨전 모델 툴박스를 포함한 주요 멀티모달 작업을 지원하며, 높은 성능과 유연성을 제공합니다.

    723-1최근 7일 스타 변화
  • MMRec@enoche

    MultiModal Recommendation을 위한 툴박스. 10개 이상의 모델 통합...

    689+1최근 7일 스타 변화
  • VLM2Vec@TIGER-AI-Lab

    VLM2Vec / MMEB (ICLR 2025), VLM2Vec-V2 / MMEB-V2 (TMLR 2026), MMEB-V3 (COLM 2026) 관련 코드를 포함하는 저장소입니다.

    682+2최근 7일 스타 변화
← 토픽 목록으로