본문으로 건너뛰기
buildradar
Sign in
토픽 · multimodal

multimodal

multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
145
총 스타
624,577
평균 스타
4,307
비중
0.03%

같은 리포지토리에 multimodal 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 multimodal 태그가 달린 리포지토리예요.

  • claude-real-video@HUANGCHIHHUNGLeo

    Claude(또는 기타 LLM)가 URL이나 로컬 파일에서 텍스트와 함께 장면 인식 기능 및 중복이 제거된 프레임을 통해 동영상을 실제로 시청할 수 있도록 지원합니다. 로컬에서 실행되며, MIT 라이선스입니다.

    2,092
  • doc7@magicrew

    시각적 이해를 통해 문서를 AI 학습용 Markdown으로 변환

    1,180
  • 텍스트 전용 LLM을 위한 더 나은 시각 툴킷 및 스킬(다중 이미지 이해, 이미지 Q&A, 프론트엔드 UI 복원, GUI 자동화 등 지원, 여러 주요 에이전트와 선택적 연동 가능, 복사한 이미지 직접 인식)

    1,127
  • dsh-vision-router@ysr666

    텍스트 전용 DeepSeek Harness agent를 위한 비전 기능: 내장 무료 비전 체인(키 불필요) + 픽셀 수준 비전 도구(Q&A, 그라운딩, 자르기, 픽셀 차이, 색상, OCR, SVG 추적, 누끼, 스크린샷). 명령어 하나로 설치, Python 불필요, 이미지 작업이 일반적인 도구 호출 작업처럼 작동합니다.

    1,034
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    977
  • anything-llm@Mintplex-Labs

    지능을 대여하지 마세요. AnythingLLM으로 소유하세요. 강력한 로컬 우선 에이전트 경험을 위한 모든 것

    65,371+339최근 7일 스타 변화
  • ai-agent-book@bojieli

    《인사이드 AI Agent: 디자인 원리 및 엔지니어링 실습》(리보제 지음) 오픈소스 메인 저장소: 전체 책 본문, 컴파일된 PDF 및 장별 부가 코드

    43,359+2,617최근 7일 스타 변화
  • UI-TARS-desktop@bytedance

    오픈소스 멀티모달 AI 에이전트 스택: 최첨단 AI 모델과 에이전트 인프라 연결

    38,742+62최근 7일 스타 변화
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] GPT-4V 수준 이상의 기능을 목표로 구축된 Visual Instruction Tuning (LLaVA).

    25,005+9최근 7일 스타 변화
  • unilm@microsoft

    다양한 태스크, 언어, 모달리티 전반에 걸친 대규모 자기지도 학습 사전 훈련

    22,196+3최근 7일 스타 변화
  • serve@jina-ai

    ☁️ 클라우드 Native 스택으로 멀티모달 AI 애플리케이션 구축

    21,861+1최근 7일 스타 변화
  • screenpipe@screenpipe

    YC (S26) | 오픈 컴퓨터 히스토리 | 로컬에서 화면을 지속적으로 녹화하고 에이전트(Claude, Codex, Openclaw, Hermes, Runner 등)에 컨텍스트 제공

    21,296+133최근 7일 스타 변화
  • Janus@deepseek-ai

    Janus-Series: 통합 멀티모달 이해 및 생성 모델

    17,762+13최근 7일 스타 변화
  • ms-swift@modelscope

    PEFT 또는 풀 파라미터를 사용하여 600개 이상의 LLM(Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) 및 300개 이상의 MLLM(Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...)을 학습/미세조정(CPT/SFT/DPO/GRPO)하는 툴킷 (AAAI 2025).

    15,400+76최근 7일 스타 변화
  • rerun@rerun-io

    멀티모달 로보틱스 데이터 시각화, 쿼리 및 학습용 스트리밍.

    11,372+36최근 7일 스타 변화
  • all-in-rag@datawhalechina

    🔍 대규모 언어 모델(LLM) 어플리케이션 개발 실전 1: RAG 기술 풀스택 가이드, 온라인 읽기 주소: https://datawhalechina.github.io/all-in-rag/

    10,676+163최근 7일 스타 변화
  • runanywhere-sdks@RunanywhereAI

    로컬에서 AI를 실행하기 위한 프로덕션 준비 완료 툴킷

    10,280-12최근 7일 스타 변화
  • pyod@yzhao062

    표, 시계열, 그래프, 텍스트, 이미지, 오디오 데이터 전반에서 이상치를 탐지하기 위한 Python 라이브러리. 60개 이상의 탐지기, 벤치마크 기반 ADEngine 오케스트레이션, AI 에이전트를 위한 에이전틱 워크플로를 제공합니다.

    9,977+5최근 7일 스타 변화
  • PixelRAG@StarTrail-org

    웹 파싱의 끝. 확장 가능한 픽셀 네이티브 검색의 시작. 링크: https://pixelrag.ai/

    9,788+134최근 7일 스타 변화
  • seatunnel@apache

    SeaTunnel은 멀티모달, 고성능, 분산형 대규모 데이터 통합 도구입니다.

    9,600+30최근 7일 스타 변화
  • deeplake@activeloopai

    Deeplake는 에이전트를 위한 AI 데이터 런타임입니다. 멀티모달 데이터 레이크가 포함된 서버리스 postgres를 제공하여 확장 가능한 검색 및 학습을 가능하게 합니다.

    9,230+3최근 7일 스타 변화
  • MobileAgent@X-PLUG

    Mobile-Agent: 강력한 GUI 에이전트 패밀리

    9,148+32최근 7일 스타 변화
  • BentoML@bentoml

    AI 앱과 모델을 서빙하는 가장 쉬운 방법 - 모델 추론 API, 작업 큐, LLM 앱, 멀티 모델 파이프라인 등을 구축하세요!

    8,813+18최근 7일 스타 변화
  • mlx-audio@Blaizzy

    Apple의 MLX 프레임워크를 기반으로 구축된 텍스트 음성 변환(TTS), 음성 텍스트 변환(STT) 및 음성 간 변환(STS) 라이브러리로, Apple Silicon에서 효율적인 음성 분석을 제공합니다.

    7,803+31최근 7일 스타 변화
  • courses@SkalskiP

    인공지능(AI) 관련 다양한 강좌와 리소스 링크를 엄선한 저장소

    6,479-1최근 7일 스타 변화
  • vllm-omni@vllm-project

    옴니 모달리티 모델을 위한 효율적인 모델 추론 프레임워크

    6,457+229최근 7일 스타 변화
  • genkit@genkit-ai

    JavaScript, Go, Dart, Python으로 에이전틱 앱을 구축하기 위한 오픈소스 프레임워크, Google이 직접 제작하여 프로덕션에서 사용 중

    6,384+34최근 7일 스타 변화
  • ai-notes@swyxio

    새로운 AI 동향을 빠르게 파악하려는 소프트웨어 엔지니어를 위한 노트. https://latent.space 글쓰기 및 제품 브레인스토밍을 위한 데이터 저장소로 사용되며, /Resources 폴더 아래의 표준 참고 자료가 정리되어 있습니다.

    6,247+1최근 7일 스타 변화
  • VLM-R1@om-ai-lab

    강화된 VLM을 통한 시각적 이해 해결

    6,014+0최근 7일 스타 변화
  • pyspur@PySpur-Dev

    에이전트 워크플로우를 위한 시각적 플레이그라운드: 에이전트를 10배 더 빠르게 반복 및 개선

    5,780+5최근 7일 스타 변화
  • Daft@Eventual-Inc

    AI 및 멀티모달 워크로드를 위한 고성능 데이터 엔진. 모든 규모에서 이미지, 오디오, 비디오 및 정형 데이터를 처리합니다.

    5,732+7최근 7일 스타 변화
  • UltraRAG@OpenBMB

    복잡하고 혁신적인 RAG 파이프라인 구축을 위한 로우코드 MCP 프레임워크

    5,674+6최근 7일 스타 변화
  • mmf@facebookresearch

    Facebook AI Research(FAIR)에서 개발한 비전 및 언어 멀티모달 연구를 위한 모듈형 프레임워크

    5,634+1최근 7일 스타 변화
  • xtuner@InternLM

    초대형 MoE 모델을 위해 구축된 차세대 학습 엔진

    5,185+5최근 7일 스타 변화
  • align-anything@PKU-Alignment

    Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습

    4,668+0최근 7일 스타 변화
← 토픽 목록으로