본문으로 건너뛰기
buildradar
Sign in
토픽 · multimodal

multimodal

multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 148개
  • stability-sdk@Stability-AI

    stability.ai API와 상호작용하기 위한 SDK (예: stable diffusion 추론)

    2,435-1최근 7일 스타 변화
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: 문서 이해를 위한 모듈식 멀티모달 대형 언어 모델

    2,411+0최근 7일 스타 변화
  • InternVideo@OpenGVLab

    [ECCV2024] 멀티모달 이해를 위한 비디오 파운데이션 모델 및 데이터

    2,374+5최근 7일 스타 변화
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: 처음부터 또는 시드 데이터를 사용하여 고품질 합성 데이터 생성.

    2,197+7최근 7일 스타 변화
  • genai-processors@google-gemini

    GenAI Processors는 효율적인 병렬 콘텐츠 처리를 지원하는 경량 Python 라이브러리입니다.

    2,120+0최근 7일 스타 변화
  • claude-real-video@HUANGCHIHHUNGLeo

    Claude(또는 기타 LLM)가 URL이나 로컬 파일에서 텍스트와 함께 장면 인식 기능 및 중복이 제거된 프레임을 통해 동영상을 실제로 시청할 수 있도록 지원합니다. 로컬에서 실행되며, MIT 라이선스입니다.

    2,109+20최근 7일 스타 변화
  • parlor@fikrikarim

    GPT-Live와 유사한 기능을 갖춘 온디바이스 실시간 멀티모달 AI

    2,048+7최근 7일 스타 변화
  • Show-o@showlab

    [ICLR & NeurIPS 2025] 멀티모달 이해와 생성을 통합하는 단일 Transformer인 Show-o 시리즈 저장소입니다.

    1,975+1최근 7일 스타 변화
  • Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.

    1,961+1최근 7일 스타 변화
  • BitNet@kyegomez

    pytorch로 구현한 "BitNet: 대규모 언어 모델을 위한 1비트 트랜스포머 확장"

    1,946+0최근 7일 스타 변화
  • AdvancedLiterateMachinery@AlibabaResearch

    고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.

    1,835+1최근 7일 스타 변화
  • DeTikZify@potamides

    TikZ를 활용한 과학 도표 및 스케치용 그래픽 프로그램 합성

    1,818+1최근 7일 스타 변화
  • 앱을 위한 셀프 코딩 시스템 — 안드로이드용 Alan AI SDK

    1,807-1최근 7일 스타 변화
  • 앱을 위한 자체 코딩 시스템 — Flutter용 Alan AI SDK

    1,756-1최근 7일 스타 변화
  • alan-sdk-ionic@alan-ai

    앱을 위한 셀프 코딩 시스템 — Ionic용 Alan AI SDK

    1,649-1최근 7일 스타 변화
  • pixeltable@pixeltable

    AI 데이터 앱을 위한 통합 멀티모달 백엔드

    1,619+5최근 7일 스타 변화
  • mllm@UbiquitousLearning

    모바일 기기용 고속 멀티모달 LLM

    1,602+3최근 7일 스타 변화
  • thepipe@emcf

    비전 언어 모델을 기반으로 복잡한 문서에서 깔끔한 데이터 추출 ⚡

    1,524+0최근 7일 스타 변화
  • Ovis@ATH-MaaS

    시각 및 텍스트 임베딩을 구조적으로 정렬하도록 설계된 새로운 멀티모달 대형 언어 모델(MLLM) 아키텍처입니다.

    1,514+2최근 7일 스타 변화
  • ha-llmvision@valentinfrlch

    가정을 위한 시각 지능.

    1,454+10최근 7일 스타 변화
  • awesome-japanese-llm@llm-jp

    일본어 LLM 모음 - Overview of Japanese LLMs

    1,428+1최근 7일 스타 변화
  • SDT@dailenson

    이 저장소는 손글씨 생성을 위한 필체와 문자 스타일 분리(Disentangling Writer and Character Styles for Handwriting Generation, CVPR 2023)의 공식 구현입니다.

    1,406-1최근 7일 스타 변화
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,363+462최근 7일 스타 변화
  • airunner@Capsize-Games

    이미지 생성, 실시간 음성 대화, LLM 기반 챗봇 및 자동화된 워크플로우를 위한 오프라인 추론 엔진

    1,314+0최근 7일 스타 변화
  • 155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.

    1,310+2최근 7일 스타 변화
  • claude-video-vision@jordanrendric

    Claude에게 동영상을 시청하고 이해할 수 있는 능력을 부여하세요 — 프레임 추출 및 멀티모달 오디오 분석 기능이 포함된 Claude Code 플러그인

    1,281+6최근 7일 스타 변화
  • UForm@unum-cloud

    다국어 텍스트, 이미지, 비디오 전반의 콘텐츠 이해 및 생성을 위한 포켓 사이즈 멀티모달 AI, OpenAI CLIP 및 LLaVA보다 최대 5배 빠름 🖼️ & 🖋️

    1,247+1최근 7일 스타 변화
  • xtreme1@xtreme1-io

    Xtreme1은 멀티모달 데이터 학습을 위한 올인원 데이터 레이블링 및 주석 플랫폼이며 3D LiDAR 포인트 클라우드, 이미지 및 LLM을 지원합니다.

    1,239+2최근 7일 스타 변화
  • LLaMA-Mesh@nv-tlabs

    언어 모델을 활용한 3D Mesh 생성 통합

    1,167+0최근 7일 스타 변화
  • doc7@magicrew

    시각적 이해를 통해 문서를 AI 학습용 Markdown으로 변환

    1,153-25최근 7일 스타 변화
← 토픽 목록으로