본문으로 건너뛰기
buildradar
Sign in
토픽 · multimodal

multimodal

multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 148개
  • tree-of-thoughts@kyegomez

    모델 추론 능력을 최소 70% 이상 향상시키는 '생각의 나무(Tree of Thoughts)' 플러그앤플레이 구현: 대규모 언어 모델을 활용한 신중한 문제 해결

    4,592+0최근 7일 스타 변화
  • 대규모 언어 모델, AI 페인팅 등을 위한 엄선된 튜토리얼 및 리소스입니다.

    4,537+2최근 7일 스타 변화
  • img2dataset@rom1504

    대규모 이미지 URL 세트를 이미지 데이터셋으로 쉽게 변환합니다. 단일 머신에서 20시간 만에 1억 개의 URL을 다운로드, 크기 조정 및 패키징할 수 있습니다.

    4,445+2최근 7일 스타 변화
  • lmms-eval@EvolvingLMMs-Lab

    텍스트, 이미지, 비디오, 오디오 작업을 아우르는 올인원 멀티모달 평가 툴킷

    4,390+7최근 7일 스타 변화
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM(봉신방 대형 모델)은 IDEA 연구원 인지 컴퓨팅 및 자연어 연구 센터가 주도하는 오픈소스 대형 모델 생태계로, 중국어 AIGC 및 인지 지능의 인프라 역할을 합니다.

    4,122-1최근 7일 스타 변화
  • MOSS-TTS@OpenMOSS

    MOSS‑TTS Family는 MOSI.AI와 OpenMOSS 팀이 개발한 오픈소스 음성 및 사운드 생성 모델 패밀리입니다. 고충실도, 고표현력, 복잡한 실제 시나리오를 위해 설계되었으며 안정적인 장문 음성, 다화자 대화, 목소리/캐릭터 디자인, 환경 음향 효과 및 실시간 스트리밍 TTS를 지원합니다.

    4,058+18최근 7일 스타 변화
  • mmpretrain@open-mmlab

    OpenMMLab 사전 훈련 툴박스 및 벤치마크

    3,850-1최근 7일 스타 변화
  • modlens@liustack

    DeepSeek Harness를 위한 최초의 비전 플러그인이자, 모든 텍스트 전용 코딩 에이전트를 위한 비전 브리지입니다. 이미지를 붙여넣으면 구조화된 JSON 증거(OCR, 레이아웃, 시맨틱)를 얻을 수 있습니다.

    3,839+83최근 7일 스타 변화
  • SimpleMem@aiming-lab

    SimpleMem: LLM 에이전트를 위한 효율적인 평생 메모리 — 텍스트 및 멀티모달

    3,735+9최근 7일 스타 변화
  • morphik-core@morphik-org

    오픈소스 멀티모달 검색 엔진(Morphik Core). 숙련된 간호 및 시니어 리빙을 위한 AI 백오피스인 Morphik(morphik.ai) 제작.

    3,710-1최근 7일 스타 변화
  • Chain-of-Thought 프롬프팅부터 OpenAI o1 및 DeepSeek-R1까지 🍓

    3,681+3최근 7일 스타 변화
  • NExT-GPT@NExT-GPT

    ICML 2024 논문 NExT-GPT(Any-to-Any Multimodal Large Language Model)를 위한 코드 및 모델

    3,634-2최근 7일 스타 변화
  • mteb@embeddings-benchmark

    MTEB: 다양한 언어와 모달리티에 걸친 임베딩의 최첨단 평가

    3,414+5최근 7일 스타 변화
  • InternGPT@OpenGVLab

    InternGPT (iGPT)는 AI 모델을 쉽게 시각화할 수 있는 오픈소스 데모 플랫폼입니다. 이제 DragGAN, ChatGPT, ImageBind, GPT-4와 같은 멀티모달 채팅, SAM, 대화형 이미지 편집 등을 지원합니다. igpt.opengvlab.com에서 체험해 보세요.

    3,205+0최근 7일 스타 변화
  • vortex@vortex-data

    열 압축을 위한 확장 가능한 최첨단 프레임워크이자 가장 빠른 FOSS 열 파일 형식. 구 @spiraldb, 현 Linux Foundation 산하 LFAI&Data의 인큐베이션 단계 프로젝트

    3,171+8최근 7일 스타 변화
  • torchscale@microsoft

    (M)LLM을 위한 기본 아키텍처

    3,139+1최근 7일 스타 변화
  • docarray@docarray

    멀티모달 데이터 표현, 전송, 저장 및 검색

    3,123-1최근 7일 스타 변화
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: 실제 컴퓨터 환경의 개방형 작업을 위한 멀티모달 에이전트 벤치마킹

    3,118+6최근 7일 스타 변화
  • ai@TanStack

    🤖 OpenAI, Anthropic, Gemini, React, Vue, Svelte, Solid 전반에서 스트리밍 채팅, 툴 호출, 에이전트 및 멀티모달 앱을 지원하는 타입 안전하고 제공자 독립적인 TypeScript AI SDK.

    3,057+15최근 7일 스타 변화
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 상호작용을 위한 종합 멀티모달 시스템

    2,925-1최근 7일 스타 변화
  • datachain@datachain-ai

    비정형 데이터를 위한 컨텍스트 레이어: S3, GCS, Azure 상의 타입 지정 및 버전 관리된 데이터셋

    2,816+5최근 7일 스타 변화
  • clip-retrieval@rom1504

    CLIP 임베딩을 쉽게 계산하고 이를 활용하여 CLIP 검색 시스템 구축

    2,796+1최근 7일 스타 변화
  • autodistill@autodistill

    라벨링 없이 이미지 추론 (기반 모델을 사용하여 지도 학습 모델 훈련)

    2,770+3최근 7일 스타 변화
  • maestro@roboflow

    멀티모달 모델(PaliGemma 2, Florence-2, Qwen2.5-VL)의 파인튜닝 과정을 간소화합니다.

    2,695+1최근 7일 스타 변화
  • OmAgent@om-ai-lab

    [EMNLP-2024] 빠른 프로토타입 및 프로덕션을 위한 멀티모달 언어 에이전트 구축

    2,666+1최근 7일 스타 변화
  • generative-ai@genieincodebottle

    상세한 로드맵, 프로젝트, 유스케이스, 면접 준비, 코딩 준비를 포함한 생성형 AI에 대한 종합 리소스

    2,610+1최근 7일 스타 변화
  • OFA@OFA-Sys

    OFA (ICML 2022) 공식 저장소. 논문: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0최근 7일 스타 변화
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl: 강력한 멀티모달 대형 언어 모델 패밀리

    2,539+0최근 7일 스타 변화
  • HuixiangDou@InternLM

    HuixiangDou: LLM 기반 기술 지원을 통한 단톡방 시나리오 극복

    2,502+2최근 7일 스타 변화
  • (ෆ`꒳´ෆ) 텍스트-이미지 생성/합성에 대한 조사.

    2,444+0최근 7일 스타 변화
← 토픽 목록으로