Lompat ke konten utama
buildradar
Sign in
Topik · multimodal

multimodal

Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.

Repositori
145
Total bintang
624.577
Rata-rata bintang
4.307
Porsi
0,03%

Topik yang sering muncul berdampingan dengan multimodal di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda multimodal.

  • claude-real-video@HUANGCHIHHUNGLeo

    Memungkinkan Claude (atau LLM lainnya) untuk menonton video secara nyata—dengan bingkai yang sadar adegan, deduplikasi, serta transkrip dari URL atau file lokal. Berjalan secara lokal, lisensi MIT

    2.092
  • doc7@magicrew

    Ubah dokumen menjadi Markdown siap-AI dengan pemahaman visual

    1.180
  • Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.

    1.128
  • dsh-vision-router@ysr666

    Mata untuk agen DeepSeek Harness khusus teks: rantai visi gratis bawaan (tanpa kunci) + alat visi tingkat piksel (Tanya Jawab, grounding, potong, perbedaan piksel, warna, OCR, penelusuran SVG, guntingan, tangkapan layar). Instalasi satu perintah, tanpa Python, pekerjaan gambar berfungsi seperti giliran pemanggilan alat biasa.

    1.034
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    954
  • anything-llm@Mintplex-Labs

    Berhenti menyewa kecerdasan Anda. Miliki sepenuhnya dengan AnythingLLM. Semua yang Anda butuhkan untuk pengalaman agen lokal yang canggih

    65.371+339Perubahan bintang dalam 7 hari terakhir
  • ai-agent-book@bojieli

    Memahami AI Agent secara mendalam: Prinsip Desain dan Praktik Rekayasa (oleh Li Bojie) repositori sumber terbuka: teks lengkap buku, PDF kompilasi, dan kode pendukung per bab.

    43.359+2.617Perubahan bintang dalam 7 hari terakhir
  • UI-TARS-desktop@bytedance

    Tumpukan Agen AI Multimodal Sumber Terbuka: Menghubungkan Model AI Canggih dan Infrastruktur Agen.

    38.742+62Perubahan bintang dalam 7 hari terakhir
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) yang dibangun untuk mencapai kemampuan setingkat GPT-4V dan seterusnya.

    25.005+9Perubahan bintang dalam 7 hari terakhir
  • unilm@microsoft

    Pra-pelatihan mandiri skala besar lintas tugas, bahasa, dan modalitas

    22.196+3Perubahan bintang dalam 7 hari terakhir
  • serve@jina-ai

    ☁️ Bangun aplikasi AI multimodal dengan tumpukan native cloud (cloud-native)

    21.861+1Perubahan bintang dalam 7 hari terakhir
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Rekam layar Anda secara terus-menerus di lokal dan berikan konteks ke agen Anda (Claude, Codex, Openclaw, Hermes, Runner...)

    21.296+133Perubahan bintang dalam 7 hari terakhir
  • Janus@deepseek-ai

    Janus-Series: Model Pemahaman dan Generasi Multimodal Terpadu

    17.762+13Perubahan bintang dalam 7 hari terakhir
  • ms-swift@modelscope

    Gunakan PEFT atau Full-parameter untuk CPT/SFT/DPO/GRPO 600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) dan 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.400+76Perubahan bintang dalam 7 hari terakhir
  • rerun@rerun-io

    Visualisasikan, kueri, dan streaming untuk melatih data robotika multimodal.

    11.372+36Perubahan bintang dalam 7 hari terakhir
  • all-in-rag@datawhalechina

    Praktik pengembangan aplikasi LLM 1: Panduan full-stack teknologi RAG, baca online di: https://datawhalechina.github.io/all-in-rag/

    10.676+163Perubahan bintang dalam 7 hari terakhir
  • runanywhere-sdks@RunanywhereAI

    Toolkit siap produksi untuk menjalankan AI secara lokal

    10.280-12Perubahan bintang dalam 7 hari terakhir
  • pyod@yzhao062

    Library Python untuk deteksi anomali di seluruh data tabular, deret waktu (time series), graf, teks, gambar, dan audio. Memiliki 60+ detektor, orkestrasi ADEngine berbasis tolok ukur (benchmark), dan alur kerja agen (agentic workflow) untuk agen AI.

    9.977+5Perubahan bintang dalam 7 hari terakhir
  • PixelRAG@StarTrail-org

    Akhir dari parsing web. Awal dari pencarian pixel-native yang terukur. link: https://pixelrag.ai/

    9.788+134Perubahan bintang dalam 7 hari terakhir
  • seatunnel@apache

    SeaTunnel adalah alat integrasi data masif terdistribusi, berkinerja tinggi, dan multimodal.

    9.600+30Perubahan bintang dalam 7 hari terakhir
  • deeplake@activeloopai

    Deeplake adalah AI Data Runtime untuk Agen. Menyediakan postgres serverless dengan datalake multimodal untuk pengambilan dan pelatihan data yang skalabel.

    9.230+3Perubahan bintang dalam 7 hari terakhir
  • MobileAgent@X-PLUG

    Mobile-Agent: Keluarga Agen GUI yang Kuat

    9.148+32Perubahan bintang dalam 7 hari terakhir
  • BentoML@bentoml

    Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.

    8.813+18Perubahan bintang dalam 7 hari terakhir
  • mlx-audio@Blaizzy

    Pustaka text-to-speech (TTS), speech-to-text (STT), dan speech-to-speech (STS) yang dibangun di atas framework MLX Apple, menyediakan analisis suara yang efisien di Apple Silicon.

    7.803+31Perubahan bintang dalam 7 hari terakhir
  • courses@SkalskiP

    Repositori ini adalah kumpulan tautan pilihan ke berbagai kursus dan sumber daya tentang Kecerdasan Buatan (AI)

    6.479-1Perubahan bintang dalam 7 hari terakhir
  • vllm-omni@vllm-project

    Framework untuk inferensi model yang efisien dengan model omni-modality

    6.457+229Perubahan bintang dalam 7 hari terakhir
  • genkit@genkit-ai

    Framework sumber terbuka untuk membangun aplikasi agen di JavaScript, Go, Dart, dan Python, yang dibangun dan digunakan dalam produksi oleh Google

    6.384+34Perubahan bintang dalam 7 hari terakhir
  • ai-notes@swyxio

    Catatan untuk insinyur perangkat lunak agar cepat memahami perkembangan AI baru. Berfungsi sebagai datastore untuk tulisan https://latent.space, dan curah pendapat produk, tetapi memiliki referensi kanonis yang telah dibersihkan di bawah folder /Resources.

    6.247+1Perubahan bintang dalam 7 hari terakhir
  • VLM-R1@om-ai-lab

    Menyelesaikan Pemahaman Visual dengan VLM yang Diperkuat

    6.014+0Perubahan bintang dalam 7 hari terakhir
  • pyspur@PySpur-Dev

    Visual playground untuk alur kerja agen: Iterasi agen Anda 10x lebih cepat

    5.780+5Perubahan bintang dalam 7 hari terakhir
  • Daft@Eventual-Inc

    Mesin data berkinerja tinggi untuk beban kerja AI dan multimodal. Memproses gambar, audio, video, dan data terstruktur pada skala apa pun

    5.732+7Perubahan bintang dalam 7 hari terakhir
  • UltraRAG@OpenBMB

    Kerangka kerja MCP Low-Code untuk membangun pipeline RAG yang kompleks dan inovatif.

    5.674+6Perubahan bintang dalam 7 hari terakhir
  • mmf@facebookresearch

    Framework modular untuk penelitian multimodal visi & bahasa dari Facebook AI Research (FAIR)

    5.634+1Perubahan bintang dalam 7 hari terakhir
  • xtuner@InternLM

    Mesin pelatihan generasi berikutnya yang dibangun untuk model MoE skala ultra-besar.

    5.185+5Perubahan bintang dalam 7 hari terakhir
  • align-anything@PKU-Alignment

    Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik

    4.668+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik