multimodal
Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan multimodal di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda multimodal.
- #1
Memungkinkan Claude (atau LLM lainnya) untuk menonton video secara nyata—dengan bingkai yang sadar adegan, deduplikasi, serta transkrip dari URL atau file lokal. Berjalan secara lokal, lisensi MIT
★ 2.092 - #2★ 1.180
- #3
Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.
★ 1.128 - #4
Mata untuk agen DeepSeek Harness khusus teks: rantai visi gratis bawaan (tanpa kunci) + alat visi tingkat piksel (Tanya Jawab, grounding, potong, perbedaan piksel, warna, OCR, penelusuran SVG, guntingan, tangkapan layar). Instalasi satu perintah, tanpa Python, pekerjaan gambar berfungsi seperti giliran pemanggilan alat biasa.
★ 1.034 - #5
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 954
- #1
Berhenti menyewa kecerdasan Anda. Miliki sepenuhnya dengan AnythingLLM. Semua yang Anda butuhkan untuk pengalaman agen lokal yang canggih
★ 65.371+339Perubahan bintang dalam 7 hari terakhir - #2
Memahami AI Agent secara mendalam: Prinsip Desain dan Praktik Rekayasa (oleh Li Bojie) repositori sumber terbuka: teks lengkap buku, PDF kompilasi, dan kode pendukung per bab.
★ 43.359+2.617Perubahan bintang dalam 7 hari terakhir - #3
Tumpukan Agen AI Multimodal Sumber Terbuka: Menghubungkan Model AI Canggih dan Infrastruktur Agen.
★ 38.742+62Perubahan bintang dalam 7 hari terakhir - #4
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) yang dibangun untuk mencapai kemampuan setingkat GPT-4V dan seterusnya.
★ 25.005+9Perubahan bintang dalam 7 hari terakhir - #5★ 22.196+3Perubahan bintang dalam 7 hari terakhir
- #6★ 21.861+1Perubahan bintang dalam 7 hari terakhir
- #7
YC (S26) | Open Computer History | Rekam layar Anda secara terus-menerus di lokal dan berikan konteks ke agen Anda (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.296+133Perubahan bintang dalam 7 hari terakhir - #8★ 17.762+13Perubahan bintang dalam 7 hari terakhir
- #9
Gunakan PEFT atau Full-parameter untuk CPT/SFT/DPO/GRPO 600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) dan 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.400+76Perubahan bintang dalam 7 hari terakhir - #10★ 11.372+36Perubahan bintang dalam 7 hari terakhir
- #11
Praktik pengembangan aplikasi LLM 1: Panduan full-stack teknologi RAG, baca online di: https://datawhalechina.github.io/all-in-rag/
★ 10.676+163Perubahan bintang dalam 7 hari terakhir - #12
Toolkit siap produksi untuk menjalankan AI secara lokal
★ 10.280-12Perubahan bintang dalam 7 hari terakhir - #13
Library Python untuk deteksi anomali di seluruh data tabular, deret waktu (time series), graf, teks, gambar, dan audio. Memiliki 60+ detektor, orkestrasi ADEngine berbasis tolok ukur (benchmark), dan alur kerja agen (agentic workflow) untuk agen AI.
★ 9.977+5Perubahan bintang dalam 7 hari terakhir - #14
Akhir dari parsing web. Awal dari pencarian pixel-native yang terukur. link: https://pixelrag.ai/
★ 9.788+134Perubahan bintang dalam 7 hari terakhir - #15
SeaTunnel adalah alat integrasi data masif terdistribusi, berkinerja tinggi, dan multimodal.
★ 9.600+30Perubahan bintang dalam 7 hari terakhir - #16
Deeplake adalah AI Data Runtime untuk Agen. Menyediakan postgres serverless dengan datalake multimodal untuk pengambilan dan pelatihan data yang skalabel.
★ 9.230+3Perubahan bintang dalam 7 hari terakhir - #17
Mobile-Agent: Keluarga Agen GUI yang Kuat
★ 9.148+32Perubahan bintang dalam 7 hari terakhir - #18
Cara termudah untuk melayani aplikasi dan model AI - Membangun API inferensi model, antrean tugas, aplikasi LLM, pipeline multi-model, dan banyak lagi.
★ 8.813+18Perubahan bintang dalam 7 hari terakhir - #19
Pustaka text-to-speech (TTS), speech-to-text (STT), dan speech-to-speech (STS) yang dibangun di atas framework MLX Apple, menyediakan analisis suara yang efisien di Apple Silicon.
★ 7.803+31Perubahan bintang dalam 7 hari terakhir - #20
Repositori ini adalah kumpulan tautan pilihan ke berbagai kursus dan sumber daya tentang Kecerdasan Buatan (AI)
★ 6.479-1Perubahan bintang dalam 7 hari terakhir - #21★ 6.457+229Perubahan bintang dalam 7 hari terakhir
- #22
Framework sumber terbuka untuk membangun aplikasi agen di JavaScript, Go, Dart, dan Python, yang dibangun dan digunakan dalam produksi oleh Google
★ 6.384+34Perubahan bintang dalam 7 hari terakhir - #23
Catatan untuk insinyur perangkat lunak agar cepat memahami perkembangan AI baru. Berfungsi sebagai datastore untuk tulisan https://latent.space, dan curah pendapat produk, tetapi memiliki referensi kanonis yang telah dibersihkan di bawah folder /Resources.
★ 6.247+1Perubahan bintang dalam 7 hari terakhir - #24★ 6.014+0Perubahan bintang dalam 7 hari terakhir
- #25★ 5.780+5Perubahan bintang dalam 7 hari terakhir
- #26
Mesin data berkinerja tinggi untuk beban kerja AI dan multimodal. Memproses gambar, audio, video, dan data terstruktur pada skala apa pun
★ 5.732+7Perubahan bintang dalam 7 hari terakhir - #27
Kerangka kerja MCP Low-Code untuk membangun pipeline RAG yang kompleks dan inovatif.
★ 5.674+6Perubahan bintang dalam 7 hari terakhir - #28
Framework modular untuk penelitian multimodal visi & bahasa dari Facebook AI Research (FAIR)
★ 5.634+1Perubahan bintang dalam 7 hari terakhir - #29
Mesin pelatihan generasi berikutnya yang dibangun untuk model MoE skala ultra-besar.
★ 5.185+5Perubahan bintang dalam 7 hari terakhir - #30
Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik
★ 4.668+0Perubahan bintang dalam 7 hari terakhir