multimodal
Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.
- #91
Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.
★ 1.136+18Perubahan bintang dalam 7 hari terakhir - #92
Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Cordova
★ 1.132+0Perubahan bintang dalam 7 hari terakhir - #93
SGLang-Omni mendukung penyajian berkinerja tinggi untuk model TTS, ASR, ucapan, dan omni.
★ 1.118+143Perubahan bintang dalam 7 hari terakhir - #94★ 1.110+5Perubahan bintang dalam 7 hari terakhir
- #95
Mata untuk agen DeepSeek Harness khusus teks: rantai visi gratis bawaan (tanpa kunci) + alat visi tingkat piksel (Tanya Jawab, grounding, potong, perbedaan piksel, warna, OCR, penelusuran SVG, guntingan, tangkapan layar). Instalasi satu perintah, tanpa Python, pekerjaan gambar berfungsi seperti giliran pemanggilan alat biasa.
★ 1.088+68Perubahan bintang dalam 7 hari terakhir - #96★ 1.088+1Perubahan bintang dalam 7 hari terakhir
- #97
🩺 Model medis multimodal bahasa Mandarin pertama yang dapat membaca rontgen dada | Model Multimodal Medis Tiongkok pertama untuk Ringkasan Radiografi Dada.
★ 1.084+2Perubahan bintang dalam 7 hari terakhir - #98
[Sorotan ICLR'24] Seri Model Besar Multimodal Bahasa Mandarin dan Inggris (Chat dan Paint) | Berdasarkan model dasar CPM
★ 1.061-1Perubahan bintang dalam 7 hari terakhir - #99
Model representasi umum lintas modalitas visi, audio, dan bahasa. Makalah: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Perubahan bintang dalam 7 hari terakhir - #100
[Kandidat Best Paper ECCV 2024 & TPAMI 2025] PointLLM: Memberdayakan Large Language Models untuk memahami Point Clouds.
★ 1.054+3Perubahan bintang dalam 7 hari terakhir - #101
Implementasi resmi untuk "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"
★ 1.032+1Perubahan bintang dalam 7 hari terakhir - #102
Penalaran Multimodal Chain-of-Thought: Survei Komprehensif
★ 1.025+2Perubahan bintang dalam 7 hari terakhir - #103★ 1.017+38Perubahan bintang dalam 7 hari terakhir
- #104
Sumber daya, contoh, dan tutorial untuk AI multimodal, RAG, dan agen menggunakan pencarian vektor serta LLM
★ 973-1Perubahan bintang dalam 7 hari terakhir - #105★ 968+73Perubahan bintang dalam 7 hari terakhir
- #106★ 902+3Perubahan bintang dalam 7 hari terakhir
- #107
Tentang Repositori ini adalah koleksi pilihan dari makalah CVPR 2025 yang paling menarik dan berpengaruh. 🔥 [Paper + Code + Demo]
★ 895+1Perubahan bintang dalam 7 hari terakhir - #108★ 889+1Perubahan bintang dalam 7 hari terakhir
- #109★ 881-1Perubahan bintang dalam 7 hari terakhir
- #110
⚡ Pemecah captcha yang kompatibel dengan YesCaptcha yang dapat di-host sendiri, dibangun dengan FastAPI, Playwright, dan model multimodal yang kompatibel dengan OpenAI.
★ 869+4Perubahan bintang dalam 7 hari terakhir - #111
Mesin pelatihan model multimodal yang sederhana dan terpadu. Ringan, fleksibel, dan dirancang untuk peretasan skala besar.
★ 825+1Perubahan bintang dalam 7 hari terakhir - #112
[TMLR 2025🔥] Survei untuk model autoregresif dalam visi.
★ 808+1Perubahan bintang dalam 7 hari terakhir - #113★ 803+0Perubahan bintang dalam 7 hari terakhir
- #114
Melatih Model secara Kontrastif di PyTorch
★ 802+0Perubahan bintang dalam 7 hari terakhir - #115
Pemantauan lokal + Visi AI — Kerangka kerja pemantauan AI berbasis LAN yang didukung ponsel cerdas dengan keluaran peristiwa terstruktur untuk akuisisi dan analisis data.
★ 772+12Perubahan bintang dalam 7 hari terakhir - #116
Daftar makalah tentang model multimodal dan bahasa besar, hanya digunakan untuk mencatat makalah yang saya baca di arXiv harian untuk kebutuhan pribadi.
★ 761+1Perubahan bintang dalam 7 hari terakhir - #117
[ECCV 2024] InstructIR: Restorasi gambar berkualitas tinggi mengikuti instruksi manusia https://huggingface.co/spaces/marcosv/InstructIR
★ 742+0Perubahan bintang dalam 7 hari terakhir - #118
Integrasi dan Eksplorasi Multimodal Paddle, mendukung tugas multimodal arus utama, termasuk model pra-pelatihan multimodal skala besar end-to-end dan kotak alat model difusi. Dilengkapi dengan kinerja tinggi dan fleksibilitas.
★ 723-1Perubahan bintang dalam 7 hari terakhir - #119★ 689+1Perubahan bintang dalam 7 hari terakhir
- #120
Repositori ini berisi kode untuk "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], dan "MMEB-V3" [COLM 2026]
★ 682+2Perubahan bintang dalam 7 hari terakhir