multimodal
Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.
- #121
MOSS-Audio adalah model dasar sumber terbuka untuk pemahaman audio terpadu, yang memungkinkan ucapan, suara, musik, pemberian keterangan, tanya jawab, dan penalaran dalam skenario dunia nyata.
★ 657+5Perubahan bintang dalam 7 hari terakhir - #122
✨✨Makalah dan tolok ukur terbaru dalam penalaran dengan Foundation Models
★ 657+1Perubahan bintang dalam 7 hari terakhir - #123★ 641-1Perubahan bintang dalam 7 hari terakhir
- #124
Halaman Proyek untuk "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"
★ 640+0Perubahan bintang dalam 7 hari terakhir - #125
👁️ + 💬 + 🎧 = 🤖 Daftar pilihan model fondasi dan multimodal teratas! [Makalah + Kode + Contoh + Tutorial]
★ 637+0Perubahan bintang dalam 7 hari terakhir - #126
Second Brain adalah kerangka kerja agen yang berfungsi sebagai sistem operasi, menggunakan kecerdasan file lokal, otomatisasi alur kerja, dan LLM untuk menyelesaikan tugas serta berkomunikasi melalui berbagai modalitas dan platform pesan.
★ 632+13Perubahan bintang dalam 7 hari terakhir - #127
Implementasi resmi untuk "Blended Latent Diffusion" [SIGGRAPH 2023]
★ 632+0Perubahan bintang dalam 7 hari terakhir - #128
Repositori ini menyediakan program untuk membangun kode Retrieval Augmented Generation (RAG) bagi AI Generatif dengan LlamaIndex, Deep Lake, dan Pinecone, memanfaatkan kekuatan model OpenAI dan Hugging Face untuk pembuatan dan evaluasi.
★ 624+2Perubahan bintang dalam 7 hari terakhir - #129
Jelajahi “Aha Moment” Multimodal pada Model 2B
★ 623+0Perubahan bintang dalam 7 hari terakhir - #130
Hunyuan3D-Omni: Kerangka Kerja Terpadu untuk Pembuatan Aset 3D yang Dapat Dikontrol
★ 618+5Perubahan bintang dalam 7 hari terakhir - #131★ 613—Perubahan bintang dalam 7 hari terakhir
- #132
[ECCV 2024] Tokenisasi apa pun melalui prompting
★ 600+0Perubahan bintang dalam 7 hari terakhir - #133
Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.
★ 597+12Perubahan bintang dalam 7 hari terakhir - #134
Repositori ini berisi kode evaluasi untuk makalah "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+2Perubahan bintang dalam 7 hari terakhir - #135
Implementasi resmi untuk "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]
★ 588+0Perubahan bintang dalam 7 hari terakhir - #136
Buat otomatisasi peramban seolah-olah Anda mengajari manusia menggunakan GPT-4 Vision.
★ 586+1Perubahan bintang dalam 7 hari terakhir - #137
[ECCV2024] Grounded Multimodal Large Language Model dengan Tokenisasi Visual Terlokalisasi
★ 586+0Perubahan bintang dalam 7 hari terakhir - #138
RAI adalah kerangka kerja agen agnostik vendor untuk robotika AI Fisik, memanfaatkan alat ROS 2 untuk melakukan tindakan kompleks, skenario terdefinisi, eksekusi antarmuka bebas, ringkasan log, interaksi suara, dan lainnya.
★ 585+7Perubahan bintang dalam 7 hari terakhir - #139★ 579+13Perubahan bintang dalam 7 hari terakhir
- #140
LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.
★ 577+0Perubahan bintang dalam 7 hari terakhir - #141
Agen AI Multimodal MCP dengan mata dan telinga!
★ 575-1Perubahan bintang dalam 7 hari terakhir - #142
Sistem pengodean mandiri untuk aplikasi Anda — Alan AI SDK untuk React Native
★ 575+0Perubahan bintang dalam 7 hari terakhir - #143★ 572+1Perubahan bintang dalam 7 hari terakhir
- #144★ 568+0Perubahan bintang dalam 7 hari terakhir
- #145
Flame adalah sistem AI multimodal sumber terbuka yang dirancang untuk menerjemahkan maket desain UI ke dalam kode React berkualitas tinggi. Sistem ini memanfaatkan pemodelan bahasa-visi, sintesis data otomatis, dan alur kerja pelatihan terstruktur untuk menjembatani kesenjangan antara desain dan pengembangan front-end.
★ 562+0Perubahan bintang dalam 7 hari terakhir - #146
Pusat untuk berbagai skema khusus industri yang akan digunakan dengan VLM.
★ 556+0Perubahan bintang dalam 7 hari terakhir - #147
Awesome Multimodal Modeling [Mencakup MLLM, UMM, dan NMM]
★ 543+2Perubahan bintang dalam 7 hari terakhir - #148
Kode resmi untuk "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"
★ 508+1Perubahan bintang dalam 7 hari terakhir