Lompat ke konten utama
buildradar
Sign in
Topik · multimodal

multimodal

Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.

148 repositori
  • MOSS-Audio@OpenMOSS

    MOSS-Audio adalah model dasar sumber terbuka untuk pemahaman audio terpadu, yang memungkinkan ucapan, suara, musik, pemberian keterangan, tanya jawab, dan penalaran dalam skenario dunia nyata.

    657+5Perubahan bintang dalam 7 hari terakhir
  • ✨✨Makalah dan tolok ukur terbaru dalam penalaran dengan Foundation Models

    657+1Perubahan bintang dalam 7 hari terakhir
  • SEED@AILab-CVC

    Implementasi resmi SEED-LLaMA (ICLR 2024).

    641-1Perubahan bintang dalam 7 hari terakhir
  • Seg-Zero@JIA-Lab-research

    Halaman Proyek untuk "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"

    640+0Perubahan bintang dalam 7 hari terakhir
  • 👁️ + 💬 + 🎧 = 🤖 Daftar pilihan model fondasi dan multimodal teratas! [Makalah + Kode + Contoh + Tutorial]

    637+0Perubahan bintang dalam 7 hari terakhir
  • second-brain@henrydaum

    Second Brain adalah kerangka kerja agen yang berfungsi sebagai sistem operasi, menggunakan kecerdasan file lokal, otomatisasi alur kerja, dan LLM untuk menyelesaikan tugas serta berkomunikasi melalui berbagai modalitas dan platform pesan.

    632+13Perubahan bintang dalam 7 hari terakhir
  • blended-latent-diffusion@omriav

    Implementasi resmi untuk "Blended Latent Diffusion" [SIGGRAPH 2023]

    632+0Perubahan bintang dalam 7 hari terakhir
  • RAG-Driven-Generative-AI@Denis2054

    Repositori ini menyediakan program untuk membangun kode Retrieval Augmented Generation (RAG) bagi AI Generatif dengan LlamaIndex, Deep Lake, dan Pinecone, memanfaatkan kekuatan model OpenAI dan Hugging Face untuk pembuatan dan evaluasi.

    624+2Perubahan bintang dalam 7 hari terakhir
  • VisualThinker-R1-Zero@turningpoint-ai

    Jelajahi “Aha Moment” Multimodal pada Model 2B

    623+0Perubahan bintang dalam 7 hari terakhir
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: Kerangka Kerja Terpadu untuk Pembuatan Aset 3D yang Dapat Dikontrol

    618+5Perubahan bintang dalam 7 hari terakhir
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    613Perubahan bintang dalam 7 hari terakhir
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenisasi apa pun melalui prompting

    600+0Perubahan bintang dalam 7 hari terakhir
  • Relax@redai-studio

    Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.

    597+12Perubahan bintang dalam 7 hari terakhir
  • MMMU@MMMU-Benchmark

    Repositori ini berisi kode evaluasi untuk makalah "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+2Perubahan bintang dalam 7 hari terakhir
  • blended-diffusion@omriav

    Implementasi resmi untuk "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]

    588+0Perubahan bintang dalam 7 hari terakhir
  • AI-Employe@vignshwarar

    Buat otomatisasi peramban seolah-olah Anda mengajari manusia menggunakan GPT-4 Vision.

    586+1Perubahan bintang dalam 7 hari terakhir
  • Groma@FoundationVision

    [ECCV2024] Grounded Multimodal Large Language Model dengan Tokenisasi Visual Terlokalisasi

    586+0Perubahan bintang dalam 7 hari terakhir
  • rai@RobotecAI

    RAI adalah kerangka kerja agen agnostik vendor untuk robotika AI Fisik, memanfaatkan alat ROS 2 untuk melakukan tindakan kompleks, skenario terdefinisi, eksekusi antarmuka bebas, ringkasan log, interaksi suara, dan lainnya.

    585+7Perubahan bintang dalam 7 hari terakhir
  • motis@motis-project

    perutean multimodal, geocoding, dan ubin peta

    579+13Perubahan bintang dalam 7 hari terakhir
  • LLaVA-Mini@ictnlp

    LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.

    577+0Perubahan bintang dalam 7 hari terakhir
  • multimodal-agents-course@the-ai-merge

    Agen AI Multimodal MCP dengan mata dan telinga!

    575-1Perubahan bintang dalam 7 hari terakhir
  • Sistem pengodean mandiri untuk aplikasi Anda — Alan AI SDK untuk React Native

    575+0Perubahan bintang dalam 7 hari terakhir
  • psi@microsoft

    Platform untuk Situated Intelligence

    572+1Perubahan bintang dalam 7 hari terakhir
  • clip.cpp@monatis

    Inferensi CLIP dalam C/C++ murni tanpa dependensi tambahan

    568+0Perubahan bintang dalam 7 hari terakhir
  • Flame-Code-VLM@Flame-Code-VLM

    Flame adalah sistem AI multimodal sumber terbuka yang dirancang untuk menerjemahkan maket desain UI ke dalam kode React berkualitas tinggi. Sistem ini memanfaatkan pemodelan bahasa-visi, sintesis data otomatis, dan alur kerja pelatihan terstruktur untuk menjembatani kesenjangan antara desain dan pengembangan front-end.

    562+0Perubahan bintang dalam 7 hari terakhir
  • vlmrun-hub@vlm-run

    Pusat untuk berbagai skema khusus industri yang akan digunakan dengan VLM.

    556+0Perubahan bintang dalam 7 hari terakhir
  • Awesome Multimodal Modeling [Mencakup MLLM, UMM, dan NMM]

    543+2Perubahan bintang dalam 7 hari terakhir
  • EVF-SAM@hustvl

    Kode resmi untuk "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"

    508+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik