Lompat ke konten utama
buildradar
Sign in
Topik · multimodal

multimodal

Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.

148 repositori
  • Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.

    1.136+18Perubahan bintang dalam 7 hari terakhir
  • Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Cordova

    1.132+0Perubahan bintang dalam 7 hari terakhir
  • sglang-omni@sgl-project

    SGLang-Omni mendukung penyajian berkinerja tinggi untuk model TTS, ASR, ucapan, dan omni.

    1.118+143Perubahan bintang dalam 7 hari terakhir
  • MOVA@OpenMOSS

    MOVA: Menuju Pembuatan Video-Audio yang Dapat Diskalakan dan Disinkronkan.

    1.110+5Perubahan bintang dalam 7 hari terakhir
  • dsh-vision-router@ysr666

    Mata untuk agen DeepSeek Harness khusus teks: rantai visi gratis bawaan (tanpa kunci) + alat visi tingkat piksel (Tanya Jawab, grounding, potong, perbedaan piksel, warna, OCR, penelusuran SVG, guntingan, tangkapan layar). Instalasi satu perintah, tanpa Python, pekerjaan gambar berfungsi seperti giliran pemanggilan alat biasa.

    1.088+68Perubahan bintang dalam 7 hari terakhir
  • Aria@rhymes-ai

    Basis kode untuk Aria - Open Multimodal Native MoE

    1.088+1Perubahan bintang dalam 7 hari terakhir
  • XrayGLM@WangRongsheng

    🩺 Model medis multimodal bahasa Mandarin pertama yang dapat membaca rontgen dada | Model Multimodal Medis Tiongkok pertama untuk Ringkasan Radiografi Dada.

    1.084+2Perubahan bintang dalam 7 hari terakhir
  • VisCPM@OpenBMB

    [Sorotan ICLR'24] Seri Model Besar Multimodal Bahasa Mandarin dan Inggris (Chat dan Paint) | Berdasarkan model dasar CPM

    1.061-1Perubahan bintang dalam 7 hari terakhir
  • ONE-PEACE@OFA-Sys

    Model representasi umum lintas modalitas visi, audio, dan bahasa. Makalah: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Perubahan bintang dalam 7 hari terakhir
  • PointLLM@InternRobotics

    [Kandidat Best Paper ECCV 2024 & TPAMI 2025] PointLLM: Memberdayakan Large Language Models untuk memahami Point Clouds.

    1.054+3Perubahan bintang dalam 7 hari terakhir
  • CLIP4Clip@ArrowLuo

    Implementasi resmi untuk "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"

    1.032+1Perubahan bintang dalam 7 hari terakhir
  • Awesome-MCoT@yaotingwangofficial

    Penalaran Multimodal Chain-of-Thought: Survei Komprehensif

    1.025+2Perubahan bintang dalam 7 hari terakhir
  • tongflow@tong-io

    TongFlow — Studio GenAI Multimodal.

    1.017+38Perubahan bintang dalam 7 hari terakhir
  • vectordb-recipes@lancedb

    Sumber daya, contoh, dan tutorial untuk AI multimodal, RAG, dan agen menggunakan pencarian vektor serta LLM

    973-1Perubahan bintang dalam 7 hari terakhir
  • verl-omni@verl-project

    Kerangka kerja pelatihan RL multimodal untuk model diffusion & omni

    968+73Perubahan bintang dalam 7 hari terakhir
  • rag-time@microsoft

    RAG Time: Perjalanan Belajar 5 Minggu untuk Menguasai RAG

    902+3Perubahan bintang dalam 7 hari terakhir
  • Tentang Repositori ini adalah koleksi pilihan dari makalah CVPR 2025 yang paling menarik dan berpengaruh. 🔥 [Paper + Code + Demo]

    895+1Perubahan bintang dalam 7 hari terakhir
  • NEO@EvolvingLMMs-Lab

    NEO Series: Model Visi-Bahasa native yang dibangun dari prinsip dasar.

    889+1Perubahan bintang dalam 7 hari terakhir
  • AnyGPT@OpenMOSS

    Kode untuk "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"

    881-1Perubahan bintang dalam 7 hari terakhir
  • ohmycaptcha@shenhao-stu

    ⚡ Pemecah captcha yang kompatibel dengan YesCaptcha yang dapat di-host sendiri, dibangun dengan FastAPI, Playwright, dan model multimodal yang kompatibel dengan OpenAI.

    869+4Perubahan bintang dalam 7 hari terakhir
  • lmms-engine@EvolvingLMMs-Lab

    Mesin pelatihan model multimodal yang sederhana dan terpadu. Ringan, fleksibel, dan dirancang untuk peretasan skala besar.

    825+1Perubahan bintang dalam 7 hari terakhir
  • [TMLR 2025🔥] Survei untuk model autoregresif dalam visi.

    808+1Perubahan bintang dalam 7 hari terakhir
  • papermage@allenai

    Pustaka yang mendukung penelitian NLP dan CV pada makalah ilmiah

    803+0Perubahan bintang dalam 7 hari terakhir
  • contrastors@nomic-ai

    Melatih Model secara Kontrastif di PyTorch

    802+0Perubahan bintang dalam 7 hari terakhir
  • Pemantauan lokal + Visi AI — Kerangka kerja pemantauan AI berbasis LAN yang didukung ponsel cerdas dengan keluaran peristiwa terstruktur untuk akuisisi dan analisis data.

    772+12Perubahan bintang dalam 7 hari terakhir
  • Daftar makalah tentang model multimodal dan bahasa besar, hanya digunakan untuk mencatat makalah yang saya baca di arXiv harian untuk kebutuhan pribadi.

    761+1Perubahan bintang dalam 7 hari terakhir
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: Restorasi gambar berkualitas tinggi mengikuti instruksi manusia https://huggingface.co/spaces/marcosv/InstructIR

    742+0Perubahan bintang dalam 7 hari terakhir
  • PaddleMIX@PaddlePaddle

    Integrasi dan Eksplorasi Multimodal Paddle, mendukung tugas multimodal arus utama, termasuk model pra-pelatihan multimodal skala besar end-to-end dan kotak alat model difusi. Dilengkapi dengan kinerja tinggi dan fleksibilitas.

    723-1Perubahan bintang dalam 7 hari terakhir
  • MMRec@enoche

    Kotak Alat untuk Rekomendasi MultiModal. Mengintegrasikan 10+ Model...

    689+1Perubahan bintang dalam 7 hari terakhir
  • VLM2Vec@TIGER-AI-Lab

    Repositori ini berisi kode untuk "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], dan "MMEB-V3" [COLM 2026]

    682+2Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik