Lompat ke konten utama
buildradar
Sign in
Topik · multi-modal

multi-modal

Repositori open source terpantau bertanda multi-modal, diurutkan berdasarkan bintang.

Repositori
42
Total bintang
189.535
Rata-rata bintang
4.513
Porsi
0,01%

Topik yang sering muncul berdampingan dengan multi-modal di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda multi-modal.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • agentscope@agentscope-ai

    Bangun dan jalankan agen yang dapat Anda lihat, pahami, dan percayai.

    30.463+420Perubahan bintang dalam 7 hari terakhir
  • MiniCPM-V@OpenBMB

    MLLM seukuran saku untuk pemahaman gambar dan video yang sangat efisien di ponsel Anda

    26.283+27Perubahan bintang dalam 7 hari terakhir
  • ten-framework@TEN-framework

    Framework open-source untuk agen AI suara percakapan

    11.102+10Perubahan bintang dalam 7 hari terakhir
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] Keluarga InternVL: Alternatif Open-Source Perintis untuk GPT-4o. Model dialog multimodal open-source dengan performa mendekati GPT-4o

    10.150+3Perubahan bintang dalam 7 hari terakhir
  • modelscope@modelscope

    ModelScope: wujudkan konsep Model-sebagai-Layanan (Model-as-a-Service).

    9.121+4Perubahan bintang dalam 7 hari terakhir
  • big-AGI@enricoros

    Rangkaian AI yang didukung oleh model mutakhir dan menyediakan fungsi AI/AGI tingkat lanjut. Termasuk persona AI, fungsi AGI, obrolan multi-model Beam kelas dunia, teks-ke-gambar, suara, streaming respons, penyorotan dan eksekusi kode, impor PDF, preset untuk pengembang, dan banyak lagi. Terapkan secara on-premise atau di cloud.

    7.108+1Perubahan bintang dalam 7 hari terakhir
  • data-juicer@datajuicer

    Pemrosesan data untuk dan dengan foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6.975+26Perubahan bintang dalam 7 hari terakhir
  • CogVLM@zai-org

    model bahasa visual terbuka tingkat state-of-the-art | model pra-pelatihan multimodal

    6.744+0Perubahan bintang dalam 7 hari terakhir
  • valhalla@valhalla

    Mesin perutean sumber terbuka untuk OpenStreetMap.

    6.154+24Perubahan bintang dalam 7 hari terakhir
  • Chinese-CLIP@OFA-Sys

    Versi bahasa Mandarin dari CLIP yang mencapai pengambilan lintas modal dan pembuatan representasi dalam bahasa Mandarin.

    6.001+1Perubahan bintang dalam 7 hari terakhir
  • DALLE-pytorch@lucidrains

    Implementasi / replikasi DALL-E, Transformer Text-to-Image OpenAI, di Pytorch

    5.626-2Perubahan bintang dalam 7 hari terakhir
  • marqo@marqo-ai

    Pencarian dan Penemuan E-commerce - marqo.ai

    5.031-1Perubahan bintang dalam 7 hari terakhir
  • DeepKE@zjunlp

    [EMNLP 2022] Toolkit terbuka untuk ekstraksi dan konstruksi Knowledge Graph

    4.476+1Perubahan bintang dalam 7 hari terakhir
  • VLMEvalKit@open-compass

    Toolkit evaluasi open-source untuk large multi-modality models (LMMs), mendukung 220+ LMM, 80+ benchmark

    4.375+13Perubahan bintang dalam 7 hari terakhir
  • OmniGen@VectorSpaceLab

    OmniGen: Unified Image Generation. https://arxiv.org/pdf/2409.11340

    4.342+1Perubahan bintang dalam 7 hari terakhir
  • VisualGLM-6B@zai-org

    Model bahasa percakapan multimodal bahasa Mandarin dan Inggris.

    4.155+0Perubahan bintang dalam 7 hari terakhir
  • LLamaSharp@SciSharp

    Pustaka C#/.NET untuk menjalankan LLM (🦙LLaMA/LLaVA) di perangkat lokal Anda secara efisien.

    3.790+2Perubahan bintang dalam 7 hari terakhir
  • Video-LLaVA@PKU-YuanGroup

    【EMNLP 2024🔥】Video-LLaVA: Mempelajari Representasi Visual Terpadu melalui Penyelarasan Sebelum Proyeksi

    3.500+1Perubahan bintang dalam 7 hari terakhir
  • py-xiaozhi@huangjunsen0406

    Ekosistem asisten AI open-source dengan integrasi MCP, alur kerja multimodal, dukungan IoT, dan interaksi suara lintas platform.

    3.463+9Perubahan bintang dalam 7 hari terakhir
  • docarray@docarray

    Merepresentasikan, mengirim, menyimpan, dan mencari data multimodal

    3.123-1Perubahan bintang dalam 7 hari terakhir
  • LISA@JIA-Lab-research

    Halaman Proyek untuk "LISA: Reasoning Segmentation via Large Language Model"

    2.674+0Perubahan bintang dalam 7 hari terakhir
  • CogVLM2@zai-org

    Model multimodal sumber terbuka setingkat GPT4V berbasis Llama3-8B.

    2.433+0Perubahan bintang dalam 7 hari terakhir
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】 Mixture-of-Experts untuk Model Visi-Bahasa Besar

    2.322+0Perubahan bintang dalam 7 hari terakhir
  • RecSysPapers@tangxyw

    Koleksi makalah klasik industri dan mutakhir di bidang rekomendasi/periklanan/pencarian.

    2.188-1Perubahan bintang dalam 7 hari terakhir
  • MotionGPT@OpenMotionLab

    [NeurIPS 2023] MotionGPT: Gerakan Manusia sebagai Bahasa Asing, model generatif gerakan-bahasa terpadu menggunakan LLM

    1.963+1Perubahan bintang dalam 7 hari terakhir
  • GPTDiscord@Kav-K

    Antarmuka GPT yang tangguh dan serbaguna untuk Discord. Percakapan ala ChatGPT, pembuatan gambar, moderasi AI, indeks/basis pengetahuan kustom, ringkasan youtube, dan banyak lagi!

    1.853-2Perubahan bintang dalam 7 hari terakhir
  • SALMONN@bytedance

    Keluarga SALMONN: Sekumpulan multi-modal LLM tingkat lanjut

    1.521+3Perubahan bintang dalam 7 hari terakhir
  • MedMNIST@MedMNIST

    [pip install medmnist] 18 Dataset Standar untuk Klasifikasi Citra Biomedis 2D dan 3D

    1.399+0Perubahan bintang dalam 7 hari terakhir
  • transfusion-pytorch@lucidrains

    Implementasi PyTorch dari Transfusion, "Predict the Next Token and Diffuse Images with One Multi-Modal Model", dari MetaAI

    1.398+3Perubahan bintang dalam 7 hari terakhir
  • Repositori ini mengumpulkan makalah untuk "A Survey on Knowledge Distillation of Large Language Models". Kami memecah KD menjadi Knowledge Elicitation dan Algoritma Distilasi, serta mengeksplorasi Skill & Vertical Distillation dari LLM.

    1.306+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik