Lompat ke konten utama
buildradar
Sign in
Topik · multi-modality

multi-modality

Repositori open source terpantau bertanda multi-modality, diurutkan berdasarkan bintang.

Repositori
11
Total bintang
70.438
Rata-rata bintang
6.403
Porsi
0,00%

Topik yang sering muncul berdampingan dengan multi-modality di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda multi-modality.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) yang dibangun untuk mencapai kemampuan setingkat GPT-4V dan seterusnya.

    25.005+9Perubahan bintang dalam 7 hari terakhir
  • Kemajuan terbaru dalam Multimodal Large Language Models

    17.994+8Perubahan bintang dalam 7 hari terakhir
  • clip-as-service@jina-ai

    Embedding, penalaran, dan pemeringkatan yang skalabel untuk gambar dan kalimat dengan CLIP

    12.835+0Perubahan bintang dalam 7 hari terakhir
  • MOSS-TTS-Nano@OpenMOSS

    MOSS-TTS-Nano adalah model generasi ucapan mini multibahasa sumber terbuka dari MOSI.AI dan tim OpenMOSS. Dengan hanya 0,1 miliar parameter, model ini dirancang untuk pembuatan ucapan waktu nyata, dapat berjalan langsung di CPU tanpa GPU, dan menjaga tumpukan penyebaran tetap sederhana untuk demo lokal, layanan web, dan integrasi produk ringan.

    4.279+51Perubahan bintang dalam 7 hari terakhir
  • Otter@EvolvingLMMs-Lab

    Otter, model multi-modal berbasis OpenFlamingo (versi open-source dari Flamingo milik DeepMind), dilatih pada MIMIC-IT dan menunjukkan peningkatan kemampuan mengikuti instruksi serta pembelajaran dalam konteks.

    3.437+2Perubahan bintang dalam 7 hari terakhir
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang

    2.925+1Perubahan bintang dalam 7 hari terakhir
  • Algoritma dan Publikasi tentang Pelacakan Objek 3D

    1.028+2Perubahan bintang dalam 7 hari terakhir
  • VisRAG@OpenBMB

    RAG tanpa parsing yang didukung oleh VLM.

    979+1Perubahan bintang dalam 7 hari terakhir
  • Long-RL@NVlabs

    Long-RL: Menskalakan RL ke urutan panjang (NeurIPS 2025)

    729+2Perubahan bintang dalam 7 hari terakhir
  • MINIMA@LSXI7

    [CVPR 2025] MINIMA: Pencocokan Gambar Invarian Modalitas

    671+2Perubahan bintang dalam 7 hari terakhir
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena bertemu dengan multimodalitas! Multi-Modality Arena memungkinkan Anda membandingkan model visi-bahasa secara berdampingan sambil menyediakan gambar sebagai masukan. Mendukung MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2, dan banyak lagi!

    566+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik