Lompat ke konten utama
buildradar
Sign in
Topik · mllm

mllm

Repositori open source terpantau bertanda mllm, diurutkan berdasarkan bintang.

Repositori
36
Total bintang
92.042
Rata-rata bintang
2.557
Porsi
0,00%

Topik yang sering muncul berdampingan dengan mllm di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda mllm.

  • unilm@microsoft

    Pra-pelatihan mandiri skala besar lintas tugas, bahasa, dan modalitas

    22.196+3Perubahan bintang dalam 7 hari terakhir
  • Agent-S@simular-ai

    Agent S: kerangka kerja agen terbuka yang menggunakan komputer layaknya manusia

    12.202+20Perubahan bintang dalam 7 hari terakhir
  • MobileAgent@X-PLUG

    Mobile-Agent: Keluarga Agen GUI yang Kuat

    9.148+32Perubahan bintang dalam 7 hari terakhir
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: Melatih Large Language Models untuk Pemodelan Dalam Ruangan Terstruktur

    4.723+11Perubahan bintang dalam 7 hari terakhir
  • MagicQuill@robbyant-research

    [CVPR'25] Implementasi Resmi untuk Makalah - MagicQuill: Sistem Pengeditan Gambar Interaktif yang Cerdas

    3.689+0Perubahan bintang dalam 7 hari terakhir
  • Dari Chain-of-Thought prompting hingga OpenAI o1 dan DeepSeek-R1 🍓

    3.678+5Perubahan bintang dalam 7 hari terakhir
  • NExT-GPT@NExT-GPT

    Kode dan model untuk makalah ICML 2024, NExT-GPT: Large Language Model Multimodal Any-to-Any

    3.636-1Perubahan bintang dalam 7 hari terakhir
  • Eagle@NVlabs

    Eagle: Model Vision-Language Frontier dengan strategi berbasis data.

    3.479+50Perubahan bintang dalam 7 hari terakhir
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang

    2.926+1Perubahan bintang dalam 7 hari terakhir
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen

    2.411+2Perubahan bintang dalam 7 hari terakhir
  • cambrian@cambrian-mllm

    Cambrian-1 adalah keluarga LLM multimodal dengan desain yang berpusat pada visi.

    2.014+0Perubahan bintang dalam 7 hari terakhir
  • 🚀🚀🚀 Kumpulan proyek seri deteksi objek YOLO publik yang luar biasa dan dataset deteksi objek terkait.

    1.785+2Perubahan bintang dalam 7 hari terakhir
  • Sa2VA@bytedance

    Repo Resmi untuk Basis Kode Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (solusi ke-1 untuk LSVOS)

    1.666+4Perubahan bintang dalam 7 hari terakhir
  • Rex-Omni@IDEA-Research

    [CVPR2026] Deteksi Apa Saja melalui Prediksi Titik Berikutnya

    1.563+4Perubahan bintang dalam 7 hari terakhir
  • Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.

    1.308+2Perubahan bintang dalam 7 hari terakhir
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework Terbuka Penuh untuk Pelatihan Multimodal yang Didemokratisasi

    1.194+6Perubahan bintang dalam 7 hari terakhir
  • Bunny@BAAI-DCAI

    Keluarga model multimodal yang ringan.

    1.053+1Perubahan bintang dalam 7 hari terakhir
  • OpenEMMA@taco-group

    OpenEMMA, "reproduksi" sumber terbuka berlisensi longgar dari model EMMA Waymo.

    951+1Perubahan bintang dalam 7 hari terakhir
  • NEO@EvolvingLMMs-Lab

    NEO Series: Model Visi-Bahasa native yang dibangun dari prinsip dasar.

    888+4Perubahan bintang dalam 7 hari terakhir
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: Membebaskan kreativitas artistik manusia melalui agen retouching foto cerdas

    861+3Perubahan bintang dalam 7 hari terakhir
  • Osprey@CircleRadon

    [CVPR2024] Kode untuk "Osprey: Pixel Understanding with Visual Instruction Tuning"

    843+0Perubahan bintang dalam 7 hari terakhir
  • FSDrive@MIV-XJTU

    [Sorotan NeurIPS 2025] Implementasi resmi untuk "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving"

    822+1Perubahan bintang dalam 7 hari terakhir
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: Agen Super-Resolusi 4K untuk gambar apa pun. Agen visi komputer cerdas yang dapat memulihkan gambar apa pun menjadi 4K yang sempurna.

    819+1Perubahan bintang dalam 7 hari terakhir
  • 🚀🚀🚀Kumpulan beberapa proyek publik hebat tentang Large Language Model (LLM), Vision Language Model (VLM), Vision Language Action (VLA), AI Generated Content (AIGC), serta Dataset dan Aplikasi terkait.

    814+0Perubahan bintang dalam 7 hari terakhir
  • Ini adalah repositori untuk mendaftarkan makalah tentang pembuatan dan aplikasi grafik adegan.

    720+5Perubahan bintang dalam 7 hari terakhir
  • MPP-LLaVA@Coobiw

    Proyek Pribadi: MPP-Qwen14B & MPP-Qwen-Next (Multimodal Pipeline Parallel berdasarkan Qwen-LM). Mendukung [video/gambar/multi-gambar] {sft/percakapan}. Jangan biarkan kemiskinan membatasi imajinasi Anda! Latih MLLM mirip pelatihan LLaVA 8B/14B Anda sendiri di RTX3090/4090 24GB.

    686+2Perubahan bintang dalam 7 hari terakhir
  • SenseNova-Vision@OpenSenseNova

    Visi sebagai Generasi Multimodal Terpadu

    658+12Perubahan bintang dalam 7 hari terakhir
  • Woodpecker@VITA-MLLM

    Woodpecker: Koreksi halusinasi untuk Multimodal Large Language Models

    649+1Perubahan bintang dalam 7 hari terakhir
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: Deteksi dan lokalisasi pemalsuan gambar yang dapat dijelaskan melalui Multi-modal Large Language Models.

    621+1Perubahan bintang dalam 7 hari terakhir
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: Pengenalan dan Penalaran Emosi Multimodal dengan Penyetelan Instruksi

    616+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik