multimodal
Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.
- #61
SDK untuk berinteraksi dengan API stability.ai (misalnya inferensi stable diffusion)
★ 2.435-1Perubahan bintang dalam 7 hari terakhir - #62
mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen
★ 2.411+0Perubahan bintang dalam 7 hari terakhir - #63
[ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal
★ 2.374+5Perubahan bintang dalam 7 hari terakhir - #64
🎨 NeMo Data Designer: Menghasilkan data sintetis berkualitas tinggi dari awal atau dari data awal (seed data).
★ 2.197+7Perubahan bintang dalam 7 hari terakhir - #65
GenAI Processors adalah pustaka Python ringan yang memungkinkan pemrosesan konten paralel yang efisien.
★ 2.120+0Perubahan bintang dalam 7 hari terakhir - #66
Memungkinkan Claude (atau LLM lainnya) untuk menonton video secara nyata—dengan bingkai yang sadar adegan, deduplikasi, serta transkrip dari URL atau file lokal. Berjalan secara lokal, lisensi MIT
★ 2.109+20Perubahan bintang dalam 7 hari terakhir - #67★ 2.048+7Perubahan bintang dalam 7 hari terakhir
- #68
[ICLR & NeurIPS 2025] Repositori untuk seri Show-o, satu Transformer tunggal untuk menyatukan pemahaman dan generasi multimodal.
★ 1.975+1Perubahan bintang dalam 7 hari terakhir - #69
Implementasi open-source untuk fine-tuning seri Qwen-VL dari Alibaba Cloud.
★ 1.961+1Perubahan bintang dalam 7 hari terakhir - #70
Implementasi "BitNet: Scaling 1-bit Transformers for Large Language Models" di pytorch
★ 1.946+0Perubahan bintang dalam 7 hari terakhir - #71
Kumpulan ide dan algoritma orisinal serta inovatif menuju Advanced Literate Machinery. Proyek ini dikelola oleh Tim OCR di Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835+1Perubahan bintang dalam 7 hari terakhir - #72★ 1.818+1Perubahan bintang dalam 7 hari terakhir
- #73
Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Android
★ 1.807-1Perubahan bintang dalam 7 hari terakhir - #74
Sistem pengkodean mandiri untuk aplikasi Anda — Alan AI SDK untuk Flutter
★ 1.756-1Perubahan bintang dalam 7 hari terakhir - #75
Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Ionic
★ 1.649-1Perubahan bintang dalam 7 hari terakhir - #76
Backend multimodal terpadu untuk aplikasi data AI
★ 1.619+5Perubahan bintang dalam 7 hari terakhir - #77★ 1.602+3Perubahan bintang dalam 7 hari terakhir
- #78★ 1.524+0Perubahan bintang dalam 7 hari terakhir
- #79
Arsitektur Multimodal Large Language Model (MLLM) baru, yang dirancang untuk menyelaraskan embedding visual dan tekstual secara struktural.
★ 1.514+2Perubahan bintang dalam 7 hari terakhir - #80
Kecerdasan visual untuk rumah Anda.
★ 1.454+10Perubahan bintang dalam 7 hari terakhir - #81
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.432+521Perubahan bintang dalam 7 hari terakhir - #82
Ringkasan LLM Bahasa Jepang - Ikhtisar LLM Bahasa Jepang
★ 1.428+1Perubahan bintang dalam 7 hari terakhir - #83
Repositori ini adalah implementasi resmi dari Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)
★ 1.406-1Perubahan bintang dalam 7 hari terakhir - #84
Mesin inferensi luring untuk seni, percakapan suara waktu nyata, chatbot bertenaga LLM, dan alur kerja otomatis
★ 1.314+0Perubahan bintang dalam 7 hari terakhir - #85
Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.
★ 1.310+2Perubahan bintang dalam 7 hari terakhir - #86
Berikan kemampuan kepada Claude untuk menonton dan memahami video — plugin Claude Code dengan ekstraksi bingkai dan analisis audio multimodal
★ 1.281+6Perubahan bintang dalam 7 hari terakhir - #87
AI Multimodal Berukuran Saku untuk pemahaman dan pembuatan konten lintas teks multibahasa, gambar, dan 🔜 video, hingga 5x lebih cepat dari OpenAI CLIP dan LLaVA 🖼️ & 🖋️
★ 1.247+1Perubahan bintang dalam 7 hari terakhir - #88
Xtreme1 adalah platform pelabelan dan anotasi data serbaguna untuk pelatihan data multimodal serta mendukung point cloud 3D LiDAR, gambar, dan LLM.
★ 1.239+2Perubahan bintang dalam 7 hari terakhir - #89
Menyatukan Pembuatan Mesh 3D dengan Language Models
★ 1.167+0Perubahan bintang dalam 7 hari terakhir - #90★ 1.153-25Perubahan bintang dalam 7 hari terakhir