Lompat ke konten utama
buildradar
Sign in
Topik · multimodal

multimodal

Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.

148 repositori
  • stability-sdk@Stability-AI

    SDK untuk berinteraksi dengan API stability.ai (misalnya inferensi stable diffusion)

    2.435-1Perubahan bintang dalam 7 hari terakhir
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen

    2.411+0Perubahan bintang dalam 7 hari terakhir
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal

    2.374+5Perubahan bintang dalam 7 hari terakhir
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: Menghasilkan data sintetis berkualitas tinggi dari awal atau dari data awal (seed data).

    2.197+7Perubahan bintang dalam 7 hari terakhir
  • genai-processors@google-gemini

    GenAI Processors adalah pustaka Python ringan yang memungkinkan pemrosesan konten paralel yang efisien.

    2.120+0Perubahan bintang dalam 7 hari terakhir
  • claude-real-video@HUANGCHIHHUNGLeo

    Memungkinkan Claude (atau LLM lainnya) untuk menonton video secara nyata—dengan bingkai yang sadar adegan, deduplikasi, serta transkrip dari URL atau file lokal. Berjalan secara lokal, lisensi MIT

    2.109+20Perubahan bintang dalam 7 hari terakhir
  • parlor@fikrikarim

    AI multimodal waktu nyata pada perangkat dengan fitur yang mirip dengan GPT-Live

    2.048+7Perubahan bintang dalam 7 hari terakhir
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Repositori untuk seri Show-o, satu Transformer tunggal untuk menyatukan pemahaman dan generasi multimodal.

    1.975+1Perubahan bintang dalam 7 hari terakhir
  • Implementasi open-source untuk fine-tuning seri Qwen-VL dari Alibaba Cloud.

    1.961+1Perubahan bintang dalam 7 hari terakhir
  • BitNet@kyegomez

    Implementasi "BitNet: Scaling 1-bit Transformers for Large Language Models" di pytorch

    1.946+0Perubahan bintang dalam 7 hari terakhir
  • AdvancedLiterateMachinery@AlibabaResearch

    Kumpulan ide dan algoritma orisinal serta inovatif menuju Advanced Literate Machinery. Proyek ini dikelola oleh Tim OCR di Language Technology Lab, Tongyi Lab, Alibaba Group.

    1.835+1Perubahan bintang dalam 7 hari terakhir
  • DeTikZify@potamides

    Mensintesis Program Grafis untuk Angka Ilmiah dan Sketsa dengan TikZ.

    1.818+1Perubahan bintang dalam 7 hari terakhir
  • Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Android

    1.807-1Perubahan bintang dalam 7 hari terakhir
  • Sistem pengkodean mandiri untuk aplikasi Anda — Alan AI SDK untuk Flutter

    1.756-1Perubahan bintang dalam 7 hari terakhir
  • alan-sdk-ionic@alan-ai

    Sistem Pengodean Mandiri untuk Aplikasi Anda — Alan AI SDK untuk Ionic

    1.649-1Perubahan bintang dalam 7 hari terakhir
  • pixeltable@pixeltable

    Backend multimodal terpadu untuk aplikasi data AI

    1.619+5Perubahan bintang dalam 7 hari terakhir
  • mllm@UbiquitousLearning

    Multimodal LLM yang cepat di perangkat seluler

    1.602+3Perubahan bintang dalam 7 hari terakhir
  • thepipe@emcf

    Dapatkan data bersih dari dokumen yang rumit, didukung oleh model vision-language ⚡

    1.524+0Perubahan bintang dalam 7 hari terakhir
  • Ovis@ATH-MaaS

    Arsitektur Multimodal Large Language Model (MLLM) baru, yang dirancang untuk menyelaraskan embedding visual dan tekstual secara struktural.

    1.514+2Perubahan bintang dalam 7 hari terakhir
  • ha-llmvision@valentinfrlch

    Kecerdasan visual untuk rumah Anda.

    1.454+10Perubahan bintang dalam 7 hari terakhir
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.432+521Perubahan bintang dalam 7 hari terakhir
  • awesome-japanese-llm@llm-jp

    Ringkasan LLM Bahasa Jepang - Ikhtisar LLM Bahasa Jepang

    1.428+1Perubahan bintang dalam 7 hari terakhir
  • SDT@dailenson

    Repositori ini adalah implementasi resmi dari Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)

    1.406-1Perubahan bintang dalam 7 hari terakhir
  • airunner@Capsize-Games

    Mesin inferensi luring untuk seni, percakapan suara waktu nyata, chatbot bertenaga LLM, dan alur kerja otomatis

    1.314+0Perubahan bintang dalam 7 hari terakhir
  • Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.

    1.310+2Perubahan bintang dalam 7 hari terakhir
  • claude-video-vision@jordanrendric

    Berikan kemampuan kepada Claude untuk menonton dan memahami video — plugin Claude Code dengan ekstraksi bingkai dan analisis audio multimodal

    1.281+6Perubahan bintang dalam 7 hari terakhir
  • UForm@unum-cloud

    AI Multimodal Berukuran Saku untuk pemahaman dan pembuatan konten lintas teks multibahasa, gambar, dan 🔜 video, hingga 5x lebih cepat dari OpenAI CLIP dan LLaVA 🖼️ & 🖋️

    1.247+1Perubahan bintang dalam 7 hari terakhir
  • xtreme1@xtreme1-io

    Xtreme1 adalah platform pelabelan dan anotasi data serbaguna untuk pelatihan data multimodal serta mendukung point cloud 3D LiDAR, gambar, dan LLM.

    1.239+2Perubahan bintang dalam 7 hari terakhir
  • LLaMA-Mesh@nv-tlabs

    Menyatukan Pembuatan Mesh 3D dengan Language Models

    1.167+0Perubahan bintang dalam 7 hari terakhir
  • doc7@magicrew

    Ubah dokumen menjadi Markdown siap-AI dengan pemahaman visual

    1.153-25Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik