Lompat ke konten utama
buildradar
Sign in
Topik · multimodal

multimodal

Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.

148 repositori
  • tree-of-thoughts@kyegomez

    Implementasi Plug and Play dari Tree of Thoughts: Pemecahan Masalah yang Disengaja dengan Model Bahasa Besar yang meningkatkan penalaran model setidaknya 70%

    4.592+0Perubahan bintang dalam 7 hari terakhir
  • Tutorial dan sumber daya terkurasi untuk Large Language Models, AI Painting, dan banyak lagi.

    4.537+2Perubahan bintang dalam 7 hari terakhir
  • img2dataset@rom1504

    Ubah kumpulan URL gambar yang besar menjadi dataset gambar dengan mudah. Mampu mengunduh, mengubah ukuran, dan mengemas 100 juta URL dalam 20 jam pada satu mesin.

    4.445+2Perubahan bintang dalam 7 hari terakhir
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.

    4.390+7Perubahan bintang dalam 7 hari terakhir
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM adalah sistem model besar sumber terbuka yang dipimpin oleh pusat penelitian komputasi kognitif dan bahasa alami IDEA, yang menjadi infrastruktur untuk AIGC bahasa Mandarin dan kecerdasan kognitif.

    4.122-1Perubahan bintang dalam 7 hari terakhir
  • MOSS-TTS@OpenMOSS

    MOSS‑TTS Family adalah keluarga model pembuatan suara dan ucapan open‑source dari MOSI.AI dan tim OpenMOSS. Dirancang untuk skenario dunia nyata yang sangat akurat, sangat ekspresif, dan kompleks, mencakup ucapan berdurasi panjang yang stabil, dialog multi-pembicara, desain suara/karakter, efek suara lingkungan, dan TTS streaming waktu nyata.

    4.058+18Perubahan bintang dalam 7 hari terakhir
  • mmpretrain@open-mmlab

    Kotak Alat Pra-pelatihan dan Tolok Ukur OpenMMLab

    3.850-1Perubahan bintang dalam 7 hari terakhir
  • modlens@liustack

    Plugin visual pertama untuk DeepSeek Harness, dan jembatan visual untuk setiap agen koding teks saja. Tempel gambar, dapatkan bukti JSON terstruktur (OCR, tata letak, semantik).

    3.839+83Perubahan bintang dalam 7 hari terakhir
  • SimpleMem@aiming-lab

    SimpleMem: Memori jangka panjang yang efisien untuk Agen LLM — Teks & Multimodal

    3.735+9Perubahan bintang dalam 7 hari terakhir
  • morphik-core@morphik-org

    Mesin pengambilan multimodal sumber terbuka (Morphik Core). Oleh Morphik — AI back office untuk perawatan terampil & hunian senior (morphik.ai).

    3.710-1Perubahan bintang dalam 7 hari terakhir
  • Dari Chain-of-Thought prompting hingga OpenAI o1 dan DeepSeek-R1 🍓

    3.681+3Perubahan bintang dalam 7 hari terakhir
  • NExT-GPT@NExT-GPT

    Kode dan model untuk makalah ICML 2024, NExT-GPT: Large Language Model Multimodal Any-to-Any

    3.634-2Perubahan bintang dalam 7 hari terakhir
  • mteb@embeddings-benchmark

    MTEB: Evaluasi mutakhir untuk embedding lintas bahasa dan modalitas

    3.414+5Perubahan bintang dalam 7 hari terakhir
  • InternGPT@OpenGVLab

    InternGPT (iGPT) adalah platform demo open source untuk memamerkan model AI Anda dengan mudah. Kini mendukung DragGAN, ChatGPT, ImageBind, obrolan multimodal seperti GPT-4, SAM, penyuntingan gambar interaktif, dll. Coba di igpt.opengvlab.com.

    3.205+0Perubahan bintang dalam 7 hari terakhir
  • vortex@vortex-data

    Kerangka kerja mutakhir yang dapat diperluas untuk kompresi kolom, dan format file kolom FOSS tercepat. Sebelumnya di @spiraldb, sekarang menjadi proyek Tahap Inkubasi di LFAI&Data, bagian dari Linux Foundation.

    3.171+8Perubahan bintang dalam 7 hari terakhir
  • torchscale@microsoft

    Arsitektur fondasi untuk (M)LLM

    3.139+1Perubahan bintang dalam 7 hari terakhir
  • docarray@docarray

    Merepresentasikan, mengirim, menyimpan, dan mencari data multimodal

    3.123-1Perubahan bintang dalam 7 hari terakhir
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: Benchmarking agen multimodal untuk tugas terbuka di lingkungan komputer nyata.

    3.118+6Perubahan bintang dalam 7 hari terakhir
  • ai@TanStack

    🤖 SDK AI TypeScript yang aman dari tipe dan agnostik penyedia untuk streaming obrolan, pemanggilan alat, agen, dan aplikasi multimodal di OpenAI, Anthropic, Gemini, React, Vue, Svelte, dan Solid.

    3.057+15Perubahan bintang dalam 7 hari terakhir
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang

    2.925-1Perubahan bintang dalam 7 hari terakhir
  • datachain@datachain-ai

    Lapisan konteks untuk data tidak terstruktur: dataset bertipe dan berversi di atas S3, GCS, Azure.

    2.816+5Perubahan bintang dalam 7 hari terakhir
  • clip-retrieval@rom1504

    Hitung embedding CLIP dengan mudah dan bangun sistem temu kembali CLIP menggunakannya.

    2.796+1Perubahan bintang dalam 7 hari terakhir
  • autodistill@autodistill

    Gambar untuk inferensi tanpa pelabelan (menggunakan model dasar untuk melatih model terawasi).

    2.770+3Perubahan bintang dalam 7 hari terakhir
  • maestro@roboflow

    menyederhanakan proses fine-tuning untuk model multimodal: PaliGemma 2, Florence-2, dan Qwen2.5-VL

    2.695+1Perubahan bintang dalam 7 hari terakhir
  • OmAgent@om-ai-lab

    [EMNLP-2024] Membangun agen bahasa multimodal untuk prototipe cepat dan produksi

    2.666+1Perubahan bintang dalam 7 hari terakhir
  • generative-ai@genieincodebottle

    Sumber daya komprehensif tentang AI Generatif, termasuk peta jalan terperinci, proyek, kasus penggunaan, persiapan wawancara, dan persiapan pemrograman.

    2.610+1Perubahan bintang dalam 7 hari terakhir
  • OFA@OFA-Sys

    Repositori resmi OFA (ICML 2022). Makalah: OFA: Menyatukan Arsitektur, Tugas, dan Modalitas Melalui Kerangka Kerja Pembelajaran Sequence-to-Sequence yang Sederhana

    2.557+0Perubahan bintang dalam 7 hari terakhir
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl: Keluarga Large Language Model Multi-modal yang Kuat

    2.539+0Perubahan bintang dalam 7 hari terakhir
  • HuixiangDou@InternLM

    HuixiangDou: Mengatasi Skenario Obrolan Grup dengan Bantuan Teknis berbasis LLM

    2.502+2Perubahan bintang dalam 7 hari terakhir
  • (ෆ`꒳´ෆ) Survei tentang pembuatan/sintesis teks-ke-gambar.

    2.444+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik