multimodal
Repositori open source terpantau bertanda multimodal, diurutkan berdasarkan bintang.
- #31
Implementasi Plug and Play dari Tree of Thoughts: Pemecahan Masalah yang Disengaja dengan Model Bahasa Besar yang meningkatkan penalaran model setidaknya 70%
★ 4.592+0Perubahan bintang dalam 7 hari terakhir - #32
Tutorial dan sumber daya terkurasi untuk Large Language Models, AI Painting, dan banyak lagi.
★ 4.537+2Perubahan bintang dalam 7 hari terakhir - #33
Ubah kumpulan URL gambar yang besar menjadi dataset gambar dengan mudah. Mampu mengunduh, mengubah ukuran, dan mengemas 100 juta URL dalam 20 jam pada satu mesin.
★ 4.445+2Perubahan bintang dalam 7 hari terakhir - #34
Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.
★ 4.390+7Perubahan bintang dalam 7 hari terakhir - #35
Fengshenbang-LM adalah sistem model besar sumber terbuka yang dipimpin oleh pusat penelitian komputasi kognitif dan bahasa alami IDEA, yang menjadi infrastruktur untuk AIGC bahasa Mandarin dan kecerdasan kognitif.
★ 4.122-1Perubahan bintang dalam 7 hari terakhir - #36
MOSS‑TTS Family adalah keluarga model pembuatan suara dan ucapan open‑source dari MOSI.AI dan tim OpenMOSS. Dirancang untuk skenario dunia nyata yang sangat akurat, sangat ekspresif, dan kompleks, mencakup ucapan berdurasi panjang yang stabil, dialog multi-pembicara, desain suara/karakter, efek suara lingkungan, dan TTS streaming waktu nyata.
★ 4.058+18Perubahan bintang dalam 7 hari terakhir - #37
Kotak Alat Pra-pelatihan dan Tolok Ukur OpenMMLab
★ 3.850-1Perubahan bintang dalam 7 hari terakhir - #38
Plugin visual pertama untuk DeepSeek Harness, dan jembatan visual untuk setiap agen koding teks saja. Tempel gambar, dapatkan bukti JSON terstruktur (OCR, tata letak, semantik).
★ 3.839+83Perubahan bintang dalam 7 hari terakhir - #39
SimpleMem: Memori jangka panjang yang efisien untuk Agen LLM — Teks & Multimodal
★ 3.735+9Perubahan bintang dalam 7 hari terakhir - #40
Mesin pengambilan multimodal sumber terbuka (Morphik Core). Oleh Morphik — AI back office untuk perawatan terampil & hunian senior (morphik.ai).
★ 3.710-1Perubahan bintang dalam 7 hari terakhir - #41
Dari Chain-of-Thought prompting hingga OpenAI o1 dan DeepSeek-R1 🍓
★ 3.681+3Perubahan bintang dalam 7 hari terakhir - #42
Kode dan model untuk makalah ICML 2024, NExT-GPT: Large Language Model Multimodal Any-to-Any
★ 3.634-2Perubahan bintang dalam 7 hari terakhir - #43★ 3.414+5Perubahan bintang dalam 7 hari terakhir
- #44
InternGPT (iGPT) adalah platform demo open source untuk memamerkan model AI Anda dengan mudah. Kini mendukung DragGAN, ChatGPT, ImageBind, obrolan multimodal seperti GPT-4, SAM, penyuntingan gambar interaktif, dll. Coba di igpt.opengvlab.com.
★ 3.205+0Perubahan bintang dalam 7 hari terakhir - #45
Kerangka kerja mutakhir yang dapat diperluas untuk kompresi kolom, dan format file kolom FOSS tercepat. Sebelumnya di @spiraldb, sekarang menjadi proyek Tahap Inkubasi di LFAI&Data, bagian dari Linux Foundation.
★ 3.171+8Perubahan bintang dalam 7 hari terakhir - #46
Arsitektur fondasi untuk (M)LLM
★ 3.139+1Perubahan bintang dalam 7 hari terakhir - #47★ 3.123-1Perubahan bintang dalam 7 hari terakhir
- #48
[NeurIPS 2024] OSWorld: Benchmarking agen multimodal untuk tugas terbuka di lingkungan komputer nyata.
★ 3.118+6Perubahan bintang dalam 7 hari terakhir - #49
🤖 SDK AI TypeScript yang aman dari tipe dan agnostik penyedia untuk streaming obrolan, pemanggilan alat, agen, dan aplikasi multimodal di OpenAI, Anthropic, Gemini, React, Vue, Svelte, dan Solid.
★ 3.057+15Perubahan bintang dalam 7 hari terakhir - #50
InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang
★ 2.925-1Perubahan bintang dalam 7 hari terakhir - #51
Lapisan konteks untuk data tidak terstruktur: dataset bertipe dan berversi di atas S3, GCS, Azure.
★ 2.816+5Perubahan bintang dalam 7 hari terakhir - #52
Hitung embedding CLIP dengan mudah dan bangun sistem temu kembali CLIP menggunakannya.
★ 2.796+1Perubahan bintang dalam 7 hari terakhir - #53
Gambar untuk inferensi tanpa pelabelan (menggunakan model dasar untuk melatih model terawasi).
★ 2.770+3Perubahan bintang dalam 7 hari terakhir - #54
menyederhanakan proses fine-tuning untuk model multimodal: PaliGemma 2, Florence-2, dan Qwen2.5-VL
★ 2.695+1Perubahan bintang dalam 7 hari terakhir - #55★ 2.666+1Perubahan bintang dalam 7 hari terakhir
- #56
Sumber daya komprehensif tentang AI Generatif, termasuk peta jalan terperinci, proyek, kasus penggunaan, persiapan wawancara, dan persiapan pemrograman.
★ 2.610+1Perubahan bintang dalam 7 hari terakhir - #57
Repositori resmi OFA (ICML 2022). Makalah: OFA: Menyatukan Arsitektur, Tugas, dan Modalitas Melalui Kerangka Kerja Pembelajaran Sequence-to-Sequence yang Sederhana
★ 2.557+0Perubahan bintang dalam 7 hari terakhir - #58★ 2.539+0Perubahan bintang dalam 7 hari terakhir
- #59
HuixiangDou: Mengatasi Skenario Obrolan Grup dengan Bantuan Teknis berbasis LLM
★ 2.502+2Perubahan bintang dalam 7 hari terakhir - #60
(ෆ`꒳´ෆ) Survei tentang pembuatan/sintesis teks-ke-gambar.
★ 2.444+0Perubahan bintang dalam 7 hari terakhir