multimodal
Dépôts open source suivis étiquetés multimodal, triés par étoiles.
- #31
Implémentation prête à l'emploi de Tree of Thoughts : résolution délibérée de problèmes avec des grands modèles de langage, améliorant le raisonnement du modèle d'au moins 70 %
★ 4 592+0Évolution des étoiles sur les 7 derniers jours - #32
Tutoriels et ressources sélectionnés pour les grands modèles de langage, l'art généré par IA, et plus encore.
★ 4 537+2Évolution des étoiles sur les 7 derniers jours - #33
Transformez facilement de grands ensembles d'URL d'images en un jeu de données. Capable de télécharger, redimensionner et empaqueter 100 millions d'URL en 20 heures sur une seule machine.
★ 4 445+2Évolution des étoiles sur les 7 derniers jours - #34
Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.
★ 4 390+7Évolution des étoiles sur les 7 derniers jours - #35
Fengshenbang-LM est un écosystème de modèles open source dirigé par le centre de recherche en informatique cognitive et en langage naturel de l'IDEA, servant d'infrastructure pour l'AIGC et l'intelligence cognitive en chinois.
★ 4 122-1Évolution des étoiles sur les 7 derniers jours - #36
La famille MOSS‑TTS est une gamme de modèles open source de génération de parole et de son développée par MOSI.AI et l'équipe OpenMOSS. Conçue pour une haute fidélité et une grande expressivité dans des scénarios réels complexes, elle couvre la synthèse vocale longue durée stable, le dialogue multi-locuteur, la conception de voix et de personnages, les effets sonores environnementaux et le TTS en streaming temps réel.
★ 4 058+18Évolution des étoiles sur les 7 derniers jours - #37
Boîte à outils et benchmark de pré-entraînement OpenMMLab.
★ 3 850-1Évolution des étoiles sur les 7 derniers jours - #38
Le premier plugin de vision pour DeepSeek Harness, et le pont visuel pour tout agent de codage textuel. Collez une image et obtenez des preuves JSON structurées (OCR, mise en page, sémantique).
★ 3 839+83Évolution des étoiles sur les 7 derniers jours - #39
SimpleMem : mémoire à long terme efficace pour les agents LLM, supportant le texte et le multimodal.
★ 3 735+9Évolution des étoiles sur les 7 derniers jours - #40
Moteur de recherche multimodal open source (Morphik Core). Par Morphik — Back-office IA pour les soins infirmiers et les résidences seniors (morphik.ai).
★ 3 710-1Évolution des étoiles sur les 7 derniers jours - #41
Du Chain-of-Thought prompting à OpenAI o1 et DeepSeek-R1 🍓
★ 3 681+3Évolution des étoiles sur les 7 derniers jours - #42
Code et modèles pour l'article ICML 2024, NExT-GPT : un modèle de langage multimodal Any-to-Any.
★ 3 634-2Évolution des étoiles sur les 7 derniers jours - #43
MTEB : Évaluation de pointe des embeddings à travers les langues et les modalités
★ 3 414+5Évolution des étoiles sur les 7 derniers jours - #44
InternGPT (iGPT) est une plateforme de démonstration open source pour présenter facilement vos modèles d'IA. Prend désormais en charge DragGAN, ChatGPT, ImageBind, le chat multimodal type GPT-4, SAM, l'édition d'image interactive, etc. Essayez-le sur igpt.opengvlab.com
★ 3 205+0Évolution des étoiles sur les 7 derniers jours - #45
Framework extensible et de pointe pour la compression en colonnes, et format de fichier en colonnes FOSS le plus rapide. Anciennement chez @spiraldb, désormais projet en incubation au sein de LFAI&Data, partie de la Linux Foundation.
★ 3 171+8Évolution des étoiles sur les 7 derniers jours - #46
Architecture fondamentale pour (M)LLM.
★ 3 139+1Évolution des étoiles sur les 7 derniers jours - #47★ 3 123-1Évolution des étoiles sur les 7 derniers jours
- #48
[NeurIPS 2024] OSWorld : évaluation comparative d'agents multimodaux pour des tâches ouvertes dans des environnements informatiques réels.
★ 3 118+6Évolution des étoiles sur les 7 derniers jours - #49
SDK IA TypeScript typé et agnostique, conçu pour le chat en streaming, l'appel d'outils, les agents et les applications multimodales sur OpenAI, Anthropic, Gemini, React, Vue, Svelte et Solid.
★ 3 057+15Évolution des étoiles sur les 7 derniers jours - #50
InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.
★ 2 925-1Évolution des étoiles sur les 7 derniers jours - #51
Couche de contexte pour données non structurées : jeux de données typés et versionnés sur S3, GCS et Azure.
★ 2 816+5Évolution des étoiles sur les 7 derniers jours - #52
Calculez facilement des embeddings CLIP et construisez un système de recherche basé sur ces derniers.
★ 2 796+1Évolution des étoiles sur les 7 derniers jours - #53
Inférence d'images sans étiquetage (utilisation de modèles de fondation pour entraîner des modèles supervisés).
★ 2 770+3Évolution des étoiles sur les 7 derniers jours - #54
Simplifier le processus de fine-tuning pour les modèles multimodaux : PaliGemma 2, Florence-2 et Qwen2.5-VL
★ 2 695+1Évolution des étoiles sur les 7 derniers jours - #55
[EMNLP-2024] Création d'agents linguistiques multimodaux pour le prototypage rapide et la production
★ 2 666+1Évolution des étoiles sur les 7 derniers jours - #56
Ressources complètes sur l'IA générative, incluant une feuille de route détaillée, des projets, des cas d'utilisation, la préparation aux entretiens et la préparation au codage.
★ 2 610+1Évolution des étoiles sur les 7 derniers jours - #57
Dépôt officiel d'OFA (ICML 2022). Article : OFA : Unifier les architectures, les tâches et les modalités via un framework d'apprentissage séquence-à-séquence simple.
★ 2 557+0Évolution des étoiles sur les 7 derniers jours - #58★ 2 539+0Évolution des étoiles sur les 7 derniers jours
- #59
HuixiangDou : assistance technique basée sur LLM pour les scénarios de discussion de groupe.
★ 2 502+2Évolution des étoiles sur les 7 derniers jours - #60
Une étude sur la génération et la synthèse de texte vers image.
★ 2 444+0Évolution des étoiles sur les 7 derniers jours