Aller au contenu principal
buildradar
Sign in
Sujet · dataset

dataset

Dépôts open source suivis étiquetés dataset, triés par étoiles.

Dépôts
148
Total d'étoiles
831 242
Étoiles en moyenne
5 617
Part
0,04%

Sujets qui apparaissent souvent aux côtés de dataset sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés dataset.

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • public-apis@public-apis

    Une liste collective d'API gratuites

    474 657+1 881Évolution des étoiles sur les 7 derniers jours
  • label-studio@HumanSignal

    Label Studio est un outil d'étiquetage et d'annotation de données multi-types avec un format de sortie standardisé.

    28 191+29Évolution des étoiles sur les 7 derniers jours
  • exercises-dataset@hasaneyldrm

    Jeu de données de 1 324 exercices de fitness : GIFs animés, vignettes 180×180, données sur les groupes musculaires et équipements, et instructions étape par étape en 6 langues. La couche de données d'exercices derrière l'application LogPress.

    21 288+201Évolution des étoiles sur les 7 derniers jours
  • faker@joke2k

    Faker est un package Python qui génère des données fictives.

    19 386+3Évolution des étoiles sur les 7 derniers jours
  • cvat@cvat-ai

    Computer Vision Annotation Tool (CVAT) est une plateforme de premier plan pour la création de jeux de données visuels de haute qualité pour l'IA. Elle propose des produits open-source, cloud et entreprise, ainsi que des services d'étiquetage pour les images, vidéos et annotations 3D, incluant l'assistance par IA, l'assurance qualité, la collaboration d'équipe, l'analyse et des API développeur.

    16 636+18Évolution des étoiles sur les 7 derniers jours
  • LaTeX-OCR@lukas-blecher

    pix2tex : Utilisation d'un ViT pour convertir des images d'équations en code LaTeX.

    16 549+0Évolution des étoiles sur les 7 derniers jours
  • easy-dataset@ConardLi

    Un outil puissant pour créer des jeux de données destinés au fine-tuning de LLM, au RAG et à l'évaluation.

    14 874+20Évolution des étoiles sur les 7 derniers jours
  • doccano@doccano

    Outil d'annotation open source pour les praticiens du machine learning.

    10 762+2Évolution des étoiles sur les 7 derniers jours
  • techniques@satellite-image-deep-learning

    Techniques d'apprentissage profond pour l'imagerie satellite et aérienne.

    10 241+1Évolution des étoiles sur les 7 derniers jours
  • Corpus à grande échelle pour le traitement du langage naturel en chinois

    9 912+2Évolution des étoiles sur les 7 derniers jours
  • Données de compatibilité des navigateurs pour les technologies Web telles qu'affichées sur MDN

    5 736+6Évolution des étoiles sur les 7 derniers jours
  • Collection de modèles NLP chinois pré-entraînés de haute qualité, incluant des grands modèles, des modèles multimodaux et des grands modèles de langage.

    5 584+2Évolution des étoiles sur les 7 derniers jours
  • Liste organisée de jeux de données et d'outils pour le post-entraînement.

    4 760+1Évolution des étoiles sur les 7 derniers jours
  • esProc@SPLWare

    esProc SPL est un langage de programmation basé sur la JVM conçu pour le calcul de données structurées, servant à la fois d'outil d'analyse de données et de moteur de calcul embarqué.

    4 686+2Évolution des étoiles sur les 7 derniers jours
  • transformer@hyunwoongko

    Transformer : implémentation PyTorch de "Attention Is All You Need"

    4 651+3Évolution des étoiles sur les 7 derniers jours
  • datasets@tensorflow

    TFDS est une collection de jeux de données prêts à l'emploi avec TensorFlow, Jax, etc.

    4 583+2Évolution des étoiles sur les 7 derniers jours
  • img2dataset@rom1504

    Transformez facilement de grands ensembles d'URL d'images en un jeu de données. Capable de télécharger, redimensionner et empaqueter 100 millions d'URL en 20 heures sur une seule machine.

    4 445+2Évolution des étoiles sur les 7 derniers jours
  • Corpus de noms chinois et générateur de noms. Inclut noms de famille, prénoms, titres, noms japonais et traductions. Utilisable pour la segmentation de texte et la reconnaissance d'entités nommées.

    4 328+1Évolution des étoiles sur les 7 derniers jours
  • sql-translator@whoiskatrin

    SQL Translator est un outil permettant de convertir des requêtes en langage naturel en code SQL grâce à l'intelligence artificielle. Ce projet est 100 % gratuit et open source.

    4 321+0Évolution des étoiles sur les 7 derniers jours
  • CLUE@CLUEbenchmark

    Benchmark d'évaluation de la compréhension du langage chinois : jeux de données, lignes de base, modèles pré-entraînés, corpus et classement.

    4 278-1Évolution des étoiles sur les 7 derniers jours
  • La plus grande base de données et collection d'articles sur la détection des défauts industriels, avec une synthèse continue des jeux de données open source et des recherches majeures dans le domaine.

    4 104+1Évolution des étoiles sur les 7 derniers jours
  • csghub@OpenCSGs

    CSGHub est une nouvelle plateforme open source pour la gestion des LLM, développée par l'équipe OpenCSG. Elle propose des solutions open source, sur site et SaaS, avec des fonctionnalités comparables à Hugging Face. Gardez le contrôle total sur le cycle de vie des LLM, des jeux de données et des agents, avec une compatibilité SDK Python avec Hugging Face.

    4 104+3Évolution des étoiles sur les 7 derniers jours
  • Liste d'articles et jeux de données pour la détection industrielle d'anomalies et de défauts sur images (mise à jour continue).

    3 756+7Évolution des étoiles sur les 7 derniers jours
  • Générateur de données synthétiques pour la reconnaissance de texte

    3 693+2Évolution des étoiles sur les 7 derniers jours
  • dataset@linhandev

    Index des jeux de données d'imagerie médicale.

    3 606+1Évolution des étoiles sur les 7 derniers jours
  • StringZilla@ashvardanian

    Chaînes de caractères jusqu'à 100 fois plus rapides pour C, C++, CUDA, Python, Rust, Swift, JS et Go, utilisant NEON, AVX2, AVX-512, SVE, GPGPU et SWAR pour accélérer la recherche, le hachage, le tri, les distances d'édition, les sketches et les opérations mémoire 🦖

    3 549+6Évolution des étoiles sur les 7 derniers jours
  • waymo-open-dataset@waymo-research

    Jeu de données ouvert Waymo

    3 404+4Évolution des étoiles sur les 7 derniers jours
  • Extraction de données depuis une large gamme de sources Internet vers un DataFrame pandas.

    3 240+2Évolution des étoiles sur les 7 derniers jours
  • color-names@meodai

    Une large liste de noms de couleurs sélectionnés à la main 🌈

    2 987+3Évolution des étoiles sur les 7 derniers jours
  • whylogs@whylabs

    Une bibliothèque open-source de journalisation de données pour les modèles de machine learning et les pipelines de données. Offre une visibilité sur la qualité des données et les performances des modèles dans le temps. Prend en charge la collecte de données préservant la confidentialité, garantissant sécurité et robustesse.

    2 831+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets