tokenization
Dépôts open source suivis étiquetés tokenization, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de tokenization sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés tokenization.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1★ 33 861+23Évolution des étoiles sur les 7 derniers jours
- #2
🎒 Token-Oriented Object Notation (TOON) – sérialisation compacte et lisible par l'humain des données JSON pour les prompts LLM. SDK TypeScript, CLI et benchmarks.
★ 25 275+55Évolution des étoiles sur les 7 derniers jours - #3★ 4 075+18Évolution des étoiles sur les 7 derniers jours
- #4★ 2 004+0Évolution des étoiles sur les 7 derniers jours
- #5
Coffre-fort sécurisé pour les données clients PII/PHI/PCI/KYC
★ 1 484+1Évolution des étoiles sur les 7 derniers jours - #6
LunaSec - Scanner de sécurité des dépendances qui vous notifie automatiquement des vulnérabilités telles que Log4Shell ou node-ipc dans vos Pull Requests et builds. Protégez-vous en 30 secondes avec l'application GitHub LunaTrace : https://github.com/marketplace/lunatrace-by-lunasec/
★ 1 469+0Évolution des étoiles sur les 7 derniers jours - #7★ 1 119+2Évolution des étoiles sur les 7 derniers jours
- #8
👑 Composants et outils de visualisation spaCy pour les applications Streamlit
★ 860+0Évolution des étoiles sur les 7 derniers jours - #9
Trankit est une boîte à outils Python légère basée sur les Transformers pour le traitement du langage naturel multilingue.
★ 798+2Évolution des étoiles sur les 7 derniers jours - #10
Ekphrasis est un outil de traitement de texte orienté vers les textes issus des réseaux sociaux, tels que Twitter ou Facebook. Ekphrasis effectue la tokenisation, la normalisation des mots, la segmentation des mots (pour la division des hashtags) et la correction orthographique, en utilisant des statistiques de mots provenant de 2 grands corpus (Wikipedia anglais, Twitter - 330 millions de tweets en anglais).
★ 673-1Évolution des étoiles sur les 7 derniers jours - #11
Tokeniseur de sous-mots et entraîneur de vocabulaire non-glouton pour Python, Go, C++ et Javascript
★ 627+0Évolution des étoiles sur les 7 derniers jours - #12
Pipeline de traitement automatique du langage naturel - Division de phrases, tokenisation, lemmatisation, étiquetage morphosyntaxique et analyse syntaxique de dépendances
★ 562+0Évolution des étoiles sur les 7 derniers jours - #13
PHP Text Analysis est une bibliothèque pour effectuer des tâches de recherche d'information (IR) et de traitement du langage naturel (NLP) en PHP
★ 534+0Évolution des étoiles sur les 7 derniers jours