tokenizer
Repositorios de código abierto monitorizados etiquetados con tokenizer, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a tokenizer en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con tokenizer.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Implementa un LLM similar a ChatGPT en PyTorch desde cero, paso a paso
★ 104.010+820Variación de estrellas de los últimos 7 días - #2
Una pequeña biblioteca para convertir código fuente PHP tokenizado en XML (y potencialmente otros formatos)
★ 5195+0Variación de estrellas de los últimos 7 días - #3★ 4067+18Variación de estrellas de los últimos 7 días
- #4★ 4015+1Variación de estrellas de los últimos 7 días
- #5
Toolkit de construcción de analizadores sintácticos para JavaScript
★ 2797+0Variación de estrellas de los últimos 7 días - #6
Entorno de pruebas en línea para tokenizadores de OpenAPI
★ 1680+4Variación de estrellas de los últimos 7 días - #7★ 1421+3Variación de estrellas de los últimos 7 días
- #8
Resuelve tareas básicas de PNL en ruso; API para proyectos de Natasha de bajo nivel.
★ 1348-1Variación de estrellas de los últimos 7 días - #9
Una microlibrería de componentes de flujo para construir pipelines de procesamiento de JSON y JSONC personalizados con un uso mínimo de memoria: analiza, filtra y transforma JSON mucho más grandes que la memoria disponible con una API de tokens inspirada en SAX, en Node.js o Web Streams.
★ 1196+1Variación de estrellas de los últimos 7 días - #10
Biblioteca de Python para el procesamiento de lenguaje natural en coreano. Ofrece funciones de extracción de palabras, tokenización, etiquetado gramatical y preprocesamiento.
★ 991+3Variación de estrellas de los últimos 7 días - #11★ 981+1Variación de estrellas de los últimos 7 días
- #12★ 883+1Variación de estrellas de los últimos 7 días
- #13
Extensión de búsqueda de texto completo SQLite fts5 compatible con chino y Pinyin.
★ 860+0Variación de estrellas de los últimos 7 días - #14
El codificador y decodificador BPE Tokenizer de JavaScript más rápido para los modelos GPT de OpenAI (gpt-5, gpt-o*, gpt-4o, etc.). Puerto de tiktoken de OpenAI con funciones adicionales.
★ 839+3Variación de estrellas de los últimos 7 días - #15
Una herramienta de corpus integrada con soporte multilingüe para el estudio del lenguaje, la literatura y la traducción.
★ 759+1Variación de estrellas de los últimos 7 días - #16
Herramienta de anotación de datos especializada en el procesamiento y etiquetado de datos textuales. A través de un flujo de trabajo simplificado y retroalimentación dinámica de algoritmos, permite a los usuarios etiquetar palabras clave rápidamente, reduciendo el costo y el tiempo de la anotación manual. El proceso combina la construcción de una base mediante anotación manual, el refuerzo con anotación automática y la corrección humana, mejorando significativamente la precisión y eficiencia.
★ 699+0Variación de estrellas de los últimos 7 días - #17
Ekphrasis es una herramienta de procesamiento de texto orientada a redes sociales como Twitter o Facebook. Realiza tokenización, normalización de palabras, segmentación (para dividir hashtags) y corrección ortográfica, utilizando estadísticas de palabras de dos grandes corpus (Wikipedia en inglés y 330 millones de tuits en inglés).
★ 673-1Variación de estrellas de los últimos 7 días - #18
Open Korean Text Processor: un procesador de texto en coreano de código abierto.
★ 669+0Variación de estrellas de los últimos 7 días - #19★ 665+4Variación de estrellas de los últimos 7 días
- #20★ 634+0Variación de estrellas de los últimos 7 días
- #21
Realice la inferencia de llama3 paso a paso, comprenda los conceptos básicos, domine la derivación del proceso e implemente el código.
★ 630-1Variación de estrellas de los últimos 7 días - #22
Tokenizador de subpalabras no codicioso y entrenador de vocabulario para Python, Go, C++ y Javascript
★ 627+0Variación de estrellas de los últimos 7 días - #23
Analizador de PHP para NodeJS: extrae AST o tokens.
★ 565+1Variación de estrellas de los últimos 7 días - #24★ 556+0Variación de estrellas de los últimos 7 días
- #25
Un wrapper de Cython para MeCab que permite una tokenización y análisis morfológico del japonés rápido y al estilo Python.
★ 537+1Variación de estrellas de los últimos 7 días - #26
[NeurIPS 2025 Spotlight] Un tokenizador unificado para la generación y comprensión visual.
★ 530+0Variación de estrellas de los últimos 7 días - #27
Extensión de VSCode para resaltar bloques de código anidados.
★ 512-1Variación de estrellas de los últimos 7 días