Saltar al contenido principal
buildradar
Sign in
Tema · tokenizer

tokenizer

Repositorios de código abierto monitorizados etiquetados con tokenizer, ordenados por estrellas.

Repositorios
27
Estrellas totales
138.329
Estrellas de media
5123
Proporción
0,01%

Temas que aparecen con frecuencia junto a tokenizer en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con tokenizer.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • LLMs-from-scratch@rasbt

    Implementa un LLM similar a ChatGPT en PyTorch desde cero, paso a paso

    104.010+820Variación de estrellas de los últimos 7 días
  • tokenizer@theseer

    Una pequeña biblioteca para convertir código fuente PHP tokenizado en XML (y potencialmente otros formatos)

    5195+0Variación de estrellas de los últimos 7 días
  • gigatoken@marcelroed

    Tokenización de modelos de lenguaje a GB/s

    4067+18Variación de estrellas de los últimos 7 días
  • sqlparse@andialbrecht

    Un módulo de análisis sintáctico de SQL no validador para Python

    4015+1Variación de estrellas de los últimos 7 días
  • chevrotain@Chevrotain

    Toolkit de construcción de analizadores sintácticos para JavaScript

    2797+0Variación de estrellas de los últimos 7 días
  • tiktokenizer@dqbd

    Entorno de pruebas en línea para tokenizadores de OpenAPI

    1680+4Variación de estrellas de los últimos 7 días
  • hazm@roshan-research

    Kit de herramientas de PNL en persa

    1421+3Variación de estrellas de los últimos 7 días
  • natasha@natasha

    Resuelve tareas básicas de PNL en ruso; API para proyectos de Natasha de bajo nivel.

    1348-1Variación de estrellas de los últimos 7 días
  • stream-json@uhop

    Una microlibrería de componentes de flujo para construir pipelines de procesamiento de JSON y JSONC personalizados con un uso mínimo de memoria: analiza, filtra y transforma JSON mucho más grandes que la memoria disponible con una API de tokens inspirada en SAX, en Node.js o Web Streams.

    1196+1Variación de estrellas de los últimos 7 días
  • soynlp@lovit

    Biblioteca de Python para el procesamiento de lenguaje natural en coreano. Ofrece funciones de extracción de palabras, tokenización, etiquetado gramatical y preprocesamiento.

    991+3Variación de estrellas de los últimos 7 días
  • kagome@ikawaha

    Analizador morfológico japonés autónomo escrito en Go puro

    981+1Variación de estrellas de los últimos 7 días
  • moo@no-context

    ¡Generador de tokenizador/lexer optimizado! Utiliza /y para mejorar el rendimiento.

    883+1Variación de estrellas de los últimos 7 días
  • simple@wangfenjin

    Extensión de búsqueda de texto completo SQLite fts5 compatible con chino y Pinyin.

    860+0Variación de estrellas de los últimos 7 días
  • gpt-tokenizer@niieani

    El codificador y decodificador BPE Tokenizer de JavaScript más rápido para los modelos GPT de OpenAI (gpt-5, gpt-o*, gpt-4o, etc.). Puerto de tiktoken de OpenAI con funciones adicionales.

    839+3Variación de estrellas de los últimos 7 días
  • Wordless@BLKSerene

    Una herramienta de corpus integrada con soporte multilingüe para el estudio del lenguaje, la literatura y la traducción.

    759+1Variación de estrellas de los últimos 7 días
  • Data-Labeling@risesoft-y9

    Herramienta de anotación de datos especializada en el procesamiento y etiquetado de datos textuales. A través de un flujo de trabajo simplificado y retroalimentación dinámica de algoritmos, permite a los usuarios etiquetar palabras clave rápidamente, reduciendo el costo y el tiempo de la anotación manual. El proceso combina la construcción de una base mediante anotación manual, el refuerzo con anotación automática y la corrección humana, mejorando significativamente la precisión y eficiencia.

    699+0Variación de estrellas de los últimos 7 días
  • ekphrasis@cbaziotis

    Ekphrasis es una herramienta de procesamiento de texto orientada a redes sociales como Twitter o Facebook. Realiza tokenización, normalización de palabras, segmentación (para dividir hashtags) y corrección ortográfica, utilizando estadísticas de palabras de dos grandes corpus (Wikipedia en inglés y 330 millones de tuits en inglés).

    673-1Variación de estrellas de los últimos 7 días
  • open-korean-text@open-korean-text

    Open Korean Text Processor: un procesador de texto en coreano de código abierto.

    669+0Variación de estrellas de los últimos 7 días
  • lindera@lindera

    Una biblioteca de análisis morfológico multilingüe.

    665+4Variación de estrellas de los últimos 7 días
  • jflex@jflex-de

    Generador de escáner rápido para Java™ con soporte completo para Unicode.

    634+0Variación de estrellas de los últimos 7 días
  • Deepdive-llama3-from-scratch@therealoliver

    Realice la inferencia de llama3 paso a paso, comprenda los conceptos básicos, domine la derivación del proceso e implemente el código.

    630-1Variación de estrellas de los últimos 7 días
  • tokenmonster@alasdairforsythe

    Tokenizador de subpalabras no codicioso y entrenador de vocabulario para Python, Go, C++ y Javascript

    627+0Variación de estrellas de los últimos 7 días
  • php-parser@glayzzle

    Analizador de PHP para NodeJS: extrae AST o tokens.

    565+1Variación de estrellas de los últimos 7 días
  • js-tokens@lydell

    Tokenizador de JavaScript pequeño.

    556+0Variación de estrellas de los últimos 7 días
  • fugashi@polm

    Un wrapper de Cython para MeCab que permite una tokenización y análisis morfológico del japonés rápido y al estilo Python.

    537+1Variación de estrellas de los últimos 7 días
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] Un tokenizador unificado para la generación y comprensión visual.

    530+0Variación de estrellas de los últimos 7 días
  • vscode-blockman@leodevbro

    Extensión de VSCode para resaltar bloques de código anidados.

    512-1Variación de estrellas de los últimos 7 días
← Volver a temas