Pular para o conteúdo principal
buildradar
Sign in
Tópico · tokenizer

tokenizer

Repositórios de código aberto acompanhados marcados com tokenizer, ordenados por estrelas.

Repositórios
27
Total de estrelas
138.329
Média de estrelas
5.123
Participação
0,01%

Tópicos que aparecem com frequência ao lado de tokenizer no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com tokenizer.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • LLMs-from-scratch@rasbt

    Implemente um LLM semelhante ao ChatGPT em PyTorch do zero, passo a passo

    104.010+820Variação de estrelas nos últimos 7 dias
  • tokenizer@theseer

    Uma pequena biblioteca para converter código-fonte PHP tokenizado em XML (e potencialmente outros formatos).

    5.195+0Variação de estrelas nos últimos 7 dias
  • gigatoken@marcelroed

    Tokenização de modelos de linguagem a GB/s

    4.067+18Variação de estrelas nos últimos 7 dias
  • sqlparse@andialbrecht

    Um módulo de análise de SQL não validante para Python

    4.015+1Variação de estrelas nos últimos 7 dias
  • chevrotain@Chevrotain

    Kit de ferramentas para construção de parsers em JavaScript

    2.797+0Variação de estrelas nos últimos 7 dias
  • tiktokenizer@dqbd

    Playground online para tokenizadores OpenAPI

    1.678+4Variação de estrelas nos últimos 7 dias
  • hazm@roshan-research

    Toolkit de PLN para persa.

    1.420+3Variação de estrelas nos últimos 7 dias
  • natasha@natasha

    Resolve tarefas básicas de PLN em russo, API para projetos Natasha de baixo nível.

    1.347-1Variação de estrelas nos últimos 7 dias
  • stream-json@uhop

    Uma microlib de componentes de fluxo para construir pipelines de processamento JSON e JSONC personalizados com consumo mínimo de memória — analise, filtre e transforme JSON muito maior do que a memória disponível com uma API de tokens inspirada em SAX, no Node.js ou Web Streams.

    1.196+1Variação de estrelas nos últimos 7 dias
  • soynlp@lovit

    Biblioteca Python para processamento de linguagem natural em coreano. Fornece recursos de extração de palavras, tokenizador, etiquetagem de parte do discurso (POS) e pré-processamento.

    991+3Variação de estrelas nos últimos 7 dias
  • kagome@ikawaha

    Analisador morfológico japonês autossuficiente escrito em Go puro

    980+1Variação de estrelas nos últimos 7 dias
  • moo@no-context

    Gerador de tokenizer/lexer otimizado! 🐄 Usa /y para desempenho. Moo.

    883+1Variação de estrelas nos últimos 7 dias
  • simple@wangfenjin

    Extensão de busca de texto completo SQLite fts5 com suporte a chinês e Pinyin

    860+0Variação de estrelas nos últimos 7 dias
  • gpt-tokenizer@niieani

    O codificador e decodificador BPE Tokenizer em JavaScript mais rápido para os modelos GPT da OpenAI (gpt-5, gpt-o*, gpt-4o, etc.). Versão portada do tiktoken da OpenAI com recursos adicionais.

    838+3Variação de estrelas nos últimos 7 dias
  • Wordless@BLKSerene

    Uma ferramenta de corpus integrada com suporte multilíngue para o estudo de linguagem, literatura e tradução

    759+1Variação de estrelas nos últimos 7 dias
  • Data-Labeling@risesoft-y9

    Ferramenta de anotação de dados especializada no processamento e rotulagem de dados de texto. Através de fluxos de trabalho simplificados e feedback algorítmico dinâmico, permite que os usuários rotulem palavras-chave rapidamente, reduzindo custos e tempo de anotação manual. O processo combina anotação manual inicial, rotulagem automática e correção humana para aumentar a precisão e a eficiência.

    699+0Variação de estrelas nos últimos 7 dias
  • ekphrasis@cbaziotis

    O Ekphrasis é uma ferramenta de processamento de texto voltada para textos de redes sociais, como Twitter ou Facebook. O Ekphrasis realiza tokenização, normalização de palavras, segmentação de palavras (para divisão de hashtags) e correção ortográfica, utilizando estatísticas de palavras de dois grandes corpora (Wikipedia em inglês, Twitter - 330 milhões de tweets em inglês).

    673-1Variação de estrelas nos últimos 7 dias
  • open-korean-text@open-korean-text

    Processador de Texto Coreano Aberto - Um processador de texto coreano de código aberto

    669+0Variação de estrelas nos últimos 7 dias
  • lindera@lindera

    Uma biblioteca multilíngue de análise morfológica.

    665+4Variação de estrelas nos últimos 7 dias
  • jflex@jflex-de

    O gerador de analisadores rápidos para Java™ com suporte completo a Unicode

    633+0Variação de estrelas nos últimos 7 dias
  • Deepdive-llama3-from-scratch@therealoliver

    Implemente a inferência do llama3 passo a passo, compreenda os conceitos centrais, domine a derivação do processo e escreva o código.

    630-1Variação de estrelas nos últimos 7 dias
  • tokenmonster@alasdairforsythe

    Tokenizador de subpalavras não guloso e treinador de vocabulário para Python, Go, C++ e Javascript

    627+0Variação de estrelas nos últimos 7 dias
  • php-parser@glayzzle

    :herb: NodeJS PHP Parser - extraia AST ou tokens

    565+1Variação de estrelas nos últimos 7 dias
  • js-tokens@lydell

    Tokenizador JavaScript minúsculo.

    556+0Variação de estrelas nos últimos 7 dias
  • fugashi@polm

    Um wrapper Cython para o MeCab, permitindo tokenização e análise morfológica em japonês rápidas e no estilo Python.

    537+1Variação de estrelas nos últimos 7 dias
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] Um Tokenizador Unificado para Geração e Compreensão Visual

    530+0Variação de estrelas nos últimos 7 dias
  • vscode-blockman@leodevbro

    Extensão do VSCode para destacar blocos de código aninhados

    512-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos