Zum Hauptinhalt springen
buildradar
Sign in
Thema · tokenizer

tokenizer

Erfasste Open-Source-Repos mit dem Tag tokenizer, sortiert nach Sternen.

Repos
27
Sterne gesamt
138.329
Sterne im Schnitt
5.123
Anteil
0,01%

Themen, die häufig gemeinsam mit tokenizer am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit tokenizer getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • LLMs-from-scratch@rasbt

    Implementiere ein ChatGPT-ähnliches LLM in PyTorch von Grund auf, Schritt für Schritt.

    104.010+820Sterne-Änderung der letzten 7 Tage
  • tokenizer@theseer

    Eine kleine Bibliothek zum Konvertieren von tokenisiertem PHP-Quellcode in XML (und potenziell andere Formate)

    5.195+0Sterne-Änderung der letzten 7 Tage
  • gigatoken@marcelroed

    Sprachmodell-Tokenisierung mit GB/s

    4.067+18Sterne-Änderung der letzten 7 Tage
  • sqlparse@andialbrecht

    Ein nicht validierendes SQL-Parser-Modul für Python

    4.015+1Sterne-Änderung der letzten 7 Tage
  • chevrotain@Chevrotain

    Parser-Erstellungs-Toolkit für JavaScript

    2.797+0Sterne-Änderung der letzten 7 Tage
  • tiktokenizer@dqbd

    Online-Spielwiese für OpenAPI-Tokenisierer

    1.678+4Sterne-Änderung der letzten 7 Tage
  • hazm@roshan-research

    Persisches NLP-Toolkit

    1.420+3Sterne-Änderung der letzten 7 Tage
  • natasha@natasha

    Löst grundlegende russische NLP-Aufgaben, API für untere Natasha-Projekt-Ebenen

    1.347-1Sterne-Änderung der letzten 7 Tage
  • stream-json@uhop

    Eine Mikro-Bibliothek aus Stream-Komponenten zum Erstellen benutzerdefinierter JSON- und JSONC-Verarbeitungspipelines mit minimalem Speicherbedarf – parsen, filtern und transformieren Sie JSON, das viel größer als der verfügbare Speicher ist, mit einer SAX-inspirierten Token-API auf Node.js oder Web Streams.

    1.196+1Sterne-Änderung der letzten 7 Tage
  • soynlp@lovit

    Python-Bibliothek für die koreanische Natürliche-Sprachen-Verarbeitung (NLP). Bietet Funktionen für Worterkennung, Tokenisierung, POS-Tagging und Vorverarbeitung.

    991+3Sterne-Änderung der letzten 7 Tage
  • kagome@ikawaha

    Eigenständiger japanischer morphologischer Analysator, geschrieben in reinem Go

    981+1Sterne-Änderung der letzten 7 Tage
  • moo@no-context

    Optimierter Tokenizer-/Lexer-Generator! 🐄 Nutzt /y für mehr Performance. Muh.

    883+1Sterne-Änderung der letzten 7 Tage
  • simple@wangfenjin

    Eine SQLite3 fts5 Tokenizer-Erweiterung mit Unterstützung für Chinesisch und PinYin | Ein SQLite3 fts5 Tokenizer, der Chinesisch und PinYin unterstützt

    860+0Sterne-Änderung der letzten 7 Tage
  • gpt-tokenizer@niieani

    Der schnellste JavaScript BPE Tokenizer Encoder Decoder für die GPT-Modelle von OpenAI (gpt-5, gpt-o*, gpt-4o etc.). Portierung von OpenAIs tiktoken mit zusätzlichen Funktionen.

    839+3Sterne-Änderung der letzten 7 Tage
  • Wordless@BLKSerene

    Ein integriertes Korpus-Tool mit mehrsprachiger Unterstützung für das Studium von Sprache, Literatur und Übersetzung.

    759+1Sterne-Änderung der letzten 7 Tage
  • Data-Labeling@risesoft-y9

    Ein Tool zur Textdatenannotation, das durch effiziente Workflows und algorithmisches Feedback den manuellen Aufwand reduziert. Der Prozess kombiniert manuelle Annotation mit automatischer Unterstützung und Korrektur, um die Präzision zu steigern. Erfordert eine Open-Source-Basis für das Rollenmanagement.

    699+0Sterne-Änderung der letzten 7 Tage
  • ekphrasis@cbaziotis

    Ekphrasis ist ein Textverarbeitungswerkzeug für Texte aus sozialen Netzwerken wie Twitter oder Facebook. Es führt Tokenisierung, Wortnormalisierung, Wortsegmentierung (zum Aufteilen von Hashtags) und Rechtschreibkorrektur durch, basierend auf Wortstatistiken aus zwei großen Korpora (englische Wikipedia, Twitter mit 330 Millionen englischen Tweets).

    673-1Sterne-Änderung der letzten 7 Tage
  • open-korean-text@open-korean-text

    Open Korean Text Processor – Ein Open-Source-Prozessor für koreanischen Text

    669+0Sterne-Änderung der letzten 7 Tage
  • lindera@lindera

    Eine mehrsprachige morphologische Analysebibliothek.

    665+4Sterne-Änderung der letzten 7 Tage
  • jflex@jflex-de

    Der schnelle Scanner-Generator für Java™ mit voller Unicode-Unterstützung

    634+0Sterne-Änderung der letzten 7 Tage
  • Deepdive-llama3-from-scratch@therealoliver

    Schritt-für-Schritt-Implementierung der llama3-Inferenz, Verständnis der Kernkonzepte, Beherrschung der Prozessableitung und Implementierung des Codes.

    630-1Sterne-Änderung der letzten 7 Tage
  • tokenmonster@alasdairforsythe

    Nicht-gieriger Subword-Tokenizer und Vokabultrainer für Python, Go, C++ und JavaScript

    627+0Sterne-Änderung der letzten 7 Tage
  • php-parser@glayzzle

    NodeJS PHP Parser – Extraktion von AST oder Tokens

    565+1Sterne-Änderung der letzten 7 Tage
  • js-tokens@lydell

    Ein kompakter JavaScript-Tokenizer.

    556+0Sterne-Änderung der letzten 7 Tage
  • fugashi@polm

    Ein Cython-MeCab-Wrapper für schnelle, pythonische japanische Tokenisierung und morphologische Analyse.

    537+1Sterne-Änderung der letzten 7 Tage
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] Ein vereinheitlichter Tokenizer für visuelle Generierung und Verständnis

    530+0Sterne-Änderung der letzten 7 Tage
  • vscode-blockman@leodevbro

    VSCode-Erweiterung zur Hervorhebung verschachtelter Codeblöcke.

    512-1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen