メインコンテンツへスキップ
buildradar
Sign in
トピック · tokenizer

tokenizer

tokenizer がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
27
総スター数
138,329
平均スター数
5,123
シェア
0.01%

tokenizer と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、tokenizer がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • LLMs-from-scratch@rasbt

    PyTorchでChatGPTライクなLLMをゼロから段階的に実装。

    104,010+820直近 7 日のスター増減
  • tokenizer@theseer

    トークン化されたPHPソースコードをXML(およびその他の形式)に変換するための小型ライブラリ。

    5,195+0直近 7 日のスター増減
  • gigatoken@marcelroed

    言語モデルのトークン化をGB/sで実行

    4,067+18直近 7 日のスター増減
  • sqlparse@andialbrecht

    Python用の非検証型SQLパーサーモジュール。

    4,015+1直近 7 日のスター増減
  • chevrotain@Chevrotain

    JavaScript用パーサ構築ツールキット

    2,797+0直近 7 日のスター増減
  • tiktokenizer@dqbd

    OpenAPIトークナイザー向けのオンラインプレイグラウンド

    1,678+4直近 7 日のスター増減
  • hazm@roshan-research

    ペルシャ語 NLP ツールキット

    1,420+3直近 7 日のスター増減
  • natasha@natasha

    基本的なロシア語のNLPタスクを解決し、低レイヤーのNatashaプロジェクト向けAPIを提供するライブラリ

    1,347-1直近 7 日のスター増減
  • stream-json@uhop

    最小限のメモリフットプリントでカスタムの JSON および JSONC 処理パイプラインを構築するためのストリームコンポーネントのマイクロライブラリ — SAX にインスパイアされたトークン API を使用して、Node.js または Web Streams上で利用可能なメモリよりもはるかに大きな JSON をパース、フィルタリング、変換します。

    1,196+1直近 7 日のスター増減
  • soynlp@lovit

    韓国語の自然言語処理用 Python ライブラリ。単語抽出、トークナイザー、品詞タグ付け、前処理機能を提供します。

    991+3直近 7 日のスター増減
  • kagome@ikawaha

    純粋な Go で書かれた、外部依存のない日本語形態素解析器

    980+1直近 7 日のスター増減
  • moo@no-context

    最適化されたトークナイザー/レキサー生成ツール! 🐄 パフォーマンス向上のために /y フラグを使用。

    883+1直近 7 日のスター増減
  • simple@wangfenjin

    中国語とピンインをサポートする SQLite fts5 全文検索拡張機能 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin

    860+0直近 7 日のスター増減
  • gpt-tokenizer@niieani

    OpenAI の GPT モデル(gpt-5、gpt-o*、gpt-4o など)向けの最速 JavaScript BPE トークナイザー エンコーダー デコーダー。追加機能を備えた OpenAI の tiktoken の移植版。

    838+3直近 7 日のスター増減
  • Wordless@BLKSerene

    言語、文学、翻訳研究のための多言語サポートを備えた統合コーパスツール。

    759+1直近 7 日のスター増減
  • Data-Labeling@risesoft-y9

    データアノテーションツールは、テキストデータの処理とアノテーションに特化したツールです。簡素化された迅速なテキストアノテーションプロセスと動的なアルゴリズムフィードバックにより、ユーザーがキーワードを迅速にアノテーションできるようサポートし、アルゴリズムを通じて手動アノテーションのコストと時間を継続的に削減します。アノテーションのプロセスは、まず手動アノテーションによって基礎を構築し、次に自動アノテーションが手動アノテーションにフィードバックを行い、最終的に手動アノテーションによって修正を行うことで、アノテーションの精度と効率を大幅に向上させます。データアノテーションは、人員と役割の管理のためにオープンソースのデジタル基盤に依存しています。

    699+0直近 7 日のスター増減
  • ekphrasis@cbaziotis

    Ekphrasis は、Twitter や Facebook などのソーシャルネットワーク上のテキストに特化したテキスト処理ツールです。2つの大規模コーパス(英語 Wikipedia、英語ツイート3億3千万件)の単語統計を使用し、トークン化、単語の正規化、単語の分割(ハッシュタグ用)、スペル修正を実行します。

    673-1直近 7 日のスター増減
  • open-korean-text@open-korean-text

    オープンソースの韓国語テキスト処理プロセッサ

    669+0直近 7 日のスター増減
  • lindera@lindera

    多言語形態素解析ライブラリ。

    665+4直近 7 日のスター増減
  • jflex@jflex-de

    完全な Unicode をサポートする、Java 向けの高速なスキャナジェネレータ

    633+0直近 7 日のスター増減
  • Deepdive-llama3-from-scratch@therealoliver

    llama3の推論をステップバイステップで実現し、コア概念を理解し、プロセスの導出をマスターし、コードを実装する。

    630-1直近 7 日のスター増減
  • tokenmonster@alasdairforsythe

    Python、Go、C++、Javascript 向けの貪欲でないサブワードトークナイザーおよびボキャブラリートレーナー

    627+0直近 7 日のスター増減
  • php-parser@glayzzle

    🌿 NodeJS PHP Parser - AST やトークンの抽出

    565+1直近 7 日のスター増減
  • js-tokens@lydell

    軽量な JavaScript トークナイザー。

    556+0直近 7 日のスター増減
  • fugashi@polm

    高速でPythonらしい日本語のトークン化と形態素解析を行うためのCython製MeCabラッパー。

    537+1直近 7 日のスター増減
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] 視覚生成と理解のための統合トークナイザー

    530+0直近 7 日のスター増減
  • vscode-blockman@leodevbro

    ネストされたコードブロックをハイライトするVSCode拡張機能

    512-1直近 7 日のスター増減
← トピック一覧に戻る