Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · tokenizer

tokenizer

Các kho mã nguồn mở đang theo dõi được gắn thẻ tokenizer, sắp xếp theo số sao.

Kho mã
27
Tổng số sao
138.565
Số sao trung bình
5.132
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng tokenizer trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ tokenizer.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • LLMs-from-scratch@rasbt

    Tự triển khai một LLM giống ChatGPT bằng PyTorch từ đầu, từng bước một

    104.229+360Thay đổi số sao trong 7 ngày qua
  • tokenizer@theseer

    Một thư viện nhỏ để chuyển đổi mã nguồn PHP đã được phân tách (tokenized) thành XML (và có thể là các định dạng khác)

    5.193-2Thay đổi số sao trong 7 ngày qua
  • gigatoken@marcelroed

    Token hóa mô hình ngôn ngữ ở tốc độ GB/s

    4.075+14Thay đổi số sao trong 7 ngày qua
  • sqlparse@andialbrecht

    Một mô-đun phân tích cú pháp SQL không xác thực dành cho Python

    4.016+2Thay đổi số sao trong 7 ngày qua
  • chevrotain@Chevrotain

    Bộ công cụ xây dựng parser cho JavaScript

    2.797+0Thay đổi số sao trong 7 ngày qua
  • tiktokenizer@dqbd

    Môi trường thử nghiệm trực tuyến cho OpenAPI tokenizers

    1.681+3Thay đổi số sao trong 7 ngày qua
  • hazm@roshan-research

    Bộ công cụ NLP tiếng Ba Tư

    1.421+4Thay đổi số sao trong 7 ngày qua
  • natasha@natasha

    Giải quyết các tác vụ NLP tiếng Nga cơ bản, API cho các dự án Natasha cấp độ thấp hơn

    1.348+1Thay đổi số sao trong 7 ngày qua
  • stream-json@uhop

    Một thư viện vi mô gồm các thành phần luồng để xây dựng đường ống xử lý JSON và JSONC tùy chỉnh với dung lượng bộ nhớ tối thiểu — phân tích, lọc và chuyển đổi JSON lớn hơn nhiều so với bộ nhớ khả dụng với API mã thông báo lấy cảm hứng từ SAX, trên Node.js hoặc Web Streams.

    1.196+1Thay đổi số sao trong 7 ngày qua
  • soynlp@lovit

    Thư viện Python dành cho xử lý ngôn ngữ tự nhiên tiếng Hàn. Cung cấp các tính năng trích xuất từ, bộ tách từ, gán nhãn từ loại và tiền xử lý.

    992+1Thay đổi số sao trong 7 ngày qua
  • kagome@ikawaha

    Trình phân tích hình thái tiếng Nhật độc lập được viết bằng Go thuần túy

    981+1Thay đổi số sao trong 7 ngày qua
  • moo@no-context

    Trình tạo tokenizer/lexer được tối ưu hóa! Sử dụng /y để đạt hiệu suất cao.

    883+1Thay đổi số sao trong 7 ngày qua
  • simple@wangfenjin

    Tiện ích mở rộng SQLite fts5 hỗ trợ tìm kiếm toàn văn bản bằng tiếng Trung và Pinyin

    862+1Thay đổi số sao trong 7 ngày qua
  • gpt-tokenizer@niieani

    Bộ mã hóa và giải mã BPE Tokenizer JavaScript nhanh nhất cho các mô hình GPT của OpenAI (gpt-5, gpt-o*, gpt-4o, v.v.). Bản chuyển đổi từ tiktoken của OpenAI với các tính năng bổ sung.

    841+0Thay đổi số sao trong 7 ngày qua
  • Wordless@BLKSerene

    Công cụ ngữ liệu tích hợp hỗ trợ đa ngôn ngữ để nghiên cứu ngôn ngữ, văn học và dịch thuật

    759+0Thay đổi số sao trong 7 ngày qua
  • Data-Labeling@risesoft-y9

    Công cụ gán nhãn dữ liệu chuyên dụng để xử lý và gán nhãn dữ liệu văn bản. Thông qua quy trình gán nhãn nhanh chóng và phản hồi thuật toán động, công cụ hỗ trợ người dùng gán nhãn từ khóa nhanh chóng, đồng thời sử dụng thuật toán để giảm chi phí và thời gian gán nhãn thủ công. Quy trình gán nhãn dữ liệu bắt đầu bằng việc xây dựng nền tảng thủ công, sau đó gán nhãn tự động hỗ trợ lại cho con người, và cuối cùng là hiệu chỉnh thủ công, từ đó cải thiện đáng kể độ chính xác và hiệu quả. Việc gán nhãn dữ liệu cần dựa trên nền tảng số mã nguồn mở để quản lý vị trí nhân sự.

    699+0Thay đổi số sao trong 7 ngày qua
  • ekphrasis@cbaziotis

    Ekphrasis là công cụ xử lý văn bản, hướng tới các văn bản từ mạng xã hội như Twitter hoặc Facebook. Ekphrasis thực hiện tách từ (tokenization), chuẩn hóa từ, phân đoạn từ (để tách hashtag) và sửa lỗi chính tả, sử dụng thống kê từ vựng từ 2 kho dữ liệu lớn (Wikipedia tiếng Anh và 330 triệu tweet tiếng Anh).

    673+0Thay đổi số sao trong 7 ngày qua
  • open-korean-text@open-korean-text

    Open Korean Text Processor - Bộ xử lý văn bản tiếng Hàn mã nguồn mở

    669+0Thay đổi số sao trong 7 ngày qua
  • lindera@lindera

    Thư viện phân tích hình thái đa ngôn ngữ.

    666+3Thay đổi số sao trong 7 ngày qua
  • jflex@jflex-de

    Trình tạo bộ quét nhanh cho Java™ với hỗ trợ Unicode đầy đủ

    634+1Thay đổi số sao trong 7 ngày qua
  • Deepdive-llama3-from-scratch@therealoliver

    Thực hiện suy luận llama3 từng bước, nắm vững các khái niệm cốt lõi, hiểu rõ quá trình suy luận và triển khai mã nguồn.

    630+0Thay đổi số sao trong 7 ngày qua
  • tokenmonster@alasdairforsythe

    Trình huấn luyện từ vựng và tokenizer subword không tham lam cho Python, Go, C++ và Javascript

    627+0Thay đổi số sao trong 7 ngày qua
  • php-parser@glayzzle

    NodeJS PHP Parser - trích xuất AST hoặc token.

    565+1Thay đổi số sao trong 7 ngày qua
  • js-tokens@lydell

    Trình phân tích cú pháp (tokenizer) JavaScript nhỏ gọn

    556+0Thay đổi số sao trong 7 ngày qua
  • fugashi@polm

    Trình bao bọc Cython cho MeCab giúp phân tách từ và phân tích hình thái tiếng Nhật nhanh chóng theo phong cách Python.

    536-1Thay đổi số sao trong 7 ngày qua
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] Bộ mã hóa token thống nhất cho việc tạo và hiểu hình ảnh

    530+0Thay đổi số sao trong 7 ngày qua
  • vscode-blockman@leodevbro

    Tiện ích mở rộng VSCode để làm nổi bật các khối mã lồng nhau

    512+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề