跳到主要內容
buildradar
Sign in
主題 · data-processing

data-processing

標記 data-processing 主題、收錄中的開源專案,依星數排序。

專案數
30
總星數
165,877
平均星數
5,529
佔比
0.01%

常跟 data-processing 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 data-processing 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • pathway@pathwaycom

    用於串流處理、即時分析、LLM 管道與 RAG 的 Python ETL 框架。

    62,365-36近 7 天星數變化
  • cocoindex@cocoindex-io

    長期規劃代理的增量引擎 🌟 喜歡請點星

    11,430+48近 7 天星數變化
  • 收集實用的 Bash 單行指令與終端技巧,用於資料處理與 Linux 系統維護。

    10,767+5近 7 天星數變化
  • miller@johnkerl

    Miller 如同 awk、sed、cut、join、sort,專為 CSV、TSV 與表格化 JSON 等名稱索引資料設計。

    10,005+4近 7 天星數變化
  • dasel@TomWright

    統一查詢、轉換與修改 JSON、TOML、YAML、XML、INI、HCL、KDL 與 CSV 的工具

    8,028+7近 7 天星數變化
  • DataFlow@OpenDCAI

    使用最新 LLM 為基礎的運算子與管線,輕鬆進行資料前處理

    7,825+164近 7 天星數變化
  • rocketride-server@rocketride-org

    高效能 AI 流程引擎,核心使用 C++,提供 50+ 可用 Python 擴充節點。可在 IDE 中構建、除錯與擴展 LLM 工作流,支援 13+ 模型供應商、8+ 向量資料庫與代理協調。包含 VS Code 擴充、TypeScript/Python SDK 與 Docker 部署。

    7,371+416近 7 天星數變化
  • data-juicer@datajuicer

    為基礎模型提供資料處理!🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6,949+28近 7 天星數變化
  • DALI@NVIDIA

    GPU 加速函式庫,提供高度最佳化的建構模組與執行引擎,用於資料處理以加速深度學習訓練與推論應用。

    5,738+4近 7 天星數變化
  • smallpond@deepseek-ai

    基於 DuckDB 與 3FS 的輕量級資料處理框架

    5,002+5近 7 天星數變化
  • pandera@unionai-oss

    一個輕量、靈活且表達力強的統計資料測試庫

    4,446+5近 7 天星數變化
  • numaflow@numaproj

    用於執行大規模平行資料/串流作業的 Kubernetes 原生平台

    2,827+2近 7 天星數變化
  • datachain@datachain-ai

    非結構化資料的 Context 層:基於 S3、GCS、Azure 的具型別、具版本控制資料集

    2,814+3近 7 天星數變化
  • broadway@elixir-broadway

    使用 Elixir 進行並行與多階段的資料攝取與資料處理

    2,680+1近 7 天星數變化
  • texar@asyml

    使用 TensorFlow 的機器學習、自然語言處理與文字生成工具包。這是 CASL 專案的一部分:http://casl-project.ai/

    2,388+0近 7 天星數變化
  • bytewax@bytewax

    Python 資料流處理

    2,048+1近 7 天星數變化
  • Curator@NVIDIA-NeMo

    針對 LLM 的可擴展資料前處理與整理工具包

    1,742+12近 7 天星數變化
  • dolma@allenai

    用於產生與檢查 OLMo 預訓練資料的資料與工具。

    1,538+2近 7 天星數變化
  • pyper@pyper-dev

    讓並行 Python 變得簡單

    1,518+0近 7 天星數變化
  • data-science-on-gcp@GoogleCloudPlatform

    書籍伴隨原始碼:《Google Cloud Platform 上的資料科學》,Valliappa Lakshmanan 著,O'Reilly 出版,2017 年

    1,429+1近 7 天星數變化
  • kubetorch@run-house

    在 Kubernetes 上以 Python 神奇地分發並執行 AI 工作負載,就像用於 ML 基礎設施的 PyTorch 一樣。

    1,224+0近 7 天星數變化
  • xidel@benibela

    使用 CSS、XPath 3.0、XQuery 3.0、JSONiq 或模式比對從 HTML/XML 頁面或 JSON-API 下載並擷取資料的命令列工具。它也可以建立新或轉換後的 XML/HTML/JSON 文件。

    843+0近 7 天星數變化
  • text-dedup@ChenghaoMou

    全功能文字去重複工具

    763+0近 7 天星數變化
  • hstream@hstreamdb

    HStreamDB 是一個用於物聯網及其他領域的開源雲原生串流資料庫。為即時應用程式現代化您的資料堆疊。

    722+0近 7 天星數變化
  • collapse@fastverse

    R 語言中的進階與快速資料轉換

    705+1近 7 天星數變化
  • 關於 Apache Kafka 的列表

    591+0近 7 天星數變化
  • eternal@kousun12

    👾~ 音樂,永恆 ~ 👾

    581+1近 7 天星數變化
  • synthBTC@jofpin

    利用先進蒙地卡羅模擬與 Turbit 平行處理技術,建立比特幣預測情境的工具。

    526+0近 7 天星數變化
  • marvis-risk-agent@eddyzzl

    MARVIS-Agent:用於模型開發、驗證、資料處理、特徵工程與策略工作流程的全能信用風險代理

    518+2近 7 天星數變化
  • Musoq@Puchaczov

    無需任何資料庫的 SQL 執行環境

    505+1近 7 天星數變化
← 返回主題列表