メインコンテンツへスキップ
buildradar
Sign in
トピック · data-processing

data-processing

data-processing がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
30
総スター数
165,877
平均スター数
5,529
シェア
0.01%

data-processing と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、data-processing がタグ付けされたリポジトリ。

  • marvis-risk-agent@eddyzzl

    MARVIS-Agent: モデル開発、検証、データ処理、特徴量エンジニアリング、戦略ワークフローのための万能な信用リスクエージェント

    518
  • pathway@pathwaycom

    ストリーム処理、リアルタイム分析、LLMパイプライン、RAGのためのPython ETLフレームワーク

    62,365-36直近 7 日のスター増減
  • cocoindex@cocoindex-io

    長期ホライズンエージェントのためのインクリメンタルエンジン 🌟 気に入ったらスターを!

    11,430+48直近 7 日のスター増減
  • データ処理およびLinuxシステムメンテナンスのための便利なBashワンライナーとターミナルトリックのコレクション。

    10,767+5直近 7 日のスター増減
  • miller@johnkerl

    Millerは、CSV、TSV、表形式のJSONなどの名前付きインデックスデータに対するawk、sed、cut、join、sortのようなもの。

    10,005+4直近 7 日のスター増減
  • dasel@TomWright

    JSON、TOML、YAML、XML、INI、HCL、KDL、CSVの統一されたクエリ、変換、および変更。

    8,028+7直近 7 日のスター増減
  • DataFlow@OpenDCAI

    最新のLLMsベースのオペレーターとパイプラインによる簡単なデータ準備。

    7,825+164直近 7 日のスター増減
  • rocketride-server@rocketride-org

    C++コアと50以上のPython拡張ノードを備えた高性能AIパイプラインエンジン。IDEから13以上のモデルプロバイダー、8つ以上のベクトルデータベース、エージェントオーケストレーションを用いてLLMワークフローを構築、デバッグ、スケーリング可能にします。VS Code拡張機能、TypeScript/Python SDK、Dockerデプロイメントが含まれます。

    7,371+416直近 7 日のスター増減
  • data-juicer@datajuicer

    基盤モデルのための、そして基盤モデルを使ったデータ処理! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6,949+28直近 7 日のスター増減
  • DALI@NVIDIA

    データ処理のための高度に最適化されたビルディングブロックと実行エンジンを含むGPUアクセラレーションライブラリであり、ディープラーニングのトレーニングおよび推論アプリケーションを高速化します。

    5,738+4直近 7 日のスター増減
  • smallpond@deepseek-ai

    DuckDB と 3FS を基盤とした軽量なデータ処理フレームワーク

    5,002+5直近 7 日のスター増減
  • pandera@unionai-oss

    軽量で柔軟性があり、表現力豊かな統計データテストライブラリ

    4,443+5直近 7 日のスター増減
  • numaflow@numaproj

    大規模並列データおよびストリーミングジョブを実行するための Kubernetes ネイティブプラットフォーム

    2,827+2直近 7 日のスター増減
  • datachain@datachain-ai

    非構造化データのためのコンテキストレイヤー:S3、GCS、Azure 上の型付き、バージョン管理されたデータセット

    2,811+3直近 7 日のスター増減
  • broadway@elixir-broadway

    Elixirによる並行および多段階のデータ取り込みとデータ処理

    2,677+1直近 7 日のスター増減
  • texar@asyml

    TensorFlow による機械学習、自然言語処理、テキスト生成のためのツールキット。CASL プロジェクトの一部: http://casl-project.ai/

    2,389+0直近 7 日のスター増減
  • bytewax@bytewax

    Python ストリーム処理

    2,048+1直近 7 日のスター増減
  • Curator@NVIDIA-NeMo

    LLM向けのスケーラブルなデータ前処理およびキュレーションツールキット

    1,740+12直近 7 日のスター増減
  • dolma@allenai

    OLMo の事前トレーニングデータを生成および検査するためのデータとツール

    1,538+2直近 7 日のスター増減
  • pyper@pyper-dev

    Python の並行処理をシンプルに

    1,518+0直近 7 日のスター増減
  • data-science-on-gcp@GoogleCloudPlatform

    書籍『Data Science on the Google Cloud Platform』(Valliappa Lakshmanan 著、O'Reilly 2017年) の付属ソースコード。

    1,428+1直近 7 日のスター増減
  • kubetorch@run-house

    機械学習インフラ向け PyTorch のように、Kubernetes 上で AI ワークロードを魔法のように分散および実行します。

    1,224+0直近 7 日のスター増減
  • xidel@benibela

    CSS、XPath 3.0、XQuery 3.0、JSONiq、またはパターンマッチングを使用して、HTML/XMLページやJSON-APIからデータをダウンロードおよび抽出するコマンドラインツール。新規または変換されたXML/HTML/JSONドキュメントの作成も可能。

    843+0直近 7 日のスター増減
  • text-dedup@ChenghaoMou

    オールインワンのテキスト重複排除ツール

    765+0直近 7 日のスター増減
  • hstream@hstreamdb

    HStreamDBは、IoTおよびその先を見据えたオープンソースのクラウドネイティブ・ストリーミングデータベースです。リアルタイムアプリケーション向けにデータスタックをモダン化します。

    722+0直近 7 日のスター増減
  • collapse@fastverse

    R における高度で高速なデータ変換

    705+1直近 7 日のスター増減
  • Apache Kafka に関するリスト

    591+0直近 7 日のスター増減
  • eternal@kousun12

    👾~ 音楽よ、永遠に ~ 👾

    581+1直近 7 日のスター増減
  • synthBTC@jofpin

    高度なモンテカルロシミュレーションとTurbitの並列処理を使用して、Bitcoinの予測シナリオを作成するツール

    526+0直近 7 日のスター増減
  • marvis-risk-agent@eddyzzl

    MARVIS-Agent: モデル開発、検証、データ処理、特徴量エンジニアリング、戦略ワークフローのための万能な信用リスクエージェント

    518+2直近 7 日のスター増減
  • Musoq@Puchaczov

    データベース不要の SQL ランタイム

    505+1直近 7 日のスター増減
← トピック一覧に戻る