メインコンテンツへスキップ
buildradar
Sign in
トピック · data-engineering

data-engineering

data-engineering がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

97 件のリポジトリ
  • pyjanitor@pyjanitor-devs

    データクレンジング用のクリーンなAPI。Rパッケージ Janitor の Python 実装

    1,498+0直近 7 日のスター増減
  • data-science-on-gcp@GoogleCloudPlatform

    書籍『Data Science on the Google Cloud Platform』(Valliappa Lakshmanan 著、O'Reilly 2017年) の付属ソースコード。

    1,429+1直近 7 日のスター増減
  • odd-platform@opendatadiscovery

    初のオープンソースデータディスカバリーおよび観測可能性プラットフォーム。データ実務者の作業を簡素化し、ビジネスに集中できるようにします。

    1,427+1直近 7 日のスター増減
  • mlops-python-package@fmind

    MLOpsの取り組みやデータパイプラインを迅速に開始し標準化するための、包括的なPythonパッケージテンプレート

    1,416+0直近 7 日のスター増減
  • 主要テック企業による300件以上のエンジニアリングブログ記事のキュレーションコレクション。トップエンジニアリングチームが大規模な現実世界の課題をどのように解決しているかを学べます。

    1,388+8直近 7 日のスター増減
  • sql-ultimate-course@DataWithBaraa

    実世界の専門家による最も包括的なSQLガイド!基礎から高度なクエリ、最適化、実際のSQLまですべてを学べます

    1,384+7直近 7 日のスター増減
  • quilt@quiltdata

    Quilt は AWS 上の科学データ管理プラットフォームであり、高度にバージョン管理されコンテキストが豊富なデータパッケージを通じて、チームや AI がデータの検索、信頼、再利用を行えるように支援します。

    1,370+0直近 7 日のスター増減
  • duckle@slothflowlabs

    独自のサーバーやクラウドにデプロイできるオープンソースのETL/ELT。DuckDBをベースに構築:ノーコード/ローコードのビジュアルパイプラインまたはSQL、385のコンポーネント、dbt、CDC、データ品質、リバースETL、リネージ、AIエージェント向けMCP。ベンダーのクラウドや行ごとの課金はありません。

    1,262+15直近 7 日のスター増減
  • データ中心型 AI リソースの厳選された(ただし網羅的ではない)リスト。

    1,159+1直近 7 日のスター増減
  • around-dataengineering@abhishek-ch

    データエンジニアリングと機械学習のナレッジハブ

    1,146+0直近 7 日のスター増減
  • Open Data Contract Standard (ODCS) の公式リポジトリ

    1,118+18直近 7 日のスター増減
  • awesome-data-catalogs@opendatadiscovery

    素晴らしいデータカタログとオブザーバビリティプラットフォームのまとめ

    1,068+5直近 7 日のスター増減
  • datacontract-cli@datacontract

    データ契約の強制

    1,060+8直近 7 日のスター増減
  • flow@estuary

    🌊 Estuary を使用してデータフローを管理し、データが存在するシステムと利用したいシステムの間で継続的に同期を実現する 🌊

    972+7直近 7 日のスター増減
  • FlyFish@CloudWise-OpenSource

    FlyFishはデータビジュアライゼーションのコーディングプラットフォームです。簡単な方法で素早くデータモデルを作成し、ドラッグ&ドロップでデータビジュアライゼーションソリューションのセットを素早く生成できます。

    961+0直近 7 日のスター増減
  • SQL Server を使用したモダンなデータウェアハウス構築に関する包括的ガイド(ETL プロセス、データモデリング、分析を含む)

    934+14直近 7 日のスター増減
  • egeria@odpi

    Egeriaコア

    921+0直近 7 日のスター増減
  • スペイン語でのデータエンジニアリングの基本概念、技術的な課題、リソースをまとめたリポジトリ 🧙✨

    896+1直近 7 日のスター増減
  • bacalhau@bacalhau-project

    高速かつ低コストでデータ分散処理を行うための、コミュニティ主導型でシンプルかつ強力なフレームワーク

    871+1直近 7 日のスター増減
  • NeumAI@NeumTry

    Neum AIは、大規模なベクトル埋め込みの作成と同期を管理するためのクラス最高峰のフレームワークです

    867+0直近 7 日のスター増減
  • Udemy コース「The Complete dbt (Data Build Tool) Bootcamp」の補足資料

    827+0直近 7 日のスター増減
  • practical-data-engineering@ssp-data

    実践データエンジニアリング:不動産プロジェクトの実践ガイド

    823+2直近 7 日のスター増減
  • koheesio@Nike-Inc

    効率的なデータパイプラインを構築するためのPythonフレームワーク。モジュール性とコラボレーションを促進し、シンプルで再利用可能なコンポーネントから複雑なパイプラインの作成を可能にします。

    818+0直近 7 日のスター増減
  • altimate-code@AltimateAI

    dbt、SQL、クラウドデータウェアハウス向けのオープンソースのエイジェنت型データエンジニアリングハーネス。100以上のツール、10のデータウェアハウス、AI駆動。

    808+3直近 7 日のスター増減
  • datavines@datavane

    データをより深く理解する!Datavines はメタデータ管理とデータ品質をサポートする次世代データ可観測性プラットフォームです。

    761+1直近 7 日のスター増減
  • bigfunctions@unytics

    BigFunctions で BigQuery をパワーアップ

    759+0直近 7 日のスター増減
  • Failed-ML@kennethleungty

    機械学習プロジェクトの失敗に関する、注目度の高い現実世界の事例集

    751+0直近 7 日のスター増減
  • vectorflow@dgarnitz

    VectorFlow は、生データをインジェストし、ベクトルに変換して任意のベクトル DB に書き込むための高スループットなベクトル埋め込みパイプラインです。

    703+0直近 7 日のスター増減
  • DataFlow-Engine@risesoft-y9

    データフローエンジンは、データ統合、データ同期、データ交換、データ共有、タスク設定、タスクスケジューリングを担う基盤データ駆動エンジンです。管理・実行の分離、マルチストリーム層、プラグインライブラリなどのアーキテクチャを採用し、大規模なデータタスク、高頻度のデータ報告・収集、異種データ互換性などの実際の課題に対応します。

    696+0直近 7 日のスター増減
  • synmetrix@synmetrix

    Synmetrix – Cube をベースにした本番環境対応のオープンソースセマンティックレイヤー

    626+2直近 7 日のスター増減
← トピック一覧に戻る