跳到主要内容
buildradar
Sign in
主题 · data-pipeline

data-pipeline

标记 data-pipeline 主题、收录中的开源项目,按星标数排序。

项目数
33
总星标数
135,349
平均星标数
4,101
占比
0.01%

常跟 data-pipeline 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 data-pipeline 主题的项目。

  • hflow@Hebbian-Robotics

    Open source SDK for building multimodal data-quality, processing, enrichment, and curation pipelines for robotics and Physical AI.

    143
  • airbyte@airbytehq

    开源数据搬移工具,用于 ELT 流程与 AI 代理——支持 API、数据库与文件至数据仓库、数据湖与 AI 应用,提供自托管与云端方案

    21,981+9近 7 天星标变化
  • 以分布式 SQL 为基础,提供跨所有数据库的分片、可扩展性与安全性,赋能数据智能

    20,788-3近 7 天星标变化
  • debezium@debezium

    支持多种数据库的变更数据捕获。请于 https://github.com/debezium/dbz/issues 回报问题。

    13,072+16近 7 天星标变化
  • rocketride-server@rocketride-org

    高性能 AI 流水线引擎,核心使用 C++,提供 50+ 可用 Python 可扩展节点。可在 IDE 中构建、调试与扩展 LLM 工作流,支持 13+ 模型提供商、8+ 向量数据库与代理编排。包含 VS Code 扩展、TypeScript/Python SDK 与 Docker 部署。

    7,641+270近 7 天星标变化
  • snowplow@snowplow

    客户数据基础设施领袖。

    7,032+2近 7 天星标变化
  • data-juicer@datajuicer

    为基础模型提供数据处理!🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6,975+26近 7 天星标变化
  • flink-cdc@apache

    Flink CDC 是一个流式数据集成工具

    6,469+0近 7 天星标变化
  • whodb@clidey

    数据存取与运营智慧的交汇点

    5,019+2近 7 天星标变化
  • rudder-server@rudderlabs

    以隐私与安全为核心的 Segment 替代方案,使用 Golang 与 React 开发。

    4,483+4近 7 天星标变化
  • 从零开始学习数据工程的实用资源清单

    4,009-2近 7 天星标变化
  • ingestr@bruin-data

    ingestr 是一个 CLI 工具,能用单一命令无缝复制任何数据库之间的数据

    3,935+18近 7 天星标变化
  • dagu@dagucloud

    可自托管的工作流协调器,适用于主要工作非协调的团队。使用YAML描述脚本、SSH命令、容器等;将工作流与业务逻辑分离。单个二进制文件,无数据库,适合有限硬件资源。Airflow/Cron/Job Scheduler的替代方案

    3,832+17近 7 天星标变化
  • memphis@superstreamlabs

    Memphis.dev 是一个高度可扩展且轻松使用的数据流平台

    3,440+0近 7 天星标变化
  • sie@superlinked

    为你的 Agent 所需的所有模型提供开源推理服务器与生产集群。

    3,030+173近 7 天星标变化
  • whylogs@whylabs

    用于机器学习模型和数据管道的开源数据日志库。📚 提供对数据质量和模型长期性能的可见性。🛡️ 支持隐私保护的数据收集,确保安全与鲁棒性。📈

    2,831+0近 7 天星标变化
  • elementary@elementary-data

    专为数据与分析工程师打造的 dbt 原生数据可观测性解决方案。几分钟内即可监控您的数据管道。提供具备高级功能的自托管部署或云服务。

    2,405+4近 7 天星标变化
  • 一个用于 Go 的轻量级流处理库

    2,172+1近 7 天星标变化
  • doit@pydoit

    CLI 任务管理与自动化工具

    2,083-1近 7 天星标变化
  • multiwoven@Multiwoven

    🔥🔥🔥 开源 Reverse ETL —— hightouch 与 census 的替代方案。

    1,673+0近 7 天星标变化
  • olake@datazip-inc

    OLake - 最快的数据库、Kafka 与 S3 复制工具,支持 Apache Iceberg 与表格优化(称为 OLake Fusion)。⚡ 针对实时分析提供高效、快速且具可扩展性的数据导入。支持的来源:Postgres, MongoDB, MySQL, Oracle, MSSql, DB2, Kafka, S3。

    1,435+2近 7 天星标变化
  • data-science-on-gcp@GoogleCloudPlatform

    书籍伴随源码:《Google Cloud Platform 上的数据科学》,Valliappa Lakshmanan 著,O'Reilly 出版,2017 年

    1,429+1近 7 天星标变化
  • duckle@slothflowlabs

    可在您自己的服务器或云端部署的开源 ETL/ELT。基于 DuckDB 打造:无代码/低代码可视化管道或 SQL、385 个组件、dbt、CDC、数据质量、反向 ETL、血缘追踪、供 AI 代理使用的 MCP。没有厂商云端,也没有按行计费。

    1,262+15近 7 天星标变化
  • zerocode@authorjapps

    zerocode-tdd 是一个社区开发、免费、开源、以结果为导向的自动化测试,适用于数据管道、ETL、REST API、Kafka(数据流)、数据库和负载场景。全部定义在简单的 JSON 或YAML 中——零编码。

    1,013+1近 7 天星标变化
  • flow@estuary

    🌊 使用 Estuary 管理数据流,持续将数据所在的系统同步至你_希望_数据存在的系统。 🌊

    972+7近 7 天星标变化
  • seatunnel-web@apache

    SeaTunnel 是一个分布式、高性能的数据集成平台,用于海量数据(离线与实时)的同步与转换。

    877+5近 7 天星标变化
  • klio@spotify

    更聪明的音频数据管道。

    876+2近 7 天星标变化
  • covalent@AgnostiqHQ

    用于异质运算环境中协调机器学习、高性能运算、量子运算工作流程的 Pythonic 工具。

    869+0近 7 天星标变化
  • practical-data-engineering@ssp-data

    实用数据工程:实战房地产项目指南

    823+2近 7 天星标变化
  • conduit@ConduitIO

    Conduit 在数据存储库之间串流数据。Kafka Connect 的替代品。不需要 JVM。

    608+0近 7 天星标变化
  • 精选的开源工具清单,用于分析平台与数据工程生态系统

    604+4近 7 天星标变化
← 返回主题列表