Zum Hauptinhalt springen
buildradar
Sign in
Thema · data-processing

data-processing

Erfasste Open-Source-Repos mit dem Tag data-processing, sortiert nach Sternen.

Repos
30
Sterne gesamt
165.877
Sterne im Schnitt
5.529
Anteil
0,01%

Themen, die häufig gemeinsam mit data-processing am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit data-processing getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • pathway@pathwaycom

    Python‑ETL‑Framework für Stream‑Processing, Echtzeit‑Analyse, LLM‑Pipelines und RAG.

    62.365-36Sterne-Änderung der letzten 7 Tage
  • cocoindex@cocoindex-io

    Inkrementelle Engine für Agenten mit langfristigem Horizont 🌟 Stern geben, wenn es Ihnen gefällt!

    11.430+48Sterne-Änderung der letzten 7 Tage
  • Eine Sammlung nützlicher Bash-Einzeiler und Terminal-Tricks für die Datenverarbeitung und Linux-Systemwartung.

    10.767+5Sterne-Änderung der letzten 7 Tage
  • miller@johnkerl

    Miller ist wie awk, sed, cut, join und sort für namensindexierte Daten wie CSV, TSV und tabellarisches JSON

    10.005+4Sterne-Änderung der letzten 7 Tage
  • dasel@TomWright

    Einheitliche Abfrage, Transformation und Modifikation von JSON, TOML, YAML, XML, INI, HCL, KDL und CSV.

    8.028+7Sterne-Änderung der letzten 7 Tage
  • DataFlow@OpenDCAI

    Einfache Datenaufbereitung mit neuesten LLM-basierten Operatoren und Pipelines.

    7.825+164Sterne-Änderung der letzten 7 Tage
  • rocketride-server@rocketride-org

    Hochleistungs-KI-Pipeline-Engine mit einem C++-Kern und über 50 per Python erweiterbaren Nodes. Erstellen, debuggen und skalieren Sie LLM-Workflows mit über 13 Modellanbietern, über 8 Vektordatenbanken und Agenten-Orchestrierung, alles direkt aus Ihrer IDE. Inklusive VS Code-Erweiterung, TypeScript/Python-SDKs und Docker-Deployment.

    7.371+416Sterne-Änderung der letzten 7 Tage
  • data-juicer@datajuicer

    Datenverarbeitung für und mit Foundation Models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6.949+28Sterne-Änderung der letzten 7 Tage
  • DALI@NVIDIA

    Eine GPU-beschleunigte Bibliothek mit hochoptimierten Bausteinen und einer Ausführungs-Engine für die Datenverarbeitung zur Beschleunigung von Deep-Learning-Training- und Inferenzanwendungen.

    5.738+4Sterne-Änderung der letzten 7 Tage
  • smallpond@deepseek-ai

    Ein leichtgewichtigenes Datenverarbeitungs-Framework, aufgebaut auf DuckDB und 3FS.

    5.002+5Sterne-Änderung der letzten 7 Tage
  • pandera@unionai-oss

    Eine lightweight, flexible und expressive statistische Datentestbibliothek

    4.443+5Sterne-Änderung der letzten 7 Tage
  • numaflow@numaproj

    Kubernetes-native Plattform zur Ausführung massiv paralleler Daten-/Streaming-Jobs

    2.827+2Sterne-Änderung der letzten 7 Tage
  • datachain@datachain-ai

    Die Kontextschicht für unstrukturierte Daten: typisierte, versionierte Datensätze über S3, GCS, Azure

    2.814+3Sterne-Änderung der letzten 7 Tage
  • broadway@elixir-broadway

    Gleichzeitige und mehrstufige Datenerfassung und -verarbeitung mit Elixir

    2.680+1Sterne-Änderung der letzten 7 Tage
  • texar@asyml

    Toolkit für maschinelles Lernen, natürliche Sprachverarbeitung und Textgenerierung in TensorFlow. Dies ist Teil des CASL-Projekts: http://casl-project.ai/

    2.388+0Sterne-Änderung der letzten 7 Tage
  • bytewax@bytewax

    Python-Datenstromverarbeitung

    2.048+1Sterne-Änderung der letzten 7 Tage
  • Curator@NVIDIA-NeMo

    Skalierbares Toolkit zur Datenvorverarbeitung und -kuration für LLMs

    1.742+12Sterne-Änderung der letzten 7 Tage
  • dolma@allenai

    Daten und Werkzeuge zum Generieren und Untersuchen von OLMo-Vortrainingsdaten.

    1.538+2Sterne-Änderung der letzten 7 Tage
  • pyper@pyper-dev

    Nebenläufiges Python leicht gemacht

    1.518+0Sterne-Änderung der letzten 7 Tage
  • data-science-on-gcp@GoogleCloudPlatform

    Quellcode zum Buch: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

    1.429+1Sterne-Änderung der letzten 7 Tage
  • kubetorch@run-house

    KI-Workloads in Python magisch auf Kubernetes verteilen und ausführen, wie PyTorch für ML-Infra.

    1.224+0Sterne-Änderung der letzten 7 Tage
  • xidel@benibela

    Kommandozeilen-Tool zum Herunterladen und Extrahieren von Daten aus HTML/XML-Seiten oder JSON-APIs mittels CSS, XPath 3.0, XQuery 3.0, JSONiq oder Pattern Matching. Es kann zudem neue oder transformierte XML/HTML/JSON-Dokumente erstellen.

    843+0Sterne-Änderung der letzten 7 Tage
  • text-dedup@ChenghaoMou

    Alles-in-Einer-Text-Deduplizierung

    763+0Sterne-Änderung der letzten 7 Tage
  • hstream@hstreamdb

    HStreamDB ist eine Open-Source, Cloud-native Streaming-Datenbank für IoT und darüber hinaus. Modernisieren Sie Ihren Daten-Stack für Echtzeitanwendungen.

    722+0Sterne-Änderung der letzten 7 Tage
  • collapse@fastverse

    Fortgeschrittene und schnelle Datentransformation in R

    705+1Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste rund um Apache Kafka.

    591+0Sterne-Änderung der letzten 7 Tage
  • eternal@kousun12

    👾~ Musik, ewig ~ 👾

    581+1Sterne-Änderung der letzten 7 Tage
  • synthBTC@jofpin

    Ein Tool, das fortschrittliche Monte-Carlo-Simulationen und Turbit-Parallelverarbeitung verwendet, um mögliche Bitcoin-Vorhersageszenarien zu erstellen.

    526+0Sterne-Änderung der letzten 7 Tage
  • marvis-risk-agent@eddyzzl

    MARVIS-Agent: Universeller Kreditrisiko-Agent für Modellentwicklung, Validierung, Datenverarbeitung, Feature Engineering und Strategie-Workflows.

    518+2Sterne-Änderung der letzten 7 Tage
  • Musoq@Puchaczov

    SQL-Runtime ohne Datenbank.

    505+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen