Lompat ke konten utama
buildradar
Sign in
Topik · data-processing

data-processing

Repositori open source terpantau bertanda data-processing, diurutkan berdasarkan bintang.

Repositori
30
Total bintang
165.877
Rata-rata bintang
5.529
Porsi
0,01%

Topik yang sering muncul berdampingan dengan data-processing di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda data-processing.

  • marvis-risk-agent@eddyzzl

    MARVIS-Agent: agen risiko kredit serbaguna untuk pengembangan model, validasi, pemrosesan data, rekayasa fitur, dan alur kerja strategi.

    518
  • pathway@pathwaycom

    Framework ETL Python untuk pemrosesan stream, analitik real-time, pipeline LLM, dan RAG.

    62.365-36Perubahan bintang dalam 7 hari terakhir
  • cocoindex@cocoindex-io

    Mesin inkremental untuk agen berjangka panjang 🌟 Beri bintang jika Anda menyukainya!

    11.430+48Perubahan bintang dalam 7 hari terakhir
  • Kumpulan Bash One-Liner praktis dan trik terminal untuk pemrosesan data serta pemeliharaan sistem Linux.

    10.767+5Perubahan bintang dalam 7 hari terakhir
  • miller@johnkerl

    Miller seperti awk, sed, cut, join, dan sort untuk data berindeks nama seperti CSV, TSV, dan JSON tabular.

    10.005+4Perubahan bintang dalam 7 hari terakhir
  • dasel@TomWright

    Kueri, transformasi, dan modifikasi terpadu untuk JSON, TOML, YAML, XML, INI, HCL, KDL, dan CSV.

    8.028+7Perubahan bintang dalam 7 hari terakhir
  • DataFlow@OpenDCAI

    Persiapan data yang mudah dengan operator dan pipeline berbasis LLM terbaru.

    7.825+164Perubahan bintang dalam 7 hari terakhir
  • rocketride-server@rocketride-org

    Engine AI pipeline berkinerja tinggi dengan core C++ dan 50+ node yang dapat diperluas dengan Python. Buat, debug, dan tingkatkan skala alur kerja LLM dengan 13+ penyedia model, 8+ database vektor, dan orkestrasi agent, semuanya dari IDE Anda. Termasuk ekstensi VS Code, SDK TypeScript/Python, dan penyebaran Docker.

    7.371+416Perubahan bintang dalam 7 hari terakhir
  • data-juicer@datajuicer

    Pemrosesan data untuk dan dengan foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6.949+28Perubahan bintang dalam 7 hari terakhir
  • DALI@NVIDIA

    Pustaka berakselerasi GPU yang berisi blok bangunan yang sangat dioptimalkan dan mesin eksekusi untuk pemrosesan data guna mempercepat aplikasi pelatihan dan inferensi pembelajaran mendalam.

    5.738+4Perubahan bintang dalam 7 hari terakhir
  • smallpond@deepseek-ai

    Framework pemrosesan data ringan yang dibangun di atas DuckDB dan 3FS.

    5.002+5Perubahan bintang dalam 7 hari terakhir
  • pandera@unionai-oss

    Pustaka pengujian data statistik yang ringan, fleksibel, dan ekspresif

    4.443+5Perubahan bintang dalam 7 hari terakhir
  • numaflow@numaproj

    Platform berbasis Kubernetes untuk menjalankan pekerjaan data/streaming yang sangat paralel.

    2.827+2Perubahan bintang dalam 7 hari terakhir
  • datachain@datachain-ai

    Lapisan konteks untuk data tidak terstruktur: dataset bertipe dan berversi di atas S3, GCS, Azure.

    2.811+3Perubahan bintang dalam 7 hari terakhir
  • broadway@elixir-broadway

    Ingesti dan pemrosesan data konkuren serta multi-tahap dengan Elixir

    2.677+1Perubahan bintang dalam 7 hari terakhir
  • texar@asyml

    Toolkit untuk Machine Learning, Natural Language Processing, dan Text Generation di TensorFlow. Ini adalah bagian dari proyek CASL: http://casl-project.ai/

    2.389+0Perubahan bintang dalam 7 hari terakhir
  • bytewax@bytewax

    Pemrosesan Stream Python.

    2.048+1Perubahan bintang dalam 7 hari terakhir
  • Curator@NVIDIA-NeMo

    Toolkit pemrosesan awal dan kurasi data yang dapat diskalakan untuk LLM

    1.740+12Perubahan bintang dalam 7 hari terakhir
  • dolma@allenai

    Data dan alat untuk menghasilkan serta memeriksa data pra-pelatihan OLMo.

    1.538+2Perubahan bintang dalam 7 hari terakhir
  • pyper@pyper-dev

    Python konkurensi dibuat menjadi sederhana

    1.518+0Perubahan bintang dalam 7 hari terakhir
  • data-science-on-gcp@GoogleCloudPlatform

    Kode sumber pendamping buku: Data Science on the Google Cloud Platform, Valliappa Lakshmanan, O'Reilly 2017

    1.428+1Perubahan bintang dalam 7 hari terakhir
  • kubetorch@run-house

    Distribusikan dan jalankan beban kerja AI di Kubernetes secara ajaib dengan Python, seperti PyTorch untuk infrastruktur ML.

    1.224+0Perubahan bintang dalam 7 hari terakhir
  • xidel@benibela

    Alat baris perintah untuk mengunduh dan mengekstrak data dari halaman HTML/XML atau API JSON, menggunakan CSS, XPath 3.0, XQuery 3.0, JSONiq, atau pencocokan pola. Alat ini juga dapat membuat dokumen XML/HTML/JSON baru atau yang telah diubah.

    843+0Perubahan bintang dalam 7 hari terakhir
  • text-dedup@ChenghaoMou

    Deduplikasi teks serbaguna

    765+0Perubahan bintang dalam 7 hari terakhir
  • hstream@hstreamdb

    HStreamDB adalah basis data streaming native cloud sumber terbuka untuk IoT dan sekitarnya. Modernisasi tumpukan data Anda untuk aplikasi waktu nyata.

    722+0Perubahan bintang dalam 7 hari terakhir
  • collapse@fastverse

    Transformasi Data yang Canggih dan Cepat di R

    705+1Perubahan bintang dalam 7 hari terakhir
  • Daftar tentang Apache Kafka

    591+0Perubahan bintang dalam 7 hari terakhir
  • eternal@kousun12

    👾~ musik, abadi ~ 👾

    581+1Perubahan bintang dalam 7 hari terakhir
  • synthBTC@jofpin

    Alat yang menggunakan simulasi Monte Carlo tingkat lanjut dan pemrosesan paralel Turbit untuk membuat skenario prediksi Bitcoin yang mungkin.

    526+0Perubahan bintang dalam 7 hari terakhir
  • marvis-risk-agent@eddyzzl

    MARVIS-Agent: agen risiko kredit serbaguna untuk pengembangan model, validasi, pemrosesan data, rekayasa fitur, dan alur kerja strategi.

    518+2Perubahan bintang dalam 7 hari terakhir
  • Musoq@Puchaczov

    SQL Runtime tanpa database apa pun

    505+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik