data-engineering
Repositorios de código abierto monitorizados etiquetados con data-engineering, ordenados por estrellas.
- #31
SQL Translator es una herramienta para convertir consultas en lenguaje natural en código SQL utilizando inteligencia artificial. Este proyecto es 100% gratuito y de código abierto.
★ 4321+0Variación de estrellas de los últimos 7 días - #32
pandas en AWS - Integración sencilla con Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer y S3 (Parquet, CSV, JSON y EXCEL).
★ 4119+0Variación de estrellas de los últimos 7 días - #33
Una lista de recursos útiles para aprender ingeniería de datos desde cero
★ 4009-2Variación de estrellas de los últimos 7 días - #34★ 3831+0Variación de estrellas de los últimos 7 días
- #35★ 3774+4Variación de estrellas de los últimos 7 días
- #36
Memphis.dev es una plataforma de streaming de datos altamente escalable y fácil de usar.
★ 3440+0Variación de estrellas de los últimos 7 días - #37
Aprende a diseñar, desarrollar, desplegar e iterar aplicaciones de ML listas para producción.
★ 3399+2Variación de estrellas de los últimos 7 días - #38
Reemplazo directo de Apache Spark escrito en Rust, que unifica el procesamiento por lotes, el procesamiento de flujos y las cargas de trabajo de IA intensivas en computación.
★ 3341+4Variación de estrellas de los últimos 7 días - #39
Una lista increíble de proyectos de ingeniería de datos de código abierto
★ 3278+5Variación de estrellas de los últimos 7 días - #40
Apache DevLake es una plataforma de datos de desarrollo de código abierto para ingerir, analizar y visualizar datos fragmentados de herramientas de DevOps, extrayendo información para la excelencia en ingeniería, la experiencia del desarrollador y el crecimiento de la comunidad.
★ 3121+5Variación de estrellas de los últimos 7 días - #41
Aprende a construir tu asistente de IA Second Brain con LLMs, agentes, RAG, fine-tuning, LLMOps y técnicas de sistemas de IA.
★ 3068+9Variación de estrellas de los últimos 7 días - #42
Meltano: el motor de integración de datos declarativo centrado en código que impulsa tus ideas de productos más ambiciosas basadas en datos y ML. Dile adiós a escribir, mantener y escalar tus propias integraciones de API.
★ 2616+2Variación de estrellas de los últimos 7 días - #43
Apache Hamilton ayuda a los científicos de datos e ingenieros a definir flujos de datos comprobables, modulares y autodocumentados que codifican la procedencia, el rastreo y los metadatos. Se ejecuta y escala en cualquier lugar donde lo haga Python.
★ 2584+1Variación de estrellas de los últimos 7 días - #44
Un nuevo SOTA para RAG: una arquitectura de recuperación original y una base de conocimientos de código abierto para humanos y agentes.
★ 2456+20Variación de estrellas de los últimos 7 días - #45
Un servicio de clasificación personalizada de Machine Learning de bajo código para artículos, listados, resultados de búsqueda y recomendaciones que aumenta la participación del usuario. Un motor Learn-to-Rank amigable.
★ 2434+0Variación de estrellas de los últimos 7 días - #46★ 2420-1Variación de estrellas de los últimos 7 días
- #47
Datart es una plataforma abierta de visualización de datos de próxima generación
★ 2303+1Variación de estrellas de los últimos 7 días - #48★ 2048+1Variación de estrellas de los últimos 7 días
- #49
El mejor lugar para aprender ingeniería de datos. Creado y mantenido por la comunidad de ingeniería de datos.
★ 2021+3Variación de estrellas de los últimos 7 días - #50
Feathr – Una plataforma de ingeniería de datos e IA escalable y unificada para empresas
★ 1937+0Variación de estrellas de los últimos 7 días - #51
Una lista curada de recursos increíbles sobre dbt
★ 1722+1Variación de estrellas de los últimos 7 días - #52
Más de 2000 preguntas de entrevista para ingenieros de datos
★ 1721+5Variación de estrellas de los últimos 7 días - #53
MLRun es una plataforma MLOps de código abierto para construir y gestionar rápidamente aplicaciones de ML continuas a lo largo de su ciclo de vida. MLRun se integra en tu entorno de desarrollo y CI/CD, automatizando la entrega de datos de producción, pipelines de ML y aplicaciones en línea.
★ 1694+1Variación de estrellas de los últimos 7 días - #54
🔥🔥🔥 Reverse ETL de código abierto - alternativa a hightouch y census.
★ 1673+0Variación de estrellas de los últimos 7 días - #55
Una lista exhaustiva de más de 180 canales de YouTube sobre ciencia de datos, ingeniería de datos, aprendizaje automático, aprendizaje profundo, informática, programación, ingeniería de software, etc.
★ 1624+1Variación de estrellas de los últimos 7 días - #56
👾 nao es un agente de análisis de código abierto. (1) Crea contexto con la CLI de nao-core, (2) despliega la interfaz de chat de nao para todos.
★ 1600+9Variación de estrellas de los últimos 7 días - #57
:bar_chart: :clipboard: Paneles de control usando archivos YAML o JSON
★ 1582+1Variación de estrellas de los últimos 7 días - #58
ktx es una capa de contexto ejecutable para agentes de datos y análisis 🐙 Permite que Claude Code, Codex u otros agentes de IA consulten bases de datos analíticas con precisión y con el contexto completo de su empresa.
★ 1571+5Variación de estrellas de los últimos 7 días - #59
DataFrames de streaming en Python para Kafka.
★ 1569+1Variación de estrellas de los últimos 7 días - #60★ 1517-1Variación de estrellas de los últimos 7 días