data-extraction
Repositorios de código abierto monitorizados etiquetados con data-extraction, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a data-extraction en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con data-extraction.
- #1
Extractor gratuito y de código abierto para historiales de chat de asistentes de programación por IA. Compatible con Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code y más.
★ 554
- #1
La API de contexto para buscar, extraer e interactuar con la web a gran escala. 🔥
★ 175.781+1747Variación de estrellas de los últimos 7 días - #2
🕷️ ¡Un framework de Web Scraping adaptativo que maneja todo, desde una sola solicitud hasta un rastreo a gran escala!
★ 78.099+941Variación de estrellas de los últimos 7 días - #3
Scraper de Python basado en IA
★ 30.435+388Variación de estrellas de los últimos 7 días - #4
🔥 La plataforma de código abierto sin código para web scraping, rastreo, búsqueda y extracción de datos con IA • Convierte sitios web en API estructuradas en minutos 🔥
★ 17.349+27Variación de estrellas de los últimos 7 días - #5
Lenguaje declarativo de automatización de datos y tiempo de ejecución en Go para flujos de trabajo de extracción estructurada.
★ 6009+1Variación de estrellas de los últimos 7 días - #6★ 5709-3Variación de estrellas de los últimos 7 días
- #7
CLI de automatización de navegadores creado para agentes de IA. Supera los muros anti-bot y transfiere el control a humanos entre plataformas cuando se atasque. Ejecución multitarea en paralelo, operación independiente de múltiples sesiones y navegación aislada en múltiples cuentas.
★ 5549+27Variación de estrellas de los últimos 7 días - #8
Un potente servidor Model Context Protocol (MCP) que ofrece una solución integral para el acceso web público.
★ 2624+10Variación de estrellas de los últimos 7 días - #9
Plataforma de automatización de navegador autoalojada e indetectable. Impulsada por Camoufox (Firefox) para tasas de detección del 0%. Diseñada para velocidad, privacidad y escalabilidad.
★ 2279+7Variación de estrellas de los últimos 7 días - #10
Paquete de Python para extraer datos de recetas de cocina
★ 2218+2Variación de estrellas de los últimos 7 días - #11
ContextGem: Extracción sencilla de LLM a partir de documentos
★ 1996+1Variación de estrellas de los últimos 7 días - #12
Extraer artículos de una URL dada
★ 1911+1Variación de estrellas de los últimos 7 días - #13
:truck: Flujos de trabajo de preparación de datos ágiles facilitados con Pandas, Dask, cuDF, Dask-cuDF, Vaex y PySpark
★ 1536+0Variación de estrellas de los últimos 7 días - #14
Un kit de herramientas de Python potente y apto para principiantes para análisis financiero y automatización, diseñado para hacer que la inversión moderna sea accesible para todos
★ 1391+3Variación de estrellas de los últimos 7 días - #15★ 1353+3Variación de estrellas de los últimos 7 días
- #16
⛏️ El motor de extracción detrás de Maigret: convierte cualquier URL de perfil en un registro OSINT estructurado en más de 150 sitios
★ 1081+5Variación de estrellas de los últimos 7 días - #17
La biblioteca de PDF más rápida para Python y Rust. Extracción de texto, extracción de imágenes, conversión a markdown, creación y edición de PDF. 0.8ms de media, 5 veces más rápida que los líderes del sector, 100% de tasa de éxito en 3,830 archivos PDF. MIT/Apache-2.0.
★ 1015+11Variación de estrellas de los últimos 7 días - #18
Alternativa rápida y ligera a Firecrawl/Tavily escrita en Rust. Web scraper, crawler y API de búsqueda con servidor MCP para agentes de IA. API compatible con Firecrawl (/scrape, /crawl, /search). 2.3 veces más rápido que Tavily y 1.5 veces más rápido que Firecrawl en benchmarks de 1000 URLs. 6 MB de RAM, binario único. Autohospedable o mediante nube gestionada.
★ 952+87Variación de estrellas de los últimos 7 días - #19
Asistente de IA de código abierto y centrado en lo local para tus datos. Unifica tareas, notas, documentos, fotos y marcadores. Privado, autohospedado y extensible mediante APIs.
★ 917+5Variación de estrellas de los últimos 7 días - #20
:newspaper: Deja que ChatGPT resuma Hacker News por ti.
★ 756+0Variación de estrellas de los últimos 7 días - #21
🚜 Analiza texto y tablas desde archivos PDF.
★ 704+0Variación de estrellas de los últimos 7 días - #22
Editor de web scraping impulsado por IA con constructor de flujo de trabajo visual. Crea, prueba y despliega scrapers web usando lenguaje natural. Desarrollado con ScrapeGraphAI y LangGraph.
★ 694+10Variación de estrellas de los últimos 7 días - #23
Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!
★ 686+135Variación de estrellas de los últimos 7 días - #24
Integración de la API de Google Reviews y un scraper escalable para extraer calificaciones, texto de reseñas e información comercial de Google Maps mediante una API estructurada.
★ 594+1Variación de estrellas de los últimos 7 días - #25
Web-scraping indetectable y análisis de HTML fluido en Python.
★ 563+2Variación de estrellas de los últimos 7 días - #26
La página de estado de GitHub faltante: un intento de Flat Data para documentar históricamente los estados de GitHub
★ 561+0Variación de estrellas de los últimos 7 días - #27
Infraestructura web de código abierto para IA. Extrae, rastrea y automatiza la web, limpia Markdown, gestiona sesiones de navegador y prepara datos para tus agentes.
★ 559+0Variación de estrellas de los últimos 7 días - #28
Extractor gratuito y de código abierto para historiales de chat de asistentes de programación por IA. Compatible con Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code y más.
★ 554+5Variación de estrellas de los últimos 7 días