Saltar al contenido principal
buildradar
Sign in
Tema · data-extraction

data-extraction

Repositorios de código abierto monitorizados etiquetados con data-extraction, ordenados por estrellas.

Repositorios
28
Estrellas totales
343.727
Estrellas de media
12.276
Proporción
0,02%

Temas que aparecen con frecuencia junto a data-extraction en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con data-extraction.

  • ai-data-extractor@bawadou

    Extractor gratuito y de código abierto para historiales de chat de asistentes de programación por IA. Compatible con Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code y más.

    554
  • firecrawl@firecrawl

    La API de contexto para buscar, extraer e interactuar con la web a gran escala. 🔥

    175.781+1747Variación de estrellas de los últimos 7 días
  • Scrapling@D4Vinci

    🕷️ ¡Un framework de Web Scraping adaptativo que maneja todo, desde una sola solicitud hasta un rastreo a gran escala!

    78.099+941Variación de estrellas de los últimos 7 días
  • Scrapegraph-ai@ScrapeGraphAI

    Scraper de Python basado en IA

    30.435+388Variación de estrellas de los últimos 7 días
  • maxun@getmaxun

    🔥 La plataforma de código abierto sin código para web scraping, rastreo, búsqueda y extracción de datos con IA • Convierte sitios web en API estructuradas en minutos 🔥

    17.349+27Variación de estrellas de los últimos 7 días
  • ferret@MontFerret

    Lenguaje declarativo de automatización de datos y tiempo de ejecución en Go para flujos de trabajo de extracción estructurada.

    6009+1Variación de estrellas de los últimos 7 días
  • flashtext@vi3k6i5

    Extraer palabras clave de oraciones o reemplazarlas en ellas.

    5709-3Variación de estrellas de los últimos 7 días
  • skills@browser-act

    CLI de automatización de navegadores creado para agentes de IA. Supera los muros anti-bot y transfiere el control a humanos entre plataformas cuando se atasque. Ejecución multitarea en paralelo, operación independiente de múltiples sesiones y navegación aislada en múltiples cuentas.

    5549+27Variación de estrellas de los últimos 7 días
  • brightdata-mcp@brightdata

    Un potente servidor Model Context Protocol (MCP) que ofrece una solución integral para el acceso web público.

    2624+10Variación de estrellas de los últimos 7 días
  • HeadlessX@saifyxpro

    Plataforma de automatización de navegador autoalojada e indetectable. Impulsada por Camoufox (Firefox) para tasas de detección del 0%. Diseñada para velocidad, privacidad y escalabilidad.

    2279+7Variación de estrellas de los últimos 7 días
  • recipe-scrapers@hhursev

    Paquete de Python para extraer datos de recetas de cocina

    2218+2Variación de estrellas de los últimos 7 días
  • contextgem@shcherbak-ai

    ContextGem: Extracción sencilla de LLM a partir de documentos

    1996+1Variación de estrellas de los últimos 7 días
  • article-extractor@extractus

    Extraer artículos de una URL dada

    1911+1Variación de estrellas de los últimos 7 días
  • optimus@hi-primus

    :truck: Flujos de trabajo de preparación de datos ágiles facilitados con Pandas, Dask, cuDF, Dask-cuDF, Vaex y PySpark

    1536+0Variación de estrellas de los últimos 7 días
  • vnstock@thinh-vu

    Un kit de herramientas de Python potente y apto para principiantes para análisis financiero y automatización, diseñado para hacer que la inversión moderna sea accesible para todos

    1391+3Variación de estrellas de los últimos 7 días
  • parsera@raznem

    Biblioteca ligera para extraer (scraping) sitios web con LLM.

    1353+3Variación de estrellas de los últimos 7 días
  • socid-extractor@soxoj

    ⛏️ El motor de extracción detrás de Maigret: convierte cualquier URL de perfil en un registro OSINT estructurado en más de 150 sitios

    1081+5Variación de estrellas de los últimos 7 días
  • pdf_oxide@yfedoseev

    La biblioteca de PDF más rápida para Python y Rust. Extracción de texto, extracción de imágenes, conversión a markdown, creación y edición de PDF. 0.8ms de media, 5 veces más rápida que los líderes del sector, 100% de tasa de éxito en 3,830 archivos PDF. MIT/Apache-2.0.

    1015+11Variación de estrellas de los últimos 7 días
  • crw@us

    Alternativa rápida y ligera a Firecrawl/Tavily escrita en Rust. Web scraper, crawler y API de búsqueda con servidor MCP para agentes de IA. API compatible con Firecrawl (/scrape, /crawl, /search). 2.3 veces más rápido que Tavily y 1.5 veces más rápido que Firecrawl en benchmarks de 1000 URLs. 6 MB de RAM, binario único. Autohospedable o mediante nube gestionada.

    952+87Variación de estrellas de los últimos 7 días
  • eclaire@eclaire-labs

    Asistente de IA de código abierto y centrado en lo local para tus datos. Unifica tareas, notas, documentos, fotos y marcadores. Privado, autohospedado y extensible mediante APIs.

    917+5Variación de estrellas de los últimos 7 días
  • hacker-news-digest@polyrabbit

    :newspaper: Deja que ChatGPT resuma Hacker News por ti.

    756+0Variación de estrellas de los últimos 7 días
  • npm-pdfreader@adrienjoly

    🚜 Analiza texto y tablas desde archivos PDF.

    704+0Variación de estrellas de los últimos 7 días
  • scrapecraft@ScrapeGraphAI

    Editor de web scraping impulsado por IA con constructor de flujo de trabajo visual. Crea, prueba y despliega scrapers web usando lenguaje natural. Desarrollado con ScrapeGraphAI y LangGraph.

    694+10Variación de estrellas de los últimos 7 días
  • ai-web-scraper@ScrapingBee

    Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!

    686+135Variación de estrellas de los últimos 7 días
  • Integración de la API de Google Reviews y un scraper escalable para extraer calificaciones, texto de reseñas e información comercial de Google Maps mediante una API estructurada.

    594+1Variación de estrellas de los últimos 7 días
  • Stealth-Requests@jpjacobpadilla

    Web-scraping indetectable y análisis de HTML fluido en Python.

    563+2Variación de estrellas de los últimos 7 días
  • github-statuses@mrshu

    La página de estado de GitHub faltante: un intento de Flat Data para documentar históricamente los estados de GitHub

    561+0Variación de estrellas de los últimos 7 días
  • reader@vakra-dev

    Infraestructura web de código abierto para IA. Extrae, rastrea y automatiza la web, limpia Markdown, gestiona sesiones de navegador y prepara datos para tus agentes.

    559+0Variación de estrellas de los últimos 7 días
  • ai-data-extractor@bawadou

    Extractor gratuito y de código abierto para historiales de chat de asistentes de programación por IA. Compatible con Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code y más.

    554+5Variación de estrellas de los últimos 7 días
← Volver a temas