scraper
Repositorios de código abierto monitorizados etiquetados con scraper, ordenados por estrellas.
- #61
Newspaper4k, un fork del popular Newspaper3k para la extracción de artículos, títulos y metadatos de sitios web de noticias.
★ 1141+1Variación de estrellas de los últimos 7 días - #62★ 1116+2Variación de estrellas de los últimos 7 días
- #63
Desarrollo de scrapers web en Ruby mediante un DSL limpio asistido por IA. Kimurai utiliza IA para identificar la ubicación de los datos, almacena selectores en caché y realiza el scraping con Ruby puro, obteniendo la inteligencia de un LLM sin la latencia ni los costos por token de cada solicitud.
★ 1102+0Variación de estrellas de los últimos 7 días - #64
Scripts de web scraping en Python escalables para más de 40 dominios populares.
★ 1076+4Variación de estrellas de los últimos 7 días - #65
API PHP+REST no oficial de MyAnimeList que ofrece funciones adicionales a la API oficial
★ 1072+6Variación de estrellas de los últimos 7 días - #66
Universal Reddit Scraper: una herramienta de línea de comandos integral para extraer y archivar datos de Reddit.
★ 1022+1Variación de estrellas de los últimos 7 días - #67
Un gestor integral para organizar recursos en la computadora, con elementos de gamificación.
★ 1019+6Variación de estrellas de los últimos 7 días - #68★ 1017+12Variación de estrellas de los últimos 7 días
- #69
Scraper de Google Play para Python inspirado en <facundoolano/google-play-scraper>
★ 1010+2Variación de estrellas de los últimos 7 días - #70
La primera herramienta para ver publicaciones privadas de Instagram de forma anónima
★ 994+13Variación de estrellas de los últimos 7 días - #71★ 956+0Variación de estrellas de los últimos 7 días
- #72
Obtén tweets, respuestas, líneas de tiempo y artículos de X/Twitter sin inicio de sesión ni claves API; herramienta de campo para agentes de IA.
★ 955+6Variación de estrellas de los últimos 7 días - #73★ 884+1Variación de estrellas de los últimos 7 días
- #74
Una biblioteca basada en Kotlin para pruebas, scraping y análisis, que permite extraer datos de HTML (renderizado en servidor y cliente). Pone especial énfasis en la facilidad de uso y alta legibilidad mediante un DSL intuitivo. Aunque está diseñada como biblioteca de pruebas, también puede usarse para hacer scraping de sitios web de forma conveniente.
★ 875-1Variación de estrellas de los últimos 7 días - #75
Herramienta de línea de comandos para descargar y extraer datos de páginas HTML/XML o API JSON, utilizando CSS, XPath 3.0, XQuery 3.0, JSONiq o coincidencia de patrones. También puede crear documentos XML/HTML/JSON nuevos o transformados.
★ 844+1Variación de estrellas de los últimos 7 días - #76★ 842+5Variación de estrellas de los últimos 7 días
- #77
Un descargador de galerías de imágenes y doujinshi de propósito general
★ 841+0Variación de estrellas de los últimos 7 días - #78
Convierte algunas novelas web al formato epub
★ 840+1Variación de estrellas de los últimos 7 días - #79
Una versátil librería de web spidering para Ruby capaz de rastrear un sitio, múltiples dominios, enlaces específicos o de forma infinita. Spidr está diseñado para ser rápido y fácil de usar.
★ 836+0Variación de estrellas de los últimos 7 días - #80★ 805+0Variación de estrellas de los últimos 7 días
- #81
Una base de datos abierta de datos de sanciones internacionales, personas de interés y personas expuestas políticamente
★ 797+6Variación de estrellas de los últimos 7 días - #82
Motor de scraping autohospedado: evita cualquier desafío de JS y captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Alternativa y reemplazo directo para FlareSolverr y Byparr en tu stack *arr.
★ 782+46Variación de estrellas de los últimos 7 días - #83
Scraper de perfiles de LinkedIn que devuelve datos estructurados en formato JSON.
★ 776+0Variación de estrellas de los últimos 7 días - #84
operative framework es un framework de OSINT basado en Rust; permite interactuar con múltiples objetivos, ejecutar diversos módulos, crear enlaces con objetivos, exportar informes a PDF, añadir notas a objetivos o resultados, interactuar con API RESTful y escribir tus propios módulos.
★ 749-1Variación de estrellas de los últimos 7 días - #85
Paquete de Python para extraer datos de propiedades inmobiliarias.
★ 739+3Variación de estrellas de los últimos 7 días - #86
Un rastreador de precios multiusuario autohospedado para Amazon, Aliexpress, ebay y muchas otras tiendas personalizadas. Reciba notificaciones cuando el precio cumpla con uno o más criterios establecidos por el usuario.
★ 738+2Variación de estrellas de los últimos 7 días - #87★ 737+1Variación de estrellas de los últimos 7 días
- #88
Una biblioteca de Scala para extraer contenido de páginas HTML
★ 732+0Variación de estrellas de los últimos 7 días - #89★ 730+0Variación de estrellas de los últimos 7 días
- #90
Documentación de la API interna de Twitter
★ 711+1Variación de estrellas de los últimos 7 días