crawler
Repositorios de código abierto monitorizados etiquetados con crawler, ordenados por estrellas.
- #61
Prompts filtrados de GPTs para omitir el límite de 25 mensajes o probar GPTs sin una suscripción Plus.
★ 2469+1Variación de estrellas de los últimos 7 días - #62★ 2463+0Variación de estrellas de los últimos 7 días
- #63
🕷 CrawlerDetect es una clase PHP para detectar bots/crawlers/spiders a través del user agent
★ 2403+2Variación de estrellas de los últimos 7 días - #64
Framework de rastreo web en C# multiplataforma diseñado para ofrecer velocidad y flexibilidad. ¡Por favor, dale una estrella a este proyecto! +1.
★ 2310+0Variación de estrellas de los últimos 7 días - #65
Clonador de sitios web: utiliza potentes rutinas de Go para clonar sitios web en tu computadora en segundos.
★ 2239+5Variación de estrellas de los últimos 7 días - #66
🏳️🌈 Descargador de medios de cualquier sitio, incluyendo Twitter, Reddit, Instagram, BlueSky, TikTok, Threads, Facebook, OnlyFans, YouTube, Pinterest, PornHub, XHamster, XVIDEOS, ThisVid, etc.
★ 2161+8Variación de estrellas de los últimos 7 días - #67
Transforma contenido web en datos listos para LLM.
★ 2158+32Variación de estrellas de los últimos 7 días - #68
SkyBlue (BlueSky Collector) es un sistema de rastreo web de código abierto y gratuito. Solo requiere hacer clic y editar reglas para recopilar datos. Puede ejecutarse de forma local, en hosting virtual o en servidores en la nube, es capaz de rastrear casi todo tipo de páginas web, se integra sin problemas con varios programas CMS para la creación de sitios web, publica datos en tiempo real sin necesidad de iniciar sesión y funciona de forma totalmente automática sin intervención humana. Es un software de rastreo web en la nube totalmente multiplataforma para macrodatos.
★ 2088-1Variación de estrellas de los últimos 7 días - #69★ 2019+0Variación de estrellas de los últimos 7 días
- #70
Colección de casos de web crawlers. Incluye, entre otros: Taobao, JD, Tmall, Douban, Douyin, Kuaishou, Weibo, WeChat, Ali, Toutiao, PDD, Youku, iQiyi, Ctrip, 12306, 58, Sohu, varios índices, VIP/Wanfang, Z-Library, Oalib, novelas, sitios de licitaciones, sitios de compras, Xiaohongshu, Dianping, Twitter, Maimai, Zhihu.
★ 1967+1Variación de estrellas de los últimos 7 días - #71
Navegador antidetect sigiloso gratuito para Playwright: huella digital de Firefox sin cabeza indetectable. Scraping con Python, bypass de recaptcha y detección de bots. Código abierto.
★ 1962+13Variación de estrellas de los últimos 7 días - #72
Biblioteca central de NewPipe para extraer datos de sitios de streaming.
★ 1960+3Variación de estrellas de los últimos 7 días - #73
Solución de exploración de memoria del navegador (en exploración...)
★ 1912+0Variación de estrellas de los últimos 7 días - #74★ 1891+3Variación de estrellas de los últimos 7 días
- #75★ 1879+2Variación de estrellas de los últimos 7 días
- #76
Monitorización, recopilación y transferencia de contenido multiplataforma. Un panel web para gestionar Douyin, Xiaohongshu y Kuaishou.
★ 1833+65Variación de estrellas de los últimos 7 días - #77
Diskover Community Edition: indexador de archivos, motor de búsqueda y herramienta de gestión y análisis de datos de código abierto basado en Elasticsearch
★ 1816-2Variación de estrellas de los últimos 7 días - #78
Rastreador web de imágenes multiproceso para Google y Naver (Selenium)
★ 1692+1Variación de estrellas de los últimos 7 días - #79
Enlace de Python para los motores Modest y Lexbor. Un analizador HTML5 rápido con selectores CSS para Python.
★ 1671+4Variación de estrellas de los últimos 7 días - #80
Web scrapers en Python: incluye extracción de música de NetEase Cloud, videos de Bilibili, preguntas de Zhihu, fondos de pantalla, videos de xvideos, audiolibros, Weibo, datos de Anjuke con visualización, extractor de portadas de Bilibili, pool de proxies IP, análisis de datos de usuarios de Zhihu y scrapers de usuarios de GitHub
★ 1649+4Variación de estrellas de los últimos 7 días - #81
Rastreador web para archivistas: salida WARC, panel de control para todos los rastreos y patrones de ignorar dinámicos.
★ 1609+2Variación de estrellas de los últimos 7 días - #82
Rastreador de Douyin: recopila datos públicos de perfiles, me gusta, favoritos, audio original, temas, búsquedas, colecciones, publicaciones, seguidores y seguidos.
★ 1605+1Variación de estrellas de los últimos 7 días - #83
ScopeSentry: mapeo del ciberespacio, enumeración de subdominios, escaneo de puertos, descubrimiento de información sensible, escaneo de vulnerabilidades y nodos distribuidos.
★ 1601+9Variación de estrellas de los últimos 7 días - #84
Herramienta CLI para guardar una copia fiel de una página web completa en un solo archivo HTML (basado en SingleFile).
★ 1579+9Variación de estrellas de los últimos 7 días - #85
❤️ Fredy - [F]ind [R]eal [E]state [D]amn Eas[y] - Fredy busca continuamente nuevos apartamentos y casas en Alemania en plataformas como ImmoScout24, Immowelt, eBay Kleinanzeigen y te entrega los resultados al instante a través de Slack, Telegram, correo electrónico, Discord o ntfy, para que puedas concentrarte en las cosas más importantes de la vida ;)
★ 1462+11Variación de estrellas de los últimos 7 días - #86★ 1451+0Variación de estrellas de los últimos 7 días
- #87
Un cliente HTTP de Python ergonómico y respetuoso con la privacidad
★ 1438+1Variación de estrellas de los últimos 7 días - #88
Herramienta de recopilación de datos de Xiaohongshu y descarga masiva de imágenes y videos de sitios web, con una interfaz atractiva (descarga masiva, extracción de video, imágenes). Telegram: https://t.me/+ZtLSwuIKTo44MDY1
★ 1436+2Variación de estrellas de los últimos 7 días - #89
Colección de parches para puppeteer y playwright para evitar la detección de automatización y fugas. Ayuda a evitar las páginas CAPTCHA de Cloudflare y DataDome. Fácil de aplicar o quitar, y se puede habilitar o deshabilitar bajo demanda.
★ 1422-1Variación de estrellas de los últimos 7 días - #90★ 1417-1Variación de estrellas de los últimos 7 días