scraping
Erfasste Open-Source-Repos mit dem Tag scraping, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit scraping am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit scraping getaggt wurden.
- #1
Selbst gehostete Scraping-Engine — umgeht jegliche JS-Herausforderungen und Captchas: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Eine FlareSolverr- und Byparr-Alternative sowie direkter Ersatz für Ihren *arr-Stack.
★ 793 - #2
A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.
★ 515
- #1
Die Context API zum Suchen, Scrapen und Interagieren mit dem Web auf großer Skalierung. 🔥
★ 175.781+0Sterne-Änderung der letzten 7 Tage - #2
🕷️ Ein adaptives Web-Scraping-Framework, das alles von einer einzelnen Anfrage bis zu einem groß angelegten Crawl behandelt!
★ 78.099+0Sterne-Änderung der letzten 7 Tage - #3★ 64.179+0Sterne-Änderung der letzten 7 Tage
- #4
🕵️♂️ Erstelle ein Dossier zu einer Person anhand des Benutzernamens von über 3000 Websites.
★ 37.256+0Sterne-Änderung der letzten 7 Tage - #5
Python‑Scraper basierend auf KI
★ 30.435+0Sterne-Änderung der letzten 7 Tage - #6
Open‑Source‑KI‑Bewerbungs‑Bot in Python: Browser‑Automatisierung und Web‑Scraping zum Lesen von Stellenanzeigen, dann automatisches Bewerben mit einem zugeschnittenen Lebenslauf und Anschreiben für jede Anzeige.
★ 30.304+0Sterne-Änderung der letzten 7 Tage - #7
Crawlee—A web scraping and browser automation library for Node.js zur Erstellung zuverlässiger Crawler. In JavaScript und TypeScript. Daten für KI, LLMs, RAG oder GPTs extrahieren. HTML, PDF, JPG, PNG und andere Dateien von Websites herunterladen. Funktioniert mit Puppeteer, Playwright, Cheerio, JSDOM und raw HTTP. Sowohl headful als auch headless-Modus. Mit Proxy-Rotation.
★ 25.622+0Sterne-Änderung der letzten 7 Tage - #8★ 25.494+0Sterne-Änderung der letzten 7 Tage
- #9
Pythonisches HTML-Parsing für Menschen™
★ 13.812+0Sterne-Änderung der letzten 7 Tage - #10
Benutzerdefinierter Selenium Chromedriver | Zero-Config | Umgeht ALLE Bot-Schutzsysteme (wie Distil / Imperva / Datadome / CloudFlare IUAM)
★ 12.821+0Sterne-Änderung der letzten 7 Tage - #11★ 11.681+0Sterne-Änderung der letzten 7 Tage
- #12★ 11.634+0Sterne-Änderung der letzten 7 Tage
- #13
Crawlee — Eine Web-Scraping- und Browser-Automatisierungsbibliothek für Python zur Erstellung zuverlässiger Crawler. Extrahieren Sie Daten für KI, LLMs, RAG oder GPTs. Laden Sie HTML, PDF, JPG, PNG und andere Dateien von Websites herunter. Funktioniert mit Parsel, BeautifulSoup, Playwright und nativem HTTP. Sowohl Headful- als auch Headless-Modus. Mit Proxy-Rotation.
★ 9.481+0Sterne-Änderung der letzten 7 Tage - #14
Stealth-Headless-Browser für AI-Agents – umgeht Cloudflare, Bot-Erkennung und Anti-Scraping. Drop-in-Ersatz für Puppeteer/Playwright.
★ 9.039+0Sterne-Änderung der letzten 7 Tage - #15
Liste von Bibliotheken, Tools und APIs für Web Scraping und Datenverarbeitung.
★ 8.139+0Sterne-Änderung der letzten 7 Tage - #16
Ein intelligenter, automatischer, schneller und leichtgewichtiger Web Scraper für Python
★ 7.932+0Sterne-Änderung der letzten 7 Tage - #17
Tabula ist ein Werkzeug zum Befreien von Datentabellen, die in PDF-Dateien eingeschlossen sind.
★ 7.480+0Sterne-Änderung der letzten 7 Tage - #18
Pydoll ist eine Bibliothek zur Automatisierung von Chromium-basierten Browsern ohne WebDriver und bietet realistische Interaktionen.
★ 7.060+0Sterne-Änderung der letzten 7 Tage - #19
Python- und Befehlszeilen-Tool zum Sammeln von Text und Metadaten im Web: Crawling, Scraping, Extraktion, Ausgabe als CSV, JSON, HTML, MD, TXT, XML
★ 6.754+0Sterne-Änderung der letzten 7 Tage - #20
🚀 Kostenlose Liste von HTTP-, SOCKS4- und SOCKS5-Proxys * Alle 5 Minuten aktualisiert * sowie Rotations-Proxy-API (über 100 Länder)
★ 6.685+0Sterne-Änderung der letzten 7 Tage - #21
Schweizer Taschenmesser zum Scraping und Extrahieren von Daten aus Online-Ressourcen, entwickelt für Hacker
★ 4.771+0Sterne-Änderung der letzten 7 Tage - #22
Twitter API Scraper | Ohne API-Schlüssel | Twitter Interne API | Kostenlos | Twitter Scraper | Twitter Bot
★ 4.645+0Sterne-Änderung der letzten 7 Tage - #23
Mechanize ist eine Ruby-Bibliothek, die die automatisierte Web-Interaktion vereinfacht.
★ 4.440+0Sterne-Änderung der letzten 7 Tage - #24★ 4.015+0Sterne-Änderung der letzten 7 Tage
- #25
AnyCrawl 🚀: Ein Node.js/TypeScript-Crawler, der Websites in LLM-fähige Daten umwandelt und strukturierte SERP-Ergebnisse von Google/Bing/Baidu usw. extrahiert. Natives Multithreading für die Massenverarbeitung.
★ 3.446+0Sterne-Änderung der letzten 7 Tage - #26
Möchtest du kostenlos neue Dinge lernen? Mit Hilfe von Web-Scraping und Automatisierung findet dieses Skript die nötigen Udemy-Gutscheine und schreibt dich absolut kostenlos in kostenpflichtige Udemy-Kurse ein!
★ 3.292+0Sterne-Änderung der letzten 7 Tage - #27
Öffentliche Facebook-Seiten ohne API-Schlüssel scrapen
★ 3.279+0Sterne-Änderung der letzten 7 Tage - #28★ 3.069+0Sterne-Änderung der letzten 7 Tage
- #29
Ein Open-Source-Fingerabdruck-Browser basierend auf Ungoogled Chromium.
★ 3.014+0Sterne-Änderung der letzten 7 Tage - #30
Lernen Sie Schritt für Schritt, wie Sie Google Trends-Daten scrapen und mit Python und der Oxylabs SERP API vergleichen. Extrahieren Sie Keywords, deren Beliebtheit, regionale Aufschlüsselung, verwandte Anfragen und mehr.
★ 2.909+0Sterne-Änderung der letzten 7 Tage