Was ist ein Webcrawler?
Ein Webcrawler (auch kurz Crawler, Spider, Bot oder Robot genannt) ist ein Computerprogramm, das automatisch das World Wide Web nach Webseiten durchsucht. Der Crawler gelangt dabei über sog. Hyperlinks von einer Website zur Nächsten. Findet der Crawler auf einer Webseite weitere Hyperlinks zu noch nicht von ihm besuchten Webseiten, so werden diese Links gespeichert und zu einem späteren Zeitpunkt zum Besuch der Webseiten verwendet. Unsere websitedetail.net Crawler durchsuchen Websites gezielt nach den Daten, die auf unserer Webseite angezeigt werden.
Wie schließe ich unsere Crawler aus?
Über den "Robots Exclusion Standard" ist es jedem Webseiten-Betreiber möglich, den Zugriff eines Crawlers auf die eigenen Webseiten zu beeinflussen. Um unsere Crawler komplett auszuschließen, füge folgenden Eintrag in deine robots.txt ein:
User-agent: websitedetail.net Disallow: /
Wie kann ich unsere Crawler identifizieren?
Unsere Webcrawler verstecken sich nicht! Sie übertragen ihre User-Agent-Kennung, über die du alle Zugriffe eindeutig unseren Crawlern zuordnen kannst:
websitedetail.net
Gefährden unsere Crawler meine Website?
Nein. Um Beeinträchtigungen auf die Stabilität und Performance deiner Internetpräsenz zu verhindern, sind unsere Webcrawler so konfiguriert, dass zwischen zwei Seitenabrufen stets eine Pause von ca. 1 Sekunde eingehalten wird. Unsere Crawler können zudem nur GET-Requests absenden, keine POST-Requests – sie lesen also nur Daten, senden aber keine.
Können die Crawler Schadsoftware enthalten?
Nein! Unsere Crawler wurden weder dazu programmiert, noch sind sie in der Lage, auf besuchten Servern irgendeine Art von Schadsoftware zu installieren.
Hast du Fragen zu unseren Crawlern? Kontaktiere uns.
