Wie Bots und Schaber vom Essen Ihrer Bandbreite zu stoppen
Ein überraschender Teil Ihres Verkehrs ist Roboter, und nicht die gute Art. Wie man die Schaber essen Ihre Bandbreite zu erkennen, sagen sie abgesehen von Google, und schließen sie am Rande.
Hier ist eine Sache, die fast jedem wachsenden Standort passiert. Sie öffnen Ihre Analysen, sehen eine gesunde Verkehrsnummer und fühlen sich gut. Dann öffnen Sie Ihre rohen Server-Logs — die Analyse zeigt Ihnen nie, weil Schaber nicht JavaScript laufen und daher nie in Google Analytics überhaupt erscheinen — und feststellen, dass ein einziger IP-Bereich den gesamten Produktkatalog vier Mal in dieser Woche, in alphabetischer Reihenfolge, um drei Uhr morgens.
Das ist ein Kratzer. Es hat nichts beigetragen, kostete Sie Bandbreite, und wenn Ihre Preise auf diesen Seiten sind, weiß es jetzt, sie.
Der Instinkt an dieser Stelle ist, alles zu blockieren, was kein Mensch ist. Tun Sie das nicht: Sie würden Googlebot damit nehmen, und Ihren Suchverkehr zu verlieren ist ein weitaus teureres Problem als die Bandbreite, die Sie zu speichern versuchten. Was du willst, ist ein Türsteher, keine Wand.
Sortieren der Bots, die Sie von denen, die Sie nicht
Bots zu halten
- Googlebot, Bingbot — sie sind, warum die Menschen finden Sie
- Uptime und Performance-Monitore, die Sie konfiguriert haben
- Link Vorschau-Hotcher für Slack, WhatsApp, soziale Plattformen
- Zahlung und Webhook Rückrufe von Diensten, die Sie verwenden
Bots zum Anhalten
- Preis- und Inhaltsabschaber kopieren Ihren Katalog
- Beglaubigungs-Stuffer, die gestohlene Logins nachspielen
- Sicherheitsscanner, die nach bekannten Exploits suchen
- Spam Bots Hämmern Formen und Kommentar Endpunkte
Es gibt eine dritte Kategorie, die in letzter Zeit sehr stark gewachsen ist und in keiner Spalte ordentlich passt: AI-Trainings-Crawler. Ob Sie das wollen, ist eher eine geschäftliche Entscheidung als eine Sicherheitsentscheidung, und es lohnt sich, bewusst statt durch Zufall zu machen. Die meisten von ihnen respektieren robots.txt, und die meisten veröffentlichen die Benutzer-Agenten-Strings, die sie verwenden, so dass ein paar Zeilen in robots.txt behandelt die gut-behabten. Die, die robots.txt ignorieren, sind per Definition in der zweiten Spalte.
Die Schlechten finden
Die kritische Regel ist, dass Sie Bots durch identifizieren Verhalten, nicht durch das, was sie behaupten, zu sein . Ein Benutzer-Agent-String ist ein Textfeld, das der Client füllt , ein Schaber, der sagt, es ist Chrome auf macOS kostet seinen Autor etwa vier Sekunden Aufwand .
Verhalten ist viel schwieriger zu fälschen, weil es bedeutet, langsamer und teurer zu sein, was den Punkt des Abkratzens besiegt.
Inhuman Request Rate und Rhythmus
Eine Person lädt nicht 60 Produktseiten in 4 Sekunden. Sie laden sie auch nicht in genau 250 Millisekunden Abständen für sechs Stunden. Menschen sind erratisch; Skripte sind Metronome.
Nur das HTML, keine Möbel
Ein Browser, der eine Seite lädt, holt auch das CSS, die Schriftarten, die Bilder. Ein Schaber will das HTML und nichts anderes. Ein Client, der tausend Seiten und Null Stylesheets fordert, ist kein Browser.
Geforderte Identität, die nicht überprüft
Googlebot veröffentlicht seine IP-Bereiche, und ein umgekehrter DNS-Lookup auf einem echten Googlebot IP löst googlebot.com und Forward-Resolves zurück. Alles, was behauptet, Googlebot von einem Verbraucher VPS-Provider zu sein, lügt.
Mechanische URL Muster
Gehen Sie Ihre Sitemap nach oben bis unten, oder iterieren Produkt-IDs sequentiell, oder die Suche nach Pfaden, die nur in einem Sicherheitsscanner der Wortliste.
Verkehr von Hosting-Bereichen, die nie konvertiert
Echte Kunden stöbern in Wohn- und Mobilfunknetzen. Eine plötzliche Flut aus einem Rechenzentrum ASN mit einer Null-Konversionsrate ist ein starkes Signal für sich.
Blockieren Sie niemals auf Benutzer-Agent allein, und seien Sie vorsichtig, blockieren ganze Länder. Beide sehen entscheidend in einem Armaturenbrett aus und beide kosten Sie leise echte Kunden. Insbesondere Länderblocks werden während eines Vorfalls meist gesetzt und nie wieder überprüft.
Warum die Kante der richtige Ort ist, um dies zu tun
Dies ist der Teil, der die Wirtschaft verändert. Wenn Sie einen Schaber bei Ihrem Ursprung blockieren, hat die Anfrage bereits das Internet überquert, eine TLS-Verbindung geöffnet, Ihre Anwendung geweckt und auf dem Weg dorthin Bandbreite verbraucht. Du hast das alles bezahlt und dann eine 403 zurückgegeben.
Blockieren Sie es am Rand — draußen am PoP, dem nächsten Bot — und die Anfrage erreicht nie Ihren Ursprung überhaupt. Ihre Anwendung wacht nie auf, Ihre Ursprungsbandbreite ist unberührt, und Ihre Protokolle bleiben lesbar. Bei einem ernsthaften Abwracklauf ist das der Unterschied zwischen einer Belästigung und einem Ausfall.
Die Schichten, die funktionieren
Kein einziger Mechanismus fängt alles, und das ist in Ordnung, weil sie gut komponieren. In ungefähr der Reihenfolge sollten sie laufen:
| Ebene | Was es fängt | Falsch-positives Risiko |
|---|---|---|
| Netzwerk-Blockliste | Bekannte schlechte IPs, die bereits im Netzwerk identifiziert wurden | Sehr niedrig |
| Verifizierte Botenkontrolle | Impostors behaupten, Googlebot zu sein | Sehr niedrig |
| Höchstsatz | Alles, was schneller als ein Mensch verlangt, könnte | Niedrig, wenn die Grenze großzügig ist |
| Honeypot-Pfade | Kriechen, die Verbindungen folgen, die Menschen nicht sehen können | Nahe Null |
| Arbeitsbeweis | Großautomatisierung jeder Art | Niedrig |
| Land/ASN-Regeln | Blunt, situationsbedingt | Hoch — sparsam nutzen |
Honigtöpfe werden unterschätzt
Ein Honigtopf ist eine URL, die kein Mensch jemals besuchen wird – von Ihrer Seite verlinkt, aber vor der Ansicht verborgen und in robots.txt nicht erlaubt. Ein wahrer Besucher sieht es nie. Ein gut benommener Roboter liest robots.txt und überspringt ihn. Alles, was es verlangt, hat sowohl ignoriert robots.txt und folgte einem unsichtbaren Link, die etwa so nahe an Beweis für schlechte Absicht, wie Sie auf dem offenen Web erhalten. Falsche Positive liegen nahe bei Null, was es zu einem der wenigen Signale macht, sofort und automatisch zu handeln.
Arbeitsnachweis ist die höfliche Option
Eine Proof-of-Work-Herausforderung fordert den Kunden auf, ein kleines Computer-Puzzle zu lösen, bevor er bedient wird. Ein echter Browser macht es in einem Blinken und der Besucher bemerkt nie etwas passiert. Aber ein Schaber, der 100.000 Anfragen macht, muss jetzt echte CPU für jeden ausgeben, und die Arithmetik, die die Operation lohnend machte, hört auf zu arbeiten. Sie blockiert niemanden — sie macht nur die Kosten für die Abschrottung im industriellen Maßstab höher, als sie zurückbringt, was normalerweise ausreicht.
Was diese Woche zu tun ist
- Lesen Sie Ihre Rohprotokolle, nicht die Analyse. Scrapers führen JavaScript nicht aus, so dass sie in Google Analytics unsichtbar sind. Sortieren Sie Anfragen nach IP und nach User-Agent und schauen Sie sich die Top-Zwanzig von jedem.
- Setzen Sie ein großzügiges Preislimit auf alles. Etwas, das weit über dem liegt, was ein Mensch tun könnte — es geht darum, das Offensichtliche zu fangen, nicht um seine Nutzer zu bewachen.
- Verfestigen Sie es auf den Endpunkten, die wichtig sind. Login, Passwort-Reset, Suche und Checkout verdienen viel strengere Grenzen als Ihr Blog.
- Überprüfung des verifizierten Bots einschalten Also impostor Googlebots aufhören, einen freien Pass zu bekommen.
- Einen Honigtopfpfad hinzufügen und schau dir an, was eine Woche lang hineingeht, bevor du entscheidest, was du dagegen tun sollst.
- Entscheiden Sie sich absichtlich über KI-Crawler. Egal, wie Sie gehen, schreiben Sie es in robots.txt anstatt es dem Zufall zu überlassen.
Häufig gestellte Fragen
Wie kann ich verhindern, dass meine Website kopiert wird?
Blockieren Sie sie an der CDN-Kante, die auf Verhalten statt User-Agent basiert. Die effektive Kombination ist rate limiting, verifiziert-bot-Prüfungen, so dass Betrüger-Crawler abgelehnt werden, Honigtopf Pfade, die nur automatisierte Kunden anfordern, und eine Beweis-of-Work-Herausforderung, die groß angelegte Abschrottung macht zu teuer, um es wert zu sein. Blockieren am Rand bedeutet, dass die Anfrage nie Ihren Ursprung erreicht oder Ihre Bandbreite kostet.
Wie kann ich einem schlechten Bot von Googlebot sagen?
Prüfen Sie es, anstatt dem Benutzer-Agenten-String zu vertrauen, den jeder einstellen kann. Google veröffentlicht seine Suchmaschinen-IP-Bereiche, und eine echte Googlebot IP löst über Reverse DNS zu einem googlebot.com Hostname, die vorwärts-Lösung zurück auf die gleiche IP. Alles, was behauptet, Googlebot von einem Hosting-Provider oder VPS-Bereich zu sein, ist ein Betrüger und kann sicher blockiert werden.
Wird Blocking Bots meinem SEO schaden?
Nicht, wenn Sie die Liste der überprüften Suchmaschinen erlauben. Das Risiko kommt von stumpfen Regeln — Sperrung eines ganzen Landes oder eine übermäßig aggressive Rate Grenze, die Googlebot während eines Krabbenplatzes fängt. Halten Sie verifizierte Suchmaschinen Bots von Geschwindigkeitsbegrenzungen und Herausforderungen befreit, und überprüfen Sie Ihre Search Console Crawling-Statistiken nach jeder Änderung, um das Crawlen normal fortgesetzt zu bestätigen.
Stoppt Roboter.txt Schaber?
Nein. robots.txt ist ein Antrag, kein Durchsetzungsmechanismus. Gut benommene Raupen wie Googlebot und die meisten KI-Trainings-Roboter ehren es; Schaber und bösartige Bots ignorieren es vollständig, und einige nutzen es als eine Karte der Wege, die Sie lieber nicht sehen würden. Es lohnt sich, für die Bots, die kooperieren, aber es ist keine Sicherheitskontrolle.
Was ist eine Herausforderung?
Eine Proof-of-Work Herausforderung erfordert den Browser des Clients, um ein kleines Computer-Puzzle zu lösen, bevor die Seite bedient wird. Ein echter Browser vervollständigt es in einem Bruchteil einer Sekunde und der Besucher sieht nichts Ungewöhnliches, aber ein Bot macht Hunderttausende von Anfragen müssen echte CPU auf jedem ausgeben. Sie identifiziert Bots nicht – sie macht die Automatisierung im Maßstab wirtschaftlich sinnlos.
Warum tauchen Schaber nicht in Google Analytics auf?
Google Analytics setzt auf die Ausführung von JavaScript im Browser, und die meisten Scraper fordern das rohe HTML, ohne irgendwelche Skripte auszuführen. Das bedeutet, dass das Abwracken von Verkehr in der Analytik völlig unsichtbar ist und gleichzeitig die reale Bandbreite und die Ursprungskapazität verbraucht. Um es zu sehen, schauen Sie sich rohen Server oder CDN-Protokolle an, wo jede Anfrage angezeigt wird, unabhängig davon, ob JavaScript ausgeführt wird.
Sie werden nie zu Null Bots bekommen, und Null zu jagen ist, wie die Menschen am Ende blockieren ihre eigenen Kunden. Das realistische Ziel ist, dass der automatisierte Verkehr, den Sie bezahlen, ist Verkehr, den Sie zuzulassen gewählt haben.
Sehen Sie, wie NordicCDN dies für Ihre Website tut:
Mads hat seit seinem 16. Lebensjahr in der IT gearbeitet — hauptsächlich als Hosting. Er beteiligte sich früh an einer SaaS-Firma und half, sie bis zur Übernahme durch Visma weiterzuentwickeln, hat Data-Center-Netzwerke aufgebaut und betrieben und diente als CTO eines dänischen Rechenzentrums. Er hat NordicCDN gestartet, um eine schnelle, sichere Infrastruktur einfach zu bedienen.