Nicht nur schädliche Bots erfordern Maßnahmen. Eine gute Bot-Management-Strategie vermeidet es, vertrauenswürdige Bots zu blockieren, und wehrt gleichzeitig schädliche ab.
Nach Lektüre dieses Artikels können Sie Folgendes:
Ähnliche Inhalte
Was ist ein Bot?
Was ist Bot-Traffic?
Was ist Bot-Management?
Brute-Force-Angriff
Was ist Content Scraping?
Abonnieren Sie theNET und erhalten Sie monatlich die meistdiskutierten Internet-Insights von Cloudflare.
Link zum Artikel kopieren
Ein Bot ist ein Computerprogramm, das Interaktionen mit Websites über das Internet automatisiert. Wir verwenden den Begriff „guter“ Bot für jeden Bot, der Aufgaben ausführt, die nicht absichtlich für Websites schädlich oder anderweitig böswillig sind. Da gute Bots oft Eigenschaften mit schädlichen teilen, ist gezieltes Blockieren schwierig.
Es gibt viele Arten von vertrauenswürdigen Bots, die jeweils für unterschiedliche Aufgaben entwickelt wurden. Hier einige Beispiele:
Website-Administratoren sollten darauf achten, „gute“ Bots nicht unbeabsichtigt zu blockieren, während sie versuchen, schädlichen Bot-Traffic herauszufiltern. Viele Websites lassen beispielsweise in der Regel Webcrawler-Bots von Suchmaschinen durch, da eine Website ohne sie nicht in den Suchergebnissen angezeigt werden kann.
Schädliche Bots können Daten stehlen, in Benutzerkonten eindringen, Datenmüll über Online-Formulare senden und andere böswillige Aktivitäten ausführen. Zu den Arten von schlechten Bots gehören Credential Stuffing-Bots, Content Scraping-Bots, Spam-Bots und Klickbetrug-Bots.
Das Verwalten vertrauenswürdiger Bots beginnt mit der korrekten Einrichtung von Regeln in der robots.txt-Datei einer Website. Eine robots.txt-Datei ist eine Textdatei, die sich auf einem Webserver befindet und die Regeln für alle Bots angibt, die auf die gehostete Website oder Anwendung zugreifen. Diese Regeln legen fest, welche Seiten die Bots durchsuchen können und welche nicht, welchen Links sie folgen sollen und welchen nicht, sowie andere Anweisungen für das Verhalten der Bots. Cloudflare bietet einen verwalteten robots.txt-Dienst an, um die Konfiguration dieser Regeln zu vereinfachen.
Einige (aber nicht alle) gute Bots werden den in robots.txt-Dateien deklarierten Präferenzen folgen. Google hat zum Beispiel erklärt, dass ein Website-Besitzer, wenn er nicht möchte, dass eine bestimmte Seite seiner Website in den Google-Suchergebnissen erscheint, eine Regel in die robots.txt-Datei schreiben kann, um zu verhindern, dass Googlebot diese Seite indexiert. Ebenso kann eine Website per robots.txt angeben, dass ihre Inhalte nicht zum LLM-Training verwendet werden sollen. Um es klarzustellen: robots.txt-Dateien verhindern nicht wirklich, dass Bots auf Websites zugreifen, und einige Bot-Betreiber ignorieren sie einfach.
Stellen Sie sich eine Genehmigungsliste als eine Art Gästeliste für eine Veranstaltung vor: Wenn jemand, der nicht auf der Gästeliste steht, versucht, an der Veranstaltung teilzunehmen, hindert das Sicherheitspersonal ihn daran. Jeder, der auf der Liste steht, kann unbehindert an der Veranstaltung teilnehmen. Ein solches Vorgehen ist notwendig, weil sich ungebetene Gäste möglicherweise schlecht benehmen und die Party für alle anderen ruinieren.
Beim Bot-Management funktionieren Genehmigungsliste im Grunde genommen auf dieselbe Weise. Eine Genehmigungsliste ist eine Liste von Bots, die auf eine Website zugreifen dürfen. In der Regel funktioniert dies über einen sogenannten „User Agent“, die IP-Adresse des Bots oder eine Kombination aus beiden. Ein User Agent ist eine Textzeichenfolge, die den Typ des Benutzers (oder Bots) gegenüber einem Webserver identifiziert.
Durch Führen einer Liste von erlaubten vertrauenswürdigen Bot-User Agents, wie z. B. solchen, die zu Suchmaschinen gehören, und das anschließende Blockieren von Bots, die nicht auf der Liste stehen, kann ein Webserver den Zugriff für vertrauenswürdige Bots sicherstellen.
Webserver können auch eine Blockierliste mit bekannten schädlichen Bots führen.
Eine Blockierliste ist im Kontext von Netzwerken eine Liste von IP-Adressen, User Agents oder anderen Indikatoren der Online-Identität, die nicht auf einen Server, ein Netzwerk oder eine Website zugreifen dürfen. Dies ist ein etwas anderer Ansatz als die Verwendung einer Genehmigungsliste: Eine auf einer Blockierliste basierende Bot-Management-Strategie blockiert diese spezifischen Bots und lässt alle anderen Bots durch, während eine Genehmigungsliste-Strategie nur bestimmte Bots durchlässt und alle anderen blockiert.
Es ist möglich, dass ein schädlicher Bot seine User-Agent-Zeichenfolge so fälscht, dass er zumindest anfangs wie ein vertrauenswürdiger Bot aussieht – so wie ein Dieb einen gefälschten Ausweis verwenden könnte, um vorzutäuschen, er stünde auf der Gästeliste, und sich in eine Veranstaltung einzuschleichen.
Daher müssen Genehmigungslisten vertrauenswürdiger Bots mit anderen Ansätzen zur Erkennung von Spoofing kombiniert werden, wie z. B. der Verhaltensanalyse oder dem maschinellen Lernen. Dies hilft dabei, zusätzlich zum einfachen Genehmigen bekannter vertrauenswürdiger Bots sowohl schädliche als auch unbekannte vertrauenswürdige Bots proaktiv zu identifizieren.
Die meisten KI-Tools trainieren sich selbst mit Inhalten aus dem Web. KI-Crawler-Bots durchsuchen das Web nach neuen Inhalten. Das kann je nach Geschäftsmodell für eine bestimmte Website legitim oder schädlich sein.
Einige Websitebetreiber könnten feststellen, dass das fortgesetzte Crawlen durch KI-Bots ihre Backends erschöpft oder ihre Bandbreitenkosten zu stark erhöht. Andere könnten eine negative Beeinträchtigung ihrer Geschäftsmodelle erfahren, wenn sie auf ihre Originalinhalte zur Umsatzgenerierung angewiesen sind (z. B. ein werbebasiertes Umsatzmodell), da KI-Tools ihre Inhalte nutzen können, um Nutzeranfragen zu beantworten, ohne dass die Nutzer ihre Website besuchen.
Ein Bot-Manager-Produkt ermöglicht guten Bots den Zugriff auf eine Webseite, blockiert schlechte Bots und hilft Website-Administratoren, ihre Beziehungen zu KI-Crawlern und -Tools zu verwalten. Cloudflare Bot Management nutzt Machine Learning und Verhaltensanalysen des Traffics im gesamten Netzwerk, um schädliche Bots zu erkennen, während vertrauenswürdige Bots automatisch und kontinuierlich auf eine Positivliste gesetzt werden. Mit verwalteter robots.txt-Datei kann Cloudflare die robots.txt-Dateien von Websites automatisch ändern, um die Präferenzen des Website-Administrators auszudrücken. Und mit der Pay-per-Crawl-Funktion von Cloudflare können Website-Administratoren bestimmte KI-Crawler zulassen oder blockieren oder den Betreibern dieser Crawler sogar eine Gebühr pro Crawl in Rechnung stellen.
Ein vertrauenswürdiger Bot ist ein Computerprogramm, das Aufgaben über das Internet automatisiert, ohne dabei absichtlich böswillig oder für Websites schädlich zu sein. Beispiele hierfür sind Suchmaschinen-Crawler, die Webseiten indexieren und Websites dabei helfen, Traffic zu generieren, Copyright-Bots, die Inhalte aufspüren, die gegen das Urheberrecht verstoßen, und Site-Überwachungs-Bots, die auf Ausfälle prüfen.
Die Bot-Management-Strategie einer Website muss zwischen vertrauenswürdigen und schädlichen Bots unterscheiden. Es ist wichtig, vertrauenswürdigen Bots, wie beispielsweise Suchmaschinen-Crawlern, den Zugriff auf eine Website zu ermöglichen, damit die Website in den Suchergebnissen angezeigt wird. Gleichzeitig können einige vertrauenswürdige Bots, wie z. B. KI-Crawler, eine große Anzahl von Anfragen senden, die die Bandbreitenkosten einer Website erhöhen oder ihre Backend-Server überlasten können, wenn sie keine direkten Anweisungen erhalten, dies nicht zu tun.
Eine robots.txt-Datei ist eine Textdatei auf einem Webserver, die Regeln für Bots enthält. Diese Regeln können festlegen, welche Seiten Bots durchsuchen dürfen, welchen Links sie folgen dürfen und wie oft sie eine Website durchsuchen dürfen. Sie ist ein Ausgangspunkt für ein gutes Bot-Management, auch wenn einige Bots diese Regeln möglicherweise ignorieren.
Zwei gängige Methoden sind Genehmigungslisten und Blockierlisten. Eine Genehmigungsliste ist wie eine Gästeliste: Es handelt sich um eine Liste von Bots, denen der Zugriff auf Ihre Website gestattet ist, während alle anderen blockiert werden. Eine Blockierliste ist das Gegenteil davon: Es handelt sich um eine Liste bestimmter Bots, denen der Zugriff verweigert wird, während alle anderen zugelassen sind.
Eine Genehmigungsliste allein reicht nicht immer aus. Schädliche Bots können manchmal ihre Identität verschleiern, um die Genehmigungsliste zu überlisten. Daher sollten Genehmigungslisten mit anderen Methoden wie Verhaltensanalysen oder maschinellem Lernen kombiniert werden, um böswillige Bot-Aktivitäten zu erkennen.
Eine Bot-Management-Lösung wurde entwickelt, um vertrauenswürdige Bots zuzulassen, schädliche Bots zu blockieren und Website-Betreibern dabei zu helfen, ihre Interaktionen mit verschiedenen Arten von Crawlern zu verwalten. Cloudflare Bot Management nutzt beispielsweise maschinelles Lernen und Verhaltensanalysen, um schädliche Bots zu erkennen, während automatisch eine Genehmigungsliste mit verifizierten vertrauenswürdigen Bots geführt wird.