Anubis chroni serwisy przed agresywnym skrobaniem AI
Dowiedz się, jak system Anubis broni serwery przed zautomatyzowanym zbieraniem treści przez firmy AI.
System Anubis to rozwiązanie ochronne wdrażane przez administratorów serwisów internetowych w celu powstrzymania masowego, zautomatyzowanego zbierania treści przez firmy zajmujące się sztuczną inteligencją.
Dlaczego serwery potrzebują ochrony przed skrobaniem?
Agresywne skrobanie treści — czyli automatyczne pobieranie dużych ilości danych za pośrednictwem botów — powoduje poważne problemy techniczne dla serwera. Zasoby serwera zostają przeciążone, co skutkuje przestojami i niedostępnością witryny dla zwykłych użytkowników. W efekcie strona może być niedostępna dla osób, które chcą ją odwiedzić w naturalny sposób. To wpływa bezpośrednio na doświadczenie czytelników i funkcjonowanie całej platformy.
Jak działa system Anubis?
Anubis opiera się na schemacie Proof-of-Work, który jest wzorowany na systemie Hashcash. Hashcash to rozwiązanie zaproponowane pierwotnie do zmniejszania spamu w poczcie elektronicznej — działało na zasadzie wymagania od nadawcy wiadomości wykonania pewnej obliczeniowej pracy, która dla pojedynczych wiadomości jest nieznaczna, ale dla masowego spamowania staje się kosztowna.
Anubis przenosi tę ideę na grunt ochrony serwisów internetowych. Dla zwykłego użytkownika, który odwiedza stronę normalnie, obciążenie obliczeniowe jest praktycznie niezauważalne — system nie stanowi przeszkody w przeglądaniu treści. Natomiast dla masowych skrapaczy, którzy próbują pobierać setki lub tysiące stron jednocześnie, koszt operacji rośnie wykładniczo. Każde żądanie wymaga wykonania pracy obliczeniowej, a gdy żądań jest miliony, koszt staje się prohibicyjny.
| Aspekt | Zwykły użytkownik | Masowy skrabacz |
|---|---|---|
| Liczba żądań | Kilka-kilkadziesiąt na sesję | Tysiące-miliony |
| Obciążenie obliczeniowe | Znikome | Znaczne |
| Wpływ na doświadczenie | Brak | Operacja staje się nieopłacalna |
| Cel systemu | Transparentny dostęp | Blokada |
Rozwiązanie tymczasowe czy długoterminowe?
Warto wiedzieć, że Anubis to rozwiązanie przejściowe. Administrator infokatowice.pl, który go wdrożył, traktuje go jako etap pośredni w budowaniu bardziej zaawansowanego systemu ochrony. Docelowo system ma być w stanie identyfikować przeglądarki headless — czyli narzędzia automatyczne, które symulują przeglądarkę internetową, ale nie są używane przez człowieka.
Identyfikacja przeglądarek headless będzie odbywać się poprzez analizę renderowania czcionek. Nowoczesne przeglądarki mają wbudowane funkcje JavaScript, które umożliwiają precyzyjne renderowanie tekstu. Boty i narzędzia automatyczne często nie posiadają tych możliwości lub je wyłączają. Analiza sposobu, w jaki strona renderuje czcionki, może więc ujawnić, czy dostęp pochodzi od człowieka, czy od maszyny.
Co to oznacza dla użytkowników serwisu?
Dla zwykłych czytelników wdrożenie systemu Anubis powinno być przejrzyste — nie powinni oni odczuwać żadnych utrudnień. Jednak jeśli używasz wtyczek bezpieczeństwa, takich jak JShelter, która wyłącza niektóre funkcje JavaScript w celu ochrony prywatności, możesz napotkać problemy z dostępem do serwisu. JShelter blokuje właśnie te funkcje, które są niezbędne do działania systemu Anubis.
W takim przypadku użytkownik musi wyłączyć wtyczkę JShelter dla domeny infokatowice.pl, aby móc normalnie korzystać z serwisu. To wymaga świadomości problemu i ręcznej konfiguracji — nie jest to automatyczne. Dla osób, które nie wiedzą o tej zależności, strona może wydawać się niedostępna lub działać wolniej niż zwykle.
System Anubis pokazuje, jak administratorzy serwisów muszą balansować między ochroną swoich zasobów a zapewnieniem dostępu dla autentycznych użytkowników. To nie jest idealne rozwiązanie, ale ilustruje rosnący problem masowego zbierania treści przez firmy AI i konieczność wdrażania środków obronnych.
Na podstawie: infokatowice.pl. Tekst opracowany redakcyjnie.