Na jakie pytania odpowiada to hasło
- Czy mój serwis jest w danych treningowych modeli AI?
- Czy blokowanie Common Crawl w robots.txt ma sens?
Common Crawl i dane treningowe: wyjaśnienie
Mechanizm jest prosty: modele językowe uczą się na wielkich zbiorach tekstu, a Common Crawl dostarcza większość tego materiału. Z naszych analiz i raportów branżowych: około 95% danych treningowych Common Crawl to angielski, więc polskie treści są w zdecydowanej mniejszości. Serwis z pełnowartościową wersją angielską kluczowych podstron – przetłumaczoną merytorycznie, a nie ślepym autotranslate – trafia do modeli i do odpowiedzi anglojęzycznych znacznie częściej.
Model z marką w danych treningowych potrafi polecić ją nawet z wyłączonym wyszukiwaniem internetu, dlatego warto zrobić taki test: odpytaj model o swoją kategorię bez dostępu do sieci i zobacz, czy twoja marka w ogóle istnieje w jego pamięci.
Druga kwestia to dostęp. Nie blokuj Common Crawl w robots.txt, jeśli zależy ci na wejściu do danych treningowych kolejnych generacji modeli – marka nieobecna w materiale treningowym nie istnieje dla modelu, który odpowiada z pamięci. Pamiętaj jednak o granicach tej decyzji: wyłączenie CCBot nie karze cię w klasycznym SEO, to wybór dotyczący warstwy AI, nie pozycji w Google.
Biznesowo to najtańsza dźwignia długoterminowa: treść przetworzona przez crawl pracuje na markę latami, bez opłat i bez utrzymania, bo wchodzi do bazy, na której uczą się kolejne modele.