# Checklista dostępności serwisu dla modeli AI (AI Access Audit)

> Dla kogo: Konsultant SEO/GEO · Czas: 2–4 godziny
> Wersja online i arkusz XLSX: https://skuteczne-pozycjonowanie-stron.pl/porady/checklisty/dostep-dla-ai/

Checklistę stosujesz przy audycie, czy modele AI w ogóle mają dostęp do serwisu – zanim zaczniesz optymalizować treści pod GEO, upewnij się, że crawlerzy AI nie dostają zamkniętych drzwi. Wypełnia ją konsultant SEO/GEO na starcie projektu AI lub przy spadku obecności marki w odpowiedziach; pełny audyt dostępu zajmuje 2-4 godziny. Zasada: najtańsze poprawki tutaj (robots, Bing, llms.txt) odblokowują całą resztę pracy GEO.

## robots.txt i crawlerzy AI
- [ ] **Robots.txt przejrzany pod kątem crawlerów AI** – otwórz domena.pl/robots.txt i wypisz reguły dla botów AI: GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot, Applebot, Bytespider. Każdy User-agent ma jawną decyzję: dostęp albo świadomy blok.
- [ ] **Test GPTBot: dostęp do kluczowej podstrony** – sprawdź, czy GPTBot może pobrać kluczowe podstrony (test w GSC/Bing lub symulacja user-agent); zablokowany GPTBot = brak cytowań w ChatGPT z Twojego serwisu.
- [ ] **Test ClaudeBot i PerplexityBot: dostęp do kluczowej podstrony** – powtórz test dla ClaudeBot i PerplexityBot: status 200 przy pobieraniu, brak blokady na poziomie CDN. Perplexity buduje odpowiedzi na żywo – blokada = zero cytowań w Perplexity.
- [ ] **CCBot nieblokowany (dane treningowe)** – sprawdź robots.txt: CCBot ma dostęp. CCBot zasila Common Crawl = baza treningowa kolejnych modeli; blokada dziś to nieobecność w treningu za rok.
- [ ] **Blokada w Cloudflare "Block AI Scrapers" zweryfikowana** – sprawdź ustawienia Cloudflare klienta: czy włączono wbudowaną blokadę botów AI. Najczęstszy przypadek utraty dostępu: ktoś kliknął przełącznik i nikt nie wiedział, że odcina to cały ruch AI.
- [ ] **Brak blokad na poziomie serwera/WAF dla botów AI** – przejrzyj reguły WAF i .htaccess/nginx: user-agenty botów AI nie są odrzucane na poziomie serwera (403). Blokada w robots.txt jest deklaratywna; blokada na serwerze jest twarda – sprawdź obie warstwy.

## llms.txt i metadane dla modeli
- [ ] **llms.txt rozważony i wdrożony lub świadomie odroczony** – sprawdź, czy serwis ma /llms.txt z mapą kluczowych treści; standard jest dyskusyjny (jedni twierdzą, że działa, inni że to bujda), ale koszt wdrożenia jest niski. Decyzję dokumentuj – nie zostawiaj "nie wiem".
- [ ] **JSON-LD z jawnymi encjami i sameAs** – sprawdź w kodzie kluczowych podstron: schema z encjami Organization/Person/Product i polami sameAs do profili. JSON-LD to najtańsza ekstrakcja dla modeli (pomija HTML/JS).
- [ ] **Treść kluczowa w surowym HTML, nie w JS** – porównaj surowy HTML z renderowanym DOM: fakty, nazwy, ceny dostępne bez uruchamiania JavaScript. Modele i mniej zasobne crawlery nie zawsze renderują JS.
- [ ] **Transkrypty wideo i podcastów opublikowane** – zweryfikuj: każde wideo/podcast ma pełną transkrypcję tekstową na stronie. Do modeli trafia tekst, nie obraz czy audio.

## Wersja EN i trening
- [ ] **Pełnowartościowa wersja EN kluczowych podstron** – sprawdź, czy kluczowe podstrony mają realną wersję EN (nie ślepy auto-translate). Ok. 95% danych treningowych Common Crawl to angielski – serwis bez EN jest treningowo niewidzialny.
- [ ] **Kluczowe URL-e dostępne dla Common Crawl** – sprawdź obecność kluczowych URL w Common Crawl (indeks CC) i robots.txt pod CCBot. Obecność w CC to warunek wejścia do następnego treningu.

## Bing i alternatywne mapy
- [ ] **Serwis zaindeksowany w Bing + Bing Webmaster Tools podpięte** – sprawdź widoczność w Bing i instalację Bing Webmaster Tools (konto Microsoft pod klienta). Bing zasila część odpowiedzi – ale NIE traktuj Bing/IndexNow jako głównej dźwigni do ChatGPT.
- [ ] **Bing Places założony przy fizycznej lokalizacji** – przy lokalizacji fizycznej: profil Bing Places uzupełniony standardem GMB. Lokalni klienci pytają modele "najlepszy X w mieście" – modele korzystają z map.
- [ ] **Profile mapowe alternatywne kompletne** – sprawdź: Apple Maps, Bing Maps, OpenStreetMap, HERE, Waze, Targeo – komplet profili standardem GMB. Obecność mapowa napędza odpowiedzi LLM na zapytania lokalne.

## Profile społeczne, Wikipedia, wzmianki
- [ ] **Profile social media marki kompletne i spójne** – sprawdź: LinkedIn, YouTube, Reddit, for branżowe – kompletne profile z linkami do strony i spójnymi nazwami. Modele korzystają z profili publicznych jako źródeł opisu marki.
- [ ] **LinkedIn: profil firmy i aktywność osoby-eksperta** – sprawdź profil firmowy i profil eksperta (bio, LinkedIn, schema Person w serwisie). LinkedIn jest wśród źródeł, które "ruszają" AI – wzmianki z LinkedIn wspierają odpowiedzi rekomendacyjne.
- [ ] **YouTube: kanał i transkrypcje kluczowych materiałów** – sprawdź kanał klienta; YT bardzo często jest źródłem w ChatGPT. Kluczowe materiały z transkrypcjami na stronie i na kanale.
- [ ] **Medium/Quora: publikacje eksperckie zaplanowane** – sprawdź obecność marki/eksperta na Medium i Quora; publikuj eksperckie odpowiedzi i artykuły. To źródła z naszego standardu link buildingu pod AI – wzmianki z nich wspierają rekomendacje modeli.
- [ ] **Wikipedia/Wikidata: obecność lub plan wzmianki** – sprawdź, czy marka ma artykuł w Wikipedii lub przynajmniej rekord Wikidata; jeśli nie – zaplanuj drogę wzmianki/linku. Wzmianka z Wikipedii to jeden z najsilniejszych sygnałów encyjnych.
- [ ] **Autentyczna obecność na Reddit (jeśli branża tego wymaga)** – sprawdź: oficjalne konto marki, ewentualnie subreddit; zaangażowanie autentyczne, nie astroturfing. Reddit to ok. 10x więcej cytowań niż Wikipedia (dane z raportów branżowych).
- [ ] **Integracja serwisu z social media** – sprawdź na stronie: widoczne linki do profili SM, wdrożone polecenia udostępniania, integracja z opiniami gdzie możliwe. Spójność serwisu z profilem społecznym wzmacnia sygnał encyjny.

## Kwadrant wzmianka × cytowanie
- [ ] **Wzmianki vs cytowania policzone i przypisane do kwadrantu** – dla marki policz wzmianki (nazwa w odpowiedzi) i cytowania (link do domeny); dużo wzmianek / mało cytowań → broń wzmianek; mało / dużo → pchaj cytowania. Przykład z naszych danych: marka z 74% wzmianek bez cytowania własnej domeny.
- [ ] **Test "czy AI wie, co to za marka"** – odpytaj ChatGPT/Gemini/Perplexity o domenę klienta: "co to jest za marka", "co znajduje się na stronie X". Odpowiedź nieznajoma lub błędna = problem dostępu lub treningu, nie treści.
- [ ] **Test obecności w danych treningowych (web search wyłączony)** – odpytaj z WYŁĄCZONYM web search: marka polecana z pamięci = secured w treningu. To inna warstwa niż cytowanie – wymaga innych działań.

## Jak interpretować wyniki

Sekcja "robots.txt i crawlerzy AI" jest bramą: każdy niezaliczony punkt tutaj unieważnia pytanie "dlaczego nas nie cytują" – model, który nie ma dostępu, nie może cytować; zacznij od Cloudflare i robots.txt, bo to najczęstsza przyczyna utraty cytowań. Sekcje "llms.txt i metadane" i "wersja EN" decydują o tym, czy model potrafi Cię zrozumieć i zapamiętać: JSON-LD + surowy HTML + EN to trójka warunkująca długoterminową obecność w treningu. Sekcja "Bing i mapy" jest ważna dla lokalnych – przy serwisie globalnym traktuj ją jako opcjonalną, przy lokalnym jako obowiązkową. Sekcja wzmianek domyka sygnały pozastronowe: zero wzmianek poza stroną to problem reputacji encyjnej, nie technicznej. Wynik: pełna sekcja 1 = serwis dostępny dla AI (warunek konieczny); pełne sekcje 1-3 = gotowość treningowa; komplet = pełny AI Access Audit zaliczony. Każdy niezaliczony punkt dokumentuj z nazwą crawlera i URL-em testowym – audyt bez dowodu pobrania to opinia.

---
SEODEV · skuteczne-pozycjonowanie-stron.pl · hello@seodev.agency · +48 537 269 103
