Skąd modele AI biorą informacje: wiedza z treningu i wyszukiwanie
Zanim przejdziemy do sygnałów zaufania, warto rozdzielić dwa mechanizmy. Często wrzuca się je do jednego worka, a działają inaczej.
Wiedza parametryczna, czyli innymi słowy to, czego model nauczył się podczas treningu. W sytuacji, kiedy Twoja marka, nazwisko czy dane pojawiały się w materiałach treningowych, model może odtworzyć związane z nimi informacje bez sięgania do sieci. Na tę warstwę mamy wpływ pośredni i z opóźnieniem, ponieważ aktualizacja wiedzy zapisanej w parametrach wymaga dalszego treningu lub innej ingerencji w model.
Wyszukiwanie informacji podczas odpowiadania pozwala narzędziom takim jak ChatGPT Search, Perplexity, Copilot, AI Overviews czy AI Mode w Google korzystać z materiałów spoza wiedzy parametrycznej. Retrieval oznacza wyszukiwanie materiałów, a (retrieval-augmented generation) to generowanie odpowiedzi z ich wykorzystaniem. Mogą one pochodzić z indeksu, zapisanej kopii, bazy dokumentów albo strony pobranej na żądanie. Nie każda odpowiedź wymaga ponownego pobrania wszystkich stron. Jeśli strona jest dostępna, czytelna i przydatna dla danego pytania, może zostać zacytowana bez czekania na trening kolejnego modelu.
Co to w praktyce oznacza? Model odpowiadający wyłącznie z wiedzy parametrycznej nie sprawdza źródeł informacji na bieżąco, czyli bazuje tylko na wiedzy treningowej.
Jak AI wybiera źródła do cytowania w odpowiedzi
W dużym uproszczeniu system najpierw interpretuje pytanie i wyszukuje kandydatów, następnie porządkuje wyniki, wybiera materiały do kontekstu modelu i generuje odpowiedź z odnośnikami. Google opisuje technikę rozgałęziania zapytań (ang. query fan-out), w której AI Overviews i AI Mode wykonują wiele powiązanych wyszukiwań dotyczących podtematów. Źródło może więc trafić do odpowiedzi przez bardziej szczegółowe zapytanie niż to wpisane przez użytkownika.
Dostępność, trafność i wiarygodność to osobne kryteria. Dokument może być dostępny i rzetelny, ale nie odpowiadać na konkretne pytanie. Podobieństwo tekstu do zapytania również nie dowodzi prawdziwości informacji. Pełne reguły selekcji i wagi sygnałów w poszczególnych produktach nie są publiczne, dlatego wskazówki redakcyjne w tym artykule traktuj jako sposoby poprawy użyteczności treści, bez gwarancji cytowania. Szerszą strategię, w której się mieszczą, opisuję w przewodniku po GEO.
Czy bot AI widzi Twoją stronę? Dostęp jako warunek zerowy
Nawet najlepiej udokumentowana treść nie stanie się bezpośrednim źródłem odpowiedzi, jeśli system AI nie będzie mógł do niej dotrzeć, a trudności z pobieraniem strony wyjątkowo łatwo przeoczyć. Warto pamiętać, że brak śladu po wizycie bota w logach serwera nie oznacza od razu, że strona jest niewidoczna – system może przecież korzystać z pamięci podręcznej albo danych od pośredników.
robots.txt, CDN i WAF: boty AI do treningu i do wyszukiwania
Poszczególni dostawcy stosują własne user-agenty i często osobne boty do treningu i do wyszukiwania. OpenAI ma GPTBot (trening), OAI-SearchBot (wyszukiwanie) i ChatGPT-User (pobieranie na żądanie użytkownika). Anthropic ma ClaudeBot, Claude-SearchBot i Claude-User. Perplexity rozdziela PerplexityBot, wykorzystywany do wyszukiwania, oraz Perplexity-User, obsługujący pobrania na żądanie użytkownika. Tam, gdzie dostawca rozdziela te zastosowania, możesz zablokować trening i jednocześnie pozwalać na wyszukiwanie.
Pobieranie na żądanie ma inne zasady niż automatyczne indeksowanie. OpenAI zaznacza, że reguły robots.txt mogą nie dotyczyć ChatGPT-User, a Perplexity opisuje Perplexity-User jako mechanizm, który zwykle je ignoruje. Robots.txt wyraża preferencje dla botów; faktyczną blokadę dostępu egzekwuje serwer lub infrastruktura przed nim.
Drugą pułapką jest infrastruktura. Cloudflare w lipcu 2025 roku ogłosił domyślne blokowanie crawlerów AI, ale w 2026 roku rozdzielił kontrolę ruchu na Search, Agent i Training. Ustawienia zależą od kategorii ruchu i konfiguracji witryny, więc nie należy zakładać, że każda nowa domena blokuje wszystkie boty AI. Sprawdź aktualne reguły w panelu. Podobne blokady mogą siedzieć w , w ustawieniach hostingu albo we wtyczce bezpieczeństwa. Plik robots.txt może pozwalać na wszystko, a bot i tak dostaje 403.
Czy crawlery AI renderują JavaScript?
To punkt szczególnie ważny dla stron na Reakcie i innych frameworkach . Googlebot renderuje JavaScript od lat. Analiza Vercel i MERJ z 17 grudnia 2024 roku wykazała, że badane crawlery AI, w tym GPTBot i ClaudeBot, pobierały pliki JS, ale ich nie wykonywały. To obserwacja dotycząca konkretnych botów w danym okresie, a nie uniwersalna reguła dla wszystkich narzędzi AI i agentów korzystających z przeglądarki.
Jeśli treść artykułu, opis produktu albo dane strukturalne powstają dopiero w przeglądarce (, ang. client-side rendering), bot bez renderowania JS nie odczyta tych elementów z początkowego HTML-u. Ta sama podstrona może więc dobrze wypadać w wynikach Google i sprawiać problemy przy bezpośrednim pobieraniu przez inne systemy.
Rozwiązaniem jest , generowanie statyczne () albo wstępne renderowanie (prerendering). Wstępny test to pobranie strony przez curl, sprawdzenie statusu HTTP po przekierowaniach i wyszukanie zdania w zapisanej odpowiedzi:
Brak wyników w poleceniu grep wymaga bezpośredniej weryfikacji kodu HTML. Poszukiwane zdanie może być bowiem rozdzielone znacznikami, zapisane z użyciem encji, a sama pobrana odpowiedź może zawierać błąd lub ekran blokady (np. Cloudflare). Warto pamiętać, że podmienienie nagłówka User-Agent nie odtwarza adresu IP ani pozostałych cech prawdziwego bota. Dostęp należy zatem potwierdzać również w logach serwera oraz sieci , weryfikując tożsamość żądań zgodnie z oficjalną dokumentacją dostawcy.
Wymagania Google dla AI Overviews i AI Mode
W przypadku AI Overviews i AI Mode Google wymaga, by strona była zindeksowana i kwalifikowała się do wyświetlenia z fragmentem opisu (ang. snippet), żeby mogła pojawić się jako link wspierający odpowiedź. Poza tym nie ma dodatkowych wymagań technicznych.
Google AI Overviews i AI Mode korzystają z infrastruktury Google Search, a dostęp reguluje Googlebot. Z kolei dla wyszukiwania ChatGPT znaczenie ma OAI-SearchBot, podczas gdy Perplexity dokumentuje własnego bota wyszukiwawczego i pobrania na żądanie. Ostatecznie to, że pojawiamy się w Google, nie znaczy, że pojawimy się w innych narzędziach.
Tożsamość marki i autora: jak AI przypisuje treść do podmiotu
Jednoznaczna tożsamość ułatwia przypisanie treści do konkretnego podmiotu – firmy, autora czy produktu – i skutecznie ogranicza ryzyko pomylenia marek lub osób o podobnych nazwach.
O czym trzeba pamiętać i co pomaga:
- Spójność nazwy i opisu. Wszędzie. Ta sama nazwa firmy, ten sam opis działalności, te same dane kontaktowe na stronie, w Profilu Firmy w Google, na LinkedInie oraz w katalogach branżowych. Rozbieżności (inna nazwa w KRS, inna na stronie, jeszcze inna w mediach społecznościowych) utrudniają połączenie wzmianek w jedną .
- Dane strukturalne Organization i Person z właściwością
sameAs, wskazującą oficjalne profile, a sama strona autora może dodatkowo korzystać zProfilePage. Dane strukturalne są istotne, pomagają w jednoznacznej identyfikacji i też muszą zgadzać się z tym, co widać na stronie. Google wprost pisze, że do funkcji AI nie potrzeba żadnego specjalnego , ale lepiej to mieć zrobione na stronie. - Autor z weryfikowalnym śladem. Notka o autorze pod artykułem to minimum. Liczy się to, czy daną osobę da się znaleźć gdzie indziej: publikacje, wystąpienia, projekty, profil zawodowy, linki do GitHuba czy LinkedIna. Jeśli chcesz zobaczyć, jak to wygląda, zajrzyj na koniec tego artykułu.
Badanie opublikowane w styczniu 2026 roku na arXiv („Authority Signals in AI Cited Health Sources”) przeanalizowało 615 źródeł cytowanych przez ChatGPT 5.2 Pro w odpowiedziach na 100 pytań zdrowotnych. 75,7% cytowań prowadziło do źródeł sklasyfikowanych jako instytucjonalne, takich jak Mayo Clinic, NHS, PubMed czy Wikipedia. To badanie opisowe, ograniczone do jednej dziedziny i jednego modelu, więc nie dowodzi mechanizmu przyczynowego.
W tej samej próbie 64,7% źródeł nie miało wskazanego autora, a 60,8% nie zawierało odwołań do źródeł. Dane zebrano 11 stycznia 2026 roku, prosząc dodatkowo o podanie źródeł wraz z odnośnikami. Badanie ukazuje specyfikę wybranych materiałów, jednak nie porównuje ich z pełnym zbiorem stron, które system mógł potencjalnie uwzględnić. Poza tym, na jego podstawie nie można stwierdzić, czy dodanie notki biograficznej autora zwiększy liczbę cytowań, ani też bezpośrednio przełożyć uzyskanych wyników na inne branże – takie jak prawo, medycyna czy finanse – bądź na odmienne produkty AI.
Z tym tematem wiąże się , czyli doświadczenie, wiedza ekspercka, autorytet i zaufanie w wytycznych jakości Google (E-E-A-T nie jest pojedynczym czynnikiem rankingowym). Są to przydatne ramy oceny treści, bez ujawnionej wspólnej punktacji dla ChatGPT, Perplexity i Google.
Sprawdzalne twierdzenia i źródła w treści pod AI
Zdanie z Twojego tekstu może zostać wykorzystane w odpowiedzi AI. Podanie dowodów ułatwia jego sprawdzenie czytelnikowi i systemowi, który rzeczywiście weryfikuje materiały. Nie oznacza to, że każdy produkt automatycznie porównuje wszystkie twierdzenia z niezależnymi źródłami.
W praktyce oznacza to:
- Konkretne, wiarygodne źródła. Nazwa instytucji, tytuł raportu, data, najlepiej z linkiem do źródła pierwotnego.
- Liczby z kontekstem. Przykładowo piszemy: „Konwersja na stronie produktowej wzrosła z 1,8% do 2,4% w ciągu trzech miesięcy po wdrożeniu SSR” to twierdzenie, które można zacytować. Obejmuje zakres, liczbę i ma sens.
- Oddzielenie faktów od opinii. Jasno zaznacz, co jest danymi, a co Twoją interpretacją. Sformułowania typu „moim zdaniem”, „w naszych projektach” czy „według dokumentacji” nie osłabiają tekstu, ale precyzują, czego dotyczy twierdzenie.
- Przyznawanie się do ograniczeń. W sytuacji, kiedy wykorzystujesz dane szacunkowe, dotyczą jednej branży albo wkrótce się zdezaktualizują, napisz to wyraźnie. Tekst, który zna swoje granice, jest bardziej wiarygodny niż tekst, który twierdzi wszystko z tą samą pewnością.
- Dane własne. Wyniki z własnych projektów, pomiary, studia przypadków, analiza logów. Mogą dostarczyć informacji niedostępnych w innych publikacjach. Opisz metodę i ograniczenia, żeby czytelnik mógł ocenić je jako źródło pierwotne.
- Lista źródeł na końcu tekstu. Ułatwia weryfikację zarówno ludziom, jak i systemom.
Struktura treści pod AI: fragmenty zrozumiałe bez kontekstu
Wiele systemów wyszukiwania materiałów dzieli dokumenty na fragmenty (tzw. ) i wybiera te, które najlepiej pasują do pytania. Wyszukiwanie może wykorzystywać , dopasowanie słów, np. , lub połączenie obu metod, po którym następuje ponowne uporządkowanie wyników (Anthropic opisuje takie podejście w materiale „Contextual Retrieval”). Zależnie od implementacji model może otrzymać fragmenty z dodatkowym kontekstem albo pełne dokumenty, dlatego samodzielnie zrozumiałe sekcje są dobrą praktyką, a nie wymaganiem jednego wspólnego algorytmu.
Co z tego wynika dla struktury:
- Każda sekcja pod nagłówkiem H2 lub H3 powinna być zrozumiała w oderwaniu od reszty. Jeśli ktoś zobaczy tylko ten fragment, czy będzie wiedział, o czym mowa?
- Odpowiedź na początku sekcji, kontekst później. Pierwsze zdanie po nagłówku powinno odpowiadać na pytanie z nagłówka.
- Unikaj odwołań do wcześniejszych części. „Jak wspomniałem wyżej” albo „to rozwiązanie” po wycięciu z kontekstu tracą sens. Lepiej powtórzyć nazwę rzeczy, o której mowa.
- Definiuj pojęcia tam, gdzie ich używasz. Jedno zdanie wyjaśnienia przy pierwszym użyciu terminu wystarczy.
- Semantyczny HTML. Poprawna hierarchia nagłówków, prawdziwe listy (
<ul>,<ol>) zamiast akapitów z myślnikami, tabele dla danych porównawczych. Parsery łatwiej wyciągają z tego strukturę. - Precyzyjna terminologia. W tekście specjalistycznym używaj nazw, którymi posługuje się branża. Model łatwiej powiąże fragment z pytaniem, gdy padną w nim właściwe pojęcia, a nie ich opisowe zamienniki.
Wzmianki o marce poza stroną: media, fora i opinie
Twoja strona to tylko jedno z wielu miejsc, z których model składa obraz marki i tutaj liczy się cały ekosystem wzmianek.
- Wzmianki w mediach i serwisach branżowych, także bez linku. Współwystępowanie nazwy marki z tematem może pomóc w tworzeniu skojarzeń podczas treningu, jeśli materiał trafi do danych. Sama liczba wzmianek nie daje jednak przewidywalnego wyniku.
- Dyskusje w społecznościach. Reddit ma od 2024 roku umowy dotyczące dostępu do danych z Google i OpenAI, a wątki z forów mogą pojawiać się w cytowaniach AI. Umowa na dane nie dowodzi wyższej wagi rekomendacji użytkownika niż tekstu sponsorowanego. Przy ocenie takiej rekomendacji liczy się jej kontekst i możliwość sprawdzenia opisanych doświadczeń.
- Zestawienia i rankingi. Przy pytaniach typu „jakie są najlepsze narzędzia do X” zewnętrzna lista może dostarczyć kandydatów do porównania. Obecność w zestawieniu stwarza taką możliwość, ale nie gwarantuje rekomendacji ani cytowania.
- Linki z wiarygodnych domen. Uczelnie, instytucje publiczne, uznane media. Poza mocą rankingową w klasycznym SEO to też sygnał, że ktoś z zewnątrz uznał treść za wartą przywołania.
- Opinie klientów. Wydźwięk recenzji i dyskusji może wpłynąć na opis marki, jeśli system wykorzysta je w odpowiedzi, zwłaszcza przy pytaniach o rekomendacje.
Szczegóły tego, jak poszczególne systemy ważą te sygnały, oczywiście nie są jawne, więc traktuj wzmianki jako dodatkowe miejsca, w których odbiorca lub system może znaleźć informacje o marce. Przy ocenie wiarygodności należy szukać niezależnych potwierdzeń oraz weryfikować pierwotne pochodzenie danych, zamiast po prostu liczyć powtórzenia tego samego tekstu.
Aktualność treści i daty publikacji a odpowiedzi AI
Dla pytań o rzeczy, które się zmieniają (ceny, przepisy, wersje oprogramowania, trendy), świeżość ma duże znaczenie. Wyszukiwanie pozwala dostarczyć dane nowsze niż wiedza treningowa modelu, choć nie gwarantuje dotarcia do najnowszej wersji. Przy pytaniu historycznym starszy dokument może być właściwym źródłem.
- Widoczna data publikacji i aktualizacji w treści oraz w danych strukturalnych. W schema.org służą do tego właściwości
datePublishedidateModified. - Nie zmieniaj daty bez zmiany treści. Google w dokumentacji o datach wprost odradza odświeżanie dat bez istotnych zmian. Sztucznie „odmłodzony” tekst z nieaktualnymi informacjami to sygnał przeciwny do zamierzonego.
- Aktualizuj przeterminowane odniesienia. „Trendy na 2024 rok” wymagają zmiany w poradniku przedstawianym jako bieżący. W analizie historycznej zachowaj rok i wyjaśnij, jakiego okresu dotyczą wnioski.
- Dopisuj bieżący kontekst. Krótka sekcja o tym, co zmieniło się od publikacji, często wystarczy, żeby stary tekst znów był użyteczny.
HTTPS, Core Web Vitals i dostępność: które sygnały techniczne mają znaczenie?
W tekstach o wyszukiwaniu AI często pojawiają się twierdzenia techniczne, których nikt nie potwierdził. Warto je rozdzielić.
HTTPS to dziś standard i brak certyfikatu szkodzi z wielu powodów: ostrzeżenia w przeglądarce, ranking w Google, zaufanie użytkowników. Nie ma natomiast publicznie udokumentowanej, wspólnej reguły, według której modele pomijają wszystkie strony bez HTTPS. Błąd certyfikatu TLS może niezależnie uniemożliwić narzędziu pobranie strony, co jest problemem dostępu, zanim dojdzie do oceny treści.
(LCP, INP, CLS) są wykorzystywane przez systemy rankingowe Google. Dbanie o nie pozostaje częścią SEO, ale nie mamy potwierdzonej osobnej premii za te wyniki przy wyborze cytowań w AI Overviews. Samo pobranie surowego HTML-u nie mierzy INP ani CLS. Na tym etapie liczy się to, czy serwer odpowiada i czy nie zwraca błędów lub przekroczeń czasu odpowiedzi.
Natrętne wyskakujące okna i reklamy przykrywające treść szkodzą w Google (wytyczne dotyczące reklam pełnoekranowych, ang. interstitials) i w odbiorze użytkownika. Jeśli takie elementy są w HTML-u przed treścią główną, mogą też zaśmiecać fragmenty, które parser wyciąga ze strony.
Dostępność obejmuje znacznie więcej niż semantyczny HTML, ale sensowne opisy alt, poprawna hierarchia nagłówków i tekstowe odpowiedniki informacji na obrazkach pomagają również w odczycie dokumentu przez narzędzia. To część wspólna potrzeb czytników ekranu i parserów, bez gwarancji identycznego przetwarzania strony.
Co obniża wiarygodność treści w oczach AI?
- Sprzeczności. Różne liczby w różnych artykułach, różne definicje tego samego pojęcia, inna cena na stronie usługi i w cenniku. Utrudniają weryfikację, a system może wybrać niewłaściwy wariant, nawet jeśli zauważy rozbieżność.
- Kontrowersyjne tezy bez mocnego oparcia. Twierdzenie sprzeczne z konsensusem nie jest automatycznie złe, ale wymaga znacznie silniejszych dowodów niż powtórzenie wiedzy powszechnej.
- Generyczność. Tekst, który mówi to samo co dziesięć innych, tylko innymi słowami, daje odbiorcy niewiele dodatkowej wartości. Google ma patent na ocenę przyrostu informacji (ang. information gain), czyli wartości dodanej względem innych dokumentów. Sam patent nie dowodzi wdrożenia ani stosowania tej metody do wyboru źródeł w odpowiedziach AI.
- Brak eksperta w tematach . W zdrowiu, finansach i prawie błędy mogą wpływać na bezpieczeństwo i decyzje życiowe odbiorcy, dlatego wiedza autora i sprawdzalne źródła mają szczególne znaczenie. Opisane badanie zdrowotne nie dowodzi jednak automatycznego odrzucania anonimowych tekstów przez AI.
- Język clickbaitowy. Wykrzykniki, „szokujące” odkrycia, obietnice bez pokrycia utrudniają oddzielenie informacji od perswazji. Unikanie takiego stylu to zalecenie redakcyjne; nie ma tu dowodu na wspólną dla systemów AI karę za określone sformułowania.
- Dane strukturalne niezgodne z treścią. Znaczniki schema.org opisujące coś, czego nie ma na stronie, to w Google naruszenie wytycznych. Nie należy z tego wywodzić identycznego sposobu wykrywania i oceniania rozbieżności przez każdy system AI.
Czy cytowanie przez AI potwierdza wiarygodność źródła?
Renoma źródła, prawdziwość informacji i poprawność cytowania to trzy różne rzeczy. Nawet uznana instytucja może publikować dokument, który jest nieaktualny albo dotyczy innej populacji niż pytanie użytkownika. Z kolei poprawny fakt może zostać opatrzony linkiem do strony, która go nie potwierdza.
Badanie „Evaluating Verifiability in Generative Search Engines” z 2023 roku wykazało problemy z kompletnością i trafnością cytowań w badanych wyszukiwarkach generatywnych. Jego wyniki liczbowe dotyczą ówczesnych produktów, więc nie opisują jakości obecnych wersji. Pokazuje jednak, dlaczego przy ocenie odpowiedzi trzeba sprawdzać, czy źródło rzeczywiście wspiera przypisane mu zdanie i czy wszystkie twierdzenia wymagające dowodów mają takie wsparcie.
Otwórz wskazany materiał, sprawdź datę, zakres danych i zdanie, na które powołuje się odpowiedź. Przy rozbieżnościach wróć do dokumentu pierwotnego. Kilka zgodnych odpowiedzi AI również nie stanowi niezależnego potwierdzenia, jeśli wszystkie opierają się na tej samej publikacji.
Jak mierzyć widoczność i cytowania w odpowiedziach AI?
Nie będę wchodził w temat narzędzi do pomiaru widoczności AI, ale skupię się na samej metodyce. Najpierw musisz przygotować stały zestaw pytań odpowiadających temu, czego szukają Twoi klienci, i powtarzać sprawdzenie w tych samych produktach i trybach. Musisz mieć zapisaną datę, treść pytania, język, ustawienia oraz cytowane adresy, przy czym oddziel wzmiankę o marce od linku do Twojej strony, a potem sprawdź, czy odpowiedź poprawnie wykorzystuje jej treść.
Po zmianach porównuj wyniki z wcześniejszymi pomiarami, logami zweryfikowanych botów oraz ruchem i konwersjami z odesłań. Wizyta crawlera potwierdza pobranie, a odnotowany link potwierdza cytowanie w konkretnej odpowiedzi. Google uwzględnia ruch z AI Overviews i AI Mode w raporcie skuteczności Search Console dla typu wyszukiwania „Sieć”.


