Rozmowy o widoczności w ChatGPT, Perplexity czy AI Overviews rozjeżdżają się najczęściej nie dlatego, że zespół ma różne dane, tylko dlatego, że każdy używa innych słów na to samo zjawisko. Ktoś mówi „cytowanie”, ktoś inny „wzmianka”, a trzecia osoba ma na myśli link w source boxie. Ten słownik porządkuje 40 pojęć, które realnie pojawiają się w briefach, raportach i sporach o budżet.
Definicje są celowo krótkie, po jednym zdaniu, z przykładem użycia w kontekście optymalizacji treści. Jeśli dopiero zaczynasz, warto zacząć od tekstu czym jest AIO w 2026, a potem wrócić tutaj po konkretne terminy.
Jak korzystać z tego słownika
Pojęcia pogrupowałem w pięć warstw, które odpowiadają kolejnym etapom drogi treści do odpowiedzi modelu: warstwa modelu, warstwa wyszukiwania, warstwa treści, warstwa widoczności i warstwa dostępu. Taki podział jest wygodniejszy niż alfabetyczny, bo pokazuje zależności. Nie zoptymalizujesz cytowań (warstwa widoczności), jeśli crawler AI nie ma dostępu do strony (warstwa dostępu).
Praktyczna wskazówka: przy wdrożeniu ustal z zespołem, których pięciu pojęć używacie w raportach, i trzymajcie się ich konsekwentnie. Reszta niech zostanie w dokumentacji. Rozjazd terminologiczny kosztuje więcej niż brak jednego narzędzia.
Pojęcia wokół modelu: LLM, kontekst, halucynacja
Ta warstwa opisuje sam model językowy, czyli to, co generuje ostateczną odpowiedź. Większości z tych rzeczy nie kontrolujesz, ale bez nich nie zrozumiesz, dlaczego treść bywa cytowana raz, a raz nie.
| Pojęcie | Definicja | Przykład użycia |
|---|---|---|
| LLM | Duży model językowy przewidujący kolejne tokeny na podstawie wzorców z treningu. | „Perplexity używa kilku LLM zależnie od trybu.” |
| Token | Najmniejsza jednostka tekstu, jaką przetwarza model, zwykle fragment słowa. | „Polski tekst zużywa więcej tokenów niż angielski.” |
| Okno kontekstowe | Maksymalna liczba tokenów, jaką model widzi w jednym zapytaniu razem z pobranymi źródłami. | „Długi artykuł trafia do kontekstu tylko we fragmentach.” |
| Halucynacja | Odpowiedź brzmiąca wiarygodnie, ale niepokryta żadnym źródłem ani faktem. | „Model podał nieistniejący cennik, to halucynacja.” |
| Knowledge cutoff | Data, po której model nie ma wiedzy z treningu i musi sięgnąć po wyszukiwanie. | „Nowość z marca zobaczy tylko przez retrieval.” |
| Prompt | Instrukcja użytkownika lub systemu sterująca zachowaniem modelu. | „Testujemy 20 promptów brandowych miesięcznie.” |
| Temperatura | Parametr losowości: im wyższy, tym bardziej zróżnicowane odpowiedzi na to samo pytanie. | „Rozbieżność wyników testu bierze się z temperatury.” |
| Fine-tuning | Douczenie modelu na własnym zbiorze danych, zmieniające jego domyślne odpowiedzi. | „Fine-tuning nie wpłynie na to, czy model zacytuje Twój blog.” |
Pojęcia wokół wyszukiwania: RAG, grounding, retrieval
Tu dzieje się najwięcej z perspektywy AIO. To warstwa, która decyduje, czy Twoja strona w ogóle trafi do kontekstu odpowiedzi. Mechanikę tego procesu rozkładam krok po kroku w tekście o tym, jak działa RAG w wyszukiwarkach AI.
| Pojęcie | Definicja | Przykład użycia |
|---|---|---|
| RAG | Architektura, w której model przed odpowiedzią pobiera dokumenty i generuje na ich podstawie. | „AI Overviews działa w schemacie zbliżonym do RAG.” |
| Retrieval | Etap pobierania kandydatów: dokumentów lub fragmentów pasujących do zapytania. | „Strona nie przeszła retrievalu, więc nie było szans na cytat.” |
| Grounding | Osadzenie odpowiedzi w konkretnych, weryfikowalnych źródłach zamiast w samej pamięci modelu. | „Bez groundingu nie ma linków pod odpowiedzią.” |
| Query fan-out | Rozbicie jednego pytania użytkownika na kilka zapytań wyszukiwania w tle. | „Jedno pytanie o ceny wygenerowało sześć zapytań.” |
| Rewriting zapytania | Przeformułowanie pytania przez model na formę skuteczniejszą w wyszukiwarce. | „Model zamienił potoczne pytanie na frazę techniczną.” |
| Reranking | Powtórne uszeregowanie pobranych fragmentów pod kątem trafności przed wysłaniem do modelu. | „Reranker wyrzucił nasz fragment na miejsce 40.” |
| Indeks wektorowy | Baza przechowująca treść jako wektory, przeszukiwana po podobieństwie znaczeniowym. | „Asystent na stronie stoi na indeksie wektorowym.” |
| Wyszukiwanie hybrydowe | Połączenie dopasowania słów kluczowych z dopasowaniem semantycznym. | „Hybryda ratuje frazy brandowe, których wektor gubi.” |
Pojęcia wokół treści: chunk, embedding, passage
Warstwa, na którą masz największy wpływ redakcyjny. Model nie ocenia „artykułu” jako całości, tylko wybrane kawałki, dlatego sposób cięcia i formatowania treści jest decyzją SEO, a nie kosmetyką.
| Pojęcie | Definicja | Przykład użycia |
|---|---|---|
| Chunk | Fragment tekstu, na jaki dzielona jest strona przed indeksowaniem wektorowym. | „Sekcja bez nagłówka wpadła do chunka z inną tematyką.” |
| Chunking | Strategia dzielenia treści: po nagłówkach, po zdaniach albo po stałej liczbie tokenów. | „Zmieniliśmy chunking na podział po H2.” |
| Embedding | Liczbowa reprezentacja znaczenia fragmentu, pozwalająca porównywać teksty semantycznie. | „Dwa akapity o cenach mają bliskie embeddingi.” |
| Passage | Fragment strony, który wyszukiwarka ocenia i pokazuje niezależnie od reszty dokumentu. | „Google wyciągnął jeden passage z połowy tekstu.” |
| Bezpośrednia odpowiedź | Zwięzły akapit odpowiadający na pytanie w pierwszych dwóch, trzech zdaniach sekcji. | „Każdy H2 zaczynamy od bezpośredniej odpowiedzi.” |
| Semantic HTML | Znaczniki opisujące strukturę treści, a nie jej wygląd: nagłówki, listy, tabele. | „Divy zamiast nagłówków psują parsowanie.” |
| Dane strukturalne | Schema.org w JSON-LD, opisująca encje i relacje w sposób maszynowo czytelny. | „FAQPage pomaga wyciągnąć pytania z sekcji FAQ.” |
| Encja | Rozpoznawalny byt: marka, osoba, produkt, miejsce, z którym model wiąże fakty. | „Nazwa firmy nie jest jeszcze encją w grafie wiedzy.” |
Podział na chunki opisuję szerzej przy okazji chunkowania treści pod RAG, a definicję samych danych strukturalnych warto sprawdzić bezpośrednio w dokumentacji Google Search Central.
Pojęcia wokół widoczności: cytowanie, source box, share of voice
Ta warstwa to Twoje KPI. Największy błąd raportowy polega na mieszaniu cytowania z wzmianką, bo obie rzeczy mierzy się inaczej i obie znaczą co innego dla ruchu.
| Pojęcie | Definicja | Przykład użycia |
|---|---|---|
| Cytowanie | Klikalne odwołanie do konkretnego URL pod lub obok odpowiedzi modelu. | „W 12 z 30 promptów mamy cytowanie.” |
| Wzmianka marki | Pojawienie się nazwy w treści odpowiedzi, bez linku do źródła. | „Wzmianka bez linku nie da ruchu, ale buduje rozpoznawalność.” |
| Source box | Element interfejsu zbierający źródła użyte przy generowaniu odpowiedzi. | „Jesteśmy w source boxie, ale na piątej pozycji.” |
| Citation rank | Pozycja źródła na liście cytowań, wpływająca na szansę kliknięcia. | „Awans z pozycji 6 na 2 podniósł CTR dwukrotnie.” |
| Share of voice w AI | Udział marki we wszystkich odpowiedziach dla zdefiniowanego zestawu promptów. | „Nasz SOV w kategorii to 18 procent.” |
| AI Overviews | Generowane podsumowanie nad wynikami Google, z linkami do źródeł. | „AI Overviews zabrało klik z pozycji trzeciej.” |
| AI Mode | Konwersacyjny tryb wyszukiwania Google, oparty na wielokrotnym fan-oucie zapytań. | „W AI Mode ścieżka użytkownika jest dłuższa.” |
| Sentyment marki | Wydźwięk, z jakim model opisuje markę: pozytywny, neutralny lub negatywny. | „Model powtarza stary zarzut z forum, mamy problem z sentymentem.” |
Jak przełożyć te definicje na liczby w arkuszu, pokazuję w zestawieniu metryk widoczności w LLM.
Pojęcia wokół dostępu: crawler AI, llms.txt, opt-out
Warstwa najczęściej pomijana, a potrafi wyzerować cały wysiłek redakcyjny. Jeśli bot nie pobierze strony w momencie odpowiadania użytkownikowi, treść nie istnieje dla modelu, niezależnie od jakości.
| Pojęcie | Definicja | Przykład użycia |
|---|---|---|
| Crawler AI | Bot pobierający treść na potrzeby treningu, indeksu lub odpowiedzi na żywo. | „W logach widać trzy różne crawlery AI.” |
| GPTBot | Bot OpenAI zbierający dane do treningu modeli, sterowany przez robots.txt. | „Blokada GPTBota nie blokuje cytowań w ChatGPT.” |
| ChatGPT-User | Agent pobierający stronę w czasie rzeczywistym, gdy użytkownik zadaje pytanie. | „To jego trzeba przepuścić, żeby mieć cytowania.” |
| Robots.txt | Plik z regułami dostępu dla botów, respektowany dobrowolnie. | „Reguła Disallow objęła cały katalog bloga.” |
| llms.txt | Propozycja pliku wskazującego modelom najważniejsze treści serwisu w formie tekstowej. | „Wystawiliśmy llms.txt z listą kluczowych poradników.” |
| Opt-out | Świadome wykluczenie treści z użycia przez konkretnego dostawcę modelu. | „Opt-out dla treningu, zgoda na retrieval.” |
| Blokada WAF | Odcięcie botów na poziomie firewalla lub CDN, często włączone domyślnie. | „Cloudflare blokował agenta, choć robots.txt go wpuszczał.” |
| Paywall | Zabezpieczenie treści, które zwykle uniemożliwia botowi odczyt pełnego tekstu. | „Za paywallem model widzi tylko lead.” |
Aktualną listę botów i przypisanych im reguł OpenAI publikuje w oficjalnej dokumentacji. Warto ją sprawdzać raz na kwartał, bo nazwy agentów się zmieniają.
Które pojęcia mylą się najczęściej
Cztery pary terminów odpowiadają za większość nieporozumień w raportach:
- Cytowanie kontra wzmianka. Cytowanie ma URL i generuje ruch, wzmianka jest samą nazwą w tekście odpowiedzi. Mierz je w osobnych kolumnach.
- Trening kontra retrieval. Blokada bota treningowego nie usuwa Cię z odpowiedzi na żywo, a blokada agenta użytkownika owszem.
- Chunk kontra passage. Chunk to jednostka indeksowania po Twojej lub cudzej stronie, passage to fragment wybrany przez wyszukiwarkę do prezentacji.
- Grounding kontra RAG. RAG opisuje architekturę, grounding opisuje efekt, czyli osadzenie odpowiedzi w źródle. Można mieć RAG bez sensownego groundingu.
Do tej listy dochodzi klasyczny problem znany z klasycznego SEO: dwa teksty walczące o tę samą frazę. W AIO objawia się on tym, że model cytuje raz jeden, raz drugi URL, przez co żaden nie buduje autorytetu. Diagnostykę opisuję w tekście o kanibalizacji słów kluczowych.
Jeśli chcesz sprawdzić, jak model faktycznie mówi o Twojej marce, zanim ustalisz KPI, zacznij od prostego monitoringu cytowań w ChatGPT. Bez tej bazy każde pojęcie z warstwy widoczności pozostaje teorią.
FAQ
Czym różni się AIO od klasycznego SEO?
SEO optymalizuje pozycję dokumentu na liście wyników, AIO optymalizuje szansę, że fragment dokumentu zostanie pobrany i zacytowany w generowanej odpowiedzi. Techniki częściowo się pokrywają (struktura, dane strukturalne, autorytet), ale metryki są inne: zamiast pozycji i CTR mierzysz cytowania, wzmianki i share of voice.
Czy muszę wdrażać llms.txt?
Nie jest to standard obowiązkowy ani powszechnie respektowany przez dostawców modeli. Traktuj go jako tani eksperyment: kilkanaście minut pracy, zerowe ryzyko. Priorytetem pozostaje poprawny robots.txt, przepuszczenie agentów pobierających treść na żywo i czytelna struktura nagłówków.
Ile pojęć wystarczy do pierwszego raportu AIO?
Pięć: cytowanie, wzmianka marki, share of voice, prompt testowy i crawler AI. Na tym zestawie zbudujesz raport, który zrozumie zarząd. Resztę terminologii zostaw w dokumentacji technicznej dla zespołu wdrożeniowego.
Czy halucynacja modelu na temat marki to problem SEO?
Tak, i to pilny. Jeśli model powtarza nieaktualną cenę albo nieistniejącą funkcję, źródłem zwykle jest stara podstrona, nieaktualizowany cennik lub treść zewnętrzna z wysokim autorytetem. Naprawa polega na aktualizacji własnych źródeł i dodaniu jednoznacznych, datowanych stwierdzeń tam, gdzie model szuka faktów.
Jak często aktualizować taki słownik?
Realnie raz na pół roku, bo w tym tempie zmieniają się nazwy agentów, interfejsy cytowań i funkcje wyszukiwarek generatywnych. Grupy pojęć (model, wyszukiwanie, treść, widoczność, dostęp) są stabilne, zmieniają się głównie konkretne nazwy własne wewnątrz nich.