Technikai / Technical

robots.txt és AI crawlerek: kit engedj be, kit tilts ki?

2026. július 8. Daniel Dexuro 9 perces olvasás Read in English →

Ki járja a weboldalad? A Google? Igen. Az OpenAI, az Anthropic, a Perplexity és a Microsoft? Valószínűleg igen. De szeretnéd-e, hogy hozzáférjenek az oldaladhoz? A robots.txt a válasz — az a fájl, amely azt mondja az összes bot-nak: „te ide jöhetsz, te meg nem". Ebben a cikkben megmutatjuk, mely AI-crawlerek léteznek, mi mit csinál, és hogyan kell kezelniük őket a GEO-szemszögből.

Kik járnak az oldaladra? (GPTBot, ClaudeBot, PerplexityBot, Google-Extended)

Négy fő AI-crawler létezik, amely ma aktív az oldaladra jár:

  1. GPTBot (OpenAI): Ez a ChatGPT tanítási és böngészési funkcióját szolgálja. A GPTBot élő webcrawlt végez, hogy friss tartalmat keressen az interneten, amelyet a ChatGPT böngészési funkciójában használhat. Teljesítménye magas.
  2. Claude-Web (Anthropic): Ez az Anthropic Claude-AI-ját szolgálja. Hasonlóan a GPTBot-hoz, az Anthropic szintén végez webcrawlt, hogy friss információkat szerezzen a Claude számára.
  3. PerplexityBot (Perplexity AI): A Perplexity egy keresõmotor-szerû AI-platform, amely élõ weboldalakról merít. Az oldalad tényleges látogatása szinte garantált, ha engedélyezed a PerplexityBot-ot.
  4. Google-Extended (Google): Az OpenAI, az Anthropic és más AI-vállalatok megosztják tanítási adataikat a Googleval vagy fordítva. A Google-Extended a Google AI Overviews-hoz szükséges, és az, hogy a Google az oldalad indexelésekor ezt a tokent használja.

Tiltani vagy engedni? A GEO-szempont

Ha a GEO az a cél — hogy az AI-motorok idézzenek téged — akkor az az ajánlás: engedélyezd az összes fenti bot-ot. A GPTBot, a Claude-Web és a PerplexityBot blokkolása azt jelenti, hogy az oldalad új tartalma soha nem kerül be az ezeken az AI-motorokon. Ez a teljes GEO-stratégia megtörik.

A Google-Extended tiltása az AI Overviews-ot érinti, de a hagyományos Google-keresésre nincs hatása. Azonban ha az AI Overviews-ba szeretnél bejutni, a Google-Extended-et is engedélyt kell adnod.

Persze, ha az oldalad valamilyen okból (például szabadalmazottan védett tanulmányok vagy betét után kérő tartalom) nem szeretnéd, hogy az AI-motorok használják, akkor kitilthatsz mindent. De a GEO-stratégia egyik lépése sem az engedély megtagadása.

Hogyan írd meg a robots.txt szabályokat?

Az alapvető robots.txt struktúra így néz ki:

User-agent: *
Allow: /

User-agent: GPTBot
Allow: /

User-agent: Claude-Web
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

Ez az alapértelmezett: minden bot-ot engedélyez. Ha szeretnél kitiltani egy bot-ot, írd meg:

User-agent: GPTBot
Disallow: /

Ez azt mondja a GPTBot-nak, hogy ne crawlozzon az oldalad bármelyik részét. Ha egyes részeket szeretnél kitiltani (például a `/admin/` vagy `/betanított-adatok/`), írd meg:

User-agent: GPTBot
Disallow: /admin/
Disallow: /betanított-adatok/
Allow: /

Az `Allow` végén azt mondja: „az összes többi rész OK".

Mit NEM old meg a robots.txt

Fontos: a robots.txt csak a jövőbeli crawlok irányítja. Ha az AI-motor már betanította a modellét az oldalad tartalommal (amit korábban meglátogatott), akkor a robots.txt módosítása nem fog „kitörölni" azt. Ez azt jelenti, hogy még akkor is, ha ma kitiltas a GPTBot-ot, a GPT-nek már vannak információi az oldaladról, amelyeket ott tarthat.

Másodszor, a robots.txt nem megakadályozza az indirekt adatgyűjtést. Azok az információk, amelyeket az AI máshol (például a Twitterben, a Wikipédián vagy a harmadik féltől származó weblapokról) talál rólad, nem vezérelhetők a robots.txt-ből. Az AI-motorok több forrásból merítik az adatokat, és a robots.txt csak közvetlenül az oldaladdal járó crawl-okat érint.

A gyakorlat: a javasolt robots.txt a GEO-hoz

Ha a GEO az a cél, a javasolt robots.txt így néz ki:

User-agent: *
Allow: /

# AI crawlers — allowed for GEO
User-agent: GPTBot
Allow: /

User-agent: Claude-Web
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

# Disallow specific parts if needed
User-agent: *
Disallow: /admin/
Disallow: /private/

Ez azt mondja: „Az összes AI-bot számára, az összes tartalom OK. Az adminisztrációs és a privát részek nem."

Gyakran ismételt kérdések

Nem teljesen. A ChatGPT más információforrásokkal is rendelkezik — webes keresések, korábbi adatok, harmadik féltől származó weblapok. De mivel az oldaladat nem tudja közvetlenül meglátogatni, az aktuális, specifikus tartalmad nem fog megjelenni a ChatGPT-válaszokban, ami csökkenti az esélyt a citációra.

Nem. A Google-Extended token csak az AI Overviews-hoz szükséges. Függetlenül attól, hogy engedélyezed-e vagy sem, a Googlebot (amely a hagyományos keresésért felelős) továbbra is megcáfolja az oldalad és azt a szokásos keresési rangsorolásban használja.

A webszerver-naplóban (access.log vagy hasonló) keresd az User-Agent-ben szereplő bot-neveket. A GPTBot-ot „OpenAI"-ként, a ClaudeBot-ot „Claude-Web"-ként, a PerplexityBot-ot „Perplexity"-ként fogod látni. A Google-Extended az „AdsBot-Google" vagy „Google-Extended"-ként jelenik meg.

Tilts ki az összes AI-bot-ot a robots.txt-ből (disallow: GPTBot, ClaudeBot, PerplexityBot, Google-Extended). Megjegyzés: a korábbi adatok, amelyeket az AI-motorok már betanítottak, nem lesznek eltávolítva rögtön. Az új tartalom azonban nem kerül be az AI-ba.

Ingyenes audit

Készen állsz, hogy az AI téged idézzen?

Kérj ingyenes AI hivatkozási auditot — 24 órán belül megmutatjuk, hol tart most a márkád.

Ingyenes audit kérése
Get a Free Audit