Technikai / Technical
robots.txt és AI crawlerek: kit engedj be, kit tilts ki?
Ki járja a weboldalad? A Google? Igen. Az OpenAI, az Anthropic, a Perplexity és a Microsoft? Valószínűleg igen. De szeretnéd-e, hogy hozzáférjenek az oldaladhoz? A robots.txt a válasz — az a fájl, amely azt mondja az összes bot-nak: „te ide jöhetsz, te meg nem". Ebben a cikkben megmutatjuk, mely AI-crawlerek léteznek, mi mit csinál, és hogyan kell kezelniük őket a GEO-szemszögből.
Kik járnak az oldaladra? (GPTBot, ClaudeBot, PerplexityBot, Google-Extended)
Négy fő AI-crawler létezik, amely ma aktív az oldaladra jár:
- GPTBot (OpenAI): Ez a ChatGPT tanítási és böngészési funkcióját szolgálja. A GPTBot élő webcrawlt végez, hogy friss tartalmat keressen az interneten, amelyet a ChatGPT böngészési funkciójában használhat. Teljesítménye magas.
- Claude-Web (Anthropic): Ez az Anthropic Claude-AI-ját szolgálja. Hasonlóan a GPTBot-hoz, az Anthropic szintén végez webcrawlt, hogy friss információkat szerezzen a Claude számára.
- PerplexityBot (Perplexity AI): A Perplexity egy keresõmotor-szerû AI-platform, amely élõ weboldalakról merít. Az oldalad tényleges látogatása szinte garantált, ha engedélyezed a PerplexityBot-ot.
- Google-Extended (Google): Az OpenAI, az Anthropic és más AI-vállalatok megosztják tanítási adataikat a Googleval vagy fordítva. A Google-Extended a Google AI Overviews-hoz szükséges, és az, hogy a Google az oldalad indexelésekor ezt a tokent használja.
Tiltani vagy engedni? A GEO-szempont
Ha a GEO az a cél — hogy az AI-motorok idézzenek téged — akkor az az ajánlás: engedélyezd az összes fenti bot-ot. A GPTBot, a Claude-Web és a PerplexityBot blokkolása azt jelenti, hogy az oldalad új tartalma soha nem kerül be az ezeken az AI-motorokon. Ez a teljes GEO-stratégia megtörik.
A Google-Extended tiltása az AI Overviews-ot érinti, de a hagyományos Google-keresésre nincs hatása. Azonban ha az AI Overviews-ba szeretnél bejutni, a Google-Extended-et is engedélyt kell adnod.
Persze, ha az oldalad valamilyen okból (például szabadalmazottan védett tanulmányok vagy betét után kérő tartalom) nem szeretnéd, hogy az AI-motorok használják, akkor kitilthatsz mindent. De a GEO-stratégia egyik lépése sem az engedély megtagadása.
Hogyan írd meg a robots.txt szabályokat?
Az alapvető robots.txt struktúra így néz ki:
User-agent: * Allow: / User-agent: GPTBot Allow: / User-agent: Claude-Web Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: /
Ez az alapértelmezett: minden bot-ot engedélyez. Ha szeretnél kitiltani egy bot-ot, írd meg:
User-agent: GPTBot Disallow: /
Ez azt mondja a GPTBot-nak, hogy ne crawlozzon az oldalad bármelyik részét. Ha egyes részeket szeretnél kitiltani (például a `/admin/` vagy `/betanított-adatok/`), írd meg:
User-agent: GPTBot Disallow: /admin/ Disallow: /betanított-adatok/ Allow: /
Az `Allow` végén azt mondja: „az összes többi rész OK".
Mit NEM old meg a robots.txt
Fontos: a robots.txt csak a jövőbeli crawlok irányítja. Ha az AI-motor már betanította a modellét az oldalad tartalommal (amit korábban meglátogatott), akkor a robots.txt módosítása nem fog „kitörölni" azt. Ez azt jelenti, hogy még akkor is, ha ma kitiltas a GPTBot-ot, a GPT-nek már vannak információi az oldaladról, amelyeket ott tarthat.
Másodszor, a robots.txt nem megakadályozza az indirekt adatgyűjtést. Azok az információk, amelyeket az AI máshol (például a Twitterben, a Wikipédián vagy a harmadik féltől származó weblapokról) talál rólad, nem vezérelhetők a robots.txt-ből. Az AI-motorok több forrásból merítik az adatokat, és a robots.txt csak közvetlenül az oldaladdal járó crawl-okat érint.
A gyakorlat: a javasolt robots.txt a GEO-hoz
Ha a GEO az a cél, a javasolt robots.txt így néz ki:
User-agent: * Allow: / # AI crawlers — allowed for GEO User-agent: GPTBot Allow: / User-agent: Claude-Web Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: / # Disallow specific parts if needed User-agent: * Disallow: /admin/ Disallow: /private/
Ez azt mondja: „Az összes AI-bot számára, az összes tartalom OK. Az adminisztrációs és a privát részek nem."
Gyakran ismételt kérdések
Nem teljesen. A ChatGPT más információforrásokkal is rendelkezik — webes keresések, korábbi adatok, harmadik féltől származó weblapok. De mivel az oldaladat nem tudja közvetlenül meglátogatni, az aktuális, specifikus tartalmad nem fog megjelenni a ChatGPT-válaszokban, ami csökkenti az esélyt a citációra.
Nem. A Google-Extended token csak az AI Overviews-hoz szükséges. Függetlenül attól, hogy engedélyezed-e vagy sem, a Googlebot (amely a hagyományos keresésért felelős) továbbra is megcáfolja az oldalad és azt a szokásos keresési rangsorolásban használja.
A webszerver-naplóban (access.log vagy hasonló) keresd az User-Agent-ben szereplő bot-neveket. A GPTBot-ot „OpenAI"-ként, a ClaudeBot-ot „Claude-Web"-ként, a PerplexityBot-ot „Perplexity"-ként fogod látni. A Google-Extended az „AdsBot-Google" vagy „Google-Extended"-ként jelenik meg.
Tilts ki az összes AI-bot-ot a robots.txt-ből (disallow: GPTBot, ClaudeBot, PerplexityBot, Google-Extended). Megjegyzés: a korábbi adatok, amelyeket az AI-motorok már betanítottak, nem lesznek eltávolítva rögtön. Az új tartalom azonban nem kerül be az AI-ba.
Ingyenes audit
Készen állsz, hogy az AI téged idézzen?
Kérj ingyenes AI hivatkozási auditot — 24 órán belül megmutatjuk, hol tart most a márkád.
Ingyenes audit kérése