Crawler

ClaudeBot és az Anthropic crawlerei: mit engedj be

ClaudeBot, Claude-User, Claude-SearchBot: melyik mit csinál, hogyan kezeld őket a robots.txt-ben, és mikor éri meg tiltani egy magyar kkv-nak.

Scheo · 2026-08-10 · olvasási idő ~10 perc · Szerző: Schmidt Péter

A lényeg dióhéjban: Az Anthropic három különböző ügynököt futtat: a ClaudeBot tömegesen gyűjt tartalmat, a Claude-User egy valódi felhasználó kérésére tölt le egy-egy oldalt, a Claude-SearchBot pedig a Claude keresési indexét építi. Ezért a robots.txt-ben érdemes külön kezelni őket, nem egyetlen mozdulattal kitiltani mindet.

Egy magyar kkv weboldalán ma már régen nem csak a Googlebot jár. Az elmúlt két évben a szerverlogokban feltűnt egy sor új név, és a leggyakoribbak között ott van az Anthropic három ügynöke is. A legtöbb vállalkozó akkor találkozik velük először, amikor a tárhelyszolgáltató jelez a megnövekedett terhelés miatt, vagy amikor valaki felveti, hogy az AI-cégek engedély nélkül használják fel a tartalmát. Innen jön a kérdés: tiltsam vagy engedjem? A válasz attól függ, melyik botról beszélünk, mert a három ügynök három különböző dolgot csinál, és üzletileg is teljesen más a súlyuk.

ClaudeBot és az Anthropic crawlerei: mit engedj be
ClaudeBot és az Anthropic crawlerei: mit engedj be

Mi a különbség a ClaudeBot, a Claude-User és a Claude-SearchBot között?

Röviden: a ClaudeBot tömegesen gyűjt tartalmat és nem küld látogatót, a Claude-User egy konkrét felhasználó kérésére tölt le egy-egy oldalt, a Claude-SearchBot pedig azt az indexet építi, amiből a Claude idézhet téged. Hivatalosan igazolt információ (az Anthropic saját dokumentációja alapján), hogy mindhárom külön user-agent néven azonosítja magát, és mindhárom figyelembe veszi a robots.txt utasításait.

A különbségtétel azért nem szőrszálhasogatás, mert a három ügynök három külön időskálán dolgozik. A ClaudeBot hetekkel vagy hónapokkal a felhasználói kérdés előtt jár nálad, a Claude-SearchBot néhány naponta frissít, a Claude-User pedig abban a másodpercben tölti le az oldalad, amikor valaki kérdez. Ha egyetlen szabállyal mindhármat kizárod, akkor nem csak a tanítást tiltod le, hanem azt a lekérést is, ami mögött már ott áll egy konkrét érdeklődő.

Szakmai feltételezés: a korábbi nevekkel (anthropic-ai, Claude-Web) ma már ritkán találkozni élesben, de ártalmatlan bennhagyni őket a robots.txt-ben, ha valaki régi konfigurációt örökölt.

Honnan tudod, hogy tényleg az Anthropic botja járt nálad?

Rövid válasz: a szerverlogból, és nem a user-agent névben megbízva. A user-agent egy szabadon írható szöveg, bárki beleírhatja, hogy ClaudeBot.

Kezdd a nyers számokkal. Ha van SSH-hozzáférésed a tárhelyhez, egyetlen sorral megkapod a nagyságrendet:

A második parancs megmutatja, melyik IP-címekről jött a forgalom. Saját tapasztalat: kisebb magyar tárhelyeken visszatérően látni olyan lekéréseket, amelyek ClaudeBotnak adják ki magukat, de olyan IP-tartományból érkeznek, aminek semmi köze az Anthropichoz. Ezek jellemzően scraperek, amelyek egy ismert bot nevével próbálnak átcsúszni a szűrőkön. Ilyenkor teljesen felesleges a robots.txt-t bűvölni, mert a hamisított bot úgysem olvassa el.

Az Anthropic közzéteszi a crawlerei IP-tartományait a saját dokumentációjában, ez az egyetlen megbízható ellenőrzés. Ha valakinek nincs kapacitása erre, a gyakorlati minimum: nézd meg, hogy a gyanús IP-k egy tartományba esnek-e, és hogy a lekérési minta emberi (néhány oldal) vagy gépi (percenként több száz kérés) jellegű-e.

Gyors ellenőrzőlista, ha kevés az időd: (1) mennyi az összes lekérés aránya az adott bottól, (2) hány egyedi IP-ről érkezett, (3) melyik URL-eket kérte a leggyakrabban, (4) mekkora az átvitt adatmennyiség, (5) 200-as vagy 404-es válaszokat kapott-e. Ha sok a 404, akkor nem a te tartalmadat viszi, hanem sérült linkeket követ, és a hiba nálad van.

Hogyan állítsd be a robots.txt-t az Anthropic ügynökeire?

Röviden: a robots.txt-ben minden botnak külön csoportot írsz, és tudnod kell, hogy a csoportok nem öröklődnek. Ha a ClaudeBotnak saját blokkot adsz, akkor az a User-agent: * szabályaidat teljesen figyelmen kívül hagyja. Ez a leggyakoribb hiba, amit magyar oldalakon látni.

1. Ha mindent engedsz (a legtöbb szolgáltató kkv esete)

Ilyenkor nem kell semmit írnod. A hiányzó szabály engedélyt jelent. Ha mégis explicit akarod, hogy egyértelmű legyen a következő kollégának:

2. Szelektív engedés (ez a leggyakrabban helyes megoldás)

A tanító crawlert korlátozod, a felhasználói és a keresési ügynököt beengeded:

Külön blokkban, üres sorral elválasztva:

3. Teljes tiltás

Két figyelmeztetés. Az egyik: a Google AI-felhasználásra vonatkozó tokenje ettől független (Googlebot-Extended), a kettőt ne keverd, mert a Googlebot tiltásával a klasszikus keresőből is kiléptetheted magad. A másik: szakmai feltételezés, hogy a Crawl-delay direktívát az Anthropic ügynökei nem feltétlenül veszik figyelembe, ezért terhelés ellen ne ettől várd a megoldást.

Milyen hibákat látni leggyakrabban a magyar oldalak robots.txt-jében?

Röviden: nem a hiányzó szabály okozza a bajt, hanem a rosszul megírt. Saját tapasztalat: tíz átnézett kkv-oldalból jellemzően hét-nyolcon szerepel az alábbiak közül legalább egy.

Miért nem elég a robots.txt, és mikor kell szerverszintű tiltás?

Röviden: a robots.txt udvarias kérés, nem zár. A tisztességes botok betartják, a hamisítottak nem. Ha a logban azt látod, hogy a terhelés a robots.txt módosítása után is megmarad, lépj szintet.

Apache alatt, a .htaccess fájlban egy egyszerű user-agent alapú szűrés így néz ki: RewriteCond %{HTTP_USER_AGENT} ClaudeBot [NC], majd RewriteRule .* - [F,L]. Nginx alatt ugyanez egy if ($http_user_agent ~* "ClaudeBot") { return 403; } feltétellel oldható meg. Ha a webhelyed CDN vagy proxy mögött van, ott jellemzően kattintással is beállítható a botkezelés, és ott érdemesebb is, mert nem terheli a saját szerveredet.

Fontos részlet, amit sokan elrontanak: ha a szűrést egyetlen Claude szóra írod meg, azzal a Claude-Usert is kizárod, vagyis pont azt a lekérést, ami mögött valódi érdeklődő áll. Ha tiltasz, tilts pontosan: a teljes ügynöknévre, ne egy töredékre.

Van egy köztes megoldás is a teljes tiltás és a szabad út között: sebességkorlátozás. A legtöbb tárhely- és CDN-felületen beállítható, hogy egy adott user-agent percenként hány kérést adhat le. Így a bot hozzáfér a tartalomhoz, de nem tudja megfektetni a szervert. Saját tapasztalat: a legtöbb panasz nem a botok létéből, hanem a csúcsidőben összesűrűsödő lekérésekből fakad, és ezt egy jól belőtt korlát rendezi.

Mi az üzleti mérlegelés a tiltás mögött?

Röviden: azt kell eldöntened, hogy a tartalmad marketingeszköz vagy maga a termék. A kettő ellentétes döntést kíván.

Érdemes a döntést leírni egy mondatban, és a robots.txt tetejére kommentként betenni, hogy fél év múlva te magad is emlékezz rá, miért így van. Ez triviálisnak hangzik, de a gyakorlatban a legtöbb rossz robots-beállítás abból születik, hogy valaki hozzányúlt egy örökölt fájlhoz, és nem tudta, mi miért került bele.

A jogi oldal külön kérdés. A robots.txt nem szerződés és nem jogi eszköz, csak technikai jelzés. Ha a tartalmad felhasználását ténylegesen korlátozni akarod, azt a felhasználási feltételekben is rögzíteni kell, és érdemes jogásszal átnézetni. Ez szakmai feltételezés a gyakorlat felől nézve, nem jogi tanács.

Melyik magyar kkv-nak mit érdemes engednie?

Röviden: a szolgáltatók engedjenek, a tartalomértékesítők szelektáljanak, a webshopok pedig szűkítsék az útvonalakat, ne a botokat.

Mit érdemes a tartalmon javítani, ha beengeded az ügynököket?

Röviden: az engedélyezés csak a belépőjegy. Ha a botot beengeded, de az oldalad gépi szemmel nehezen olvasható, a hozzáférésből nem lesz idézés.

Ez a néhány lépés nem garantál megjelenést, de érdemben javíthatja az esélyt, hogy a beengedett ügynök használható anyagot találjon nálad.

Hogyan méred, hogy jól döntöttél?

Röviden: három adatforrásod van, és mindhármat érdemes havi ritmusban nézni.

  1. Szerverlog: havonta számold meg botonként a lekéréseket és a lehúzott adatmennyiséget. Ez mutatja meg a valós költségoldalt.
  2. GA4 hivatkozó forgalom: nézd meg, érkezik-e látogató AI-felületekről. Ez a Claude-User működésének közvetett nyoma. Kicsi számok is jelentősek lehetnek, mert az így érkező látogató jellemzően már túl van a tájékozódáson.
  3. Kézi promptteszt: havonta tegyél fel öt-hat olyan kérdést az asszisztensnek, amire a te oldaladnak kellene válaszolnia, és jegyezd fel, hogy megjelensz-e forrásként. A válaszok változékonyak, ezért egyetlen mérés semmit nem bizonyít, de a több hónapos trend már jelzésértékű.

Fontos elvárás-kezelés: az AI-válaszokban való megjelenés nem garantálható, és nem is stabil. Amit befolyásolni tudsz, az az esély, nem az eredmény.

Milyen lépésekkel vezesd be a beállítást?

  1. Kérd le a szerverlogot legalább 30 napra, és nézd meg, ténylegesen jár-e nálad ClaudeBot.
  2. Ellenőrizd, hogy a lekérések valós IP-tartományból jönnek-e.
  3. Döntsd el egy mondatban, hogy a tartalmad marketingeszköz vagy termék.
  4. Írd meg a robots.txt-t külön csoporttal a három ügynökre, üres sorral elválasztva.
  5. Zárd ki a paraméteres, kosár- és keresési útvonalakat minden bot elől.
  6. Töltsd be a domain.hu/robots.txt címet böngészőben, és ellenőrizd, hogy tényleg az új tartalom jelenik-e meg (gyakori, hogy a cache régi verziót szolgál ki).
  7. Ha a terhelés marad, tegyél szerver- vagy CDN-szintű szabályt is, pontos ügynöknévvel.
  8. Írd be a naptáradba, hogy 30 nap múlva újra megnézed a logot és a GA4-et.

Ez a nyolc lépés kevesebb mint egy délután, és utána nem érzésre, hanem adat alapján tudsz dönteni arról, hogy kit engedsz be a saját webhelyedre.

Források és további olvasnivalók

A legfontosabbak
  • A három Anthropic-ügynök nem egyforma: csak az egyik gyűjt tömegesen, a másik kettő közvetlenül összefügg azzal, hogy a Claude idéz-e téged.
  • A robots.txt csoportjai nem öröklődnek: ha külön blokkot írsz a ClaudeBotnak, az a csillagos szabályokat teljesen figyelmen kívül hagyja.
  • A robots.txt kérés, nem fal: valódi terhelés ellen szerver- vagy CDN-szintű szabály kell, a hamisított user-agent miatt pedig IP-ellenőrzés is.
  • A tiltás akkor védhető üzletileg, ha maga a tartalom a termék; szolgáltató kkv-nál a teljes tiltás jellemzően önsebzés.
  • Mérd hónapról hónapra a logokban a botonkénti lekéréseket és a GA4-ben az AI-felületekről érkező hivatkozó forgalmat, mielőtt döntesz.

Gyakori kérdések

A ClaudeBot tiltása rontja a Google-helyezésemet?

Nem. A két rendszer teljesen független egymástól, az Anthropic ügynökeinek kizárása a Google indexelését nem érinti. Egyetlen kockázat van: ha a robots.txt-t rosszul írod meg, és a tiltás véletlenül a Googlebotra is kiterjed. Ezért érdemes minden módosítás után a Search Console robots.txt-tesztelőjével ellenőrizni az eredményt.

Ha tiltom a ClaudeBotot, akkor a Claude nem tud majd idézni engem?

Nem feltétlenül. A ClaudeBot elsősorban a tömeges tartalomgyűjtésért felel, míg az idézhetőséghez a Claude-SearchBot és a Claude-User a lényeges. Ha csak a ClaudeBotot tiltod, a másik kettőt pedig beengeded, elvileg megmarad az esélyed a megjelenésre. Ez logikusan következik az ügynökök hivatalos leírásából, de nem garantált eredmény.

Mennyi terhelést okoz egy AI-crawler egy átlagos magyar kkv-oldalon?

Ez nagyon eltérő, és inkább az oldal szerkezetétől függ, mint a méretétől. Egy statikus, néhány száz oldalas bemutatkozó oldalnál a hatás jellemzően elhanyagolható. Egy szűrőkkel teli webshopnál viszont a paraméteres URL-ek miatt sokszorosára nőhet a lekérések száma. A pontos számot csak a saját szerverlogod mondja meg.

Elég a robots.txt, vagy tűzfalszabály is kell?

A robots.txt csak azoknál a botoknál működik, amelyek tiszteletben tartják. Az Anthropic ügynökei a hivatalos dokumentáció szerint ilyenek. A hamisított user-agentekkel dolgozó scraperek ellen viszont csak szerver-, tűzfal- vagy CDN-szintű szabály véd. Ha a robots.txt módosítása után is marad a terhelés, szinte biztosan nem valódi ClaudeBotról van szó.

Milyen gyakran érdemes felülvizsgálni ezeket a beállításokat?

Negyedévente elég, hacsak nem történik nagyobb változás az oldalon. Az AI-szolgáltatók viszonylag gyakran vezetnek be új ügynökneveket, ezért a szerverlog átnézésekor mindig keresd a korábban nem látott user-agenteket is. Ha új nevet találsz, először nézz utána a szolgáltató hivatalos leírásában, és csak utána dönts a tiltásról.

Jogilag megvéd a robots.txt a tartalmam felhasználásától?

Önmagában nem. A robots.txt technikai jelzés, nem szerződés. Ha valóban korlátozni akarod a tartalmad felhasználását, azt a weboldal felhasználási feltételeiben is rögzíteni kell, és érdemes jogásszal átnézetni a megfogalmazást. Ez gyakorlati megfontolás, nem jogi tanács.

Mi a teendő, ha a robots.txt módosítása után sem változik semmi?

Először ellenőrizd, hogy a nyilvános címen tényleg az új fájl jelenik-e meg, mert a gyorsítótár vagy a CDN sokáig kiszolgálhatja a régi verziót. Ha a fájl rendben van, nézd meg a naplóban a kérések IP-címeit: ha nem az Anthropic hivatalos tartományaiból érkeznek, hamisított user-agentről van szó, ami ellen csak szerver- vagy tűzfalszintű szabály hatásos.

Források és további olvasnivalók

Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.

Kapcsolódó

Ügynöki (agentic) böngészés: amikor nem ember nyitja meg az oldalad

Helyi szolgáltatás a környékeden

Országosan dolgozunk, online és személyesen. Válaszd ki a városodat, és nézd meg, hogyan segítünk helyben:

Online marketing & AI SEO SzékesfehérvárOnline marketing & AI SEO BudapestOnline marketing & AI SEO VeszprémOnline marketing & AI SEO DunaújvárosOnline marketing & AI SEO GyőrOnline marketing & AI SEO DebrecenOnline marketing & AI SEO SzegedOnline marketing & AI SEO MiskolcOnline marketing & AI SEO PécsOnline marketing & AI SEO KecskemétOnline marketing & AI SEO NyíregyházaOnline marketing & AI SEO SzombathelyOnline marketing & AI SEO SzolnokOnline marketing & AI SEO TatabányaOnline marketing & AI SEO KaposvárOnline marketing & AI SEO BékéscsabaOnline marketing & AI SEO EgerOnline marketing & AI SEO ZalaegerszegOnline marketing & AI SEO SzekszárdOnline marketing & AI SEO Salgótarján

Weboldalkészítés városra bontva

Ha először a honlap kell, itt városonként arról írtunk:

Weboldalkészítés SzékesfehérvárWeboldalkészítés BudapestWeboldalkészítés VeszprémWeboldalkészítés DunaújvárosWeboldalkészítés GyőrWeboldalkészítés DebrecenWeboldalkészítés SzegedWeboldalkészítés MiskolcWeboldalkészítés PécsWeboldalkészítés KecskemétWeboldalkészítés NyíregyházaWeboldalkészítés SzombathelyWeboldalkészítés SzolnokWeboldalkészítés TatabányaWeboldalkészítés KaposvárWeboldalkészítés BékéscsabaWeboldalkészítés EgerWeboldalkészítés ZalaegerszegWeboldalkészítés SzekszárdWeboldalkészítés Salgótarján

15 perces AI-láthatósági gyorselemzés - díjmentesen

Megnézzük három, számodra fontos keresőkérdésnél, hogy megjelenik-e a céged a ChatGPT, a Gemini és a Google AI-válaszaiban, mely versenytársakat ajánlják helyetted, és melyik három területen érdemes először javítani. A weboldaladat előzetesen átnézzük, tehát nem sablonos, automata riportot kapsz.

Adataidat kizárólag a kapcsolatfelvételhez használjuk. Kapcsolat: m@rketinges.hu
💬 Konzultáció