Egy magyar kkv weboldalán ma már régen nem csak a Googlebot jár. Az elmúlt két évben a szerverlogokban feltűnt egy sor új név, és a leggyakoribbak között ott van az Anthropic három ügynöke is. A legtöbb vállalkozó akkor találkozik velük először, amikor a tárhelyszolgáltató jelez a megnövekedett terhelés miatt, vagy amikor valaki felveti, hogy az AI-cégek engedély nélkül használják fel a tartalmát. Innen jön a kérdés: tiltsam vagy engedjem? A válasz attól függ, melyik botról beszélünk, mert a három ügynök három különböző dolgot csinál, és üzletileg is teljesen más a súlyuk.

Mi a különbség a ClaudeBot, a Claude-User és a Claude-SearchBot között?
Röviden: a ClaudeBot tömegesen gyűjt tartalmat és nem küld látogatót, a Claude-User egy konkrét felhasználó kérésére tölt le egy-egy oldalt, a Claude-SearchBot pedig azt az indexet építi, amiből a Claude idézhet téged. Hivatalosan igazolt információ (az Anthropic saját dokumentációja alapján), hogy mindhárom külön user-agent néven azonosítja magát, és mindhárom figyelembe veszi a robots.txt utasításait.
- ClaudeBot: az általános feltérképező. Nagy mennyiségben tölt le nyilvánosan elérhető oldalakat, az így gyűjtött adat pedig a modellek tanításához használható fel. Ez a bot okozza a látható szerverterhelést, és ez az, amelyik közvetlenül soha nem hoz forgalmat.
- Claude-User: akkor lép működésbe, amikor egy ember a Claude felületén olyat kér, amihez egy weboldalt meg kell nyitni (beilleszt egy linket, vagy a keresési találatból kér összefoglalót). Ez áll a legközelebb egy valódi látogatóhoz: mögötte egy konkrét ember és egy konkrét szándék van.
- Claude-SearchBot: a keresési funkcióhoz épít és tart karban indexet. Ha ezt kizárod, azzal jó eséllyel csökkented annak az esélyét, hogy a Claude a te oldaladat hozza fel forrásként. Ez nem garantált összefüggés, de a logika egyenes.
A különbségtétel azért nem szőrszálhasogatás, mert a három ügynök három külön időskálán dolgozik. A ClaudeBot hetekkel vagy hónapokkal a felhasználói kérdés előtt jár nálad, a Claude-SearchBot néhány naponta frissít, a Claude-User pedig abban a másodpercben tölti le az oldalad, amikor valaki kérdez. Ha egyetlen szabállyal mindhármat kizárod, akkor nem csak a tanítást tiltod le, hanem azt a lekérést is, ami mögött már ott áll egy konkrét érdeklődő.
Szakmai feltételezés: a korábbi nevekkel (anthropic-ai, Claude-Web) ma már ritkán találkozni élesben, de ártalmatlan bennhagyni őket a robots.txt-ben, ha valaki régi konfigurációt örökölt.
Honnan tudod, hogy tényleg az Anthropic botja járt nálad?
Rövid válasz: a szerverlogból, és nem a user-agent névben megbízva. A user-agent egy szabadon írható szöveg, bárki beleírhatja, hogy ClaudeBot.
Kezdd a nyers számokkal. Ha van SSH-hozzáférésed a tárhelyhez, egyetlen sorral megkapod a nagyságrendet:
grep -ci "claudebot" access.loggrep -i "claude" access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head -20
A második parancs megmutatja, melyik IP-címekről jött a forgalom. Saját tapasztalat: kisebb magyar tárhelyeken visszatérően látni olyan lekéréseket, amelyek ClaudeBotnak adják ki magukat, de olyan IP-tartományból érkeznek, aminek semmi köze az Anthropichoz. Ezek jellemzően scraperek, amelyek egy ismert bot nevével próbálnak átcsúszni a szűrőkön. Ilyenkor teljesen felesleges a robots.txt-t bűvölni, mert a hamisított bot úgysem olvassa el.
Az Anthropic közzéteszi a crawlerei IP-tartományait a saját dokumentációjában, ez az egyetlen megbízható ellenőrzés. Ha valakinek nincs kapacitása erre, a gyakorlati minimum: nézd meg, hogy a gyanús IP-k egy tartományba esnek-e, és hogy a lekérési minta emberi (néhány oldal) vagy gépi (percenként több száz kérés) jellegű-e.
Gyors ellenőrzőlista, ha kevés az időd: (1) mennyi az összes lekérés aránya az adott bottól, (2) hány egyedi IP-ről érkezett, (3) melyik URL-eket kérte a leggyakrabban, (4) mekkora az átvitt adatmennyiség, (5) 200-as vagy 404-es válaszokat kapott-e. Ha sok a 404, akkor nem a te tartalmadat viszi, hanem sérült linkeket követ, és a hiba nálad van.
Hogyan állítsd be a robots.txt-t az Anthropic ügynökeire?
Röviden: a robots.txt-ben minden botnak külön csoportot írsz, és tudnod kell, hogy a csoportok nem öröklődnek. Ha a ClaudeBotnak saját blokkot adsz, akkor az a User-agent: * szabályaidat teljesen figyelmen kívül hagyja. Ez a leggyakoribb hiba, amit magyar oldalakon látni.
1. Ha mindent engedsz (a legtöbb szolgáltató kkv esete)
Ilyenkor nem kell semmit írnod. A hiányzó szabály engedélyt jelent. Ha mégis explicit akarod, hogy egyértelmű legyen a következő kollégának:
User-agent: ClaudeBotAllow: /
2. Szelektív engedés (ez a leggyakrabban helyes megoldás)
A tanító crawlert korlátozod, a felhasználói és a keresési ügynököt beengeded:
User-agent: ClaudeBotDisallow: /kosar/Disallow: /penztar/Disallow: /kereses/Disallow: /*?szuro=Allow: /
Külön blokkban, üres sorral elválasztva:
User-agent: Claude-UserAllow: /
User-agent: Claude-SearchBotAllow: /
3. Teljes tiltás
User-agent: ClaudeBotDisallow: /
Két figyelmeztetés. Az egyik: a Google AI-felhasználásra vonatkozó tokenje ettől független (Googlebot-Extended), a kettőt ne keverd, mert a Googlebot tiltásával a klasszikus keresőből is kiléptetheted magad. A másik: szakmai feltételezés, hogy a Crawl-delay direktívát az Anthropic ügynökei nem feltétlenül veszik figyelembe, ezért terhelés ellen ne ettől várd a megoldást.
Milyen hibákat látni leggyakrabban a magyar oldalak robots.txt-jében?
Röviden: nem a hiányzó szabály okozza a bajt, hanem a rosszul megírt. Saját tapasztalat: tíz átnézett kkv-oldalból jellemzően hét-nyolcon szerepel az alábbiak közül legalább egy.
- Üres sor a csoport közepén. Ha a
User-agentés a hozzá tartozóDisallowsor közé üres sor kerül, a feldolgozó két külön csoportnak látja, és a szabályod egyszerűen elveszik. - Ugyanaz az ügynöknév kétszer. Ha egy bot két külön blokkban, eltérő szabályokkal szerepel, nem lesz kiszámítható, melyik érvényesül. Vond össze egyetlen blokkba.
- Verziószámmal kiegészített név. A kis- és nagybetű nem számít az illesztésnél, de a
ClaudeBot/1.0formában megadott bejegyzés már nem biztos, hogy illeszkedik. Mindig a tiszta ügynöknevet írd be. - Hiányzó sitemap sor. A
Sitemap:direktíva csoportfüggetlen, és minden botnak szól. Ha kihagyod, ingyen dobsz el egy hasznos jelzést. - Tiltás bizalmas tartalomra. A robots.txt a letöltést kéri mellőzni, de a címet nem rejti el, sőt a fájl maga nyilvános. Ha valamit tényleg el kell zárni, oda jelszó vagy szerveroldali korlátozás kell, nem robots-szabály.
Miért nem elég a robots.txt, és mikor kell szerverszintű tiltás?
Röviden: a robots.txt udvarias kérés, nem zár. A tisztességes botok betartják, a hamisítottak nem. Ha a logban azt látod, hogy a terhelés a robots.txt módosítása után is megmarad, lépj szintet.
Apache alatt, a .htaccess fájlban egy egyszerű user-agent alapú szűrés így néz ki: RewriteCond %{HTTP_USER_AGENT} ClaudeBot [NC], majd RewriteRule .* - [F,L]. Nginx alatt ugyanez egy if ($http_user_agent ~* "ClaudeBot") { return 403; } feltétellel oldható meg. Ha a webhelyed CDN vagy proxy mögött van, ott jellemzően kattintással is beállítható a botkezelés, és ott érdemesebb is, mert nem terheli a saját szerveredet.
Fontos részlet, amit sokan elrontanak: ha a szűrést egyetlen Claude szóra írod meg, azzal a Claude-Usert is kizárod, vagyis pont azt a lekérést, ami mögött valódi érdeklődő áll. Ha tiltasz, tilts pontosan: a teljes ügynöknévre, ne egy töredékre.
Van egy köztes megoldás is a teljes tiltás és a szabad út között: sebességkorlátozás. A legtöbb tárhely- és CDN-felületen beállítható, hogy egy adott user-agent percenként hány kérést adhat le. Így a bot hozzáfér a tartalomhoz, de nem tudja megfektetni a szervert. Saját tapasztalat: a legtöbb panasz nem a botok létéből, hanem a csúcsidőben összesűrűsödő lekérésekből fakad, és ezt egy jól belőtt korlát rendezi.
Mi az üzleti mérlegelés a tiltás mögött?
Röviden: azt kell eldöntened, hogy a tartalmad marketingeszköz vagy maga a termék. A kettő ellentétes döntést kíván.
- Ha a tartalom marketingeszköz (szolgáltató kkv blogja, szolgáltatásoldalak, GYIK, referenciák), akkor a cél az, hogy minél több helyen felbukkanjon a neved. Itt a teljes tiltás önsebzés: lemondasz egy csatornáról, cserébe megspórolsz némi sávszélességet.
- Ha a tartalom maga a termék (zárt tudásbázis, saját fejlesztésű adatbázis, oktatóanyag, egyedi szakmai dokumentáció), akkor a tanító crawler kizárása védhető döntés. Ilyenkor is érdemes viszont a nyilvános marketingfelületet (kezdőlap, szolgáltatásleírás, kapcsolat) elérhetően hagyni.
- Ha a terhelés a probléma, akkor először mérj. Saját tapasztalat: egy közepes méretű magyar céges oldalon az AI-crawlerek forgalma jellemzően nem a lapok számától, hanem a paraméteres URL-ek burjánzásától robban meg (szűrők, rendezés, oldalszámozás). Ezek kizárása gyakran többet ér, mint az egész bot kitiltása.
Érdemes a döntést leírni egy mondatban, és a robots.txt tetejére kommentként betenni, hogy fél év múlva te magad is emlékezz rá, miért így van. Ez triviálisnak hangzik, de a gyakorlatban a legtöbb rossz robots-beállítás abból születik, hogy valaki hozzányúlt egy örökölt fájlhoz, és nem tudta, mi miért került bele.
A jogi oldal külön kérdés. A robots.txt nem szerződés és nem jogi eszköz, csak technikai jelzés. Ha a tartalmad felhasználását ténylegesen korlátozni akarod, azt a felhasználási feltételekben is rögzíteni kell, és érdemes jogásszal átnézetni. Ez szakmai feltételezés a gyakorlat felől nézve, nem jogi tanács.
Melyik magyar kkv-nak mit érdemes engednie?
Röviden: a szolgáltatók engedjenek, a tartalomértékesítők szelektáljanak, a webshopok pedig szűkítsék az útvonalakat, ne a botokat.
- Asztalos műhely Székesfehérváron: engedj be mindent. A cél, hogy amikor valaki egyedi konyhabútorról kérdez egy AI-asszisztenst, a te részletes anyagaid legyenek elérhetők. Itt a tiltásnak nincs racionális haszna.
- Állatorvosi rendelő Nyíregyházán: engedj, de zárd ki az időpontfoglaló és a bejelentkezés utáni útvonalakat. Ezek se a botnak, se neked nem hasznosak.
- Webshop Debrecenben: a kategória- és termékleírásokat engedd, a szűrt, paraméteres és keresési URL-eket tiltsd. Ezzel a lekérések nagy részét levágod anélkül, hogy láthatatlanná válnál.
- B2B gyártó Egerben: engedd a szakmai tartalmat. A beszerzők egyre gyakrabban használnak AI-asszisztenst előszűrésre, és ha a műszaki leírásaid nem elérhetők, egyszerűen nem kerülsz be a rövid listába.
- Online tananyagot értékesítő vállalkozás: ez az az eset, ahol a ClaudeBot tiltása mellett szólnak érvek, miközben a Claude-SearchBotot érdemes lehet beengedni, hogy a nyilvános leírásaidra hivatkozni tudjon.
Mit érdemes a tartalmon javítani, ha beengeded az ügynököket?
Röviden: az engedélyezés csak a belépőjegy. Ha a botot beengeded, de az oldalad gépi szemmel nehezen olvasható, a hozzáférésből nem lesz idézés.
- Legyen szerveroldali HTML. Ha a szöveg csak a böngészőben, JavaScript lefutása után jelenik meg, egy egyszerű letöltő üres oldalt lát. Ellenőrizd egy
curl -A "ClaudeBot" https://domain.hu/oldalparanccsal, hogy a lényegi szöveg tényleg benne van-e a válaszban. - Írj rövid, önmagában is helytálló válaszokat. Ha egy szakasz első két mondata kontextus nélkül is értelmes, azt könnyebb kiemelni és idézni.
- Tedd egyértelművé a tényadatokat. Cégnév, működési terület, szolgáltatások, elérhetőség szövegesen is szerepeljen, ne csak képen vagy ikonban.
- Adj dátumot és szerzőt. A frissítés dátuma jelzi, hogy az anyag nem elavult. Ez szakmai feltételezés, de a gyakorlat felől nézve logikus elvárás.
Ez a néhány lépés nem garantál megjelenést, de érdemben javíthatja az esélyt, hogy a beengedett ügynök használható anyagot találjon nálad.
Hogyan méred, hogy jól döntöttél?
Röviden: három adatforrásod van, és mindhármat érdemes havi ritmusban nézni.
- Szerverlog: havonta számold meg botonként a lekéréseket és a lehúzott adatmennyiséget. Ez mutatja meg a valós költségoldalt.
- GA4 hivatkozó forgalom: nézd meg, érkezik-e látogató AI-felületekről. Ez a Claude-User működésének közvetett nyoma. Kicsi számok is jelentősek lehetnek, mert az így érkező látogató jellemzően már túl van a tájékozódáson.
- Kézi promptteszt: havonta tegyél fel öt-hat olyan kérdést az asszisztensnek, amire a te oldaladnak kellene válaszolnia, és jegyezd fel, hogy megjelensz-e forrásként. A válaszok változékonyak, ezért egyetlen mérés semmit nem bizonyít, de a több hónapos trend már jelzésértékű.
Fontos elvárás-kezelés: az AI-válaszokban való megjelenés nem garantálható, és nem is stabil. Amit befolyásolni tudsz, az az esély, nem az eredmény.
Milyen lépésekkel vezesd be a beállítást?
- Kérd le a szerverlogot legalább 30 napra, és nézd meg, ténylegesen jár-e nálad ClaudeBot.
- Ellenőrizd, hogy a lekérések valós IP-tartományból jönnek-e.
- Döntsd el egy mondatban, hogy a tartalmad marketingeszköz vagy termék.
- Írd meg a robots.txt-t külön csoporttal a három ügynökre, üres sorral elválasztva.
- Zárd ki a paraméteres, kosár- és keresési útvonalakat minden bot elől.
- Töltsd be a
domain.hu/robots.txtcímet böngészőben, és ellenőrizd, hogy tényleg az új tartalom jelenik-e meg (gyakori, hogy a cache régi verziót szolgál ki). - Ha a terhelés marad, tegyél szerver- vagy CDN-szintű szabályt is, pontos ügynöknévvel.
- Írd be a naptáradba, hogy 30 nap múlva újra megnézed a logot és a GA4-et.
Ez a nyolc lépés kevesebb mint egy délután, és utána nem érzésre, hanem adat alapján tudsz dönteni arról, hogy kit engedsz be a saját webhelyedre.
Források és további olvasnivalók
- Anthropic támogatási dokumentáció: a ClaudeBot, a Claude-User és a Claude-SearchBot leírása, valamint a crawlerek IP-tartományai
- Anthropic Trust Center: adatkezelési és feltérképezési alapelvek
- Google Search Central: robots.txt specifikáció és a Googlebot-Extended token dokumentációja
- RFC 9309: Robots Exclusion Protocol (IETF szabvány)
- robotstxt.org: a protokoll eredeti leírása és gyakorlati példák
- Cloudflare fejlesztői dokumentáció: AI-crawlerek kezelése és botkezelési szabályok
- Schema.org: strukturált adat szókészlet
- W3C: webes szabványok és hozzáférhetőségi ajánlások
- A három Anthropic-ügynök nem egyforma: csak az egyik gyűjt tömegesen, a másik kettő közvetlenül összefügg azzal, hogy a Claude idéz-e téged.
- A robots.txt csoportjai nem öröklődnek: ha külön blokkot írsz a ClaudeBotnak, az a csillagos szabályokat teljesen figyelmen kívül hagyja.
- A robots.txt kérés, nem fal: valódi terhelés ellen szerver- vagy CDN-szintű szabály kell, a hamisított user-agent miatt pedig IP-ellenőrzés is.
- A tiltás akkor védhető üzletileg, ha maga a tartalom a termék; szolgáltató kkv-nál a teljes tiltás jellemzően önsebzés.
- Mérd hónapról hónapra a logokban a botonkénti lekéréseket és a GA4-ben az AI-felületekről érkező hivatkozó forgalmat, mielőtt döntesz.
Gyakori kérdések
A ClaudeBot tiltása rontja a Google-helyezésemet?
Nem. A két rendszer teljesen független egymástól, az Anthropic ügynökeinek kizárása a Google indexelését nem érinti. Egyetlen kockázat van: ha a robots.txt-t rosszul írod meg, és a tiltás véletlenül a Googlebotra is kiterjed. Ezért érdemes minden módosítás után a Search Console robots.txt-tesztelőjével ellenőrizni az eredményt.
Ha tiltom a ClaudeBotot, akkor a Claude nem tud majd idézni engem?
Nem feltétlenül. A ClaudeBot elsősorban a tömeges tartalomgyűjtésért felel, míg az idézhetőséghez a Claude-SearchBot és a Claude-User a lényeges. Ha csak a ClaudeBotot tiltod, a másik kettőt pedig beengeded, elvileg megmarad az esélyed a megjelenésre. Ez logikusan következik az ügynökök hivatalos leírásából, de nem garantált eredmény.
Mennyi terhelést okoz egy AI-crawler egy átlagos magyar kkv-oldalon?
Ez nagyon eltérő, és inkább az oldal szerkezetétől függ, mint a méretétől. Egy statikus, néhány száz oldalas bemutatkozó oldalnál a hatás jellemzően elhanyagolható. Egy szűrőkkel teli webshopnál viszont a paraméteres URL-ek miatt sokszorosára nőhet a lekérések száma. A pontos számot csak a saját szerverlogod mondja meg.
Elég a robots.txt, vagy tűzfalszabály is kell?
A robots.txt csak azoknál a botoknál működik, amelyek tiszteletben tartják. Az Anthropic ügynökei a hivatalos dokumentáció szerint ilyenek. A hamisított user-agentekkel dolgozó scraperek ellen viszont csak szerver-, tűzfal- vagy CDN-szintű szabály véd. Ha a robots.txt módosítása után is marad a terhelés, szinte biztosan nem valódi ClaudeBotról van szó.
Milyen gyakran érdemes felülvizsgálni ezeket a beállításokat?
Negyedévente elég, hacsak nem történik nagyobb változás az oldalon. Az AI-szolgáltatók viszonylag gyakran vezetnek be új ügynökneveket, ezért a szerverlog átnézésekor mindig keresd a korábban nem látott user-agenteket is. Ha új nevet találsz, először nézz utána a szolgáltató hivatalos leírásában, és csak utána dönts a tiltásról.
Jogilag megvéd a robots.txt a tartalmam felhasználásától?
Önmagában nem. A robots.txt technikai jelzés, nem szerződés. Ha valóban korlátozni akarod a tartalmad felhasználását, azt a weboldal felhasználási feltételeiben is rögzíteni kell, és érdemes jogásszal átnézetni a megfogalmazást. Ez gyakorlati megfontolás, nem jogi tanács.
Mi a teendő, ha a robots.txt módosítása után sem változik semmi?
Először ellenőrizd, hogy a nyilvános címen tényleg az új fájl jelenik-e meg, mert a gyorsítótár vagy a CDN sokáig kiszolgálhatja a régi verziót. Ha a fájl rendben van, nézd meg a naplóban a kérések IP-címeit: ha nem az Anthropic hivatalos tartományaiból érkeznek, hamisított user-agentről van szó, ami ellen csak szerver- vagy tűzfalszintű szabály hatásos.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.