- A Google-Extended nem crawler, hanem egy felhasználási jelzés: a Googlebot ettől függetlenül ugyanúgy letölti és indexeli az oldalaidat.
- Az AI Overviews a Search része, ezért a Google-Extended tiltás nem távolít el belőle, arra csak a nosnippet típusú irányelvek hatnak, amelyek viszont a sima találati kivonatodat is megölik.
- A tiltásnak licencelt adatbázis, fizetős kutatási anyag vagy szerződéses adatkorlát esetén van valós üzleti alapja, marketingcélú tartalomnál szinte soha.
- A robots.txt nem védelem: aki tényleg másolni akar, azt egy szöveges fájl nem állítja meg, csak a jogkövető rendszereket zárod ki.
- Tiltás előtt négy kérdést kell megválaszolni: mit véd, mit veszít, hol a bevétel forrása, és van-e jobb technikai eszköz ugyanarra a célra.
Ha valaki a cégedben felveti, hogy „tiltsuk le a Google AI-t az oldalunkon", szinte biztos, hogy a Google-Extended szabályra gondol. Ez egyetlen sor a robots.txt fájlban, és az elmúlt két évben a magyar kkv-s körökben is elterjedt mint az AI-védelem gyors megoldása. A baj az, hogy a legtöbben rosszul tudják, mire hat.

A tipikus félreértés így hangzik: „nem akarom, hogy a Google AI kimásolja a tartalmamat és megválaszolja helyettem a kérdést, ezért letiltom a Google-Extended tokent". A szándék érthető, a művelet viszont nem azt csinálja, amit várnak tőle. Aki emiatt tiltja le, az egy olyan ajtót zár be, amin nem jön be senki, miközben egy másik ajtón kisétál a saját láthatóságából.
Ez a cikk végigviszi, mit vezérel pontosan ez a token, mit nem, hogyan írod be és teszteled, és milyen üzleti helyzetben van értelme. A végén kapsz egy négykérdéses döntési ellenőrzőlistát, amit cégvezetőként fel kell tenned, mielőtt bárki hozzányúl a robots.txt fájlhoz.
Mit vezérel pontosan a Google-Extended token?
Rövid válasz: a Google-Extended azt szabályozza, hogy a Google felhasználhatja-e a nyilvános tartalmadat a Gemini modellek tanításához és a válaszok megalapozásához (grounding), de nem azt, hogy a Google letölti-e és indexeli-e az oldaladat.
Hivatalosan igazolt: a Google saját crawler-dokumentációja szerint a Google-Extended nem önálló robot. Nem indul el, nem tölt le semmit, nem hagy nyomot a szervernaplóban. Egy önálló robots.txt token, amit a Googlebot által amúgy is letöltött tartalom utólagos felhasználására alkalmaznak. A Google leírása szerint a hatóköre a Gemini alkalmazások, a Vertex AI generatív API-k, valamint az ezekhez tartozó grounding.
Érdemes szétszedni, mi az a két dolog, amit tényleg befolyásol:
- Modelltanítás: a jövőbeli Gemini modellek tanító anyagában szerepelhet-e a szöveged. Ez nem egyszeri, visszafordíthatatlan lépés a te oldaladról nézve, de amit egy már kiadott modell megtanult, azt nem tudod visszavonni.
- Grounding: amikor egy Gemini-alapú asszisztens futásidőben friss forrásokat keres a válaszához, felhasználhatja-e a te oldaladat forrásként. Ez a gyakorlatban a hivatkozás és az említés kérdése.
Saját tapasztalat: ügyfeleknél a második pont szokta a legnagyobb meglepetést okozni. A cégvezető azt hiszi, a tanítást tiltja le, közben azt is elvágja, hogy egy asszisztens forrásként rá tudjon mutatni a szolgáltatási oldalára. Ez a kettő ugyanabban a sorban lakik, külön nem szabályozható.
Miért nem tünteti el a Google-Extended az oldaladat az AI Overviews felületről?
Rövid válasz: mert az AI Overviews a Google Kereső része, és a keresőindexből dolgozik, amit a sima Googlebot tölt fel. A Google-Extended nem szól bele abba, mit lát a Googlebot.
Hivatalosan igazolt: a Google Search Central dokumentációja külön kimondja, hogy a keresőben megjelenő generatív élmények (AI Overviews, AI Mode) a Search infrastruktúrájára épülnek, és a Googlebot hozzáférésén múlnak. Ha a Google-Extended tiltása ki tudná venni a tartalmadat ezekből, akkor a hozzáférés-szabályozás logikája borulna fel: egy AI-felhasználási jelzés nem írja felül az indexelést.
Ebből egy fontos gyakorlati következtetés adódik. Ha valóban az a célod, hogy a tartalmad ne kerüljön be egy keresőben megjelenő AI-összefoglalóba, akkor a robots.txt nem a te eszközöd. Erre a nosnippet, a max-snippet és az egyes szakaszokra alkalmazható data-nosnippet irányelvek hatnak, mert ezek a kivonatolást korlátozzák. Csakhogy ezek nem szelektívek: ugyanaz az irányelv a hagyományos találati kivonatodat (a kék link alatti leírást) is levágja. Kevés olyan magyar kkv van, amelyiknek ez jó üzlet.
Szakmai feltételezés: a jelenlegi irány alapján ez a szétválasztás szándékos, és nem várható, hogy a Google külön, következmények nélküli AI Overviews-kikapcsolót adjon. A kereső és a generatív válaszréteg egyre inkább ugyanaz a termék, így a kettő külön szabályozása a Google oldaláról sem logikus.
Hogyan írod be a szabályt a robots.txt fájlba?
Rövid válasz: önálló User-agent csoportban, a domain gyökerében lévő robots.txt fájlban, és soha nem a Googlebot csoportjába beleírva.
Teljes tiltás
User-agent: Google-ExtendedDisallow: /
Részleges tiltás (csak a védett szekció)
Ez a reálisabb eset: van egy fizetős kutatási vagy licencelt adatbázis-részed, a többi tartalmad viszont marketingcélú, és jó, ha látszik.
User-agent: Google-ExtendedDisallow: /kutatas/Disallow: /adatbazis/Allow: /
Gyakori hibák, amiket hetente látni
- Rossz csoportba írás: ha a
Disallow: /sort aUser-agent: Googlebotalá teszed, akkor az indexelésedet lőtted ki, nem az AI-felhasználást. A robots.txt csoportos logikájú, minden robot a rá legpontosabban illeszkedő egyetlen csoportot követi. - Rossz helyre tett fájl: a robots.txt csak a gyökérben érvényes, protokollonként és aldomainenként külön. A
shop.pelda.hunem örökli apelda.huszabályait. - WordPress virtuális robots.txt: ha nincs fizikai fájl, a WordPress generál egyet. Ilyenkor a Yoast vagy a Rank Math szerkesztőjén keresztül nyúlj hozzá, mert egy kézzel feltöltött fájl felülírja a virtuálisat, és a két forrás könnyen szétcsúszik.
- Wildcard-tévedés: a
User-agent: *csoportba tett tiltás minden jól viselkedő robotra vonatkozik, a Googlebotra is. Ha csak az AI-felhasználást akartad korlátozni, ez sokkal többet zár be.
Hogyan teszteled, hogy tényleg működik-e a beállítás?
Rövid válasz: a robots.txt tartalmát ellenőrzöd (nem a forgalmat), mert a Google-Extended sosem fog látszani a naplóban.
A gyakorlati sorrend:
- Nyisd meg böngészőben a
https://a-te-domained.hu/robots.txtcímet, és nézd meg, hogy tényleg az van benne, amit írtál. Ha cache vagy CDN van előtte, kérd le friss, gyorsítótár nélküli lekéréssel is. - Parancssorból: a
curl -s https://a-te-domained.hu/robots.txtmegmutatja a nyers tartalmat. Ellenőrizd a HTTP státuszkódot is: a 200-tól eltérő válasz (különösen a 403 vagy az 5xx) más értelmezéshez vezethet. - Google Search Console robots.txt jelentés: itt látod, mikor kérte le a Google utoljára a fájlt, mit olvasott ki belőle, és talált-e szintaktikai hibát. Ez a leghitelesebb visszajelzés, mert azt mutatja, amit a Google ténylegesen látott.
- Ellenőrizd, hogy az indexelés sértetlen maradt: a GSC oldalvizsgálatában nézz rá pár fontos URL-re, hogy továbbra is indexelhetők. Ez a lépés fogja meg a rossz csoportba írt tiltást.
Saját tapasztalat: a leggyakrabban jelzett „hiba" az, hogy az ügyfél nem találja a Google-Extended kéréseit a naplóban, és azt hiszi, nem működik a beállítás. Nem hibás: ez a token nem crawler, ezért soha nem is fog megjelenni ott. Nincs olyan szervernapló-bejegyzés, ami visszaigazolná. Ez a hatás egyoldalú bizalmi rendszer, és ezt cégvezetőként érdemes tudni, mielőtt biztonsági intézkedésként hivatkozol rá.
Milyen üzleti helyzetben van értelme a tiltásnak?
Rövid válasz: akkor, ha a tartalom maga a termék, vagy ha szerződés köt arra, hogy harmadik fél ne használhassa fel.
- Licencelt adatbázis: ha az adatot más cégtől vetted meg, és a licenc kizárja a továbbadást vagy a származékos felhasználást, akkor a tiltás nem marketingdöntés, hanem szerződéses kötelezettség.
- Fizetős kutatás, saját módszertan: ha az iparági jelentésedért fizetnek, és pontosan az az érték, hogy nem lehet máshonnan megszerezni, akkor jogos a korlátozás.
- Ügyfél- vagy szerzői jogi kötöttség: például lektorált szakmai anyag, ahol a szerzővel kötött megállapodás nem terjed ki az AI-felhasználásra.
- Jogi vagy compliance előírás: egyes szabályozott szektorokban belső szabályzat írja elő az ilyen jelzés kitételét, akkor is, ha üzletileg semleges.
Vedd észre a közös pontot: mindegyik esetben a tartalom maga a bevételi forrás vagy a jogi kockázat, nem az ügyfélszerzés eszköze. Ha a szöveged célja az, hogy megtaláljanak, akkor nem tartozol ide.
Mikor kifejezetten kártékony a tiltás?
Rövid válasz: akkor, ha a tartalmad marketingcélú, vagyis azért írtad, hogy megtaláljanak, és nem azért, hogy fizessenek érte.
A saját nézőpontom: a magyar kkv-k túlnyomó többségénél a Google-Extended tiltás önsebzés. A szolgáltatásoldalad, a blogod, a gyakori kérdéseid, a referenciáid nem védendő szellemi vagyontárgyak, hanem értékesítési eszközök. Ha ezeket elzárod, akkor a másolást nem akadályozod meg (a robots.txt semmilyen technikai kényszert nem tartalmaz, csak a jogkövető rendszerek tartják be), viszont kiveszed magad azokból a válaszokból, ahol egy potenciális ügyfél éppen szolgáltatót keres.
Ez különösen fáj a helyi szolgáltatóknak. Ha valaki egy asszisztenstől azt kérdezi, kihez forduljon egy adott szakmában Székesfehérváron vagy Debrecenben, a válasz a nyilvánosan elérhető, feldolgozható forrásokból áll össze. Aki kizárta magát ebből a körből, az nem lesz az opciók között. Szakmai feltételezés: ennek a hatásnak a súlya a következő években nő, ahogy a keresés egyre nagyobb része megy át asszisztens-jellegű felületekre, de ezt ma senki nem tudja pontos számmal alátámasztani.
A másik gyakori tévedés, hogy a tiltás bármit is véd. Nem véd. Aki a szövegedet le akarja másolni, az megteszi kézzel is. Amit a robots.txt-vel elérsz, az kizárólag annyi, hogy a szabálykövető rendszereket zárod ki. Ha valamit tényleg titkolni kell, annak bejelentkezés mögött a helye, nem egy szöveges fájlban jelezve.
Milyen négy kérdést tegyen fel a cégvezető a tiltás előtt?
Rövid válasz: ha mind a négyre nincs világos, számokkal vagy szerződéssel alátámasztott válaszod, akkor ne tiltsd le.
- Mit védek ezzel konkrétan, és az mennyit ér? Nevezd meg az URL-eket vagy a szekciót. Ha erre csak annyit tudsz mondani, hogy „a tartalmunkat általában", akkor nincs védendő eszköz, csak rossz érzés.
- Mit veszítek, ha kizárom magam? Vedd elő, honnan jön ma az érdeklődés. Ha a bevétel érdemi része organikus keresésből és ajánlásból származik, akkor a láthatóság szűkítése közvetlen kockázat.
- A tartalom maga a termék, vagy a termék felé vezető út? Ha fizetnek érte, védd. Ha azért írtad, hogy megkeressenek, akkor a tiltás a saját tölcséredet szűkíti.
- Van-e pontosabb eszköz ugyanerre a célra? Bejelentkezés, fizetőfal, részleges tiltás csak az érintett könyvtárra, vagy jogi úton történő fellépés. A robots.txt a legdurvább és a leggyengébb eszköz a listán, ritkán a helyes válasz.
Egy jó gyakorlat: a döntést írásban rögzítsd, dátummal és indoklással. Fél év múlva senki nem fog emlékezni, miért került be az a két sor, és a felülvizsgálat sokkal könnyebb, ha látszik az eredeti üzleti ok.
Mit érdemes csinálni a tiltás helyett?
Ha az aggodalmad valós (nem akarod, hogy mások a te munkádból éljenek), akkor a hasznos lépések máshol vannak. Tedd egyértelművé a szerzőséget és a forrást a tartalomban, használj strukturált adatokat (Schema.org), hogy a szövegedhez tartozó cég, szerző és dátum géppel is olvasható legyen, és a valóban értékes anyagot tedd regisztráció vagy fizetés mögé. A nyilvános részt pedig hagyd nyitva, mert az a dolga, hogy dolgozzon neked.
Ez a megközelítés nem garantál semmilyen konkrét megjelenést vagy helyezést, viszont jó eséllyel jobb üzleti eredményt hoz, mint egy olyan tiltás, ami a másolást nem akadályozza meg, a láthatóságot viszont igen.
Források és további olvasnivalók
- Google Search Central: Google crawlers and user-agents (a Google-Extended token hivatalos leírása)
- Google Search Central: Robots.txt bevezető és specifikáció
- Google Search Central: A robots.txt jelentés a Google Search Console-ban
- Google Search Central: AI Overviews és AI Mode a Keresőben (dokumentáció webhelytulajdonosoknak)
- Google Search Central: Snippet-vezérlés (nosnippet, max-snippet, data-nosnippet)
- Google Cloud dokumentáció: Vertex AI grounding
- Schema.org: Article, Organization, Person típusok
- IETF RFC 9309: Robots Exclusion Protocol
Gyakori kérdések
A Google-Extended letiltása kiveszi az oldalamat az AI Overviews válaszaiból?
Nem. Az AI Overviews a Google Kereső része, és a Googlebot által épített keresőindexből dolgozik, amit a Google-Extended nem érint. A snippet-alapú megjelenést csak a nosnippet típusú irányelvek korlátozzák, azok viszont a hagyományos találati kivonatodat is levágják.
Ront a Google-Extended tiltás a keresőhelyezésemen?
A Google hivatalos álláspontja szerint nem rangsorolási tényező, és az indexelést sem befolyásolja. Közvetett hatása viszont lehet: a generatív felületeken kevesebb forrásként való említés jó eséllyel kevesebb ismertséget és kevesebb hivatkozást jelent, de ezt pontos számmal ma senki nem tudja alátámasztani.
Látom-e a szervernaplóban, hogy a Google-Extended járt az oldalamon?
Nem, és ez nem hiba. A Google-Extended nem crawler, hanem egy felhasználási jelzés a robots.txt fájlban. A letöltést a Googlebot végzi, a token csak azt szabályozza, mire használható a már letöltött tartalom.
Külön tudom tiltani a tanítást és a groundingot?
Nem. A Google-Extended egyetlen tokenként kezeli mindkettőt, tehát ha letiltod a modelltanítást, egyben azt is elveszed, hogy egy Gemini-alapú asszisztens futásidőben forrásként hivatkozzon rád. Ezt sokan nem tudják a beállítás pillanatában.
Aldomainenként külön kell beállítani?
Igen. A robots.txt gazdagépenként, protokollonként és portonként érvényes, tehát a shop.pelda.hu nem örökli a pelda.hu szabályait. Ha több aldomaint üzemeltetsz, mindegyiknek saját fájl kell.
Ha meggondolom magam, visszavonható a tiltás?
A grounding oldalán igen: ha kiveszed a szabályt, a Google újra felhasználhatja a tartalmadat forrásként. A modelltanítás oldalán részben: amit egy már kiadott modell megtanult, azt visszamenőleg nem tudod eltávolítani, csak a jövőbeli tanításra hat a változtatás.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.