Az indexelés az a pont, ahol a legtöbb weboldal némán elakad. A tartalom kész, a sitemap elment, a Search Console össze van kötve, aztán nem történik semmi: nulla megjelenés, nulla kattintás. Ilyenkor a tulajdonos jellemzően a rangsorolásról kezd beszélni, pedig a baj egy szinttel lejjebb van. Az oldal be sem került a kereső adatbázisába, tehát nincs miből rangsorolni.

Ebben a cikkben végigmegyünk azon, mit jelent pontosan az indexelés, hogyan ellenőrzöd hitelesen, mik a leggyakoribb elakadások, és mit csinálj velük lépésről lépésre. Ahol releváns, jelölöm, mi hivatalosan igazolt (a keresők saját dokumentációjából), mi saját tapasztalat (magyar kkv-oldalakon végzett munkából) és mi szakmai feltételezés.
Mit jelent pontosan az indexelés?
Rövid válasz: az indexelés az a folyamat, amelyben a kereső egy már letöltött oldalt feldolgoz, értelmez és eltárol a saját adatbázisában, hogy később meg tudja jeleníteni a találatok között. Ha egy oldal nincs indexelve, akkor semmilyen keresésre nem jelenhet meg, akármilyen jó a szöveg rajta.
Hivatalosan igazolt: a Google dokumentációja három elkülönülő szakaszt ír le. Az első a feltérképezés (crawling): a robot megtalálja az URL-t, és letölti a tartalmát. A második az indexelés: a letöltött oldalt a rendszer lerendereli, kielemzi a szöveget, a képeket és a strukturált adatokat, eldönti, hogy duplikátumról van-e szó, és ha nem, eltárolja. A harmadik a kiszolgálás: egy konkrét keresésre a rendszer az indexből válogat és rangsorol.
A gyakorlati következmény, amit sokan összekevernek: attól, hogy a robot járt az oldaladon, még nincs indexelve. A feltérképezés csak a belépő. Az indexelés külön döntés, és a Google nyíltan írja, hogy nem tárol el minden feltérképezett oldalt. Az index véges erőforrás, a rendszer pedig folyamatosan mérlegel, megéri-e helyet adni egy adott URL-nek.
Ugyanez fordítva is igaz: egy oldal kikerülhet az indexből úgy is, hogy technikailag semmit nem rontottál el rajta. Ha a tartalom elavult, vagy időközben született belőle egy jobb, teljesebb változat máshol a saját domainen, a régi verzió kieshet.
Honnan tudod biztosan, hogy indexelve van-e egy oldalad?
Rövid válasz: egyetlen hiteles eszköz van rá, a Google Search Console URL-ellenőrzője. Ez mondja meg oldalanként, hogy az adott URL benne van-e az indexben, mikor járt ott utoljára a robot, és ha nincs benne, mi az oka.
- Nyisd meg a Search Console-t arra a tulajdonra, ahová az URL tartozik.
- Illeszd be a teljes URL-t a felső sávba, protokollal együtt.
- Olvasd el a státuszt:
Az URL szerepel a Google-ben, vagyAz URL nem szerepel a Google-ben. - Nyisd le a részleteket. Itt látod a felfedezés módját, az utolsó feltérképezés dátumát, valamint a te általad megadott és a Google által ténylegesen választott kanonikus URL-t.
- Futtasd az
Élő URL tesztelésefunkciót: ez most tölti le az oldalt, és megmutatja a renderelt HTML-t is.
Amit sokan hitelesnek hisznek, pedig nem az: a site:domain.hu operátor. Mintavételezett, hozzávetőleges képet ad, és a Google többször jelezte, hogy nem diagnosztikai eszköznek szánták. Ha kevés vagy nulla találatot mutat, az önmagában semmit nem bizonyít.
Saját tapasztalat: a magyar kkv-oldalakon ritkán egyetlen URL hiányzik, sokkal inkább mintázat rajzolódik ki. Például minden szolgáltatás-aloldal bent van, de a blogcikkek nincsenek, vagy pont fordítva. Ezért az egyedi ellenőrzés mellett mindig nézd végig az Oldalak jelentést is, ahol csoportosítva látod, hány URL esik melyik státuszba, és mikor változott a trend.
Miért nem indexeli a Google az oldaladat?
Rövid válasz: a nem indexelt oldalak nagy része három csoportba esik. Vagy technikailag ki van zárva, vagy duplikátumnak minősül, vagy a rendszer nem tartja elég értékesnek ahhoz, hogy helyet adjon neki. A Search Console státuszneve elárulja, melyikről van szó.
Technikai kizárás
Ide tartozik a noindex metacímke, az X-Robots-Tag: noindex HTTP-fejléc, a robots.txt tiltás, a jelszóval védett tartalom, a 4xx és 5xx hibakódok, valamint az átirányítás. Ezek mind egyértelmű, javítható okok. A leggyakoribb baleset a fejlesztői környezetből élesbe került <meta name="robots" content="noindex"> sor, illetve a WordPress beállításai között bekapcsolva felejtett keresőmotor-láthatóság letiltása.
Fontos különbség, amin sok javítás elcsúszik: a robots.txt tiltás megakadályozza a letöltést, de nem szedi ki az oldalt az indexből. Ha egy már indexelt oldalt akarsz eltávolítani, a noindex a helyes eszköz, ehhez viszont a robotnak látnia kell az oldalt. A kettő együtt kioltja egymást.
Duplikáció és kanonizálás
A Duplikált tartalom, a Google más kanonikus oldalt választott és az Alternatív oldal megfelelő kanonikus címkével státusz nem hibaüzenet. Azt jelenti, hogy a rendszer több URL mögött ugyanazt a tartalmat látja, és egyet választott közülük. Tipikus forrásaik a szűrő- és rendezésparaméteres URL-ek, a nyomtatóbarát változatok, a webshopok variáns-oldalai, és a sablonból generált, csak településnévben eltérő aloldalak.
Értékelési döntés
A Felfedezve, jelenleg nincs indexelve azt jelenti, hogy a Google ismeri az URL-t, de le sem töltötte. A Feltérképezve, jelenleg nincs indexelve azt, hogy letöltötte, de nem tárolta el. Hivatalosan igazolt, hogy mindkettő mögött állhat minőségi mérlegelés és feltérképezési kapacitás is. Saját tapasztalat: ha egy domainen a második státusz tömegesen jelenik meg friss tartalmon, az szinte mindig vékony vagy egymáshoz túl hasonló oldalakat takar, nem szerverhibát.
Hogyan javítsd az indexelési problémát lépésről lépésre?
Rövid válasz: előbb zárd ki a technikai akadályokat, utána a duplikációt, és csak a végén nyúlj a tartalomhoz. Fordított sorrendben hetekig írhatsz olyan oldalra, amit a robot el sem ér.
- Nézd meg a státuszkódot. Az indexelhető oldal 200-as választ ad. Parancssorból:
curl -I https://pelda.hu/oldal/. Ha 301-et vagy 404-et kapsz, itt véget is ért a nyomozás. - Ellenőrizd a robots.txt fájlt a
https://pelda.hu/robots.txtcímen, és keresd az adott útvonalra illeszkedőDisallowsorokat. - Keresd meg a noindex jelet a forráskódban a robots metacímkében, és a válaszfejlécben az
X-Robots-Tagértékben. A fejlécet a fenti curl-parancs kimenetében látod. - Vizsgáld meg a kanonikus címkét. Ha az oldal önmagára mutat, rendben van:
<link rel="canonical" href="https://pelda.hu/oldal/">. Ha máshová, akkor te magad adtad át a helyét. - Futtasd az élő URL-tesztet, és nézd meg a renderelt HTML-t. Ha a lényegi szöveg csak JavaScriptből épül fel, és a renderelt kódban nem szerepel, akkor a rendszernek nincs mit indexelnie.
- Adj az oldalnak belső linket egy olyan oldalról, amiről tudod, hogy indexelve van. Az árva URL-eket a robot lassabban éri el, és kevesebb jelet társít hozzájuk.
- Kérj újra-feltérképezést az URL-ellenőrzőben, de csak akkor, ha közben tényleg javítottál valamit.
- Ha a státusz feltérképezés utáni elutasítás, ne az újraküldést ismételd. Bővítsd az oldalt valódi információval, vagy vond össze a hozzá túl hasonló testvéroldalaival.
Mennyi idő alatt indexelődik egy új oldal?
Rövid válasz: nincs rá kötelező érvényű határidő. Néhány óra és több hét között bármi előfordul, és a hosszabb várakozás önmagában még nem jelent hibát.
Hivatalosan igazolt: a Google többször közölte, hogy nem vállal időbeli ígéretet az indexelésre, és az indexelés kérése gomb sem sorolja előre az URL-t semmilyen biztos módon. Saját tapasztalat: rendszeresen frissülő, belsőleg jól linkelt magyar oldalakon az új aloldalak jellemzően pár napon belül bekerülnek, míg egy néhány hetes domainen ugyanez heteket is elvihet. Szakmai feltételezés: a különbség jó része abból jön, hogy a rendszer mennyi korábbi jelet gyűjtött már az adott domainről; ezt kívülről közvetlenül nem tudjuk mérni, csak a viselkedésből következtetünk rá.
Amit érdemes elkerülni: a napi újraküldés. A kérés ismétlése nem gyorsítja a folyamatot, viszont elfedi előled a valódi kérdést, hogy miért nem kellett a rendszernek az oldal.
Mennyit segít a sitemap, a belső linkelés és az IndexNow?
Rövid válasz: a sitemap és az IndexNow a felfedezést gyorsítja, tehát azt, hogy a kereső tudomást szerezzen az URL-ről. Magát az indexelési döntést nem ezek hozzák meg, hanem a feldolgozás.
- XML sitemap: csak indexelhető, 200-as státuszú, önmagára kanonizált URL-eket tegyél bele. Ha átirányítások és noindex oldalak is szerepelnek benne, a saját diagnosztikádat rontod el, mert a jelentésben zajt látsz majd.
- Belső linkelés: a legolcsóbb és leghatásosabb eszköz. Egy új cikk, amire a kategóriaoldalról, egy régebbi cikkből és a lábléc valamelyik gyűjtőoldaláról is mutat link, jó eséllyel gyorsabban kerül sorra, mint az, amire semmi.
- IndexNow: nyílt protokoll, amellyel egy kulcsfájllal hitelesítve azonnal jelezheted a tartalom változását. Hivatalosan igazolt, hogy a Bing és a Yandex használja. A Google nem jelentette be az átvételét, ezért a magyar piacon önmagában nem váltja ki a Search Console-t.
A sitemapet nem kell kézzel beküldeni minden változáskor. Elég, ha a rendszered automatikusan frissíti, és a robots.txt utolsó soraként ott van a Sitemap: https://pelda.hu/sitemap.xml bejegyzés.
Változtat-e bármit az indexelés szerepén az AI-válaszmotorok terjedése?
Rövid válasz: nem csökkenti a jelentőségét, inkább kiterjeszti. A nagy AI-asszisztensek jelentős része keresőmotorok indexéből vagy saját feltérképezésből dolgozik, tehát az az oldal, amelyik sehol nincs eltárolva, forrásként sem tud megjelenni egy válaszban.
Hivatalosan igazolt: az OpenAI és az Anthropic is közzéteszi a saját robotjainak user-agent nevét, és leírja, hogyan zárhatod ki őket a robots.txt-ben. Ez kétélű: ha kizárod őket, azzal a hivatkozás lehetőségétől is elzárod magad. A döntés üzleti, nem technikai, de tudatosan kell meghozni, nem véletlenül örökölni egy sablonos robots.txt fájlból.
Szakmai feltételezés: az idézhetőség szempontjából a stabil, változatlan URL és a tiszta, szerver oldalon kiszolgált HTML többet ér, mint a kliensoldalon összerakott tartalom. Ez a mérésekkel és a dokumentált feldolgozási logikával összhangban áll, de közvetlen bizonyítékunk nincs rá, és semmilyen megjelenést nem ígér.
Milyen ellenőrzőlistán menj végig, ha holnap ez a feladatod?
Rövid válasz: nyolc pont, felülről lefelé, és az elsőnél kezdve állj meg ott, ahol elakadsz.
- Az URL 200-as státuszkóddal válaszol.
- A robots.txt nem tiltja az útvonalat.
- Nincs rajta
noindexsem metacímkében, sem HTTP-fejlécben. - A kanonikus címke önmagára mutat, abszolút URL-lel.
- Az élő teszt renderelt kódjában ott van a lényegi szöveg.
- Legalább két helyről mutat rá belső link.
- Benne van a sitemapben, és a sitemap frissül.
- A tartalom nem másolata és nem sablonos ikertestvére egy másik saját oldaladnak.
Ha mind a nyolc rendben van, és az oldal két hét után sincs bent, akkor már nem technikai, hanem tartalmi kérdésről van szó. Ilyenkor az a helyes lépés, ha az oldalt érdemben bővíted, vagy összevonod egy erősebb aloldallal, és a gyengébb URL-ről átirányítasz. Ez lassabb út, viszont ez az, ami tartósan tart.
Források és további olvasnivalók
- Google Search Central: Search Essentials, valamint a feltérképezésről és indexelésről szóló fejlesztői dokumentáció
- Google Search Console Súgó: URL-ellenőrző eszköz és az Oldalak jelentés státuszainak leírása
- RFC 9309: Robots Exclusion Protocol (a robots.txt hivatalos szabványa)
- Schema.org: strukturált adat típusok és tulajdonságok
- W3C: HTML szabvány, a link és meta elemek leírása
- Bing Webmaster Tools dokumentáció és az IndexNow protokoll leírása
- OpenAI és Anthropic hivatalos crawler-dokumentációja (user-agent nevek, robots.txt kezelés)
- A feltérképezés és az indexelés két külön lépés: attól, hogy a robot letöltötte az oldalt, még nincs eltárolva az indexben.
- Az egyetlen hiteles ellenőrzés a Search Console URL-ellenőrző eszköze, a site: operátor csak hozzávetőleges képet ad.
- A javítás sorrendje: előbb technikai akadály (státuszkód, robots.txt, noindex), utána duplikáció, és csak a végén a tartalom.
- A sitemap és az IndexNow a felfedezést gyorsítja, az indexelésről szóló döntést nem ez hozza meg.
- Az AI-válaszmotorok korában is igaz: ami sehol nincs eltárolva, az forrásként sem tud megjelenni egy válaszban.
Gyakori kérdések
Mi a különbség a feltérképezés és az indexelés között?
A feltérképezés az, amikor a kereső robotja letölti az oldal tartalmát. Az indexelés az ezt követő külön lépés, amikor a rendszer feldolgozza és eltárolja az oldalt a saját adatbázisában. Attól, hogy a robot járt az oldalon, még nem biztos, hogy az oldal bekerült az indexbe.
Hogyan ellenőrzöm, hogy indexelve van-e egy oldalam?
A Google Search Console URL-ellenőrző eszközével: illeszd be a teljes URL-t, és nézd meg a státuszt. Ez az egyetlen hiteles forrás. A site: operátor csak hozzávetőleges, mintavételezett képet ad, diagnosztikára nem alkalmas.
Mit jelent a 'Feltérképezve, jelenleg nincs indexelve' üzenet?
Azt, hogy a Google letöltötte az oldalt, de úgy döntött, hogy egyelőre nem tárolja el. Jellemzően vékony, kevés önálló információt tartalmazó vagy más saját oldalaidhoz túl hasonló tartalom áll mögötte. Az újraküldés ismételgetése ilyenkor nem visz előre, az oldal érdemi bővítése vagy összevonása igen.
A robots.txt tiltással ki tudok venni egy oldalt az indexből?
Nem. A robots.txt megakadályozza a letöltést, de nem távolítja el a már indexelt oldalt. Eltávolításhoz a noindex utasítás kell, ehhez viszont a robotnak látnia kell az oldalt, tehát a robots.txt tiltást előbb fel kell oldani.
Mennyi idő alatt indexelődik egy új oldal?
Nincs rá hivatalos határidő. Néhány órától több hétig terjedhet, és erősen függ attól, mennyire ismert és mennyire rendszeresen frissül a domain. Tapasztalat szerint a belsőleg jól linkelt, rendszeresen bővülő oldalakon ez gyorsabb, egy friss domainen lassabb.
Számít-e az indexelés az AI-válaszmotoroknál is?
Igen. A nagy AI-asszisztensek jelentős része keresőindexből vagy saját feltérképezésből dolgozik, tehát ami sehol nincs eltárolva, az forrásként sem jelenhet meg egy válaszban. Ha a robots.txt-ben kizárod az AI-robotokat, azzal a hivatkozás lehetőségét is elzárod.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.