← Vsi članki
GEO

Kdo sme dostopati do tvoje vsebine? Vodič po robots.txt, Content Signals in blokiranju AI crawlerjev

28. avgust 20265 min branja
Avtor: Matej Spevan / CreateAI. Članek temelji na praktičnih SEO, GEO in AI implementacijah za slovenska podjetja.

Vsak dan tvojo spletno stran obišče več strojev kot ljudi. AI crawlerji – GPTBot, ClaudeBot, PerplexityBot in podobni – berejo tvojo vsebino za trening modelov in za sprotne odgovore v ChatGPT, Claude in Perplexity. Vprašanje ni več ali te berejo, ampak ali imaš nad tem nadzor. Ta vodič pokaže, kako ga vzpostaviš – konkretno, po korakih.

TL;DR: Z datoteko robots.txt določiš, kateri AI crawlerji smejo do tvoje vsebine. Z novo Content Signals Policy ločeno poveš, za kaj jo smejo uporabiti (trening vs. AI odgovori). Za večino podjetij je pravi cilj biti dostopen tistim AI-jem, ki prinašajo obisk, in zavesten glede treninga – ne pa blokirati vse.

Najprej razumej razliko: trije tipi AI botov

Ni vsak "AI bot" enak. Preden karkoli nastaviš, loči tri namene, ker se odločitve razlikujejo:

  1. Trening (training). Bot pobira vsebino za učenje prihodnjih modelov. Primer: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended. Ti ti neposredno ne prinesejo obiska.
  2. AI iskanje / odgovori (inference/search). Bot pobira vsebino, da jo v realnem času uporabi kot vir v odgovoru z navedbo. Primer: OAI-SearchBot (ChatGPT search), PerplexityBot, ChatGPT-User. Ti te lahko citirajo in pošljejo obiskovalca.
  3. SEO in analitika. Klasični boti orodij kot AhrefsBot, SemrushBot. Nimajo veze z AI, a obremenjujejo strežnik.

Ključni sklep: kategorijo 2 večinoma hočeš pustiti odprto (to je tvoja vidnost v AI iskalnikih), pri kategoriji 1 pa se zavestno odločiš.

Kako deluje robots.txt (in kje so meje)

robots.txt je preprosta besedilna datoteka na tvojadomena.si/robots.txt. Vsak crawler jo prebere in naj bi upošteval pravila. Osnovna sintaksa:

User-agent: GPTBot
Disallow: /

To pove GPTBotu, naj ne dostopa do ničesar. Če želiš dovoliti:

User-agent: PerplexityBot
Allow: /

Pomembna omejitev: robots.txt je vljudnostni dogovor, ne tehnična ovira. Ugledni AI ponudniki (OpenAI, Anthropic, Google, Perplexity) ga spoštujejo. Agresivni scraperji ga lahko ignorirajo. Če potrebuješ dejansko uveljavljivo blokado, potrebuješ sloj na ravni omrežja (npr. Cloudflare) – o tem več v nadaljevanju.

Praktična nastavitev po korakih

Korak 1 — Odloči se za strategijo

Za tipično slovensko podjetje (storitve, trgovina, B2B, gostinstvo) priporočamo:

  • Pusti odprto AI iskanje (OAI-SearchBot, PerplexityBot, ChatGPT-User) → to je tvoja vidnost.
  • Odloči se glede treninga (GPTBot, ClaudeBot, Google-Extended): večina naj pusti odprto, ker prisotnost v modelih pomeni, da te AI "pozna". Blokiraj le, če imaš izrecen razlog (npr. zaščita edinstvene metodologije).
  • Omeji SEO orodja s Crawl-delay, da ti ne obremenjujejo strežnika.

Za medij ali portal, ki živi od vsebine, je logika drugačna – tam ima smisel trening pogojevati ali zaračunati (glej članek o Pay Per Crawl).

Korak 2 — Zapiši robots.txt

Primer zdrave nastavitve za storitveno podjetje, ki hoče biti viden v AI iskalnikih:

User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/

# AI iskanje — pusti odprto (tvoja vidnost v AI odgovorih)
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# Trening — zavestno dovoljeno (da te modeli poznajo)
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

# SEO orodja — omejena hitrost
User-agent: AhrefsBot
Crawl-delay: 10

User-agent: SemrushBot
Crawl-delay: 10

Sitemap: https://tvojadomena.si/sitemap.xml

Če bi želel blokirati trening, a ostati v AI iskanju, spremeniš samo trening blok:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Korak 3 — Dodaj Content Signals

Content Signals Policy je razširitev, ki v robots.txt doda namen dovoljenja. Namesto zgolj "dovoli/blokiraj" izraziš, za kaj se vsebina sme uporabiti:

# Content-Signal: search=yes, ai-train=no

S tem sporočiš: "moja vsebina je na voljo za AI iskanje in navajanje, ni pa na voljo za trening modelov." Ne vsi ponudniki že v celoti berejo te signale, a standard hitro dozoreva in dobra praksa je, da je tvoj namen zapisan eksplicitno.

Korak 4 — Dodaj llms.txt (pozitivni signal)

robots.txt pove, kaj crawler ne sme. llms.txt pove, kaj je na tvoji strani vredno – strojno berljiv povzetek tvoje ponudbe, ki AI-jem pomaga pravilno razumeti in citirati tvoje podjetje. To je pozitivna stran iste medalje: ne le nadzor dostopa, ampak pomoč pri pravilni predstavitvi. Za generiranje lahko uporabiš naše brezplačno orodje.

Korak 5 — Za uveljavljivo blokado dodaj omrežni sloj

Če robots.txt ni dovolj (agresivni scraperji ga ignorirajo), potrebuješ blokado na ravni omrežja. Cloudflare ponuja gumb "Block AI bots" in Pay Per Crawl, ki dejansko ustavita ali zaračunata dostop – ne le prosita. To je edini način, da dovoljenje res uveljaviš, ne le izraziš.

Pogoste napake

  • Blokiraš vse AI-je na slepo. Rezultat: izgineš iz ChatGPT in Perplexity odgovorov. Za večino podjetij je to strel v koleno.
  • Blokiraš napačnega bota. Googlebot ni AI trening bot – če ga blokiraš, škoduješ klasičnemu Google rangiranju. AI trening pri Googlu ureja ločeni Google-Extended.
  • Zaneseš se samo na robots.txt za občutljivo vsebino. Če je vsebina res zaupna, ne sodi na javno stran – robots.txt je ne skrije pred nikomer.
  • Pozabiš na sitemap. Brez Sitemap: vrstice crawlerji težje najdejo tvoje strani.

Pogosta vprašanja

Ali me bo blokiranje GPTBota izbrisalo iz ChatGPT? Deloma. GPTBot je trening bot; njegovo blokiranje prepreči, da bi tvoja vsebina šla v trening prihodnjih modelov. Za prisotnost v ChatGPT search je pomembnejši OAI-SearchBot – tega pusti odprtega, če hočeš biti citiran.

Kje najdem robots.txt svoje strani? Na tvojadomena.si/robots.txt. Če datoteke ni, jo je treba dodati (v Next.js/statičnih straneh običajno v mapo public/, pri WordPressu prek SEO vtičnika ali strežnika).

Ali potrebujem Cloudflare? Za izražanje pravil ne – zadošča robots.txt. Za uveljavljanje (dejansko ustavljanje nespoštljivih botov) ali za zaračunavanje dostopa pa da.

Kako pogosto naj to posodabljam? Ob večjih spremembah strategije in ko se pojavijo novi pomembni AI crawlerji. Priporočamo pregled vsaj enkrat na četrtletje.


Nadzor nad AI crawlerji ni "vse ali nič" – je zavestna izbira, kdo sme, za kaj in pod kakšnimi pogoji. Za večino slovenskih podjetij je prava pot: odprto za AI iskanje, zavestno za trening, uveljavljivo le tam, kjer je res potrebno. Če želiš, da to nastavimo pravilno in hkrati poskrbimo, da te AI iskalniki dejansko citirajo, ti pri CreateAI pomagamo z GEO strategijo za slovenska podjetja.

🛠 Uporabite orodje, ki spremlja ta vodič

llms.txt Generator — brezplačno orodje, ki implementira priporočila iz tega članka.

Odprite llms.txt Generator

Sorodni članki

GEO
Konec oglasov, začetek pay-per-crawl: kako AI agenti spreminjajo monetizacijo spletnih strani
Cloudflare je predstavil Pay Per Crawl – model, kjer AI crawlerji plačajo za dostop do vsebine. Kaj to pomeni za oglase, obisk in slovenska podjetja v 2026.
GEO
Google Search Console v 2026: Novi signali, ki razkrijejo zakaj vas AI iskalniki ignorirajo
Katere metrike v Google Search Console pokažejo, zakaj vas AI iskalniki ne citirajo – in kako jih uporabiti za GEO optimizacijo v 2026.
GEO
SEO + GEO paket za slovenske SME: kaj točno vključuje (2026)
Kompleten SEO + GEO paket za slovenska podjetja. Kaj vključuje, koliko stane, koliko časa traja in kakšne rezultate pričakovati.

Potrebujete pomoč pri implementaciji?

Brezplačen 30-minutni posvet z našo ekipo.

Brezplačen posvet →