GPTBot, ClaudeBot, PerplexityBot: mitkä tekoälybotit käyvät sivullasi ja sallitko ne?
Vastaus lyhyestiKolmella suurella tekoälyhaulla on kullakin kolme bottia: yksi kerää koulutusdataa, yksi indeksoi hakua varten ja yksi hakee sivun käyttäjän pyynnöstä. Jos estät hakubotin (OAI-SearchBot, Claude-SearchBot, PerplexityBot), et näy kyseisen palvelun vastauksissa. Koulutusbotin esto ei vaikuta näkyvyyteen. Käyttäjäpyyntöbotit eivät välttämättä noudata robots.txt:tä lainkaan. Tämä sivusto sallii kaikki ja kirjaa käynnit lokista.
Robots.txt-päätös tekoälyboteista tehdään usein tunteella: “en halua, että tekoäly varastaa sisältöni”, ja sitten estetään kaikki, mikä kuulostaa tekoälyltä. Seuraus on, että yritys katoaa ChatGPT:n, Claude-haun ja Perplexityn vastauksista, ja kukaan ei huomaa, koska kukaan ei mittaa. Päätös kannattaa tehdä bottikohtaisesti, koska sama yhtiö ajaa eri botteja eri tarkoituksiin.
Joka palvelulla on kolme bottia, ja niillä on eri tehtävä
Cloudflaren bottiluettelo jakaa tekoälybotit kolmeen luokkaan: AI Crawler (kerää sisältöä mallin koulutukseen), AI Search (indeksoi hakua varten) ja AI Assistant (hakee sivun, kun käyttäjä pyytää). Kolmen suuren palvelun botit asettuvat tähän jakoon siististi.
OpenAI kuvaa omat bottinsa dokumentaatiossaan. GPTBot “is used to crawl content that may be used in training our generative AI foundation models”. OAI-SearchBot “is used to surface websites in search results in ChatGPT’s search features”, ja eston vaikutus sanotaan suoraan: “Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links.” ChatGPT-User hakee sivun, kun käyttäjä kysyy jotakin, ja OpenAI toteaa: “Because these actions are initiated by a user, robots.txt rules may not apply.” Jokaiselle kolmelle OpenAI julkaisee IP-osoitelistan JSON-muodossa.
Anthropicin jako on sama. Ohjesivun mukaan ClaudeBot kerää sisältöä mallien kehittämiseen, ja sen esto “signals that the site’s future materials should be excluded from our AI model training datasets”. Claude-SearchBot “navigates the web to improve search result quality for users”, ja sen esto “prevents our system from indexing your content for search optimization”. Claude-User hakee sivun käyttäjän kysymyksen perusteella, ja esto “prevents our system from retrieving your content in response to a user query”. Anthropic sanoo bottiensa noudattavan robots.txt:n standardiohjeita ja suosittelee robots.txt:tä IP-eston sijaan.
Perplexityllä on kaksi bottia. Dokumentaation mukaan PerplexityBot on “designed to surface and link websites in search results on Perplexity” ja noudattaa robots.txt:tä. Perplexity-User taas käy sivulla käyttäjän kysymyksen perusteella, ja dokumentaatio sanoo, että “this fetcher generally ignores robots.txt rules”. Molemmille on julkaistu IP-listat.
Google on erilainen. Google-Extended ei ole oma botti vaan robots.txt-token: “Google-Extended doesn’t have a separate HTTP request user agent string.” Se ohjaa sitä, saako Googlen muutenkin hakema sisältö käyttää Gemini-mallien koulutukseen ja groundingiin. Ja Google sanoo: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” AI Overviews ja AI Mode ovat osa hakua, joten Google-Extendedin esto ei poista sivua niistä. Niihin vaikutetaan Googlen AI-ominaisuuksien dokumentin mukaan nosnippet-, data-nosnippet-, max-snippet- ja noindex-ohjeilla.
Päätös tehdään tarkoituksen mukaan, ei nimen mukaan
Kun botit on jaettu kolmeen, päätös yksinkertaistuu kolmeen kysymykseen.
Haluatko näkyä tekoälyhaussa? Jos kyllä, salli hakubotit: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Niiden esto on sama kuin Googlebotin esto tavallisessa haussa. Pk-yritykselle, joka haluaa asiakkaita, tämä on harvoin oikea valinta.
Haluatko, että sisältöäsi käytetään mallien koulutukseen? Tämä on periaatekysymys, ja siihen vastataan koulutusboteilla: GPTBot, ClaudeBot ja Google-Extended. Niiden esto ei dokumentaation mukaan vaikuta näkyvyyteen hakuvastauksissa. Palvelusivun kirjoittajalle koulutuskäytön hyöty on epäsuora: malli, joka on lukenut alan suomenkielistä tekstiä, vastaa suomenkielisiin kysymyksiin paremmin. Haitta on, että sisältö voi päätyä vastauksiin ilman linkkiä. Molemmat ovat totta, ja siksi tämä on oikeasti valinta.
Haluatko estää käyttäjäpyyntöbotit? ChatGPT-User, Claude-User ja Perplexity-User hakevat sivun, kun ihminen pyytää tekoälyä lukemaan sen. Se on lähinnä sama kuin ihminen avaisi sivun selaimessa. OpenAI ja Perplexity sanovat suoraan, että robots.txt ei välttämättä päde. Jos ne haluaa estää, se tehdään palomuurissa julkaistujen IP-listojen perusteella, ja silloin estetään samalla asiakas, joka pyysi tekoälyä tiivistämään hinnastosi.
Robots.txt kahdelle yleisimmälle valinnalle
Jos valinta on “näy haussa, mutta älä anna koulutukseen”, robots.txt:hen tulee kolme estoa ja kaikki muu jää auki:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Hakubotteja ei mainita, jolloin ne saavat hakea kaiken. OpenAI:n dokumentaation mukaan robots.txt-muutoksen huomioiminen OAI-SearchBotin osalta kestää noin vuorokauden. Anthropic tarjoaa lisäksi Crawl-delay-laajennuksen, jos haluaa hidastaa hakutahtia estämättä.
Jos valinta on “salli kaikki ja mittaa”, kuten tällä sivustolla, tekoälybotteja ei mainita robots.txt:ssä lainkaan. Se ei ole sama kuin päätöksen tekemättä jättäminen, kun sen kirjaa ja perustelee.
Näin näet lokista, kuka kävi
Bottien tunnistus perustuu User-Agent-otsakkeeseen. OpenAI julkaisee tarkat merkkijonot: GPTBotin tunniste on muotoa “GPTBot/1.4; +https://openai.com/gptbot”, OAI-SearchBotin “OAI-SearchBot/1.4; +https://openai.com/searchbot” ja ChatGPT-Userin “ChatGPT-User/1.0; +https://openai.com/bot”. Palvelinlokista riittää hakea rivit, joissa nämä merkkijonot esiintyvät, ja laskea ne päivittäin. Sama toimii ClaudeBot-, Claude-SearchBot-, Claude-User-, PerplexityBot- ja Perplexity-User-merkkijonoille.
User-Agent on kuitenkin vain väite. Kuka tahansa voi lähettää pyynnön, joka väittää olevansa GPTBot. Google neuvoo omassa ohjeessaan tarkistamaan Googlebotin joko käänteisellä DNS-haulla tai vertaamalla IP-osoitetta julkaistuun listaan, ja perustelee: “This is useful if you’re concerned that spammers or other troublemakers are accessing your site while claiming to be from Google.” Sama tarkistus kannattaa tehdä tekoälyboteille OpenAI:n ja Perplexityn julkaisemilla IP-listoilla. Jos merkittävä osa “GPTBot”-käynneistä tulee listan ulkopuolelta, ne eivät ole OpenAI:n.
Jos sivusto on Cloudflaren takana, kuten tämä, työ on helpompi. Cloudflaren AI Crawl Control on dokumentaation mukaan “Available on all plans” ja näyttää, mitkä tekoälypalvelut hakevat sisältöä, kuinka usein, ja mitkä botit rikkovat robots.txt-ohjeita. Se, millä tekniikalla Cloudflare tunnistaa botit, ei selviä dokumentaatiosta, joten en väitä siitä mitään.
Mitä tämä sivusto tekee
mainostoimisto.ai sallii robots.txt:ssä kaikki edellä mainitut botit, myös koulutusbotit. Perustelu on sivuston tehtävä: se on julkinen koe siitä, löytääkö tekoäly suomenkielisen sivun, ja kokeen tulos olisi arvoton, jos osa boteista olisi estetty. Sivustolla on myös llms.txt ja llms-full.txt, vaikka Google sanoo, ettei niitä tarvita; se on käyty läpi artikkelissa llms.txt, tarvitseeko suomalainen yritys sitä.
Bottien käynnit kirjataan Cloudflaren lokista. Mittaus alkaa launch-päivänä 22.9.2026, ja dataa ei ole vielä riviäkään. Kun sitä on, taululle tulee kuukausittain: mikä botti kävi, kuinka monta kertaa, mitä sivuja se haki, ja hakiko yksikään llms.txt-tiedostoa. Sen rinnalle laitetaan manuaalisen testauksen tulos samalta kuukaudelta, jotta nähdään, seuraako bottikäyntiä lainaus. Testausprotokolla on artikkelissa näin testaat näkyvyytesi ChatGPT:ssä, ja koko mittauskokonaisuus pilarissa näkyvyyden mittaaminen tekoälyssä.
Jos tulos on, että botit käyvät mutta lainauksia ei tule, sekin julkaistaan. Se olisi hyödyllisempi tieto kuin useimmat robots.txt-oppaat.
Kysymyksiä, joita tästä haetaan
Estääkö GPTBot:n esto yritykseni näkymisen ChatGPT:ssä?
Ei suoraan. OpenAI:n mukaan GPTBot kerää koulutusdataa ja OAI-SearchBot hoitaa haun. Jos estät vain GPTBotin, ChatGPT:n haku voi yhä näyttää sivusi. Jos estät OAI-SearchBotin, sivusi ei näy hakuvastauksissa.
Miksi lokissa näkyy ChatGPT-User, vaikka estin sen robots.txt:ssä?
OpenAI sanoo, että ChatGPT-User hakee sivun käyttäjän pyynnöstä, ja koska toiminta on käyttäjän aloittama, 'robots.txt rules may not apply'. Perplexity sanoo saman Perplexity-Userista. Estoon tarvitaan palomuuri, ei robots.txt.
Vaikuttaako Google-Extended AI Overviews -näkyvyyteen?
Googlen dokumentaation mukaan Google-Extended ei vaikuta sivuston näkymiseen Google-haussa eikä ole ranking-signaali. Se ohjaa Gemini-mallien koulutusta ja groundingia. AI Overviews on osa hakua, ja siihen vaikutetaan nosnippet- ja max-snippet-ohjeilla.
Lähteet
- OpenAI: Overview of OpenAI crawlersGPTBot, OAI-SearchBot, ChatGPT-User: tarkoitukset, robots.txt, IP-listat
- Anthropic Help Center: Does Anthropic crawl data from the webClaudeBot, Claude-SearchBot, Claude-User: tarkoitukset ja eston vaikutus
- Perplexity Docs: Perplexity crawlersPerplexityBot noudattaa robots.txt:tä; Perplexity-User 'generally ignores robots.txt rules'
- Google Search Central: Google's common crawlersGoogle-Extended on vain robots.txt-token; ei vaikuta hakuun eikä ole ranking-signaali
- Google Search Central: Verifying Googlebot and other Google crawlersKäänteinen DNS ja IP-listat väärennettyjen bottien tunnistamiseen
- Cloudflare Docs: AI Crawl ControlSaatavilla kaikilla tasoilla; näyttää bottien pyynnöt ja robots.txt-rikkomukset
- Cloudflare Docs: AI Crawl Control bot referenceBottien luokittelu: AI Crawler, AI Search, AI Assistant
Löysitkö virheen?
Tämän tekstin kirjoitti kone ja toinen kone tarkisti faktat. Ihminen ei ole lukenut jokaista tekstiä. Jos jokin on väärin, kerro — ilmoitus menee Ilkka Immoselle, korjaus tehdään ja se merkitään tähän tekstiin näkyviin.