Pe scurt, de la Ziarist
REZUMAT AI- Cloudflare a inceput din iulie 2025 sa blocheze implicit principalii crawleri AI pentru domeniile noi, iar de la 15 septembrie 2026 extinde blocarea la paginile monetizate prin publicitate.
- Un site poate fi vizibil pentru Google si invizibil pentru AI, deoarece cele doua sisteme verifica accesul in moduri diferite.
- O analiza din iunie 2026 arata ca aproximativ 17,6% din fisierele robots.txt evaluau blocau GPTBot, iar 6,6% blocau OAI-SearchBot.
Un site poate fi vizibil pentru Google si, in acelasi timp, invizibil pentru AI, pentru ca cele doua sisteme verifica accesul in moduri diferite. Google se bazeaza, in mare parte, pe permisiunile declarate explicit de site, iar acestea sunt aproape intotdeauna acordate. Motoarele AI insa trec printr-un nivel suplimentar de securitate a site-ului, gandit initial pentru a opri atacuri sau trafic automat nedorit, iar acest nivel poate respinge crawlerele AI chiar daca site-ul le permite accesul, declarativ.
Ce diferenta este intre un crawler de training si unul care alimenteaza citarile?
Dintre robotii utilizati de OpenAI, doi au roluri relevante si distincte in acest context. GPTBot acceseaza continut care poate fi folosit pentru imbunatatirea si antrenarea modelelor, in timp ce OAI-SearchBot permite includerea paginilor in rezultatele si raspunsurile generate prin functiile de cautare ale ChatGPT. Blocarea GPTBot nu impiedica automat aparitia unui brand in raspunsurile ChatGPT. In schimb, blocarea OAI-SearchBot poate reduce sau elimina posibilitatea ca paginile site-ului sa fie accesate si citate direct prin acest mecanism.
Cat de raspandita este, de fapt, problema?
O analiza realizata de Chris Humphrey in iunie 2026 arata ca, dintre cele 7.870 de fisiere robots.txt care au putut fi evaluate, aproximativ 17,6% blocau GPTBot, iar 6,6% blocau OAI-SearchBot. Diferenta sugereaza ca accesul pentru antrenare este restrictionat mai frecvent decat accesul pentru cautare si citare. Datele nu demonstreaza insa ca fiecare companie a facut deliberat aceasta distinctie: configurarile pot reflecta si reguli implicite, implementari mai vechi sau necunoasterea rolului fiecarui crawler. Ahrefs a analizat aproape 461 de milioane de fisiere robots.txt si a masurat o rata de blocare pentru GPTBot de 7,3% la nivel extins, fata de o rata mai mica atunci cand este masurat doar domeniul principal. Datele Cloudflare Radar pentru primul trimestru din 2026 arata ca GPTBot este, simultan, cel mai blocat crawler AI in regulile de tip DISALLOW si cel mai des permis explicit in regulile de tip ALLOW.
Cum se verifica daca un site are aceasta problema?
Verificarea corecta presupune testarea accesului cu user-agent-ul exact al fiecarui crawler relevant (GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot) si urmarirea codului de raspuns real primit, nu doar citirea fisierului robots.txt. O practica recomandata este reverificarea log-urilor si al bot management-ului dupa orice modificare de configurare, pentru ca o regula prea larga poate bloca, alaturi de crawlerele AI, si Googlebot, fara ca acest lucru sa fie vizibil imediat in rapoartele clasice de trafic.
