ESG, neurodiversidad y Knowledge Custodes: una sostenibilidad digital

¿Cómo diferencian Google y OpenAI el rastreo para posicionamiento (SEO) del rastreo para entrenamiento de IA (GEO)?

Actualmente, las principales empresas de inteligencia artificial han separado sus agentes de usuario para permitir a los administradores web un control granular.

  • Google: Google actualizó la documentación del rastreador "Google-Extended" el 9 de febrero de 2024. El registro de cambios de Google aclara que el rastreo de Google-Extended es exclusivo para las aplicaciones Gemini y no tiene impacto en la Búsqueda de Google.

  • OpenAI: OpenAI introdujo GPTBot en agosto de 2023. GPTBot es el rastreador web de OpenAI que recopila contenido accesible públicamente como material de entrenamiento para futuras generaciones de modelos GPT. Sin embargo, para la función de búsqueda de ChatGPT, OpenAI opera un rastreador distinto llamado OAI-SearchBot.

¿Cuáles son las consecuencias técnicas de bloquear rastreadores de IA mediante reglas de firewall (WAF) como en Cloudflare?

El uso de reglas WAF para gestionar el tráfico de bots requiere precisión para no perjudicar la visibilidad en herramientas de IA.

  • Muchos sitios bloquean involuntariamente a GPTBot a través de reglas WAF o límites de tasa que producen un error HTTP 429 (Demasiadas solicitudes) o 403 (Prohibido).

  • El bloqueo excluye al dominio por completo de las futuras generaciones de modelos GPT.

  • Para ayudar a gestionar esto, a partir del 1 de julio de 2026, Cloudflare introdujo un nuevo campo de metadatos rastreado en BotBase para diferenciar el acceso Directo frente al Intermediario, rastreando quién puede operar el bot. Esto permite crear reglas que diferencien entre un rastreador de búsqueda legítimo y un bot de entrenamiento masivo.

¿Es posible prohibir el entrenamiento de los modelos de IA sin perder tráfico y visibilidad en los resultados de búsqueda tradicionales?

Sí, es el fundamento de una estrategia híbrida de protección de datos. Puedes bloquear la extracción de datos para el entrenamiento de grandes modelos de lenguaje (LLMs) manteniendo tu autoridad en los motores clásicos.

  • Mediante el archivo robots.txt, un administrador de sitios web puede bloquear el agente de usuario "Google-Extended" para controlar el acceso al contenido utilizado en el entrenamiento de modelos de IA.

  • Para tranquilizar a los creadores de contenido, Google agregó explícitamente la oración: "Google-Extended no afecta la inclusión o clasificación de un sitio en la Búsqueda de Google".

  • Al bloquear a estos agentes específicos y permitir el paso a Googlebot o OAI-SearchBot, te aseguras de proteger tu propiedad intelectual para que no sea simplemente "resumida" por la IA, mientras garantizas que tu entidad siga construyendo autoridad en el Knowledge Graph tradicional.

FAQ SEO & GEO: Control de Rastreadores y Entrenamiento de IA

CGV y Aviso Legal

Este sitio web utiliza exclusivamente Plausible Analytics, una herramienta de análisis web respetuosa con la privacidad.
No se utilizan cookies ni se recopilan datos personales de los visitantes.
El sistema cumple con el Reglamento General de Protección de Datos (RGPD), la directiva ePrivacy y las recomendaciones de la AEPD.

EUSKAL CONSEIL

euskalconseil@gmail.com

00 33 782505766