Cobrar a los crawlers de IA con Cloudflare: cuánto tráfico bloqueas y cuánto no ganas

Featured image for Cobrar a los crawlers de IA con Cloudflare: cuánto tráfico bloqueas y cuánto no ganas

El código 402 Payment Required llevaba desde los años noventa en la especificación de HTTP con una nota que decía, básicamente, «reservado para uso futuro». El futuro apareció en julio de 2025, cuando Cloudflare lo desempolvó para lanzar Pay Per Crawl: tu servidor le contesta 402 al bot de una empresa de IA, le dice el precio, y si el bot quiere el contenido, paga.

Es una idea preciosa y la reacción del sector fue inmediata: por fin cobramos por lo que llevan años llevándose gratis. Antes de activarlo, merece la pena hacer la aritmética completa, porque el mismo interruptor que corta el rastreo corta también la vía por la que hoy llegan citas y visitas.

Qué activa exactamente ese botón

El mecanismo es más simple de lo que suena:

  • Fijas un precio plano por petición para todo el dominio. No hay tarifas por sección ni por tipo de contenido.
  • Para cada rastreador declaras uno de tres estados: permitir, cobrar o bloquear.
  • Cuando el bot pide una URL de pago y no viene autorizado, recibe un 402 con el precio en la respuesta.
  • Cloudflare se coloca como intermediario del cobro, que es la parte de verdad difícil: te ahorra negociar un contrato con cada laboratorio.

El mismo día, además, Cloudflare empezó a bloquear por defecto los rastreadores de IA en los dominios nuevos. Así que hay bastantes sitios que ya están tomando esta decisión sin haberla tomado.

Los números que sí se pueden sostener

La métrica útil aquí es el crawl-to-refer ratio: cuántas páginas te rastrea una empresa por cada visita que te devuelve. Cloudflare publicó sus medias de red en 2025 y son estas:

  • Google: del orden de 14 rastreos por cada visita enviada.
  • OpenAI: alrededor de 1.700 rastreos por visita.
  • Anthropic: en torno a 73.000 rastreos por visita.

Traducido a la escala del ángulo: por cada mil páginas que te rastrea el bot de Google recibes unas setenta visitas. Por cada mil que te rastrea OpenAI, algo más de media visita. Con Anthropic ni siquiera llegas a la centésima de visita; necesitarías setenta y tres mil páginas rastreadas para que entre una persona por la puerta.

Ojo con lo que estamos mirando. Son medias de toda la red de Cloudflare, dominadas por sitios enormes con archivos gigantescos, y la tendencia de esos ratios ha ido empeorando trimestre a trimestre. Tu sitio puede comportarse de otra manera, sobre todo si es pequeño y muy citado. Úsalas como orden de magnitud, no como si fueran tus datos.

El detalle que se come el titular

Tratar «los bots de IA» como una sola cosa es el error caro. Cada empresa manda rastreadores distintos con propósitos distintos:

  • GPTBot recoge material para entrenamiento. OAI-SearchBot alimenta el índice con el que ChatGPT responde. ChatGPT-User aparece cuando una persona real ha pedido algo y el modelo va a mirar tu página en ese momento.
  • PerplexityBot indexa; Perplexity-User se dispara a petición del usuario.
  • Google-Extended controla el uso para entrenar Gemini, pero no te saca de los resúmenes con IA del buscador: esos se sirven con lo que rastrea Googlebot.

La distinción importa porque el poco tráfico que devuelven estos sistemas viene casi entero de los rastreadores disparados por usuario y de los que construyen el índice de respuestas. Si cobras o bloqueas en bloque, la factura de entrenamiento no la vas a ver crecer mucho y sí vas a desaparecer de las respuestas donde hoy te citan. Es la parte del GEO que se decide en el firewall, no en el contenido.

Mide tu sitio antes de tocar nada

Media hora de trabajo y sales de las medias ajenas:

  • Coge 30 días de registros del servidor (o el panel de control de rastreo de IA de Cloudflare, que ya desglosa por bot) y cuenta peticiones por agente de usuario.
  • En tu analítica, filtra las visitas cuyo origen sea chatgpt.com, perplexity.ai, gemini.google.com o copilot.microsoft.com.
  • Divide. Ese es tu ratio real, y suele sorprender en ambas direcciones.
  • Mira cuánto de ese rastreo llega al origen y cuánto se sirve desde caché. Si va casi todo por el borde, el coste que estás intentando repercutir es bastante más pequeño de lo que te imaginabas.

La decisión, según lo que tengas montado

Medio de comunicación o sitio con archivo grande

Es el caso en el que el 402 tiene sentido económico: mucho material acumulado, valor real para entrenar modelos y un ratio de rastreo por visita espantoso. La configuración razonable es cobrar o bloquear a los rastreadores de entrenamiento y dejar pasar los que sirven respuestas en directo. Y asumir una cosa: el ingreso realista de un medio mediano será modesto. La palanca aquí es de negociación colectiva más que de facturación.

Ecommerce

Justo al revés. Tu catálogo quiere estar dentro del modelo cuando alguien pregunta dónde comprar unas botas del 44. Cobrar por el acceso a tus fichas es cobrar por que te enseñen el escaparate, y con los agentes de compra empezando a hacer el recorrido entero por su cuenta, ese acceso vale más que cualquier tarifa por petición que puedas poner. Deja pasar todo lo que sirva respuestas y reserva el bloqueo para el raspado de precios de la competencia, que es un problema distinto y se ataca con límites de frecuencia.

SaaS y B2B técnico

La documentación es un canal de captación disfrazado de manual. Que un modelo sepa cómo se autentica tu API y lo explique con tu sintaxis vale más que cualquier importe por página rastreada. Lo único que conviene vigilar es el abuso puro: rastreos de miles de peticiones por minuto contra endpoints costosos, que se resuelven con límites de frecuencia y no con una tarifa.

Mi lectura

Pay Per Crawl me parece una pieza de infraestructura importante y una fuente de ingresos menor para casi todo el mundo. Su valor está en que, por primera vez, hay un mecanismo estándar para decir «esto se paga» sin abogados de por medio, y eso cambia el equilibrio de fuerzas cuando llegue el momento de negociar en serio. Lo que no cambia es la aritmética del sitio medio: el dinero que ingresarías es pequeño y la visibilidad que arriesgas es la que estabas intentando construir. Mide, separa por tipo de rastreador y decide con tus propios números, no con los del titular.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *