Qué significa pay per crawl
Pay per crawl añade una tercera opción a la relación entre un sitio web y un rastreador de inteligencia artificial. Hasta ahora existían dos: permitir el acceso sin condiciones, o bloquearlo con robots.txt. Pay per crawl introduce «permitir, pero solo si se paga».
El mecanismo técnico es el código de estado HTTP 402, Payment Required. Es un código que existe desde los primeros estándares HTTP, pensado originalmente para algún sistema de micropago que nunca llegó a generalizarse, y que durante décadas apenas se ha usado en la práctica. Pay per crawl lo recupera: cuando un rastreador pide una página con este control activo, el servidor responde 402 en lugar de entregar el contenido, y adjunta el precio de esa visita en una cabecera. El rastreador puede repetir la petición aceptando pagar, o desistir.
No es un estándar del W3C ni del IETF con adopción amplia todavía: es un modelo, implementado hasta la fecha de esta redacción principalmente por un proveedor grande de infraestructura web, y su comportamiento exacto (cabeceras, firma, moneda) depende de cómo lo implemente cada proveedor. Para un sitio, esto cambia la lógica habitual de robots.txt: en lugar de una regla fija para todos, surge una lista de precios que puede variar de un rastreador a otro.