Crawl budget

presupuesto de rastreo

El crawl budget es el tiempo y los recursos que Google dedica a recorrer una web en cada visita. Cuando un sitio tiene miles de direcciones, ese presupuesto se agota antes de llegar a las páginas que de verdad interesan. En español, presupuesto de rastreo.

De qué depende y a quién afecta

Google ajusta ese presupuesto según dos factores. Uno es lo que el servidor aguanta: si la web responde despacio o devuelve errores, el robot reduce el ritmo para no tumbarla. El otro es el interés que despierta el sitio, que depende de su autoridad, de la frecuencia con que cambia y de si el contenido nuevo merece la pena.

La buena noticia para la mayoría de las pymes es que este asunto no les afecta. Una web de 60 páginas se rastrea entera sin problema. El presupuesto de rastreo se convierte en un problema real a partir de varios miles de direcciones, sobre todo en tiendas online, portales de anuncios o webs con muchos filtros.

La señal de alarma aparece en Search Console: páginas importantes que tardan semanas en indexarse, un informe de páginas rastreadas y no indexadas que crece sin parar, o un desajuste enorme entre las direcciones detectadas y las que acaban en el índice.

Cómo se protege

Todo el trabajo consiste en que el robot no pierda el tiempo. Cinco medidas resuelven la mayoría de los casos.

  • Bloquear en el archivo de rastreo las combinaciones infinitas de filtros, buscadores internos y calendarios, que generan direcciones sin valor.
  • Eliminar las cadenas de redirecciones. Cada salto consume rastreo, y una cadena de cuatro multiplica el gasto por cuatro.
  • Arreglar los errores del servidor y las páginas inexistentes que siguen enlazadas.
  • Mantener un mapa del sitio limpio, solo con las direcciones que deben indexarse y con las fechas de modificación bien puestas.
  • Mejorar la velocidad de respuesta del servidor, porque un sitio más rápido permite recorrer más páginas en el mismo tiempo.

A eso se suma una decisión de fondo: reducir el número de páginas mediocres. Una tienda con 8.000 fichas copiadas del proveedor tiene un problema de contenido antes que de rastreo, y fusionar o eliminar lo que no aporta mejora las dos cosas a la vez.

Ejemplo: un portal de alquiler vacacional en Canarias

Un portal con 1.400 alojamientos genera direcciones distintas para cada combinación de fechas, número de huéspedes y ordenación de resultados. Search Console detecta 2,3 millones de direcciones y solo 6.800 indexadas, y los alojamientos nuevos tardan hasta seis semanas en aparecer en Google.

La intervención bloquea el rastreo de todas las combinaciones de fechas y de huéspedes, que no tienen demanda de búsqueda, y mantiene indexables solo las páginas de isla, de municipio y de tipo de alojamiento, más las fichas individuales. El mapa del sitio se reconstruye con esas 9.200 direcciones útiles y se actualiza a diario. Se corrigen además 340 redirecciones encadenadas heredadas de una migración antigua.

En dos meses, las direcciones detectadas caen a 41.000 y las indexadas suben a 9.100. Lo que más nota el negocio es la velocidad: un alojamiento nuevo pasa a indexarse en menos de 48 horas, lo que permite publicar propiedades a tiempo para la temporada alta en lugar de llegar tarde.

Pattterns ahora es Ocelot