# robots.txt — eclipseando (eclipseando.es · eclipseando.com) # # Arquitectura dual: eclipseando.es sirve el contenido en español —el castellano # de la raíz y, desde el 30-07-2026, el CATALÁN de /ca/— y eclipseando.com el # internacional (/en/, /de/, /fr/, /it/, /pt/, /nl/). # # El catalán no necesita ni una regla propia aquí abajo, y conviene que se # entienda por qué: la política del sitio es «todo rastreable e indexable», sin # un solo Disallow por idioma ni por sección (el único Disallow es /api/, que no # tiene contenido). Añadir /ca/ a alguna lista sería, como mucho, redundante. # Lo que sí cambia con el catalán es el SITEMAP, y eso está al final del fichero. # # Las REGLAS DE RASTREO de abajo son comunes a los dos dominios. Lo único que # cambia son los sitemaps del final: cada dominio declara solo el suyo. La # versión del .com la genera scripts/robots-com.mjs a partir de este mismo # fichero (y Caddy la sirve allí en /robots.txt), así que este es el único # sitio donde se tocan las reglas. # # Política: todo el contenido del sitio es rastreable e indexable, tanto # por buscadores como por rastreadores de IA. Los datos son cálculos # propios de interés público; solo pedimos que se cite la fuente # ("eclipseando"). # # Resumen del sitio para agentes de IA: # https://eclipseando.es/llms.txt (índice) # https://eclipseando.es/llms-full.txt (contexto completo en un fichero) # # NOTA DE PROTOCOLO: un grupo con User-agent nombrado NO hereda las # reglas del grupo "*". Por eso cada grupo nombrado repite su # "Disallow: /api/". Si algún día se añade un Disallow al grupo "*", # hay que replicarlo en todos los grupos de abajo. User-agent: * Allow: / # Endpoint interno de analítica (solo POST, sin contenido indexable): Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # Buscadores generalistas # ------------------------------------------------------------------ User-agent: Googlebot Allow: / Disallow: /api/ Disallow: /embed/ # Bing indexa y además alimenta a Microsoft Copilot. User-agent: Bingbot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Applebot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: DuckDuckBot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: YandexBot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Baiduspider Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Seznambot Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # OpenAI (docs: platform.openai.com/docs/bots) # ------------------------------------------------------------------ # Entrenamiento de modelos. User-agent: GPTBot Allow: / Disallow: /api/ Disallow: /embed/ # El que alimenta las CITAS de ChatGPT Search: el más importante. User-agent: OAI-SearchBot Allow: / Disallow: /api/ Disallow: /embed/ # Fetch puntual a petición de un usuario de ChatGPT. User-agent: ChatGPT-User Allow: / Disallow: /api/ Disallow: /embed/ User-agent: OAI-AdsBot Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # Anthropic (docs: support.anthropic.com — Claude bots) # ------------------------------------------------------------------ # Entrenamiento de modelos. User-agent: ClaudeBot Allow: / Disallow: /api/ Disallow: /embed/ # El que alimenta la búsqueda de Claude. User-agent: Claude-SearchBot Allow: / Disallow: /api/ Disallow: /embed/ # Fetch puntual a petición de un usuario de Claude. User-agent: Claude-User Allow: / Disallow: /api/ Disallow: /embed/ # Token heredado. User-agent: anthropic-ai Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # Google IA (no son rastreadores: son permisos de uso) # ------------------------------------------------------------------ # Permiso para usar el contenido en Gemini y en AI Overviews. User-agent: Google-Extended Allow: / # Grounding de Vertex AI. User-agent: Google-CloudVertexBot Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # Apple IA (permiso de uso, no rastreador) # ------------------------------------------------------------------ User-agent: Applebot-Extended Allow: / # ------------------------------------------------------------------ # Perplexity (docs: perplexity.ai/bots) # ------------------------------------------------------------------ # Índice de Perplexity (no entrena con el contenido). User-agent: PerplexityBot Allow: / Disallow: /api/ Disallow: /embed/ # Fetch a petición del usuario. User-agent: Perplexity-User Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # Otros agentes de IA # ------------------------------------------------------------------ User-agent: Meta-ExternalAgent Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Meta-ExternalFetcher Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Amazonbot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: MistralAI-User Allow: / Disallow: /api/ Disallow: /embed/ User-agent: cohere-ai Allow: / Disallow: /api/ Disallow: /embed/ User-agent: cohere-training-data-crawler Allow: / Disallow: /api/ Disallow: /embed/ User-agent: DuckAssistBot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: YouBot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Ai2Bot Allow: / Disallow: /api/ Disallow: /embed/ User-agent: Diffbot Allow: / Disallow: /api/ Disallow: /embed/ # Common Crawl: base de muchos conjuntos de entrenamiento. User-agent: CCBot Allow: / Disallow: /api/ Disallow: /embed/ # ------------------------------------------------------------------ # # POR QUÉ SE PROHÍBE /embed/ (01-08-2026) # --------------------------------------- # Las 8.133 páginas de /embed/ son los widgets que se incrustan en la web de # otros. Ya nacen con `noindex` —no deben salir en un buscador nunca— pero # seguían siendo rastreables, y eso no es gratis: medido en el registro de # accesos de Caddy, Googlebot hace unas 689 peticiones cada tres horas a este # sitio. A ese ritmo tarda más de tres meses en recorrer las ~55.000 URLs # publicadas, y el eclipse es el 12 de agosto. # # Gastar un tercio de ese presupuesto tan corto en páginas que por definición # no pueden aparecer en los resultados es tirarlo. Prohibirlas aquí no le # quita nada a nadie: un navegador que pinta un iframe NO lee robots.txt, así # que el widget de los periódicos sigue funcionando exactamente igual. # # Los ALIAS de municipio (/eclipse-en/lanciego-araba/ → canonical al bueno) NO # se prohíben a propósito, aunque también son ~8.000 y también van en noindex: # llevan `canonical` a la ficha buena, y para que Google haga esa fusión tiene # que poder leerlos. Prohibirlos rompería justo lo que queremos que haga. # Sitemaps # # Cada dominio tiene el SUYO, con solo sus propias URLs: .es el contenido # español —castellano Y CATALÁN (/ca/), las dos lenguas del mismo dominio— y # .com el internacional (/en/, /de/, /fr/, /it/, /pt/, /nl/). Las 8.132 fichas # catalanas de municipio entran en el sitemap del .es y NO en el del .com; lo # garantiza la lista blanca de scripts/sitemap-com.mjs, con su test. Un # sitemap no puede listar URLs de otro dominio — cuando el del .es incluía las # del .com, Google rechazó 34.064 URLs con «URL no permitida» (25-07-2026). # Caddy sirve a cada dominio su índice: en .com, /sitemap-index.xml resuelve # internamente a sitemap-com-index.xml. # # Y aquí SOLO se declaran los del .es. Declarar además el del .com era válido # —las dos propiedades están verificadas— pero no aportaba nada: cada dominio # ya está dado de alta en Search Console con su propio sitemap. Era volver a # cruzar dominios en el mismo sitio donde eso ya nos costó 34.064 URLs. # ------------------------------------------------------------------ Sitemap: https://eclipseando.es/sitemap-tiempo.xml Sitemap: https://eclipseando.es/sitemap-index.xml Sitemap: https://eclipseando.es/sitemap-prioritario.xml