Cómo eligen sus fuentes los asistentes de IA
Qué establecen de verdad los pipelines de recuperación, la documentación de crawlers y la investigación publicada sobre visibilidad en IA, y la lista más larga de cosas que aún nadie ha demostrado.
Contenido
- Puntos clave
- Qué pasa entre la pregunta y la cita
- Por qué las citas se separan del top 10 de Google
- Qué significa de verdad que un pasaje sea extraíble
- Consistencia de entidad y qué dice Google del marcado
- El acceso de crawlers son tres decisiones distintas
- Qué no se sabe
- Qué medir mientras el terreno se mueve
- Preguntas frecuentes
Los asistentes de IA eligen fuentes mediante recuperación, no mediante un segundo ranking. La pregunta se expande en varias consultas, se traen documentos de un índice o de un feed de partners, y se seleccionan pasajes para sostener frases. La cita acompaña al pasaje usado, y por eso la lista casi nunca coincide con los diez primeros de Google.
Puntos clave
- Ahrefs analizó 1,9 millones de citas en 1 millón de AI Overviews en julio de 2025. El 76 % de las URL citadas estaba en el top 10 y el 14,4 % ni siquiera en el top 100.
- Google afirma que no hay requisitos adicionales ni datos estructurados especiales para aparecer en AI Overviews o en AI Mode.
- Google describe AI Mode como una técnica que divide la pregunta en subtemas y lanza muchas consultas a la vez: el query fan-out.
- OpenAI declara que ChatGPT search usa proveedores de búsqueda de terceros y contenido de partners: una cita puede salir de un índice que no controlas.
- El Tow Center probó 1.600 consultas en ocho herramientas en marzo de 2025 y encontró respuestas incorrectas en más del 60 % de los casos.
Qué pasa entre la pregunta y la cita
Los operadores describen en público cuatro etapas: expansión de la consulta, recuperación, grounding y adjudicación de la cita. Cada una estrecha el conjunto de candidatos, y en cada una puede caerse una página.
Google describió la expansión en mayo de 2025. AI Mode divide la pregunta en subtemas y lanza "multitud de consultas simultáneamente". Su variante Deep Search lanza cientos de búsquedas antes de redactar.
La recuperación no siempre es propia. En el lanzamiento de ChatGPT search, OpenAI declaró que la función se apoya en proveedores de búsqueda de terceros y en contenido facilitado por sus partners. Eso desmonta un supuesto habitual. El asistente no mantiene necesariamente el índice que decide si tu página es candidata.
El grounding engancha pasajes a frases. El modelo escribe una afirmación y un pasaje recuperado la sostiene. La cita es un subproducto de ese paso, y por eso la autoridad de página se comporta distinto que en el ranking clásico. El análogo más cercano es la recuperación y evaluación de qué exige un LLM en producción.
Google documentó en mayo de 2025 que AI Mode usa query fan-out: "divide la pregunta en subtemas y lanza multitud de consultas simultáneamente". Su modo Deep Search llega a cientos de búsquedas para una sola petición (Google, 20 de mayo de 2025).
Por qué las citas se separan del top 10 de Google
Se separan menos de lo que sugiere la conversación, y en una dirección concreta. Ahrefs estudió 1,9 millones de citas de 1 millón de AI Overviews y publicó el 21 de julio de 2025. Tres cuartas partes de las URL citadas estaban también en el top 10 orgánico.
Lo interesante es el resto. En ese conjunto, el 14,4 % de las páginas citadas no aparecía en el top 100 para la misma keyword. Se recuperaron para una consulta que nadie tecleó, generada en la fase de fan-out.
La consecuencia práctica es simétrica. Una página puede ser citada sin posicionar para la consulta visible, y otra puede ser la primera sin ser citada nunca. Ambas derivan de que la unidad recuperada es un pasaje, no un documento.
Ahrefs analizó 1,9 millones de citas en 1 millón de AI Overviews. Publicó el 21 de julio de 2025 que el 76 % de las URL citadas estaba en el top 10. Otro 9,5 % estaba entre la 11 y la 100, y el 14,4 % fuera del top 100 (Ahrefs, 21 de julio de 2025).
Qué significa de verdad que un pasaje sea extraíble
Un pasaje es extraíble cuando responde una pregunta completa sin depender del párrafo anterior. Implica nombrar la entidad en vez de pronominalizarla, dar el número con su unidad y su fecha, y no dejar que el encabezado complete el sentido.
La evidencia publicada es más estrecha que los consejos construidos sobre ella. Aggarwal y sus coautores presentaron GEO en KDD 2024 y midieron mejoras de visibilidad de hasta el 40 % en respuestas generativas, con eficacia variable por dominio. El resultado se obtuvo sobre GEO-Bench, un benchmark construido por los propios autores.
Es un hallazgo real y no una medición de campo. Nadie ha publicado una prueba controlada que demuestre que editar un pasaje cambie la frecuencia de citación en ChatGPT, Perplexity o AI Overviews a escala de producción. El mecanismo es plausible, la evidencia es indirecta, y conviene decirlo.
Lo que sí se deduce del pipeline, sin estudio, es estructural. Si la recuperación opera sobre pasajes, un documento que solo se entiende leído de arriba abajo ofrece menos unidades utilizables. La disciplina de modelar contenido para que sobreviva a un rediseño produce esa misma forma por razones ajenas.
Consistencia de entidad y qué dice Google del marcado
La documentación de Google sobre funciones de IA es poco ambigua. Afirma que "no hay requisitos adicionales para aparecer en AI Overviews o AI Mode, ni otras optimizaciones especiales necesarias", y que "tampoco hay datos estructurados de schema.org especiales que haya que añadir".
Eso cierra un debate y deja otro abierto. Ningún marcado concede elegibilidad. Los datos estructurados correctos siguen ayudando a resolver de qué organización, producto o persona habla una página. Unos datos de entidad inconsistentes le dan al sistema evidencia contradictoria.
La postura defendible es modesta. Nombra la entidad igual en todas las páginas, mantén el bloque de organización consistente y di de qué va la página en las primeras cien palabras. Nada de eso es una técnica de citación. Es la condición ordinaria para que te entiendan.
El acceso de crawlers son tres decisiones distintas
El acceso no es un único interruptor. OpenAI documenta tres crawlers con tres propósitos: GPTBot para entrenamiento, OAI-SearchBot para la búsqueda de ChatGPT, y ChatGPT-User para peticiones que lanza una persona. La documentación advierte de que a ChatGPT-User pueden no aplicarle las reglas de robots.txt.
Perplexity documenta la misma división. PerplexityBot existe para mostrar y enlazar sitios en sus resultados y no se usa para entrenar. Perplexity-User atiende acciones iniciadas por el usuario, y la documentación indica que ese fetcher "generalmente ignora las reglas de robots.txt".
Bloquear el entrenamiento y permitir la búsqueda es, por tanto, una configuración real y no una componenda. Bloquearlo todo también, con un coste previsible. Los fundamentos que hay detrás de qué mueve realmente el LCP importan aquí por lo mismo que con Googlebot: una página que expira no se recuperó.
El cumplimiento está en disputa, no resuelto. El Tow Center encontró que cinco plataformas con crawlers públicos devolvían a veces contenido de medios que las habían bloqueado. Perplexity replicó el 4 de agosto de 2025 que los fetchers activados por usuario merecen otro trato, y discutió la atribución de tráfico de uno de esos informes.
El Tow Center probó 1.600 consultas en ocho buscadores generativos en marzo de 2025. Más del 60 % de las respuestas fueron incorrectas, con tasas de error entre el 37 % de Perplexity y el 94 % de Grok 3. Más de la mitad de las respuestas de Gemini y Grok 3 citaron URL inventadas o rotas (Columbia Journalism Review, 6 de marzo de 2025).
Qué no se sabe
Esta es la sección que casi todos los artículos del tema se saltan, y es la más larga.
Ningún asistente publica sus criterios de selección. Google dice que no hay optimización aparte, pero no qué pesa la fase de recuperación. OpenAI, Perplexity y Anthropic publican controles de rastreo, no lógica de selección. Cualquier lista ordenada de "factores GEO" es inferencia presentada como documentación.
Ningún estudio publicado demuestra un vínculo causal entre una edición on-page y la frecuencia de citación en un asistente en producción. El paper de GEO es un resultado de benchmark. Los estudios de proveedores son observacionales y miden sobre todo correlación con el posicionamiento existente.
La estabilidad se desconoce. La cifra de solapamiento de Ahrefs describe un motor, un mercado y un periodo. Nada público establece que la proporción se mantenga un año después, y los pipelines cambian más rápido que sus mediciones.
El valor comercial de una cita está sin resolver. Pew midió clics en una fuente del resumen de IA en el 1 % de las visitas a páginas que lo mostraban. Si la cita rara vez genera sesión, su valor hay que defenderlo como notoriedad, y nadie ha publicado una cifra de conversión defendible.
Qué medir mientras el terreno se mueve
Mide tres cosas y sé honesto con lo que cada una puede sostener.
Primero, el tráfico de referencia desde dominios de asistentes, separado en analítica y no mezclado con directo. Es pequeño y real, y el único número que se ata a sesiones.
Segundo, la presencia en citas contra un panel fijo de prompts. Elige entre 30 y 50 preguntas que un comprador haría de verdad, lánzalas con periodicidad y registra qué dominios aparecen. Es una muestra, no un rank tracker.
Tercero, los accesos de crawler por user agent en los logs del servidor. Eso dice si OAI-SearchBot y PerplexityBot llegan a las páginas que te importan, el único eslabón que controlas del todo.
Las expectativas de tráfico se fijan contra lo ya medido. Ahrefs encontró un clic en la primera posición un 34,5 % más bajo en keywords con AI Overview, sobre 300.000 keywords, en abril de 2025. Planificar por valor acumulado, como en contenido que se acumula frente al calendario de campañas, aguanta ese cambio mejor que planificar por clics.
Pew Research Center siguió 68.879 búsquedas en Google de 900 adultos estadounidenses durante marzo de 2025. Hubo clic en un resultado tradicional en el 8 % de las visitas con resumen de IA frente al 15 % sin él. Hubo clic en una fuente del resumen en el 1 % de esas visitas (Pew Research Center, 22 de julio de 2025).
Preguntas frecuentes
¿La optimización para motores generativos es distinta del SEO?
En parte. La rastreabilidad, la indexación y la claridad sirven para ambos. Lo que cambia es la unidad. Los asistentes recuperan pasajes para sostener frases, así que una página escrita como un único argumento largo ofrece menos piezas utilizables que otra donde cada sección responde sola.
¿Los datos estructurados meten mi página en AI Overviews?
No. La documentación de Google afirma que no hacen falta datos estructurados especiales de schema.org ni requisitos adicionales más allá de la indexación y la elegibilidad de snippet. El marcado correcto sigue ayudando a resolver entidades, que es un beneficio distinto y más modesto que la elegibilidad.
¿Conviene bloquear los crawlers de IA?
Depende de cuál. OpenAI y Perplexity documentan agentes separados para entrenamiento y para búsqueda, así que puedes rechazar el entrenamiento y seguir siendo elegible para ser citado. Bloquear el crawler de búsqueda te saca de esa superficie, y los fetchers activados por usuario pueden ignorar robots.txt igualmente.
¿Cuánto tráfico cabe esperar de los asistentes de IA?
Menos del que sugiere la atención que recibe el tema. Pew registró clics en fuentes dentro de los resúmenes de IA en el 1 % de las visitas a páginas que los mostraban, en marzo de 2025. Trata las referencias de asistentes como un canal medible pero menor.
¿Existe alguna herramienta que garantice citas?
Ninguna puede garantizarlas, porque ningún operador publica los criterios de selección. Los productos de monitorización sí pueden muestrear prompts y reportar presencia, y eso es útil. Evaluarlos es la misma decisión de compra que cualquier otra capacidad de IA, tratada en construir, comprar o envolver.
Haz primero el trabajo controlable y en este orden. Comprueba que los crawlers de búsqueda alcanzan tus páginas. Reestructura para que cada pasaje responda sin contexto. Unifica después las referencias de entidad. Descarta lo que se venda como factor de ranking para asistentes: fuera de esas empresas nadie sabe qué pesa la recuperación. Dentro de seis meses sabremos si el solapamiento con el orgánico se desplaza y si la cita sin clic tiene valor comercial medible. Hasta entonces, medir cada mes es la única forma honesta de saberlo.



