Índice del artículo
Un motor generativo no responde de memoria: busca, lee y después redacta
Un modelo de lenguaje por sí solo conoce el mundo tal como era al final de su entrenamiento, con lagunas y aproximaciones. Para responder a una pregunta de actualidad o de elección, los productos de búsqueda generativa no se apoyan en esa memoria: buscan documentos, extraen pasajes de ellos y se los dan a leer al modelo antes de que redacte. Esta arquitectura, la generación aumentada por recuperación o RAG, es común a ChatGPT con búsqueda, a Perplexity, a Claude con búsqueda web y a las respuestas generadas de Google.
La cadena consta de cuatro pasos: la interpretación del prompt y su descomposición en consultas, la recuperación de pasajes en un índice, la reclasificación y el filtrado de esos pasajes, y por último la síntesis con atribución de las fuentes. El detalle varía de un editor a otro y una parte no está documentada. Google ha descrito públicamente sus consultas en abanico para AI Mode; OpenAI, Anthropic y Perplexity documentan sus robots de búsqueda; el resto procede de la literatura técnica sobre el RAG y de nuestras mediciones.
Paso 1: el prompt se interpreta y después se descompone en subconsultas
Un prompt no es una consulta. «Dirijo un despacho de asesoría contable de doce personas en Lyon, ¿qué software de facturación elegir para pasar a la factura electrónica?» contiene una intención explícita, dos restricciones de contexto, un plazo reglamentario implícito y un criterio de tamaño. Ninguna página se ha escrito para esa frase. Por eso el motor la reescribe en varias consultas cortas, próximas a lo que se teclea en una barra de búsqueda, que cubren cada una un ángulo de la petición.
Esta descomposición es el más visible de los cuatro pasos. Google la ha bautizado «query fan-out» y la presenta como el corazón de AI Mode; Perplexity, ChatGPT y Claude muestran en su interfaz las búsquedas lanzadas antes de la respuesta. El número de consultas depende de la pregunta: una petición de definición produce una o dos, una petición de comparación puede producir una decena.
La consecuencia para una página es directa: nunca se compara con el prompt, sino con una de las subconsultas. Una página que trata un tema «en general» no corresponde con precisión a ninguna de ellas. Una sección que responde a una subconsulta identificable tiene una oportunidad cada vez que esa subconsulta se genera, sea cual sea el prompt de origen. Eso es lo que explica que un artículo concreto y preciso aparezca en respuestas a preguntas a las que no apuntaba.
Paso 2: la recuperación trabaja sobre pasajes, no sobre páginas
Cada subconsulta interroga un índice. Ese índice no es una lista de páginas enteras: en la mayoría de las implementaciones documentadas, las páginas se trocean en segmentos de unas decenas a unos centenares de palabras, y cada segmento se representa a la vez por sus palabras clave y por un vector que codifica su significado. La búsqueda combina estas dos representaciones, lo que permite encontrar un pasaje que responde a la subconsulta sin repetir sus términos exactos.
Este troceado cambia la unidad de la competición. En el posicionamiento clásico, una URL entera se mide con otras URL. En la búsqueda generativa, un segmento de su página se mide con segmentos de todas las demás páginas, incluidas las de su propio sitio. El motor no lee la página de arriba abajo para extraer su mensaje; escoge el segmento más próximo a la subconsulta y lo evalúa tal cual.
De este mecanismo se derivan tres propiedades de una página.
- Cada sección debe bastarse a sí misma. Una respuesta repartida en cinco párrafos separados por digresiones no produce ningún segmento fuerte; cinco segmentos mediocres pierden frente a un segmento preciso de un competidor.
- El título de la sección forma parte del segmento. Siga o no el troceado los títulos, el subtítulo sigue siendo el mejor indicio del tema tratado; si retoma la formulación de una subconsulta, alinea el segmento con ella.
- El segmento debe existir en el HTML que recibe el robot. Lo que se inyecta con JavaScript tras la carga, se esconde tras un consentimiento renderizado en el servidor o se bloquea en el cortafuegos nunca entra en el índice. Es la primera de las cuatro condiciones de una citación, y se comprueba antes de cualquier reescritura.
El propio índice lo construyen robots dedicados: OAI-SearchBot para la búsqueda de ChatGPT, Claude-SearchBot para Claude, PerplexityBot para Perplexity, Googlebot para AI Overviews y AI Mode. Son distintos de los robots de entrenamiento, y su frecuencia de paso no se publica; en los logs del servidor que analizamos, varía mucho según la notoriedad del sitio y la frescura de sus contenidos.
Paso 3: los pasajes candidatos se reclasifican, se deduplican y se filtran
La recuperación devuelve muchos más segmentos de los que el modelo puede leer: decenas, a veces centenares por subconsulta. El paso siguiente reduce ese volumen a unos pocos pasajes. Un modelo de reclasificación puntúa cada candidato según su capacidad de responder, leyendo el par consulta-pasaje y ya no por similitud de vocabulario. Se añaden filtros, cuya lista los editores no publican pero cuyos efectos se observan: frescura para los temas que evolucionan, fiabilidad aparente de la fuente, diversidad de los dominios.
- 01CandidatosDecenas de segmentos por subconsulta, retenidos por similitud léxica y semántica.
- 02ReclasificaciónCada par consulta-pasaje se puntúa según su capacidad de responder, no por sus palabras clave.
- 03DeduplicaciónLos pasajes que dicen lo mismo con las mismas palabras se fusionan; solo sobrevive uno.
- 04FiltrosFrescura, fiabilidad aparente de la fuente, diversidad de los dominios.
- 05Contexto del modeloSolo unos pocos pasajes, con su URL, se transmiten a la redacción.
La deduplicación penaliza sin hacer ruido. Si su página de presentación dice lo que dicen las de sus veinte competidores («un acompañamiento a medida», «un equipo de expertos»), el motor ve en ella veinte copias de un mismo pasaje y solo conserva una, rara vez la suya. A la inversa, un dato que solo usted publica (un plazo medido, un precio, un método con nombre) no tiene duplicado; pasa el filtro cada vez que responde a una subconsulta.
El filtro de fiabilidad es aquel en el que interviene la identidad de la fuente: el motor se pregunta si puede apoyarse en ese pasaje. Una página cuyo autor y editor están identificados, son coherentes con lo que se encuentra en otros sitios y están marcados con datos estructurados, ofrece más asideros a esa evaluación que una página anónima. Comparamos los criterios clásicos y los criterios generativos en SEO vs GEO: lo que cambia de verdad en los criterios de selección de fuentes.
Paso 4: el modelo redacta y atribuye
Los pasajes retenidos se colocan en la ventana de contexto del modelo con una instrucción: responder apoyándose en ellos e indicar de dónde procede cada afirmación. El modelo no copia; parafrasea, fusiona, reordena. Una frase puede combinar dos fuentes, y la atribución se hace mediante un enlace o un número después de la frase. Los errores de atribución existen, y los editores lo reconocen: una afirmación puede vincularse a una fuente que no la contiene exactamente, un matiz puede desaparecer en la paráfrasis.
Lo que este paso pide a un pasaje se resume en cuatro propiedades. No sirven para ser retenido, sino para sobrevivir a la reescritura sin deformación y para ser atribuido a la entidad correcta.
- 1AutónomoComprensible sin el párrafo anterior: ningún «este», «esta solución», «como hemos visto más arriba».Si no: el modelo rellena el vacío con su propia suposición.
- 2Cifrado y fechadoUn número con su unidad, una fecha, una condición explícita.Si no: la paráfrasis redondea o generaliza.
- 3NombradoLa entidad que habla está en el pasaje: «en SEO360», no «en nuestra agencia».Si no: la citación pierde su nombre en favor de la URL sola.
- 4No ambiguoUna afirmación por frase, sin doble negación ni ironía.Si no: el modelo elige una lectura, no siempre la suya.
El tercer punto es el que más a menudo se descuida. En un sitio, «nosotros» designa evidentemente a la empresa; fuera de la página, en un pasaje de sesenta palabras, «nosotros» ya no designa a nadie, y el modelo citará «una agencia» o la URL. Nombrar la entidad en los pasajes importantes cuesta unas pocas palabras y cambia la manera en que aparece la marca.
Lo que cada paso exige de una página
La tabla siguiente relaciona cada paso con lo que exige y con el síntoma observado cuando la exigencia no se cumple. Es nuestra cuadrícula de diagnóstico: se remonta la cadena hasta el paso que ha descartado la página.
| Paso | Lo que hace el motor | Lo que la página debe ofrecer | Síntoma si falta |
|---|---|---|---|
| 1. Descomposición | Reescribe el prompt en subconsultas cortas | Secciones alineadas con subconsultas reales, en su vocabulario | La página nunca es candidata, ni siquiera sobre su tema |
| 2. Recuperación | Busca segmentos en un índice | Un HTML completo, accesible para los robots de búsqueda de IA, troceado en secciones autónomas | La página está ausente del índice o no produce en él ningún segmento fuerte |
| 3. Reclasificación | Puntúa, deduplica, filtra | Datos propios, una fecha sincera, una entidad identificada | La página es candidata pero siempre se descarta en favor de otra |
| 4. Síntesis | Parafrasea y atribuye | Pasajes autónomos, cifrados, nombrados, no ambiguos | La página se cita pero deformada, o sin el nombre de la marca |
Tabla: desplácese horizontalmente.
El esquema siguiente compara, a lo largo de los cuatro pasos, una página redactada en respuestas directas y su versión narrativa original.
Datos ilustrativos. Lo que hay que leer en ellos: la versión narrativa sigue siendo candidata casi una vez de cada dos, pero se descuelga en la reclasificación y en la síntesis; el trabajo de reescritura actúa sobre todo en los pasos 3 y 4.
En qué difieren los motores, y por qué eso cambia poco el método
Los cuatro pasos son comunes, pero cada editor los ajusta de manera diferente, lo que explica una parte de las diferencias de cuota de citación entre motores para un mismo sitio.
- Google (AI Overviews, AI Mode) bebe de su índice clásico: una página debe estar primero indexada en él. La descomposición en abanico es amplia, lo que favorece a los sitios que cubren una intención desde varios ángulos.
- ChatGPT decide si debe buscar o responder de memoria; cuando busca, se apoya, según OpenAI, en su propio índice y en proveedores terceros. Una página ausente de esos índices nunca es candidata, aunque esté bien posicionada en Google.
- Perplexity busca sistemáticamente y cita abundantemente, con fuentes numeradas; el número de plazas por respuesta es mayor, pero la competencia de las fuentes de terceros es más fuerte.
- Claude activa la búsqueda como una herramienta, cuando la pregunta lo exige; retiene pocas fuentes y las cita con precisión, lo que hace el paso 3 más selectivo.
Estas diferencias se leen en las mediciones, pero no cambian lo que una página debe ser: secciones autónomas, cada una alineada con una subconsulta, accesibles para los robots de búsqueda, respaldadas por una entidad identificada y por datos que no existen en ningún otro sitio. Una página así es candidata en todas partes; los ajustes de los motores deciden después con qué frecuencia es retenida.
Los descuelgues típicos, paso a paso
Cuando una página no aparece, la causa se sitúa en un paso preciso, y corregirla en otro paso no sirve de nada. Estos son los descuelgues más frecuentes, clasificados por paso.
- Paso 1. Subtítulos que no se parecen a ninguna consulta («Nuestro enfoque», «Por qué elegirnos»), en una página que sin embargo trata el tema correcto.
- Paso 2. Un contenido principal renderizado en JavaScript, un cortafuegos que rechaza a
OAI-SearchBoto aPerplexityBot, una respuesta dispersa por toda la página sin una sección que la sostenga. - Paso 3. Formulaciones intercambiables con las de los competidores, ninguna fecha visible, un autor anónimo y una empresa sin datos estructurados.
- Paso 4. Pasajes que remiten al contexto («esta solución», «como se indica más arriba»), cifras sin unidad, promesas sin condición.
Las cuatro condiciones que utilizamos en auditoría, accesible, citable, identificada y corroborada, se proyectan sobre esta cadena: la accesibilidad condiciona el paso 2, la citabilidad los pasos 2 y 4, la identificación y la corroboración el paso 3. El diagnóstico encuentra el paso que descarta la página; el plan de acción lo satisface, y después pasa al siguiente.
Qué recordar
- Un motor generativo sigue cuatro pasos: descomposición del prompt, recuperación de pasajes, reclasificación, síntesis citada. Cada uno descarta páginas.
- Su página nunca se compara con el prompt, sino con subconsultas cortas; cada sección debe apuntar a una, en su vocabulario.
- La unidad de competición es el segmento de texto, no la URL: una respuesta dispersa no produce ningún segmento fuerte.
- La reclasificación deduplica las formulaciones genéricas y filtra por frescura e identidad de la fuente; solo pasan los datos propios.
- Un pasaje sobrevive a la paráfrasis si es autónomo, cifrado, fechado, nombrado y no ambiguo.
Preguntas frecuentes
¿Qué es la generación aumentada por recuperación (RAG)?
Es la arquitectura de los motores generativos: antes de redactar, el sistema busca pasajes de documentos en un índice y se los proporciona al modelo de lenguaje, que se apoya en ellos para responder y cita sus fuentes. Compensa los límites de la memoria del modelo, congelada en la fecha de su entrenamiento. ChatGPT con búsqueda, Perplexity, Claude con búsqueda web y las respuestas generadas de Google funcionan según este principio, con ajustes diferentes.
¿Por qué una página bien posicionada en Google no es necesariamente citada por las IA?
Porque la selección se realiza sobre segmentos de texto, no sobre URL, y en pasos en los que el posicionamiento de Google no interviene. Una página puede ser la primera en una consulta y no contener ninguna sección autónoma que responda a la subconsulta generada por el motor; también puede ser descartada en la reclasificación por una formulación idéntica a la de diez competidores, o no estar indexada en absoluto por los robots de búsqueda de IA.
¿Cuántas subconsultas genera un motor a partir de un prompt?
Depende de la complejidad de la pregunta y del motor. Una petición de definición produce una o dos; una petición de comparación o de elección puede producir una decena. Google ha descrito esta descomposición en abanico para AI Mode, y Perplexity muestra las consultas lanzadas en su modo de investigación profunda. El número exacto no se publica; lo importante es que una sección de página apunte a una subconsulta precisa en lugar de al prompt entero.
¿Hay que escribir una página por subconsulta?
No, basta una sección por subconsulta, siempre que se baste a sí misma. El índice trocea las páginas en segmentos; una página larga y bien estructurada, en la que cada subtítulo corresponde a una pregunta real y cada primera frase responde, produce tantos segmentos candidatos como secciones tiene. Multiplicar las páginas cortas, por el contrario, dispersa la autoridad y complica la corroboración.
¿Puede el motor deformar lo que dice mi página?
Sí. En el paso de síntesis, el modelo parafrasea y fusiona varias fuentes; un matiz puede desaparecer, una cifra puede redondearse, una afirmación puede vincularse a una fuente que no la contiene exactamente. Los editores reconocen estos errores. El riesgo se reduce escribiendo pasajes autónomos, con cifras acompañadas de su unidad y de su fecha, una afirmación por frase y el nombre de la entidad en el propio pasaje.
