Para que ChatGPT cite una página, lo decisivo no es su posición en Google ni la autoridad de su dominio, sino que el contenido pueda «extraerse de forma limpia y presente un riesgo de cita suficientemente bajo». Clasificamos una por una las 500 referencias de ChatGPT que registramos para clientes durante los últimos seis meses. Los resultados fueron muy claros: más del 80% correspondía a seis tipos de fuentes. Si una página no encaja en estas categorías, el modelo probablemente la ignorará aunque ocupe el primer puesto en Google y preferirá otra situada en octava posición cuyo contenido resulte más fácil de extraer.
¿Cómo contabilizamos estas 500 citas?
Para saber hasta dónde pueden extrapolarse las conclusiones, primero hay que explicar bien la muestra. Estas 500 respuestas proceden de interacciones reales con ChatGPT recopiladas durante nuestro seguimiento de visibilidad en IA para clientes B2B y SaaS. Incluyen tanto preguntas que inician una búsqueda como casos en los que el modelo incorpora directamente enlaces a sus fuentes, con temas que abarcan comparativas de productos, explicaciones de términos, recomendaciones para elegir una solución y tutoriales operativos. Registramos una por una las URL citadas, su posición entre los diez primeros resultados de Google para la consulta, el tipo de estructura de la página y el aspecto del texto extraído. No se trata de un estudio académico de terceros, sino de observaciones propias, documentadas caso por caso durante la ejecución. La muestra está sesgada hacia el ámbito B2B y hacia consultas en inglés y chino tradicional. Conviene interpretar las proporciones siguientes teniendo en cuenta esta limitación.
Los seis tipos de fuentes más fáciles de seleccionar
Empecemos por la conclusión y después analicemos cada categoría. Ordenadas de mayor a menor número de citas, las seis fuentes se distribuyen aproximadamente así:
- Documentación oficial y páginas de producto (documentación técnica, páginas de precios y registros de actualizaciones): aproximadamente el 26%
- Investigaciones originales y páginas de encuestas con datos sin procesar: alrededor del 21%
- Reseñas, comparativas y listas seleccionadas por terceros (no recopilaciones propias): alrededor del 18%
- Debates en foros y comunidades (Reddit, Stack Overflow, PTT y asociaciones profesionales): aproximadamente el 14%
- Instrucciones y guías prácticas claras, paso a paso: aproximadamente el 12%
- Páginas de referencia con un alto grado de consenso (Wikipedia y páginas sobre terminología o estándares del sector): alrededor del 9%
No sorprende que la documentación oficial ocupe el primer lugar. Cuando alguien pregunta «¿Esta herramienta admite esta función?» o «¿Cuánto cuesta esta solución?», la opción más segura para el modelo es citar la documentación del propio fabricante: es una fuente de primera mano, la responsabilidad está clara y existe menos riesgo de que la información sea refutada. Por eso, aunque muchas empresas SaaS publiquen contenido con frecuencia, ChatGPT termina citando únicamente unas pocas páginas de documentación y precios. La investigación original ocupa el segundo puesto gracias a «los datos que nadie más posee»: una encuesta que indique la muestra, el método y la fecha puede convertirse para el modelo en una fuente factual apta para citar, porque esa información no puede copiarse de otro sitio.

Las comparativas de terceros, en tercer lugar, responden a la necesidad de neutralidad del modelo. Ante una pregunta como «¿Qué opción es mejor, A o B?», ChatGPT tiende a citar una fuente que no pertenezca ni a A ni a B, para evitar que la respuesta parezca publicidad encubierta. Por eso, en lugar de publicar diez artículos comparativos que se proclamen imparciales, suele ser más útil conseguir que otros incluyan la marca en sus propias listas. Los debates de comunidades, en cuarta posición, son la fuente más infravalorada. Reddit y distintos foros profesionales se citan a menudo porque aportan algo que la documentación oficial no ofrece: problemas que han sufrido usuarios reales y valoraciones sin el filtro del lenguaje comercial. El modelo necesita esa perspectiva para equilibrar el discurso oficial.
En las guías prácticas, que ocupan el quinto puesto, la estructura es determinante. Si una guía utiliza las preguntas como subtítulos, coloca la respuesta inmediatamente debajo y numera los pasos con claridad, el modelo puede reutilizar casi todo el contenido sin tener que reformularlo. Las páginas de referencia con un alto grado de consenso, en sexto lugar, funcionan como la opción más segura: cuando varias fuentes corroboran un dato, una wiki o una página de estándares ofrece el menor riesgo al citarlo. Estos seis tipos de fuentes comparten un mismo patrón.
El patrón común: contenido fácil de extraer, verificable y lo bastante reciente
La autoridad de dominio de estas seis fuentes varía enormemente. Una respuesta en Reddit y la documentación de un fabricante pertenecen claramente a órdenes de magnitud distintos, pero ambas cumplen tres condiciones. Que el contenido sea fácil de extraer significa que la respuesta aparece en un fragmento de texto con sentido propio, sin obligar al modelo a leer toda la página y resumirla. Que sea verificable implica que incluye una fuente, una fecha o una cifra clara, de modo que el modelo pueda identificar su procedencia y citar una marca temporal sin exponerse a que el usuario la refute. Que sea lo bastante reciente supone que la página muestra con claridad cuándo se actualizó y no parece obsoleta. El posicionamiento responde a la lógica de Google; estas tres condiciones, a la lógica de las citas de la IA. Ambas solo coinciden en parte.
Las páginas bien posicionadas que no reciben citas suelen cometer estos errores:
Al revisar las páginas que ocupaban buenas posiciones, pero no recibieron ni una sola cita, observamos que el problema casi nunca era la calidad del contenido, sino la dificultad para extraerlo. Algunos hábitos de redacción bastan para dejar una página fuera de la lista de fuentes:
- Ocultar la respuesta en medio de un párrafo extenso, después de tres frases de contexto. Así, el modelo no puede identificar una oración que se sostenga y pueda citarse por sí sola.
- No indicar con claridad la fecha de publicación o actualización. El modelo no puede determinar si el contenido ha quedado obsoleto.
- Incluir las cifras clave únicamente en imágenes o capturas de tablas, de modo que no estén disponibles en la capa de texto.
- Mantener en todo el artículo un tono comercial en primera persona, centrado en «nuestra solución». El modelo puede considerarlo una fuente sesgada y descartarlo.
- Amontonar diez temas en una sola página, sin que ninguno de sus párrafos responda a una pregunta concreta.
Cómo convertir tu contenido en una de estas seis fuentes
No hace falta cubrir las seis categorías: basta con elegir las dos o tres que mejor encajen con los activos disponibles. Si gestionas un SaaS, empieza por reescribir cada función y solución de las páginas de documentación y precios siguiendo esta estructura: «la pregunta es el título y la respuesta aparece en la primera frase». Es la medida con mayor retorno. Después, identifica una cifra exclusiva, aunque solo sea un resumen anonimizado de los datos internos del producto. Si especificas la muestra y el periodo, podrá convertirse en una fuente secundaria. Por último, gestiona de forma activa la presencia de la marca en listas de terceros para que otros la mencionen en sus comparativas. Con estos tres pasos habrás cubierto las tres categorías con mayor tasa de selección entre las seis fuentes.
En lugar de preguntar «¿Cómo consigo que ChatGPT mencione más mi marca?», conviene plantearse otra cuestión: «¿Puede el modelo citar directamente una frase de mi página sin cambiar una sola palabra?». Si la respuesta es no, ahí está la razón por la que todavía no cita el contenido.— Tenten GEO
Empieza por una sola acción: formula en ChatGPT la pregunta para la que más te interesa conseguir una cita y comprueba qué fuente utiliza ahora y por qué la prefiere a la tuya. La respuesta suele resultar incómoda: la página citada no es necesariamente más autorizada, sino más fácil de extraer. Si quieres saber en cuál de los seis niveles se atasca tu página y por dónde deberías empezar, puedes solicitar un diagnóstico GEO de 30 minutos. Analizaremos en directo tus propias preguntas clave y recorreremos contigo todo el proceso.



