Cómo deciden realmente los LLMs qué citar

La relevancia para los modelos de lenguaje no es una opinión ni un criterio editorial. Es geometría. La IA no evalúa el valor de tu marca: mide la distancia entre tu nombre y los conceptos que busca quien pregunta. Y esa distancia se empezó a construir mucho antes de que alguien escribiera el primer prompt sobre vos.
Tabla de Contenidos

Un estudio de mas de 23,000 respuestas de LLMs encontro que las marcas que aparecen en fuentes editoriales de terceros tienen 6,5 veces mas probabilidades de ser citadas que las que dependen exclusivamente de su propio contenido publicado. No “mas probabilidades de rankear”. Mas probabilidades de ser citadas por la IA cuando alguien le pregunta sobre el tema. Eso cambia completamente donde hay que poner la energia.

El problema es que la mayoria de los equipos de marketing estan tratando de hackear la capa equivocada del sistema. Para entender por que, hay que bajar un nivel y ver como funciona esto por dentro.

Lo que la IA ve cuando lee tu nombre de marca

Antes de que el modelo haga cualquier cosa con tu contenido, lo rompe en pedazos. No lee letras ni palabras completas: lee tokens, unidades de texto que pueden ser una palabra entera, parte de una palabra, o un simbolo de puntuacion. La palabra “estrategia” puede tokenizarse como dos o tres piezas dependiendo del modelo. “Strawberry” en ingles se parte en “straw” y “berry”, que es exactamente por que los modelos tienen fama de no saber contar cuantas R’s tiene: nunca vieron la palabra entera como una unidad.

Tu nombre de marca se tokeniza igual. No es un detalle técnico menor: es la primera capa que determina cómo el modelo procesa tu identidad. Si tu nombre de marca es ambiguo, genérico o coincide con otros conceptos del lenguaje común, el modelo absorbe esa ambiguedad desde el primer token. El nombre de tu empresa no es solo una etiqueta: es una coordenada que existe en el espacio del lenguaje, y como queda depende del contexto en el que apareció durante el entrenamiento.

Tu marca vive en una coordenada

Despues de tokenizar, el modelo convierte cada token en un número, o para ser más precisa, en miles de números: un punto en un espacio de miles de dimensiones donde el significado tiene posicion geográfica. Esto se llama embedding, y es la representación matematica del significado.

Lo que hace esto fascinante, y un poco desconcertante si es la primera vez que lo escuchás, es que las palabras que se usan de manera similar terminan cerca en ese espacio. “Película” queda al lado de “film”. “Perro” queda cerca de “cachorro”. “Democracia” queda lejos de los dos, y el espacio tiene direcciones en las que se puede hacer aritmética: rey menos hombre mas mujer da, en el espacio vectorial, algo muy cercano a reina. El significado tiene geometría que se puede navegar.

Ahora apliquemos toda esta locura a tu marca. ¿Con qué palabras aparece repetidamente en la web? ¿En qué contextos, al lado de qué problemas, citada por qué voces? Eso determina tu posición en el espacio semántico donde el modelo va a buscarte.

Es lo que llamo Coordenadas Reputacionales: tu marca no existe solo en tu sitio ni en tus redes. Existe como un punto en el mapa que la IA usa para navegar el conocimiento.

La relevancia no es una opinión, es un ángulo.

Cuando alguien hace una pregunta, el modelo no busca la respuesta más bonita ni la más optimizada. Busca la que tiene mayor similitud semántica con lo que se preguntó, y esa similitud se calcula como el ángulo entre dos flechas en el espacio vectorial: cuanto más alineadas estan las flechas, más alta la relevancia. No es criterio editoria, es literal trigonometría.

El mecanismo que hace esto posible se llama atención, y es el núcleo del transformer. Basicamente, cada token de un texto le pregunta al resto del contexto:¿qué de lo que hay acá es relevante para mi? Y esa pregunta se resuelve calculando similitudes vectoriales en paralelo, multiples veces.

El transformer que dio origen a los LLMs modernos ejecuta decenas de estos lectores de atención en paralelo en cada capa. GPT-3, el modelo que instaló este paradigma en 2020, tenía 96 por cada una de sus 96 capas, y los modelos actuales operan a mayor escala sin revelar sus especificaciones. Cada prompt activa docenas de juicios simultáneos sobre qué es relevante y qué no, todos corriendo a la vez.

La relevancia para la IA no es una preferencia ni una opinión editorial. Es el ángulo entre tu marca y lo que busca quien pregunta.

Un detalle que Anthropic descubrio en su investigacion de interpretabilidad mecanica publicada en marzo de 2025: cuando se le pide a Claude que escriba un pareado que rime, el modelo ya eligió la palabra que va a terminar el segundo verso antes de escribir la primera palabra del primero. No improvisa línea a línea. Hay estructura interna, circuitos reutilizables que hacen trabajo reconocible. La IA esta haciendo mucho más que autocompletar.

¿Dónde se decide tu visibilidad? Mucho antes de que alguien pregunte

Todo este sistema (los tokens, los embeddings, la atención) se construyó a partir de un juego simple: predecir la siguiente palabra. El modelo se entrenó leyendo una porción enorme del texto disponible en internet, prediciendo miles de millones de veces cuál es la palabra más probable despues de la anterior. Para volverse bueno en ese juego, tuvo que absorber gramática, hechos, y sobre todo qué marcas aparecen al lado de qué problemas.

Ese último punto es donde se juega la visibilidad en IA. Si tu marca aparece repetidamente en el entorno de los problemas que resolves (en textos que no escribiste vos sino terceros que te citan, en foros, artículos, análisis, menciones en contexto editorial de calidad), el modelo aprende esa asociación. Si no aparece, o aparece en contextos genéricos o desconectados, tu coordenada en el espacio semántico queda lejos de donde se originan las preguntas relevantes para tu negocio.

Los datos lo confirman. El 48% de todas las citas en LLMs proviene de earned media (medios ganados, cobertura editorial de terceros), mientras que solo el 23% viene del contenido propio de la marca.

Y hay un fenomeno que los equipos de contenido deberian conocer: se llama ghost citation. Ocurre cuando el contenido de una marca es lo suficientemente bueno para ser usado como fuente por el modelo, pero la marca no tiene suficiente presencia estructural para ser mencionada por nombre. El contenido aporta, pero la marca no aparece.

Lo que esto cambia en la estrategia (y lo que no)

Si llegaste hasta acá esperando el truco técnico que hace que la IA te cite mas, este es el momento del chasquido.

Lo que determina tu visibilidad en IA es exactamente lo mismo que siempre determinó la reputación de una marca: con qué conceptos te asocias, dónde apareces, qué dicen de vos cuando no estas en la conversación, qué tan coherente es tu posición a lo largo del tiempo y en distintos canales. La diferencia es que ahora hay un sistema que lo mide con precisión matemática y lo usa para decidir en tiempo real si tu marca aparece o no en la respuesta que le da a tu cliente ideal.

Lo que sí cambia es la urgencia y la contundencia de las consecuencias. Antes, una marca sin presencia editorial suficiente perdía reputación de manera gradual. Ahora, si la IA no asocia tu nombre con los problemas que resolves, no existís en esa conversación. El cliente pregunta, el modelo responde, y vos no estas. No es que te fuiste al quinto lugar del ranking, es que directamente no apareces.

Esto tiene implicaciones claras sobre qué tipo de contenido vale la pena producir, sobre donde construir presencia más allá del propio sitio, y sobre qué significa tener una estrategia de marca sólida en 2026.

El contenido que la IA cita no es el más optimizado tecnicamente: es el que viene de marcas que saben exactamente quiénes son, qué resuelven y para quién, y que lo dijeron de manera consistente en los lugares donde el modelo fue a aprender.

Me quedo pensando en lo que descubrió Anthropic sobre el pareado que rima. El modelo ya sabe adonde va antes de empezar a escribir. Construyó hacia atras desde la palabra final antes de escribir la primera linea.

Tu marca también va a terminar en algún lugar en el espacio semántico de la IA. Ese lugar ya se está calculando, con cada artículo que te cita o no te cita, con cada aparición en un contexto relevante o irrelevante, con cada conversación en la que estas o no estas.

Tu marca, hoy, ya tiene una coordenada. Lo que queda es pensar si vas a construir hacia esa coordenada con intención, o si vas a llegar al final de la línea y ver dónde te depositó el sistema por default.

El branding nunca fue decoración. Ahora resulta que tampoco es solo reputación humana. Es la coordenada desde la que la IA te encuentra, o no.

El contenido que la IA cita no es el más optimizado tecnicamente: es el que viene de marcas que saben exactamente quiénes son, qué resuelven y para quién, y que lo dijeron de manera consistente en los lugares donde el modelo fue a aprender

 

Lo que puede hacer tu marca con todo esto

La primera capa es la que vengo repitiendo: estrategia de marca clara. No el logo ni el brandbook, sino la claridad sobre qué resolvés, para quién, desde qué lugar de autoridad genuina. Sin eso, todo lo demás es optimizar en la dirección equivocada. El modelo va a aprender a asociarte con los conceptos en los que aparecés consistentemente. Si vos no definiste cuáles son, el sistema los define por vos.

La segunda es construir presencia editorial fuera de tus propios canales. Los datos son claros: el 48% de las citas en LLMs viene de earned media. Eso significa aparecer en medios del sector, en análisis de referentes, en discusiones de comunidades relevantes. No como publicidad, sino como referencia real. Una mención en un artículo de autoridad en tu industria vale más para tu coordenada semántica que diez posts en tu propio blog.

La tercera es coherencia a lo largo del tiempo. Una marca que dice una cosa esta semana y otra la siguiente genera señales contradictorias en el espacio vectorial. La consistencia no es rigidez: es la disciplina de aparecer siempre en el mismo territorio conceptual, aunque el formato cambie.

Y la cuarta es construir las Coordenadas Reputacionales: perfiles coherentes, trabajos citables, menciones en foros especializados, backlinks de sitios con autoridad en tu tema. Lo que rodea al contenido y le da al modelo señales de contexto sobre quién sos y qué resolvés.

Si esto te resuena y querés trabajarlo, esto es exactamente lo que hago: ayudo a empresas a construir una estrategia de marca que funcione en el entorno donde la IA es tanto canal de distribución como juez de reputación. Agendemos una cafecito virtual🙂

Preguntas frecuentes sobre cómo decide la IA qué marcas citar

¿Qué son los embeddings y por qué importan para la visibilidad de mi marca en IA?

Los LLMs no buscan respuestas en tiempo real ni evaluan criterios editoriales: recuperan asociaciones aprendidas durante el entrenamiento. Cuando tu marca aparece repetidamente junto a los problemas que resolves en fuentes de calidad, el modelo aprende a asociarte con esos conceptos. Un estudio de mas de 23,000 respuestas de LLMs encontro que las marcas presentes en medios editoriales de terceros tienen 6,5 veces mas probabilidades de ser citadas que las que dependen solo de su contenido propio.

Los embeddings son representaciones matemáticas del significado: cada palabra o concepto se convierte en un punto en un espacio de miles de dimensiones, donde los conceptos relacionados quedan cerca. Tu marca ocupa un punto en ese espacio, y su posición depende del contexto en el que apareció durante el entrenamiento del modelo. Si aparece consistentemente junto a los problemas que resolves, queda cerca de esos conceptos en el espacio vectorial. Si aparece en contextos genéricos o desconectados, su coordenada semántica no te favorece.

GEO (Generative Engine Optimization) es la práctica de optimizar la presencia de una marca para ser citada en las respuestas que generan los LLMs como ChatGPT, Perplexity, Claude o Google AI Overview. A diferencia del SEO clásico, que busca posicionar páginas en resultados de búsqueda, el GEO busca que la IA incluya tu marca en sus respuestas cuando alguien pregunta sobre el tema que dominas. La diferencia práctica es decisiva: no es un ranking, es una mención directa en la respuesta.

Una ghost citation ocurre cuando el contenido de una marca es usado como fuente de referencia por el modelo, pero el nombre de la marca no aparece mencionado en la respuesta. El contenido aporta al razonamiento del LLM, pero la marca no recibe crédito visible. Para detectarlo, hay que hacer consultas frecuentes con prompts sobre el tema que cubris y observar si la IA responde con información de tus artículos sin nombrarte. Es más común de lo que parece.

Las Coordenadas Reputacionales son un concepto propio de mi metodología que describe el conjunto de señales estructurales que los sistemas de IA leen antes de evaluar el contenido de un sitio: los dominios que te enlazan, los medios donde aparece tu nombre, la coherencia entre lo que decis sobre vos y lo que dicen otros, los repositorios donde está indexado tu trabajo. En el espacio vectorial de la IA, estas coordenadas determinan la distancia entre tu marca y los conceptos por los que queres ser encontrado. Más detalles en: doi.org/10.5281/zenodo.20318714.

El contenido que los LLMs tienden a citar es el que aparece en fuentes editoriales independientes (medios, analistas, comunidades), el que está firmado por personas con autoridad reconocida en el tema, el que incluye datos específicos con atribución clara, y el que aborda el problema desde una experiencia real que no puede ser producida fácilmente por la IA misma. El contenido genérico que cualquier modelo podría escribir no tiene ventaja competitiva en términos de citación. Si tu blog podría haber sido escrito por ChatGPT, ChatGPT no va a necesitar citarlo.

Share the Post: