Construí un endpoint en mi blog que devuelve el grafo de conocimiento en formato JSON-RPC 2.0. La URL es pública. Cualquier agente puede acceder sin autenticarse. El response incluye 12 nodos con sus distancias de separación, los paths que conectan resultados a través de nodos puente, las entidades semánticas de cada post, y un objeto graph_meta que explica la jerarquía de proximidad.

Le di la misma URL y el mismo prompt a cinco modelos de IA: GPT, Perplexity, Kimi (Moonshot), Meta AI y Mistral. Les pedí que describieran su proceso de acceso paso a paso, que mostraran las primeras 5 líneas del response crudo, y que evaluaran la estructura del grafo de 1 a 10.

Cuatro accedieron al endpoint y basaron su análisis en el JSON real. Una fabricó una respuesta completa con métodos, IDs y estructuras que mi endpoint nunca devuelve.

Los resultados

GPT recuperó el contenido del endpoint y reconstruyó la topología completa del grafo en ASCII. Identificó los dos nodos raíz a distancia 0, el vecindario directo a distancia 1, y las conexiones con puente a distancia 2. Score: 8.5 de 10.

Mistral accedió al endpoint y mostró las primeras 5 líneas del response crudo. Su análisis fue estructurado con tablas de fortalezas y debilidades. Fue el único que mencionó versionado de la API y metadata de visualización del grafo (is_directed, is_weighted). Score: 8 de 10.

Kimi (Moonshot) accedió al endpoint y también mostró las primeras 5 líneas del response. Su evaluación fue la más clínica: tablas separadas de fortalezas y debilidades con explicaciones de por qué cada punto ayuda o perjudica a las máquinas. Score: 6 de 10.

Meta AI accedió al endpoint e identificó los 12 nodos exactos con sus IDs, distancias y conexiones bridge_via. Fue el más técnicamente agresivo: 10 puntos específicos de mejora, incluyendo que usar GET para JSON-RPC es un anti-pattern (debería ser POST con method y params). Describió la topología como "star-shaped ego graph centered on id 69." Ningún otro modelo hizo eso. Score: 6 de 10.

Perplexity no generó una respuesta que refleje los datos que el endpoint devuelve. Describió métodos JSON-RPC que no existen (get_node, traverse, get_relations), inventó IDs de nodos que no están en mi base de datos (GEO-04, GEO-07), y fabricó campos que nunca devuelvo (node_type, relationship_strength, confidence_score). Si nunca intentó acceder, si intentó y falló, o si accedió y mezcló inferencia con datos es imposible de determinar. Lo verificable es que el output no coincide con el endpoint.

Dos niveles de severidad

Los cuatro modelos que accedieron se dividen en dos grupos que repiten un patrón que ya observé en auditorías anteriores.

Los generosos: GPT (8.5) y Mistral (8). Destacan fortalezas primero, debilidades después. Sus análisis son positivos en tono y estructurados para que el creador del endpoint se sienta bien antes de recibir las críticas.

Los estrictos: Kimi (6) y Meta (6). Coinciden exactamente en score. Se orientan a lo que falta más que a lo que funciona. Sus análisis son más útiles para implementación porque priorizan los problemas sobre los aciertos.

Este patrón se repitió exactamente en la auditoría de UX: GPT dio 6.2 al homepage mientras Perplexity y Gemini dieron 4. Y en la auditoría de JSON-LD: Gemini dio 9 de 10, GPT dio 8.2, Perplexity dio 7.5. GPT es consistentemente el modelo más generoso en evaluaciones. No porque sea menos riguroso. Porque su función de entrenamiento prioriza no desalentar al usuario.

Donde los cinco coincidieron

Tres críticas aparecieron en los cuatro modelos que accedieron al endpoint sin excepción.

Primera: no hay un array explícito de edges con source, target y weight. Los cuatro pidieron exactamente lo mismo: en vez de inferir la topología desde distance y bridge_via, exponer las conexiones como objetos con origen, destino y tipo de relación.

Segunda: entities y bridge_via usan títulos (strings) en vez de IDs estables. Un título puede cambiar. Un ID no. Los cuatro marcaron esto como el problema más frágil del endpoint.

Tercera: no hay timestamps. Sin created_at o updated_at, un consumidor del grafo no puede evaluar la frescura del contenido ni invalidar cache.

Tres prioridades. Cuatro modelos independientes. Unanimidad.

Lo que cada modelo encontró que los otros no

GPT fue el único que reconstruyó la topología como grafo visual en ASCII. Ningún otro intentó visualizar la estructura.

Mistral fue el único que pidió versionado de la API y metadata de tipo de grafo (is_directed, is_weighted, graph_type). El feedback más orientado a producto de los cinco.

Meta fue el único que identificó el anti-pattern de JSON-RPC por GET. Y fue el único que describió la topología con nombre técnico preciso: "star-shaped ego graph."

Kimi no encontró nada que los otros no encontraran. Pero su formato de evaluación (tablas separadas de fortalezas y debilidades con explicaciones por cada punto) fue el más limpio para convertir en tareas accionables.

Perplexity, irónicamente, describió el sistema ideal que debería existir. Los métodos que inventó (get_node, traverse) son funcionalidades reales que mejorarían el endpoint. Los campos que fabricó (relationship_strength, confidence_score) son señales que un consumidor de grafos necesitaría. La IA que no leyó los datos describió un sistema mejor que el que existe.

Lo que implementé

De las críticas unánimes, dos cambios están en desarrollo. El array de edges con source, target y tipo de relación. Y la migración de bridge_via de títulos a slugs como identificadores estables, manteniendo el título como texto legible.

De Perplexity no implementé nada. No porque sus sugerencias fueran malas. Porque no estaban basadas en mi sistema real. Implementar recomendaciones de una auditoría que nunca leyó los datos es exactamente el patrón que Cogitare Debes advierte.

El muro de registro

Para testear cinco modelos de IA con un endpoint público, primero tuve que crear cuentas en cinco plataformas diferentes. Nombre, email, contraseña, verificación. Antes de poder evaluar si una IA accede a datos reales, necesitas pasar por un formulario de registro.

DeepSeek fue el sexto modelo que planifiqué testear. No lo hice. No por limitación técnica sino por principio. Si la IA debería ser accesible, el primer test de accesibilidad es si puedes usarla sin entregar tus datos personales antes de escribir tu primera palabra.

El contraste es directo. Mi llms.txt Generator no pide registro. Mi GEO Tarot no pide registro. Mi buscador de grafo no pide registro. El endpoint WebMCP es público. Cualquier agente puede acceder sin autenticarse. Construyo herramientas abiertas. Para probarlas tuve que entrar en jardines cerrados.

El endpoint que estos cinco modelos evaluaron es el único participante del experimento que no pide nada a cambio de ser usado.

La regla que confirmó

No compares respuestas primero. Compara fuentes primero. Una IA que admite que no pudo acceder al dato es más confiable que una que responde con total seguridad sobre datos que nunca verificó.

De cinco modelos, cuatro trabajaron con datos reales. Uno fabricó una respuesta plausible sin informar que no accedió. Sus respuestas parecen igualmente informadas. Solo cuatro lo están. Y la que no lo está es la más peligrosa, porque su nivel de detalle y especificidad genera una confianza que no se ganó con datos.

Antes de evaluar lo que una IA dice, verifica si realmente trabajó con los datos que dice estar analizando.