Diseño interfaces para bancos y fintechs desde hace más de 10 años. Flujos de onboarding, pantallas de aprobación, dashboards de transacciones. He pasado revisiones de usabilidad con equipos de producto, auditorías de accesibilidad con reguladores, y tests con usuarios reales que no entienden por qué un botón dice "Continuar" cuando no hay a dónde continuar.

Decidí aplicar el mismo principio a mi propio sitio. Pero en vez de contratar un equipo de QA, usé tres modelos de IA con un solo prompt: destruye la experiencia de usuario. No me des cumplidos. Solo problemas.

ChatGPT, Perplexity y Gemini auditaron las mismas 4 páginas con el mismo prompt, palabra por palabra. Los puntajes fueron brutales. Y reveladores.

Los scores

Cuatro páginas. Tres modelos. Doce puntajes.

El homepage recibió 6.2 de ChatGPT, 4 de Perplexity y 4 de Gemini. El post del blog recibió 7.1, 5 y 5. La herramienta llms.txt Generator recibió 5.4, 3 y 3. La búsqueda recibió 4.8, 2 y 2.

El primer dato interesante: Perplexity y Gemini coincidieron exactamente en los 4 puntajes. No se coordinaron. No comparten arquitectura. Pero evaluaron la severidad de cada problema con la misma escala. ChatGPT fue consistentemente 1.5 a 2.8 puntos más generoso en cada página.

El segundo dato: la búsqueda, que es la funcionalidad más técnicamente sofisticada del sitio (una CTE recursiva en MariaDB que atraviesa un grafo de 80 conexiones), recibió el puntaje más bajo de las tres. La complejidad técnica no compensa una experiencia de usuario confusa.

Donde las tres coincidieron

Cuatro problemas aparecieron en las tres auditorías sin excepción.

Primero: el metadata público expone la base de datos. Los IDs internos (P062, P069) y los conteos crudos de vistas (22 views, 43 total) aparecen en la interfaz pública. Las tres auditorías lo marcaron como database output disfrazado de interfaz. No aporta información útil al lector y comunica "esto es un prototipo de developer" en vez de "esto es un producto diseñado".

Segundo: la búsqueda muestra la arquitectura interna sin explicarla. Los puntajes del grafo (16pts, 14pts), los grados de separación y las etiquetas de conexión son comprensibles para quien construyó el sistema. No para quien busca un artículo sobre JSON. Gemini identificó un ejemplo concreto: un post con "JSON-LD" en el título aparece debajo de otro que no lo tiene, porque las conexiones del grafo acumulan más puntos. La lógica interna es correcta. La experiencia del usuario no lo es.

Tercero: la herramienta llms.txt Generator no respeta el idioma de navegación. Si alguien llega desde una citación en inglés de ChatGPT, aterriza en una interfaz en español. Es un bug de localización que las tres detectaron.

Cuarto: el homepage no tiene orientación para visitantes nuevos. Las tres auditorías usaron variaciones de la misma crítica: un visitante que llega por primera vez desde una citación de IA no sabe si esto es un blog, un portfolio, un hub de herramientas o un sitio de consultoría. No hay un "empieza aquí" visible.

Donde divergieron

Las divergencias son tan reveladoras como las coincidencias.

ChatGPT fue estructurado pero moderado. Sus críticas venían con contexto. "The value proposition is vague" seguido de exactamente qué preguntas no responde. Su feedback fue el más fácil de convertir en tareas accionables porque identificaba el problema, explicaba por qué importa, y sugería la dirección de la solución.

Perplexity fue filosófico y evaluativo. No listó problemas individuales. Describió la impresión general que cada página crea y por qué esa impresión falla. "The site seems to have strong opinions and lots of content, but not enough guidance for strangers." Útil para entender la percepción macro. Menos útil para saber qué cambiar mañana.

Gemini fue el más técnico y el más duro. Citó elementos específicos del DOM. Identificó que los glifos de texto plano (▾, →, ✦) se usan como decoración de interfaz en vez de SVGs escalables. Señaló que la sección de compartir usa caracteres minimalistas crudos (𝕏, in, WA) sin CTAs visuales claros. Encontró el bug de la búsqueda donde "JSON-LD" en el título pierde contra un post sin esa palabra por peso de grafo. De las tres auditorías, fue la más útil para implementación directa.

Lo que descarté

Las tres insistieron en que el sitio debería ser un portfolio de consultoría con case studies, testimonios, métricas de clientes y un path de conversión claro. "After reading three pages I still don't know: Can I hire you? What services do you sell?"

Esa crítica proyecta una suposición sobre el propósito del sitio que no es correcta. shinobis.com es un blog de contenido técnico y herramientas gratuitas. No es un sitio de venta de servicios de consultoría. Los modelos evaluaron el sitio contra un criterio que yo nunca establecí. Eso no invalida las observaciones sobre UX. Pero invalida la conclusión de que el sitio "falla" en posicionar servicios que no ofrece.

Perplexity y Gemini dieron 2 de 10 a la búsqueda, lo cual es excesivo. El buscador de grafo hace algo que ningún otro blog personal hace: muestra por qué un resultado es relevante, no solo que lo es. El problema no es el concepto. Es la presentación. Los puntajes y grados internos no deberían ser visibles. Pero la funcionalidad subyacente no merece un 2.

Gemini entró en detalles de implementación de accesibilidad (aria-live regions, focus management en inserción dinámica del DOM) que son válidos como bugs individuales pero no son problemas de arquitectura UX. Son items para un sprint de accesibilidad, no para un rediseño.

Lo que implementé

De las tres auditorías combinadas, implementé cuatro cambios ordenados por impacto.

Eliminé los IDs internos y métricas crudas de las vistas públicas. Los post IDs (P062, P069) y los conteos sin contexto (22 views) ya no aparecen en la interfaz. Diez minutos de trabajo en el template PHP. Impacto inmediato en la percepción de profesionalismo.

Rebalanceé el scoring de la búsqueda. El grafo sigue siendo el motor, pero ahora la coincidencia directa en el título tiene un boost mínimo garantizado. Si el usuario busca "json" y un post tiene "JSON-LD" en el título, ese post no puede quedar debajo de uno que no lo tiene, sin importar cuántas conexiones de segundo grado acumule el otro. Los puntajes internos ya no son visibles en la interfaz.

Arreglé la localización de la herramienta. El llms.txt Generator ahora detecta el idioma de navegación y sirve la interfaz correspondiente.

Agregué un bloque de orientación al homepage para visitantes nuevos. Una sección visible que responde tres preguntas: qué es este sitio, para quién es, y por dónde empezar.

Lo que aprendí sobre las auditorías con IA

Tres modelos auditando el mismo sitio con el mismo prompt producen tres niveles de severidad diferentes. ChatGPT tiende a moderar sus críticas incluso cuando le pides brutalidad. Perplexity evalúa impresiones generales. Gemini entra en detalles técnicos de implementación.

Si hubiera pedido la auditoría solo a ChatGPT, habría pensado que el homepage estaba en 6.2 y que la búsqueda era un 4.8 razonable. Si solo a Gemini, habría pensado que todo necesita reconstruirse desde cero. La realidad es que los problemas reales son específicos y solucionables, no sistémicos.

El patrón es el mismo que con la auditoría de JSON-LD: no le preguntas a una IA. Le preguntas a tres. Implementas lo que coincide. Evalúas lo que diverge. Descartas lo que proyecta suposiciones incorrectas sobre tu producto.

Lo más revelador no fueron los problemas que encontraron. Fue la ironía. Un diseñador UX con 10 años de experiencia en interfaces bancarias tenía database IDs visibles en la interfaz pública de su propio blog. No porque no supiera que es un error. Porque cuando eres el builder y el designer del mismo producto, los puntos ciegos se multiplican. Ves la arquitectura. No ves la interfaz.

Las tres IAs vieron la interfaz. Ese fue su valor.