10年以上、銀行とフィンテックのインターフェースを設計してきた。オンボーディングフロー、承認画面、取引ダッシュボード。プロダクトチームとのユーザビリティレビュー、規制当局とのアクセシビリティ監査、「続行」ボタンが続行先がないのになぜ「続行」と書いてあるか理解できない実際のユーザーとのテストを経験してきた。
同じ原則を自分のサイトに適用することにした。QAチームを雇う代わりに、3つのAIモデルに1つのプロンプトを使った。ユーザー体験を破壊せよ。デザインを褒めるな。問題だけ。
ChatGPT、Perplexity、Geminiが同じ4ページを同じプロンプトで一字一句同じに監査した。スコアは残酷だった。そして示唆に富んでいた。
スコア
4ページ。3モデル。12スコア。
ホームページはChatGPTから6.2、Perplexityから4、Geminiから4を受けた。ブログ投稿は7.1、5、5。llms.txt Generatorツールは5.4、3、3。検索は4.8、2、2。
最初の興味深い発見:PerplexityとGeminiは4つのスコアすべてで正確に一致した。調整はしていない。アーキテクチャを共有していない。しかし各問題の深刻度を同じスケールで評価した。ChatGPTはすべてのページで一貫して1.5から2.8ポイント寛大だった。
2番目の発見:検索ページは、サイトで最も技術的に洗練された機能(80の接続のグラフを走査するMariaDBの再帰CTE)であるにもかかわらず、3つすべてから最低スコアを受けた。技術的な複雑さは混乱するユーザー体験を補わない。
3つが一致したところ
4つの問題が例外なく3つの監査すべてに現れた。
第一に、公開メタデータがデータベースを露出している。内部ID(P062、P069)と生のビューカウント(22 views、43 total)が公開インターフェースに表示される。3つすべてがインターフェースに偽装されたデータベース出力としてフラグを立てた。
第二に、検索が内部アーキテクチャを説明なしに表示している。グラフスコア(16pts、14pts)、分離度、接続ラベルはシステムを構築した人には理解できる。JSONについて記事を検索する人には理解できない。Geminiは具体的な例を特定した。タイトルに「JSON-LD」がある投稿が、それがない投稿の下に表示される。グラフ接続がより多くのポイントを蓄積するからだ。内部ロジックは正しい。ユーザー体験は正しくない。
第三に、llms.txt Generatorツールがナビゲーション言語を尊重しない。英語のChatGPT引用から来た人がスペイン語のインターフェースに到着する。
第四に、ホームページに新規訪問者のためのオリエンテーションがない。AI引用から初めて到着した訪問者が、これがブログか、ポートフォリオか、ツールハブか、コンサルティングサイトかわからない。
意見が分かれたところ
相違は一致と同じくらい示唆に富む。
ChatGPTは構造的だが穏健だった。批判にはコンテキストが伴った。フィードバックは問題を特定し、なぜ重要かを説明し、解決の方向を示したため、アクション可能なタスクに変換しやすかった。
Perplexityは哲学的で評価的だった。個別の問題をリストしなかった。各ページが生み出す全体的な印象と、なぜその印象が失敗するかを描写した。マクロな認識を理解するのに有用。明日何を変えるべきかを知るには有用性が低い。
Geminiは最も技術的で最も厳しかった。特定のDOM要素を引用した。プレーンテキストグリフ(▾、→、✦)がスケーラブルなSVGの代わりにインターフェース装飾として使用されていることを特定した。3つの監査のうち、直接実装に最も有用だった。
却下したもの
3つすべてが、サイトはケーススタディ、テスティモニアル、クライアントメトリクス、明確なコンバージョンパスを持つコンサルティングポートフォリオであるべきだと主張した。
その批判はサイトの目的について正しくない仮定を投影している。shinobis.comは技術コンテンツブログと無料ツールハブだ。コンサルティングサービスの販売サイトではない。モデルは私が設定していない基準に対してサイトを評価した。
PerplexityとGeminiが検索に2/10を付けたのは過剰だ。グラフ検索は他のどの個人ブログもやっていないことをする。結果がなぜ関連するかを示す。問題はコンセプトではない。プレゼンテーションだ。
実装したもの
3つの監査を組み合わせて、インパクト順に4つの変更を実装した。
公開ビューから内部IDと生のメトリクスを削除した。投稿ID(P062、P069)とコンテキストのないカウント(22 views)はインターフェースに表示されなくなった。PHPテンプレートでの10分の作業。プロフェッショナリズムの認識に即座にインパクト。
検索スコアリングをリバランスした。グラフはまだエンジンだが、直接タイトル一致に最低限の保証ブーストがある。ユーザーが「json」を検索してタイトルに「JSON-LD」がある投稿がある場合、2度目の接続がいくつ蓄積されても、それがない投稿の下にランクされることはない。内部スコアはインターフェースに表示されなくなった。
ツールのローカライゼーションを修正した。llms.txt Generatorはナビゲーション言語を検出し、対応するインターフェースを提供する。
新規訪問者のためのオリエンテーションブロックをホームページに追加した。3つの質問に答える可視セクション:このサイトは何か、誰のためか、どこから始めるか。
AI監査について学んだこと
同じサイトを同じプロンプトで監査する3つのモデルは、3つの異なる深刻度レベルを生み出す。ChatGPTは残酷さを求められても批判を和らげる傾向がある。Perplexityは全体的な印象を評価する。Geminiは技術的な実装の詳細に入る。
ChatGPTだけに聞いていたら、ホームページは6.2で検索は妥当な4.8だと思っていただろう。Geminiだけなら、すべてをゼロから再構築する必要があると思っていただろう。現実は、本当の問題は具体的で解決可能であり、体系的ではないということだ。
パターンはJSON-LD監査と同じだ。1つのAIに聞くのではない。3つに聞く。重複するものを実装する。分岐するものを評価する。製品について誤った仮定を投影するものを却下する。
最も示唆的だったのは、発見された問題ではなかった。皮肉だった。銀行インターフェースで10年の経験を持つUXデザイナーが、自分のブログの公開インターフェースにデータベースIDを表示していた。それが間違いだと知らなかったからではない。同じ製品のビルダーとデザイナーであるとき、盲点が増殖するからだ。アーキテクチャが見える。インターフェースが見えない。
3つのAIはインターフェースを見た。それが彼らの価値だった。