GPT-Visionにshinobis.comのホームページのスクリーンショットを渡した。別のチャットで、同じサイトの完全なHTMLを貼り付けた。両方に同じ5つの質問:何についてか、誰向けか、階層は何か、最初に何をするか、何が混乱するか。
2つの異なるサイトを描写した。
画像から:「何であるかは理解できるが、最初に何をすべきか100%確信が持てない。」HTMLから:「HTMLは従来のブログ分類よりもAIにとってはるかに明示的だ。」
サイトは人間よりも機械にとって明確だ。そしてそれは意図的ではなかった。
画像が伝えないこと
スクリーンショットから、GPT-Visionは一般的なテーマを素早く特定した。しかし5つの問題を指摘した。
サイトのアイデンティティが不明確。ロゴは読めない名前なしの「XX」として表示される。サムネイルは視覚的に記事リストを支配するがコンテンツについて何も伝えない。GPT-Visionはサムネイルを「QR-code-looking」と描写した。
競合するエントリーポイントが多すぎる。無料ツール、Claude Code、3つのパス、記事。「サイトは理解できるが、クリエイターが最も重要だと考えるものがすぐにはわからない。」
HTMLが伝えること
HTMLから、視覚的なものを何も見ずに、GPTはサイトのはるかに完全で一貫したメンタルモデルを構築した。
正確に何であるかを特定した:「実際の制作作業でAIを使用するUX/UIデザイナーによる個人的な技術出版物とツールハブ。」HTMLがサイトが何であるか、誰向けか、背後にある原則を明示的に宣言しているからだ。
完全な階層をマッピングした:ポジショニング、次にツール、次にオリエンテーション、次にユーザーインテント、次にキュレーションされたコンテンツ、次に記事。
曖昧さなしに主要なアクションを特定した:「Try my free tools」はbtn-primaryクラスを持ちH1の直下にある。機械にとって階層は明確だ。ページを見る人間にとっては、隣の「Start with Claude Code」と競合する。
同じサイト、2つの読み方
相違が発見だ。HTMLからAIは正確に私が誰か、何をするか、なぜ重要かを知る。画像からは、ロゴが「XX」に見え、訪問者はヒーローを読まないと誰のサイトか理解できない。
HTMLはアクセシブルだ。視覚体験は情報的ではない。コードが確立する優先順位は視覚的に翻訳されない。
GEOについて明らかにすること
6ヶ月間、機械がコンテンツを理解するためのインフラを構築した。JSON-LD、llms.txt、コンテンツネゴシエーション、WebMCPエンドポイント付きグラフ検索。すべて機能する。AIモデルはサイトを読み、何であるか、誰向けか、コンテンツがどう関連するかを正確に理解する。
しかし視覚層は同じ明確さで伝えない。見えないインフラは見えるインターフェースよりも正確だ。バックエンドは機械に正確に話す。フロントエンドは人間に曖昧に話す。
通常の優先順位の興味深い逆転だ。機械のためにセマンティック構造を意図的に最適化し、視覚インターフェースが同じレベルの注意を受けていなかったことを発見した。
症状としてのサムネイル
ジェネレーティブ画像はストックフォトが繰り返され死んでいると感じる問題を解決するために生まれた。各画像は投稿タイトルのハッシュから生成されたユニークなビジュアルパターンだ。SVGで2から8KB。
しかしGPT-Visionはデータなしに疑っていたことを確認した:サムネイルはコンテンツを伝えない。機能はコンテンツコミュニケーションではなく、ビジュアルアイデンティティだ。コミュニケーションとして評価すれば失敗する。アイデンティティとして評価すれば機能する。問題は人間がコミュニケーションを期待する視覚スペースを占めていることだ。
教訓
セマンティックインフラが視覚インターフェースより明確なら、ほとんどのブログにない問題がある:機械が人よりもよく理解する。人間がまだコンテンツに時間を費やす価値があるかを決めるエコシステムでは、半分の仕事が完璧で、もう半分が追いつく必要があることを意味する。
GEOの強さを明らかにする同じテストがUXの弱さを明らかにする。メトリクスだけやコードだけを読んでは発見できない。2つの異なるオーディエンスがサイトをどう見るかを見る必要がある:HTMLを読む機械と、画面を見る人間。