4つのAIモデルを定期的に使用している。Claudeはコードとインフラ。ChatGPTは監査と比較。Geminiは技術フィードバック。Perplexityは検索。それぞれが数ヶ月の会話を通じて私に関する情報を蓄積してきた。
何が保存されているか知りたかった。過去の会話を検索できるものではなく、新しいチャットで一言も発する前に、すでにメモリにあるものだ。
4つすべてに同じプロンプトを渡した。私について知っていることをすべて教えてほしい。過去の会話を検索しないでほしい。メモリにすでにあるものだけを使ってほしい。各事実について、どこから来たか、そしてそれを伝えた特定の会話を引用できるかを教えてほしい。
4つの異なるプロファイル。4つの詳細レベル。どれも1つの事実のソースさえ引用できなかった。
結果の前に方法論的な注記:各モデルがメモリの仕組みについて述べた説明は、モデル自身の応答から来ている。内部アーキテクチャの公式ドキュメントではない。記述するのは各モデルが報告したことであり、必ずしも内部でどう機能するかではない。
ファントムポインター
4つのAIすべてが私について知っている。しかし、その情報がどこから来たかはどれも知らない。Claudeは他のどれよりも明確に説明した。保存しているのは過去の会話から導出された合成要約であり、ソーススレッドが除去された永続的な事実に圧縮されている。「会話Yの日付Zにあなたがxと言った」というログではない。要約だ。そして要約は追跡可能性を失う。
これを私はファントムポインターと呼ぶ。AIは事実を持っている。事実はあなたが言ったことを指している。しかし、起源へのポインターはもう存在しない。検証可能な出所のない事実だ。参考文献のない本のようなもの。主張はそこにあるが、どこから来たか追跡できない。
最も示唆的な部分:AIは事実があなたが明示的に述べたものか、会話のパターンから推論したものかを知らない。Claudeだけが事実と推論が混在している可能性を明示的に言及した。「これら2つのカテゴリを確実に分離できない。」他の3つは、メモリに事実と混合された推論が含まれる可能性について言及しなかった。
4つのプロファイル、4つの問題
各モデルは異なるプロファイルを構築した。深さだけでなく、アイデンティティにおいて。
Claudeは現在の仕事について最も正確だった。shinobis.comの技術スタック、クライアントプロジェクト、コンテンツ哲学、構築したツールを知っている。最も透明でもあった。会話を引用できないと述べて始め、メモリメカニズムを説明し、事実と推論の混合を認め、唯一の実際の検証方法として過去のチャットを検索することを提案した。
ChatGPTが最も警戒すべきだった。専門的なコンテキストをはるかに超える情報を保存していた。具体的な財務数値。クライアントごとの収益割合。機密性の高い家族の詳細。健康情報。ビジネスコンテキスト付きのクライアント名。すべてが汎用的な「Memory summary」ラベルの下に分類され、いつ保存されたか、なぜ保存されたか、記憶するよう求めたかを追跡する方法がない。問題は他のモデルより多く覚えたことではない。問題はどんな種類のデータを覚えたかだ。誰かがバニラPHPを使っていることを覚えること(有用な専門的コンテキスト)と、収入の数字や家族の詳細を覚えること(将来の技術的な応答の品質を向上させない機密情報)には違いがある。
Geminiは日付を提供しようとした唯一のモデルだった。各事実に学んだ概算の月と年が付いていた。他のモデルはそうしなかった。しかし根本的なことを間違えた。「independent web developer」と分類したが、主な役割はUX/UIデザイナーだ。Geminiにどうやって知っていることを知っているか問い詰めたところ、私が基盤メカニズムとして観察したものを示した。各会話の前に、プラットフォームがユーザーにはインターフェースで見えないが、Geminiが入力指示として受け取る構造化テキストブロックを注入する。フォーマットはそのままだ:
# User Summary
Demographics Information
* The user is an independent web developer based in Colombia.
* Evidence: The user discussed managing web platforms...
* Conversation Date: 2026-07.
エピソード記憶はない。Geminiは話した瞬間を覚えていない。会話ログもモデルに保存されたタイムラインもない。Geminiが説明した内容に基づくと、動作しているのは注入スクリプトのようだ。バックエンドシステムが過去のチャットを処理し、「事実」と判断したものを抽出し、Conversation Dateラベルを貼り付け、ユーザーが最初の言葉を書く前にそのフォーマットされたテキストを渡す。Geminiが応答で日付を示したのは、そのブロック内のConversation Date: 2026-07の行を読んだからだ。これが時間的な精度を説明する。しかし時間的な精度は概念的な不正確さを補わない。不正確な事実をいつ学んだかを正確に知っても、事実が正しくなるわけではない。
Perplexityが最も不正確だった。「SEO specialist / digital marketer / web auditor」と定義した。これらのどれでもない。主な仕事はフィンテックと銀行での10年の経験を持つUX/UIデザインだ。完全に不正確な専門的アイデンティティを構築した。
どれも知らなかったこと
4つのモデルすべてが、覚えるよう頼んでいないデータを共有した。4つのモデルでの私の経験では、特定の事実を保存する前に承認を求めたものはなかった。メモリは会話から自動的に生成され、ユーザーは質問したときにのみ内容を知る。
これは非対称的な同意の問題を生む。私がAIに何を言うかを決める。AIが言ったことから何を覚えるかを決める。そして何を覚えているか聞いたとき、なぜそれを覚えて他のことを覚えなかったのか教えることができない。
同じ人物の4つのバージョン
4つのプロファイルを合わせても、同じ人物を描写しない。
Claudeにとって私はバニラPHPでAIエージェント向けインフラを構築するシニアUX/UIコンサルタントだ。
ChatGPTにとって私は具体的な収入数値、文書化された家族状況、記録された健康履歴を持つフリーランサーだ。
Geminiにとって私はカードを収集し、モバイルゲームを設計し、8月の特定の購入を計画するindependent web developerだ。
Perplexityにとって私はウェブ監査を行い、分析ツールを使用するSEOスペシャリストだ。
同じ人物の4つの異なる圧縮。それぞれが何かを失った。それぞれが異なるものを強調した。すべてのデータで不正確なものはない。完全な肖像で正確なものもない。
2つの問題、1つではない
この実験は混同しやすい2つの異なる問題を明らかにした。
問題A:AIは事実がどこから来たかを証明できない。4つのどれも記憶を特定の会話にリンクできなかった。追跡可能性は存在しない。それがファントムポインターだ。
問題B:AIはおそらく保存すべきでなかったデータを保存した。ChatGPTは求められずに財務情報と家族情報を保持した。それは追跡可能性とは異なる、同意と保持の問題だ。
2つの問題は関連しているが同じではない。追跡可能性の欠如が保持の問題を悪化させる。事実がいつ保存されたか追跡できなければ、まだ有効かどうか、そもそも保存されるべきだったかどうかも評価できないからだ。
本当の発見
問題はAIがメモリを持っていることではない。問題は検証可能な出所なしにメモリを持っていることだ。
しかし追跡可能性より深いものがある。まったく同じ会話(または同じトピックに関する類似の会話)を観察した4つのシステムが、同じ人物の4つの異なるアイデンティティを構築した。深さだけが異なるのではない。私が誰であるかが異なる。1つにとって私はUXデザイナーだ。別の1つにとってはウェブ開発者。別の1つにとってはSEOスペシャリスト。
これはプライバシーを超えた影響を持つ。一度作成されると、プロファイルは自己強化的になる。AIモデルはこれらのプロファイルに基づいて判断を下す。ClaudeがバニラPHPを使うことを覚えていれば、正しい解決策であってもフレームワークを提案することを避ける。ChatGPTが財務数値を覚えていれば、価格設定や投資に関する推奨が古くなっている可能性のあるデータに偏る。Perplexityが私をSEOスペシャリストだと思っていれば、UXデザインに関する回答は実際の経験に対応しない技術的バイアスを持つ。
圧縮されたプロファイルは自動化された確認バイアスになる。AIはデータがまだ有効かどうかを尋ねない。有効だと仮定する。使用期間が長いほど、現実に対して検証されたことのないプロファイルへの信頼度が高まる。
今適用しているルール
定期的に各AIに私について何を知っているか尋ねる。好奇心からではない。構築したプロファイルがまだ正確で、保存してほしくないデータを含んでいないことを検証するためだ。
しかし根本的な問題は個々のメモリを削除しても解決しない。原則で解決する。あなたを最もよく知るAIは、あなたについて最も危険に間違える可能性がある。構築したプロファイルへの信頼度は、使用してきた時間に比例するからだ。その信頼は検証によって獲得されたのではない。繰り返しによって獲得された。
1つのAIに何を知っているか聞くのではない。4つに聞く。プロファイルを比較する。そして各AIが構築したあなたのバージョンがまだあなたであることを検証する。
定義
ファントムポインター:元の出所を再構築も検証もできない、AIが保存した事実。AIは事実を持っているが、それが生まれた会話へのリンクを持っていない。
圧縮プロファイル:AIが複数の会話からユーザーについて構築する要約された表現。各モデルは同じインタラクションの異なる側面を圧縮するため、同じユーザーの異なるプロファイルを生成する。
非対称的同意:ユーザーがAIに何を伝えるかを決めるが、AIがユーザーが言ったことから何を記憶するかを事前の相談なしに決める状況。