公開日 2026.07.30 / 情報確認日 2026.07.30 / 執筆・編集:テクヒカ編集部
PR 本記事には広告リンクが含まれます。広告の有無にかかわらず、Mem0・Zep・Letta・Cogneeの評価と向かないケースも明記しています。
「AIエージェント 観測ツール」で検索すると、LangSmithやArize Phoenixのような実行トレース製品がまず候補に挙がります。ただ、長期記憶を持つエージェントでは、見るべき対象がもう一つあります。前回の会話や顧客情報を、いつ、どの入力から保存し、今回の回答でなぜ呼び戻したのかという記憶の履歴です。
実行ログが正常でも、保存された記憶が誤っていれば次の回答は静かにずれます。2026年7月に公開されたMemGhost研究は、外部メールを処理しただけで偽情報が長期記憶へ入り、後の会話や行動へ残る危険を示しました。そこで本記事では、Mem0・Zep・Letta・Cogneeを、検索精度の順位ではなく、保存方式、出典、権限、削除、セルフホスト、監査のしやすさで比較します。
実行の観測は、一回の処理で使ったプロンプト、検索結果、モデル呼び出し、ツール、遅延、エラーを追うものです。仕組みはLangSmithで追える実行トレースと、Arize PhoenixによるRAGデバッグで詳しく整理しています。
一方、記憶の観測は複数回の実行をまたぎます。最低限、書き込み元、保存時刻、対象ユーザー、記憶タイプ、検索された実行、更新履歴、削除結果を追えなければなりません。「以前そう教わった」という回答が、本人の発言なのか、外部メールなのか、要約時の推測なのかを説明するためです。
| 観測する層 | 追う対象 | 代表例 |
|---|---|---|
| 実行 | 入力、検索、ツール、遅延、エラー、評価 | LangSmith、Phoenix、Langfuse |
| 記憶 | 書き込み元、保存内容、検索理由、失効、削除 | Mem0、Zep、Letta、Cognee |
Mem0は、会話から好みや事実を抽出し、ユーザー、エージェント、実行のIDに結び付けて検索するメモリー層です。セマンティック検索にmetadataフィルター、しきい値、リランキングを組み合わせられ、管理型Platformとオープンソース版があります。1件削除だけでなく、ユーザーやエージェント単位の削除へつなげやすいため、サポートBotや社内アシスタントへ短い記憶を追加したいチームの第一候補です。
ただし、APIが簡単でも書き込み根拠まで自動で安全になるわけではありません。送信元、会話ID、信頼区分、保存理由をmetadataへ残し、会社方針や実行手順は自動保存しないルールが必要です。
Zepは、人物、組織、製品などのノードと、関係・事実をエッジで持つ時間対応のContext Graphが中心です。「担当者はAさん」からBさんへ変わったとき、古い事実を消すだけでなく、有効だった期間を保持できます。顧客、契約、障害、商談のように、正しさが時間で変わる情報に向きます。
APIログ、ダッシュボードの監査ログ、RBAC・ABAC、BYOK、BYOCなど企業向けの選択肢もあります。なお、ローカルで動かせるOSSのGraphitiと管理型Zepは同一製品ではありません。Zep相当を自社VPCへ置く場合は、Enterpriseの提供条件を確認する必要があります。
Lettaは、永続メモリーだけを外付けするより、状態を持つAgentを作り、動かし、観測するランタイムに近い製品です。Memory Blockは常にコンテキストへ入り、ユーザー情報、役割、方針、作業状態をAgent自身が更新できます。方針Blockをread-onlyにする、必要な間だけBlockをattachする、といった明示的な制御ができます。
Letta AppやCLI、APIでは状態とメモリーを確認でき、RunのTrace APIではAgentのステップやツール実行を追えます。一方、共有Blockを変更・削除すると複数Agentへ影響するため、共有範囲と編集権限を先に決めないと運用事故が広がります。
Cogneeは、文書や構造化データをチャンク、要約、エンティティ、関係へ変換し、リレーショナル、ベクトル、グラフの各ストアで管理します。会話の好みを数件覚えるより、社内規程、設計書、顧客資料、コードの関係を知識化したい場合に向きます。原文と派生データの来歴を持てる点も、記憶監査との相性がよい部分です。
OSSでローカル運用でき、CloudやBYO cloudも選べます。forget操作ではデータ項目、データセット、ユーザー全体を対象にできますが、セルフホストではLLM、埋め込み、グラフDB、ベクトルDB、ファイル保管の責任が自社へ戻ります。
Mem0・Zep・Letta・Cogneeは、開発者がエージェントへ長期記憶を組み込むための基盤です。どの業務をAIへ任せ、何を長く残すかが決まっていない段階では、基盤から作るより、複数モデルを同じワークスペースで使い分けて対象業務を絞る方が先です。
以下のDoraverse案内は広告です。 Doraverse公式サイトでは、15種類以上のAIモデルをまとめて利用でき、14日間の無料トライアルはクレジットカード不要と案内されています。編集部としては、要約、資料作成、議事録などを試しながら「残す必要がある情報」と「その場で完結する作業」を分ける用途なら、記憶基盤の検討前にも接点があると判断しました。ただし、Doraverseは本記事で比較する4つのメモリー基盤には含めておらず、出典追跡やロールバックの代替として勧めるものではありません。
| 製品 | 記憶の中心 | 監査の手掛かり | 自社運用 |
|---|---|---|---|
| Mem0 | ユーザー単位の事実・好み | metadata、履歴、分析、削除API | OSSあり |
| Zep | 時系列の事実・関係 | API/監査ログ、権限、時間情報 | Graphiti OSS/Zep BYOC |
| Letta | Agentが編集する状態 | App/CLI、State、Trace、Evals | App Serverあり |
| Cognee | 文書由来のベクトル+グラフ | 来歴、Dataset、Graph | OSS/BYO cloud |
検索精度は、元データ、分割、埋め込み、再ランキング、質問の種類で変わります。各社ベンチマークを順位表にするより、①保存元を追えるか、②信頼度で検索対象を絞れるか、③書き換え履歴が残るか、④ユーザー単位で消せるか、⑤派生データまで削除できるか、⑥事故時にロールバックできるかを確認する方が実務的です。
2026年7月公開のプレプリント「When Claws Remember but Do Not Tell」は、外部から届いた1通のメールを個人AIエージェントが処理すると、攻撃者がメモリーDBへ直接触らなくても、偽の事実や好みが永続メモリーへ入り、後の会話や行動へ影響するstealth memory injectionを検証しました。研究チームは108ケースのWhisperBenchと、1回の送信で攻撃文を作るMemGhostを提案しています。
保留した56ケースでは、OpenClawとGPT-5.4で87.5%、Claude Code SDKとSonnet 4.6で71.4%のエンドツーエンド成功率が報告され、ファイル型だけでなくベクトル型のMem0への転移も示されました。ただし、4製品すべてに同じ脆弱性と成功率が確認されたわけではありません。問題の中心は、未信頼入力を読み、モデル判断で長期記憶へ書き、後で信頼済み情報として検索する構造です。
別の研究は、明示的な保存命令だけでなく、自動保存、コンテキスト圧縮時の保存、経験から手順を作る保存も攻撃面になると整理しています。メール本文に「覚えて」と書かれていなくても、要約や学習処理を通じて情報が昇格する可能性があります。
メール、Web、添付ファイル、CRMの自由記述は未信頼データとして扱い、読んだだけでは長期記憶へ書きません。通常は「保存候補」へ送り、会社方針、実行手順、送金先、権限情報は人または別サービスの承認を必要とします。
ユーザーの好み、確認済みの業務事実、作業履歴、実行手順は同じnamespaceへ入れません。Lettaなら方針Blockをread-onlyにし、他製品でも高リスク情報は別ストアと別権限で管理します。
source_type、source_id、sender、created_at、tenant_id、trust_level、content_hashを残します。「顧客が言った」ではなく「メールID XをAgent Yが要約した」と追える粒度です。検索時も、送金や外部送信では外部メール由来の記憶を除外するなど、関連度と信頼度を分けます。
どの入力が記憶を書き、どの実行で呼び出され、どのツール操作へつながったかを一続きで記録します。記憶ツールのログとLangSmithやPhoenixのトレースを結ぶことで、「回答が変だった」から記憶IDまで遡れます。
テスト用の偽記憶を保存し、検索で出ることを確認した後、削除してベクトル、グラフ、要約から消えるかを検査します。異常時は自動書き込みと高リスクツールを止め、対象期間を隔離し、派生データを含めて削除・再構築します。事故当日に初めて削除APIを触る運用は避けるべきです。
4製品は課金単位が違うため、月額だけを横並びにすると判断を誤ります。Mem0はaddとretrieval、Zepは投入するEpisodeのサイズ、Lettaはプラン・稼働Agent・ツール実行・LLM利用、Cognee Cloudは処理トークン量が中心です。
本番費用を見積もるときは、1会話から作る記憶候補数、検索回数、再処理、削除、監査ログの保存期間まで含めます。無料枠で動く試作品と、細かな権限や監査ログが必要な本番環境は別物です。上記は2026年7月30日に各社公式料金ページで確認した値で、月払いと年払い、管理型とセルフホストの費用を分けて記載しています。
年に数回しか使わない業務、毎回正本データを取得できる業務、誤記憶が送金・人事・法務判断へ直結する業務では、永続メモリーを入れない選択も有力です。必要な資料を都度RAGで取得し、セッション終了後に状態を捨てる方が説明しやすい場合があります。
同じではありません。LangSmithやPhoenixは一回の実行を追う観測が中心で、Mem0・Zep・Letta・Cogneeはセッションをまたぐ記憶を作る側です。本番では両者を相関IDで結びます。
いいえ。研究ではMem0への転移が示されましたが、本質は特定製品ではなく、未信頼入力をAgent判断で長期記憶へ書き、後から信頼済み状態として検索する構造です。Zep・Letta・Cogneeが同じ成功率で攻撃されたという結果ではありません。
短いユーザー事実を素早く追加するならMem0、事実の変更時期や関係をグラフで持ちたいならZepが分かりやすい分岐です。監査ログ、権限、自社VPC配置が必要なら対象プランも確認してください。
保存先を管理できる点では有効ですが、それだけでは対策になりません。外部メールやWebを読み、自動で長期記憶へ書くなら、社内環境にも汚染経路が残ります。書き込み承認、出典、検索時の信頼フィルター、停止・削除手順が必要です。
機能、料金、制限と研究結果は、以下の一次資料を2026年7月30日に確認しました。
個人の作業履歴をファイルとして管理する方法はObsidianとCodexで長期記憶を作る方法も参考になります。製品型メモリーでも、正本データ、保存期限、削除責任者を先に決める考え方は共通です。