核心戦略:コンテキストを有効性と再利用性に基づいて層別に保存
核心思想:コンテキストを時間的有効性と再利用性に応じて層別に保存(短期・中期・長期記憶)し、現在のタスクに無関係な情報の干渉を防ぎます。
短期記憶(Short-term Memory):
セッション内の一時的な状態(例:現在のツール呼び出し結果)で、セッション終了時に消去されます。
中期記憶(Medium-term Memory):
セッションを跨ぐ最近の情報(例:30日以内のユーザー操作履歴)で、定期的にクリーンアップされます。
長期記憶(Long-term Memory):
永続的な重要情報(例:ユーザーID、メンバーシップレベル)です。
作用:コンテキストの干渉(Context Distraction)を減少させ、初期の無関係な詳細が核心情報を希釈するのを防ぎます。
核心手法:トークン消費を減らすための要約、剪定、構造化変換
核心方法:要約、剪定、構造化変換を通じてトークン消費を削減し、コンテキストオーバーフロー(Context Overflow)を防ぎます。
要約(Summarization):
LLMまたは軽量モデル(例:GPT-4o-mini)を使用して長文を圧縮します(例:10回の対話 → 300トークン)。
剪定(Pruning):
冗長な内容(例:礼儀的な言葉、既に解決したエラー)を削除します。
構造化変換:
ツールから返されるJSON/CSVを自然言語+重要フィールドに変換します(例:{"status":"shipped"} → "注文は発送済みです")。
效果:ウィンドウ爆発問題を解決し、APIコストと遅延を削減します。
動的なコンテキスト選別:リクエストタイプとシナリオに基づいて最も関連性の高いコンテキストを選択
リクエストタイプルーティング:例えばユーザーが「年次有給休暇残高」を尋ねた場合 → OAツールAPIとユーザーID情報のみを呼び出します。
情報優先度ルーティング:
関連性+時間的有効性+重要性の評価関数に基づいて高価値コンテンツを保持します(評価≥0.5)。
シナリオ別ルーティング:
ECシナリオではOAコンテキストをフィルタリングし、ツールの混乱(Context Clash)を防ぎます。
技術実装:
ルールエンジン + LLM意図認識(例:GPT-4o-miniが曖昧なリクエストを認識)。
作用:無関係な情報の汚染を防ぎ、関連性の高いコンテキストのみを選択的に使用します。
マルチエージェントアーキテクチャ:サブタスクを処理するサブエージェントを通じて長いコンテキストの干渉を防ぐ
サブエージェント構成:
サブエージェントがサブタスクを処理し、メインエージェントには圧縮された結論のみを渡します。これにより長いコンテキストの干渉を防ぎます。
例:Leadエージェントはサブエージェントの要約を受け取り、元の観測データではありません。
サンドボックス機構:
ツール呼び出しは隔離環境で実行され、エラー結果が直接メインコンテキストを汚染することはありません。
作用:コンテキストの汚染(Context Poisoning)と衝突(Context Clash)を防ぎます。
エラー情報の保持:構造化されたエラーをコンテキストに挿入し、LLMが自己修正するのを支援
エラー情報保持:形式化されたエラー(例:スタックトレース)をコンテキストに挿入し、LLMが後続の操作を調整するのを支援します。
例:ツール呼び出しが失敗した後、LLMはエラー情報に基づいて後続の操作を調整します。
再試行制限:
再試行カウンターを設定します(例:最大3回)、無限ループを防ぎます。
重要点:エラーは構造化して提示する必要があります(例:[ERROR]とマーク)、元のノイズがモデルを混乱させないようにします。
動的なトークン配分とコンテキスト価値の定量化
ウィンドウ予算アルゴリズム:
トークン割り当てを動的に配分します(例:GPT-4oの32Kウィンドウ:System層512トークン、User層10K)。
評価関数:
コンテキスト価値を定量化します。式の例:
評価 = 0.4×関連性 + 0.3×時間的有効性 + 0.2×重要性 + 0.1×パーソナライズ
低評価フィルタ:
評価≥0.5のコンテキストスライスのみを保持します。
作用:トークン使用を最適化し、最も価値のあるコンテキストにリソースを集中させます。
避けるべき一般的な誤りとその対策
誤り4(時間的有効性の無視):
コンテキストにTTL(有効期限)を設定します(例:プロモーション情報は24時間生存)、定期的に期限切れデータをクリーンアップします。
誤り5(セキュリティの欠如):
機密情報(例:身分証番号)は暗号化して保存し、権限に基づいてコンテキストをフィルタリングします。
誤り6(品質監視の欠如):
コンテキストの評価分布、圧縮率を監視し、低品質コンテンツ(評価<0.3)をブロックします。
コンテキストエンジニアリングは、分層、圧縮、ルーティング、隔離という4つの中核戦略を通じて、エラーの構造化挿入と動的評価メカニズムを組み合わせることで、長いコンテキストによって引き起こされるパフォーマンス低下、コスト急増、システムクラッシュなどの致命的なエラーを体系的に回避します。
重要なポイント:LLMが高価値情報のみを処理するように、コンテキストの情報密度と関連性を知的に管理することで、エージェントの堅牢性(Robustness)を確実に向上させます。