AIエージェントのOperational Memory設計
会話履歴の memory では長期運用が回りません。同じリポジトリの知識ストア3つを schema / provenance / expiry / rollback の4軸で実測し、機械が読む列は100%埋まる一方、last_verified は31件中3件しか生きていなかった記録です。測り方も置きます。
読み込み中...
9 件の記事が見つかりました
会話履歴の memory では長期運用が回りません。同じリポジトリの知識ストア3つを schema / provenance / expiry / rollback の4軸で実測し、機械が読む列は100%埋まる一方、last_verified は31件中3件しか生きていなかった記録です。測り方も置きます。
生成行数やトークン量のような累積カウンタ型のKPIは定義上単調で、悪化を表現できません。自リポジトリのgit履歴で確かめたところ、判定を確定できた15対象のうち12が一度も純減していませんでした。検証済み成果の側に分母を与える手順と、比率にした途端に桁が変わる罠を記録します。
AIの判断を決定的な自動化へ昇格させるループを実装したところ、「昇格すべきだと気づく」側の判定器が、8つのすり抜け型のうち6つで沈黙していました。対照実験の終了コードと監査スクリプトの実出力で記録します。
モデルが賢くなればSkillやAGENTS.mdは削れる、という前提を自リポジトリの全履歴で検証しました。結果は変更があった9か月すべてで増加、追加417ファイルに対し実質削除5件。削る判断が一度も行われていないという負債の形と、参照エッジ・二面検証という削除基準を、そのまま動くスクリプトと終了コードで示します。
Coding Agent のモデルが更新・廃止されたとき、プロンプト資産と自動化を壊さずに移行する運用設計を解説します。モデル依存の3層棚卸し、Model Matrix、回帰テストの検知率を mutation で実測した自リポジトリのデータ(13変異中8検知)まで。AI Platform / Tech Lead 向け。
AIエージェント開発をチャット指示の延長で終わらせず、仕様・権限・テスト・運用の4層で設計するための保存版ガイド。Claude Code、Codex、MCP、SDDを導入する前に決めるべき順序を整理する。
夜間呼び出しでチームが疲弊し、SRE・EM が離職リスクを抱えるチーム向けに、オンコール疲弊を改善する運用設計を症状診断・根本原因・段階的対策(ローテ・アラートチューニング・AI triage・体制)の 4 ステップで整理する。
AIエージェント運用で障害や想定外の出力が起きたとき、人間が迷わず止めて戻して再開するための Runbook 設計を整理する。AIエージェントを本番環境で動かし始めると、想定外の出力やループ暴走、外部API障害など「止めなければいけない瞬間」が必
AIエージェントが無理に処理を続けず、人間へ正しくエスカレーションするための条件設計と運用ルールを整理する。エスカレーション判定ロジックと実装例を具体的に解説。設計テンプレートと実装コード付きで解説。