AIの推論を自動化へ昇格させるループの穴
AIの判断を決定的な自動化へ昇格させるループを実装したところ、「昇格すべきだと気づく」側の判定器が、8つのすり抜け型のうち6つで沈黙していました。対照実験の終了コードと監査スクリプトの実出力で記録します。
読み込み中...
12 件の記事が見つかりました
AIの判断を決定的な自動化へ昇格させるループを実装したところ、「昇格すべきだと気づく」側の判定器が、8つのすり抜け型のうち6つで沈黙していました。対照実験の終了コードと監査スクリプトの実出力で記録します。
AIエージェントに危険なコマンド名を列挙して禁じても、被害範囲は狭まりません。このリポジトリのdeny 19件を数え、危険コマンドを止めていたはずのフックが本番のpayload形状では1件も止めていなかった実測を、修正前後の対照とコマンドつきで記録しました。
モデルが賢くなればSkillやAGENTS.mdは削れる、という前提を自リポジトリの全履歴で検証しました。結果は変更があった9か月すべてで増加、追加417ファイルに対し実質削除5件。削る判断が一度も行われていないという負債の形と、参照エッジ・二面検証という削除基準を、そのまま動くスクリプトと終了コードで示します。
CIが緑でも、そのガードが一度も発火していないことがあります。本ブログのリポジトリで見つかった7種類の「効かないガード」をPR番号つきで分類し、壊した入力を1回通す二面検証の手順と、その検証自体が摩耗していく実測(検出分岐9個のうちテストは4個)を、コマンドと終了コードで示します。
Issue Triage Agentにcloseを任せると誤クローズが怖い。このリポジトリの39 issue・close判断36件をリプレイし、PRリンクという最強の証拠でも2件を誤closeしていた実測と、証拠収集(Researcher)と判定(Judge)を分ける設計をコマンドつきで記録しました。
LLM 本番運用で必要なガードレールを、input validation・output filtering・prompt injection 対策の3レイヤーで設計する。NLP2026 の議論とOWASP LLM Top10 を参照した2026年版の実装パターン。
MCPのallowlist粒度・scope命名・組織導入の3点を判断軸で整理する。既存のMCP分離アーキ記事と合わせて読むと効果が高い。MCP権限の本丸は「allowlistの粒度」と「scope命名」の2つ
Claude Code hooks を品質担保・監査・安全制御の3用途で使い分け、ライフサイクルとCI責務分担で配置を決めるための実装パターンと失敗回避策を整理する。Claude Code hooks の用途は「品質担保」「監査」「安全制御」の3つ
AIコーディングエージェント導入で増える攻撃面を、権限・流出検知・実行時制御・設計判断の4層モデルで整理し、優先順位の判断軸を提示する。AIコーディングエージェント導入で増える攻撃面は「権限」「流出」「実行時」「設計判断」の4層に分解できる
AIエージェントが無理に処理を続けず、人間へ正しくエスカレーションするための条件設計と運用ルールを整理する。エスカレーション判定ロジックと実装例を具体的に解説。設計テンプレートと実装コード付きで解説。
AIを相棒からチームへ進化させる運用モデルを、Lead・Implementer・Critic・Scribeの4役割とガードレールで体系的に整理する。1体のAIに全部任せると、判断責任が曖昧になって破綻しやすい
Model Context Protocol(MCP)でAIワーカーのツール連携を標準化。属人プロンプトから脱出し、許可ツールを固定して禁止領域アクセスを0に近づける実践ガイド。こんにちは、みねです。