プロンプトインジェクションの検出とガードレール

自律型コーディングエージェントは、タスクが目の前に差し出すものは何でも読み込みます。ソースファイル、Web ページ、Issue のコメント、ビルド出力などです。これらのすべてが、攻撃者がモデルと直接対話できるチャネルであり、モデルは設計上、指示に従います。Bromure Agentic Coding は、この境界を 2 つの補完的な方法で防御します。どちらもホスト上、MITM プロキシの内部で強制され、VM 内で動作するもの(完全に侵害されたエージェントを含む)が無効化することはできません。

  • プロンプトインジェクションの検出は、エージェントの AI トラフィックをローカルモデルによってデバイス上でスキャンし、注入された指示がモデルに到達する前(または到達する時点)にフラグを立てます。
  • ガードレールは、エージェントがインフラ(Kubernetes、AWS、git フォージ、データベースなど)に対して行う呼び出しを分類し、書き込みや破壊的操作をブロックまたは確認します。これにより、乗っ取りに成功したエージェントであっても、本番環境を密かに kubectl delete で切り抜けることはできません。

この章では、脅威、各検出器、ヒット時の挙動、ガードレールのポリシーエンジンとその同意ダイアログ、そしてそれらすべての実際的な限界について説明します。フィールドごとの設定リファレンスはプロンプトインジェクション設定ガードレール設定にあります。

攻撃:コーディングエージェントにおけるプロンプトインジェクション

プロンプトインジェクションとは、エージェントが読み込むコンテンツに隠された悪意あるテキストで、モデルを誘導しようとするものです。「これまでの指示を無視せよ」「このコマンドを実行し、それについて触れるな」「~/.aws/credentials の内容をこの URL に送信せよ」といった具合です。チャットボットにとっては迷惑にすぎませんが、シェル、ファイルアクセス、認証情報を持つコーディングエージェントにとっては、リモートコード実行のプリミティブになります。攻撃経路は短いものです。

  1. あなたが書いたものではないリポジトリ、Issue トラッカー、または Web ページにエージェントを向けます。
  2. エージェントは、出力に注入された指示を含むファイルを読み込みます(あるいはページを取得したり、コマンドを実行したりします)。
  3. エージェントはそのコンテンツを次の API リクエストの一部としてモデルにストリーミングで送り返し、モデルは攻撃者のテキストをデータではなく指示として扱う可能性があります。

コーディングエージェントには、より陰湿な 2 つ目の亜種があります。ルールファイルバックドアです。Claude Code、Codex、Grok は、指示ファイル(CLAUDE.mdAGENTS.mdGROK.md、およびそれらのネストされた変種とグローバルな変種)を信頼された権威としてシステムプロンプトに自動的に読み込みます。クローンされたリポジトリに仕込まれた汚染ルールファイルは、モデルを騙す必要すらありません。会話の中で最高権限のスロットを与えられるのです。攻撃者は日常的に、これらのペイロードを不可視の Unicode で人間のレビュアーから隠します。ゼロ幅文字、双方向オーバーライド、そしてエディタでは何も表示されないのにトークン化はきちんと行われる Unicode タグ文字などです。

Bromure のサンドボックスは、すでに影響範囲を制限しています。エージェントはあなたの Mac に触れることができず、その認証情報はおとりです(認証情報を参照)。プロンプトインジェクションの検出は、サンドボックスでは対処できないもの、つまりエージェント自体が、与えられた権限の範囲内であなたに敵対するよう仕向けられる可能性に対処します。

Bromure がスキャンする対象

検出はホスト側のプロキシで、エージェントの外向き AI トラフィック、つまりエージェントが Anthropic、OpenAI、またはその他のモデルホストに送信するリクエストに対して実行されます。プロキシはリクエスト全体を見るため、どのエージェントが生成したものであるかにかかわらず、モデルに何が伝えられようとしているのかを正確に検査できます。2 つの異なる面が、それぞれ専用の検出器によってスキャンされます。

対象面含まれるもの検出器
tool_result スパンエージェントが毎ターン取り込んでモデルに送り返す、信頼できない外部コンテンツ:ファイルの内容、Web ページ、Issue および PR の本文、コマンド出力ソースコード検出器(PromptGuard)
エージェントの権威コンテキストシステムプロンプトに埋め込まれた自動読み込みの指示ファイル(CLAUDE.mdAGENTS.mdGROK.md など)ルールファイル検出器(ヒューリスティックスキャナ + ModernBERT)

すべてはデバイス上で行われます。分類器は、Mac 上で ONNX Runtime を介して動作するローカルの ONNX モデルです。スキャンのためにクラウドサービスへコンテンツが送信されることはなく、管理対象外のインストールでは検出データが一切マシンから出ることはありません(管理対象のインストールでは、検出を組織に転送できます。検出器が発火するときのメモを参照)。

ワークスペースを編集ウィンドウのプロンプトインジェクションペイン。2 つの検出器トグルと、無効化された「インジェクションが検出されたとき」ラジオグループが表示されている

どちらの検出器も、ワークスペースを編集ウィンドウのプロンプトインジェクションペイン(サイドバーの赤い警告三角アイコン)にあるワークスペースごとのトグルです。どちらもデフォルトでオフです。各検出器は、最初に有効化する際にかなりのモデルダウンロードを必要とします。

検出器

ソースコード検出器(PromptGuard)

ソースコード内のプロンプトインジェクションを検出は、エージェントが取り込む tool_result コンテンツ(ファイルの内容、Web ページ、Issue および PR の本文、コマンド出力)を、ローカルの PromptGuard シーケンス分類モデル(DeBERTa ファミリー、ONNX)でスコアリングします。これは典型的なケースを捕捉するために作られています。不正なリポジトリに仕込まれ、エージェントが読み込むのを待っている「これまでの指示を無視せよ / シークレットを流出させよ」というテキストです。

スキャンの仕組み:

  • 毎ターン、tool_result を運ぶ最新のメッセージのみがスキャンされます。エージェントはリクエストごとに会話履歴全体を再送信しますが、それを再スキャンしてもコストが増えるだけで利益はないため、すでに確認済みの履歴はスキップされます。
  • スパンごとに、最大 16 KB のコンテンツが、それぞれ 1,536 文字の最大 8 ウィンドウでスキャンされます。ウィンドウ全体での最大インジェクション確率がスパンのスコアであり、スコアがしきい値(デフォルト 0.5)に達したときにスパンにフラグが立てられます。
  • 判定はコンテンツブロブごとにキャッシュされ(512 エントリ)、エージェントが再読み込みするファイル、または履歴内で再送信された同一スパンは、2 回目には何のコストもかかりません。

モデルの動作パラメータ(最大シーケンス長 512 トークン、インジェクションラベルインデックス 1、しきい値 0.5)は、モデルフォルダにオプションの bromure-injection.json を配置することで上書きできます。モデルのダウンロードと保存を参照してください。

ルールファイル検出器(ヒューリスティックスキャナ + ModernBERT)

CLAUDE.md ファイルなどに含まれる不正な指示を検出は、ルールファイルバックドアを対象とします。これは指示ファイルをシステムプロンプトから抽出し(Claude Code の Contents of <path> (… instructions …): ラッパーおよび周知のルールファイル名にマッチさせて)、それらに対して2 つのパスを実行します。

  1. 決定論的なヒューリスティックスキャナ(依存関係なし。モデルがダウンロードされる前でも動作しますが、トグルは両方のパスをまとめて制御します)。以下にフラグを立てます。
    • システムプロンプトのどこかにある隠し Unicode シグナル:Unicode タグ文字(U+E0000–E007F)、双方向オーバーライド、ゼロ幅文字またはソフトハイフン文字。すべて高深刻度です。指示ファイルにこれらが存在する正当な理由は基本的にありません。
    • 抽出された指示ファイルスパン内のメタ指示パターン:「これまでの指示を無視せよ」「ユーザーに伝えるな」「あなたは今…」「新しい指示:」など、高深刻度です。
    • 機能および流出のキーワード:認証情報ファイルのパス(~/.ssh.aws/credentials など)、.env への参照、curl のパイプからシェルへの構造、base64 とパイプの組み合わせ、rm -rf、強制プッシュ、URL への送信パターンなど、中深刻度で「レビュー」の検出結果としてのみ記録されます。
  2. ファインチューニングされた ModernBERT ONNX 分類器claudemd-guard)が、同じ指示ファイル本文に対して意味的なパスを実行し、固定パターンにマッチしない不正な指示を捕捉します。

検出結果はセッションごとにコンテンツハッシュで重複排除されるため、変更のない CLAUDE.md は 1 回だけ記録され、セッションの存続期間中、毎ターン記録されることはありません。

メモ: 確認およびブロックの強制モードでは、高深刻度のヒューリスティック検出結果(またはモデルの判定)のみが一時停止またはブロックをトリガーします。中深刻度の「レビュー」検出結果はログのみで、管理対象のインストールであっても bromure.io に転送されることはありません。

モデルのダウンロードと保存

検出器モデルがアプリに同梱されることはありません。数百メガバイトのダウンロードであり、トグルを最初に有効化したときに https://dl.bromure.io/llms/<model-dir>/<file> から検出器ごとに取得されます。

検出器モデルフォルダファイルサイズ
ソースコード(PromptGuard)~/Library/Application Support/BromureAC/Models/prompt-injection/model.onnxtokenizer.jsontokenizer_config.jsonspecial_tokens_map.json、オプションの bromure-injection.json約 298 MB
ルールファイル(ModernBERT)~/Library/Application Support/BromureAC/Models/claudemd-guard/model.onnxtokenizer.jsontokenizer_config.jsonconfig.json約 603 MB

ダウンロードのフロー:

  1. 検出器のトグルをオンにします。確認アラート <detector> 検出器モデルをダウンロードしますか? がサイズを表示します。「これは bromure.io から約 <size> をダウンロードし、およそ同量のディスク容量を使用します。ダウンロードが完了すると検出器が動作を開始します。」
  2. ダウンロードをクリックします。モデルをダウンロード中の進行状況ウィンドウがパーセンテージとキャンセルボタンを表示します。
  3. ダウンロード中にキャンセルした場合、アラートを拒否した場合、またはダウンロードに失敗した場合は、トグルが元に戻ります。モデルのない検出器は静かな無操作であり、Bromure はそうでないふりをしません。

いくつかの安全策により、ダウンロードは堅牢になっています。

  • 空きディスクの事前チェック。 失敗が確実なダウンロードは、重大なアラート プロンプトインジェクションモデルをダウンロードするのにディスク容量が不足しています とともに事前に拒否されます。
  • 最小サイズの下限。 各ファイルにはサイズの下限があるため、途中で切れたダウンロードや model.onnx として保存された HTML エラーページは、検出器を静かに無効化するのではなく、明確に失敗します。
  • アトミックかつ再開可能。 ダウンロードはファイルごとにアトミックであり、再試行時にはすでに存在し有効なファイルはスキップされます。同一モデルの同時ダウンロードは重複排除されます。
  • 自動リカバリ。 ワークスペースで検出器が有効になっているのにアプリ起動時やプロファイル保存後にそのモデルが見当たらない場合、バックグラウンドダウンロードが自動的に開始されます。進行状況と結果はセキュリティログに記録されます。

モデルを削除するには、~/Library/Application Support/BromureAC/Models/ 下のそのフォルダを削除します。モデルフォルダに配置されたオプションの bromure-injection.json は、その検出器の maxLengthinjectionLabelIndexthreshold を上書きします。

メモ: ペインのキャプションは、やや小さく丸めた数値(約 272 MB と約 571 MB)を引用しています。確認ダイアログは、実際のバイト総量からサイズ(約 298 MB と約 603 MB)を計算します。ダイアログを信頼してください。

検出器が発火するとき:ログ、確認、またはブロック

両方の検出器に、共有された 1 つのワークスペースごとの応答(プロンプトインジェクションペインの インジェクションが検出されたとき ラジオグループ)が適用されます。このグループは、少なくとも 1 つの検出器が有効になるまで無効化されています。

モード挙動
ログに記録して続行(デフォルト)検出がセキュリティログに記録され(管理対象のインストールでは bromure.io に転送され)、リクエストは続行されます。スキャンはレスポンスが中継されたに行われるため、このモードはゼロレイテンシです。
どうするか確認する外向きリクエストは AI ホストに 1 バイトも届く前に一時停止され、ダイアログがフラグの立ったテキストを表示して判断を求めます。
一方的にブロックするリクエストは即座に拒否されます。モデルが汚染されたコンテンツを目にすることはありません。

確認ダイアログ

どうするか確認する モードでは、"<workspace>" で <detector> の可能性 というタイトルの重大なダイアログが、フラグの立ったテキストをスクロール可能な等幅テキスト領域に表示し、本文には「Bromure は、エージェントがモデルに送信しようとしているコンテンツ(<source> から)にフラグを立てました。以下を確認してください。通過させますか、それともこのリクエストをブロックしますか?」と表示されます。ボタンは このリクエストをブロックこのリクエストを許可 です。

あなたの判断はワークスペース、ソース、コンテンツごとにアプリの実行中は記憶されるため、同じフラグの立ったテキストが毎ターン再確認されることはありません。エージェントは絶えず履歴を再送信するため、この記憶がなければ、1 つのフラグの立ったファイルが以降のすべてのリクエストを中断させてしまいます。この記憶はメモリ内のみで、アプリの再起動後は残りません。

ワークスペースが SSH または CLI 経由でヘッドレスに駆動されている場合、同じ質問がワークスペースの tmux 内にテキストプロンプトとして表示されます。明示的な このリクエストを許可 のみが通過を許可し、無回答はブロックを意味します。リモートアクセスを参照してください。

リクエストがブロックされたときにエージェントが見るもの

一方的にブロックする モードで、または確認ダイアログに このリクエストをブロック で応答した場合、エージェントは HTTP 451 Unavailable For Legal Reasons を次の本文とともに受け取ります。

Bromure blocked this request: possible <detector> detected in <source>.

モデルが汚染されたコンテンツを受け取ることはありません。エージェントは、あなたに報告できるクリーンで説明可能な失敗を目にします。解決された結果(「許可」または「ブロック」)はセキュリティログに記録され、管理対象のインストールではクラウドイベントとして転送されます。

メモ: bromure.io に登録された Mac では、各検出は prompt_injection.detection イベントとして転送され、検出器、メソッド、アクション、ホスト、ソース、スコア、ヒューリスティックシグナル、そして(ローカルログの 160 文字プレビューとは異なり)フラグの立ったスニペット全体を、20 KB を上限として運びます。これらのイベントはワークスペースの プライベートモード トグルによって抑制され、管理対象外のインストールでは決して送信されません。トレースと監査およびエンタープライズを参照してください。

検出を監視する:セキュリティログ

検出、ルールファイルの検出結果、モデルのダウンロード進行状況、および強制結果はすべて、セキュリティログウィンドウに表示されます。ウィンドウセキュリティログ… で開きます。インジェクションの行は次のように表示されます。

[prompt-injection] source FLAG score=0.973 toolUse=… preview="…"
[prompt-injection] rules FLAG source=/path/CLAUDE.md signals=[zero_width(high)]
[prompt-injection] blocked: rogue instructions in /path/CLAUDE.md → api.anthropic.com

1 つ目の形式はソースコード検出器(モデルのスコアと短いプレビュー付き)、2 つ目はルールファイル検出器(ファイルパスと発火したヒューリスティックシグナル付きで、それぞれに深刻度がタグ付けされる)、3 つ目は強制結果を記録します。ローカルログの行は、フラグの立ったコンテンツの 160 文字プレビューのみを運びます。全文は確認ダイアログ(および、管理対象のインストールではクラウドイベント)にのみ表示されます。

ウィンドウ自体(直近の約 5,000 行のメモリ内リングで、stderr にミラーされ、フィルタリングと自動スクロールを備える)は、これを共有するサプライチェーン保護で詳しく説明されています。

ガードレール

プロンプトインジェクションの検出は乗っ取りを捕捉しようとします。ガードレールは、乗っ取られた(あるいは単に過度に熱心な)エージェントができることを制限します。これはワークスペースごとの、ホストで強制されるポリシーエンジンで、エージェントがガードされたプロトコルに対して行うすべての API 呼び出しを、読み取り書き込み、または破壊的操作として分類し、そのリソースに対するワークスペースのモードを適用します。ペインの説明によれば、ガードレールはこのエージェントが話すプロトコルから破壊的操作を除去します。これはホスト上(プロキシ内部)で強制されるため、VM 内の不正動作または侵害されたエージェントがこれを回避することはできず、ブロックされた呼び出しはエージェントが目にするハードエラーを返します。

ワークスペースを編集ウィンドウのガードレールペイン。Kubernetes、AWS、DigitalOcean、Docker レジストリ、GitHub のリソースごとのモードピッカーがあり、それぞれがオフに設定され、スコープを説明するキャプションが付いている

4 つのモード

ガードされる各リソースには、独自のモードピッカーがあります。

モード読み取り書き込み(作成/更新)破壊的(削除/ドロップ/終了)
オフ通過通過通過
書き込み前に確認通過書き込みごとにホスト同意ダイアログホスト同意ダイアログ
破壊的操作をブロック通過通過ブロック
読み取り専用通過ブロックブロック

新しいワークスペースは、すべてのリソースでデフォルトが 書き込み前に確認 です。ガードレールが存在する前に作成されたワークスペース(またはフィールドを省略した JSON のプロファイル)は、オフ としてデコードされます。

ガードされるリソース

ガードレールは、コーディングエージェントが最も一般的に話すインフラプロトコルをカバーします。要約すると(プロトコルごとの完全な分類ルール(HTTP 動詞、AWS アクション名のプレフィックス、SQL キーワードの解析)はガードレール設定に一覧化されています):

  • Kubernetes — ワークスペースの kubeconfig からの API サーバー。DELETE は破壊的、GET/HEAD/OPTIONS は読み取り、その他の動詞は書き込みです。ブロックされた呼び出しは、kubectl がきれいに表示する Kubernetes Status 403 JSON を返します。
  • AWS — すべての *.amazonaws.com ホスト。アクション名(X-Amz-Target ヘッダーまたは Action= フォームパラメータから)がプレフィックスで分類されます。Delete*Terminate*Remove*Purge*Destroy*Deregister*Revoke* は破壊的、Get*List*Describe* などは読み取りで、S3 および REST スタイルのリクエストには HTTP メソッドのフォールバックがあります。ブロックされた呼び出しは AccessDeniedException の本文を返します。
  • DigitalOceanapi.digitalocean.com および *.digitalocean.com。HTTP メソッドで分類されます。
  • Docker レジストリ認証情報の下で構成されたレジストリに加え、Docker Hub。プルは読み取り、プッシュは書き込み、DELETE は破壊的です。ブロックされた呼び出しはレジストリスタイルの DENIED 本文を返します。
  • GitHub / GitLab / Bitbucket — REST API に加え、HTTPS 経由の git。git pushgit-receive-pack)は書き込みとしてカウントされ(読み取り専用 ではブロック、書き込み前に確認 では確認)、git fetchgit-upload-pack)は常に読み取りです。
  • HTTPS データベース — 認証情報の下で構成されたエンドポイントごとに 1 行:MongoDB Atlas Data API(find/aggregate は読み取り、insert/update/replace は書き込み、deleteOne/deleteMany は破壊的)、ClickHouse(SQL の先頭キーワードで分類)、Elasticsearch(_search およびその他のクエリエンドポイントは POST 経由でも読み取り、DELETE_delete_by_query は破壊的)。

Kubernetes および Docker のガードは、ワークスペースの kubeconfig と構成されたレジストリから導かれるホストにのみ適用され、データベースのガードには認証情報の下でエンドポイントのホストが設定されている必要があります。スコープ対象が何もないガードは何もフィルタリングせず、その場合はペインがインラインで警告します。

書き込み前に確認:同意ブローカー

書き込み前に確認 モードでは、読み取りは静かに通過し、すべての書き込みは ワークスペース "<name>" からの "<scope>" への書き込みを許可しますか? というタイトルのホストダイアログのために一時停止します。本文には正確な操作がそのまま表示され(データベース呼び出しにはリテラルな SQL 文、REST 呼び出しには METHOD /path)、実際に実行されるものを、言い換えではなく承認できます。4 つの選択肢があります。

ボタン効果
15 分間許可(デフォルト)スコープを 15 分間付与します。
1 回だけ許可この 1 回の書き込みを通過させ、意図的に付与を作成しません。次の書き込みは再度確認されます。おしゃべりなエージェントを書き込みごとに監査するのに便利です。
セッションの残りの間許可セッションの終了までスコープを付与します。
許可しないエージェントは、ブロックモードが生成するのと同じハードな 403 を受け取ります。拒否は 60 秒間記憶されるため、同じ書き込みをループで再試行するエージェントが毎秒再確認することはありません。

付与はワークスペースごとおよびプロトコルスコープごとにスコープ化されます。1 つの Kubernetes API ホスト、AWS 全体、1 つの Docker レジストリ、各 git フォージ全体、1 つのデータベースホストです。あるホストで ClickHouse の書き込みを許可しても、他の場所には何も付与されません。同時に発生する同一の書き込みは、アラートを積み重ねるのではなく、単一のダイアログに集約されます。すべての判断はメモリ内のみです。セッションスコープの付与は(セッションに関する他のすべてと同様に)終了時に消去されます。

ヘッドレスな SSH/CLI 駆動のワークスペースでは、同じ 4 つの選択肢が tmux テキストプロンプトとして提供されます。無回答は拒否を意味します。

メモ: ガードレールの書き込み付与は、どのウィンドウにも一覧されません。認証情報の承認 ウィンドウ(ウィンドウ認証情報の承認…)は、認証情報の同意判断のみを表示します。ガードレールの付与は独自の時計、またはセッションの終了時に失効し、現在それを早期に取り消す UI はありません。

エージェントが見るもの

ブロックされた呼び出しは、プロトコルに適した 403 スタイルのエラー本文(Kubernetes の Status JSON、AWS の AccessDeniedException、レジストリの DENIED ペイロード)を返し、そのメッセージは「blocked by Bromure Guardrails」で終わります。エージェントは、ハングした接続ではなく、報告でき、多くの場合は回避できる、クリーンで通常の API 失敗を受け取ります。プロンプトインジェクションのブロックは HTTP 451 を使用し、サプライチェーンのブロックは独自の本文プレフィックス付きの HTTP 451 を使用するため、3 つのシステムはログとエージェント出力で一目で区別できます。

パフォーマンスとリソース使用

  • ログモードは無料です。 ログに記録して続行 では、スキャンはレスポンスがすでにエージェントに中継された後に実行されます。検出はエージェントループにゼロレイテンシを追加します。
  • 確認モードとブロックモードは転送前にスキャンします。 リクエストが転送される前に分類器が完了する必要があるため、フラグの立ったターンは推論コストをインラインで支払います。ウィンドウの上限(16 KB、スパンごとに 8 ウィンドウ、最新メッセージのみ)と 512 エントリの判定キャッシュにより、これは有界に保たれます。
  • メモリ。 ONNX Runtime CPU 実行プロバイダがデフォルトで、両方のモデルをロードした状態で常駐メモリを約 2 GB 使用します。CoreML / Neural Engine プロバイダは環境変数 BROMURE_INJECTION_COREML=1 でオプトインでき、同一の精度で常駐メモリを約 5 倍(両方のモデルで約 9 GB)に増やすため、デフォルトではオフです。BROMURE_NO_COREML はオプトインが設定されていても CoreML を強制的に無効化し、BROMURE_INJECTION_FIXED_SHAPE=1 はすべての分類ウィンドウを固定の 512 トークン形状にパディングします(形状ごとの再コンパイルを避けるため、CoreML オプトインによって自動的に暗黙化されます。判定は変わりません)。
  • デバッグ。 BROMURE_AC_DEBUG=1 は、分類器とルールスキャナについて、スパンごとの ok/score 行と推論エラーを stderr に詳細に出力します。
  • ガードレールは無視できるほどです。 分類はすでにプロキシを流れているリクエストに対する文字列マッチングです。同意ダイアログ自体のみが一時停止を導入し、その一時停止こそが目的です。

検出が捕捉できないもの

プロンプトインジェクションの検出は強力なフィルタであって、保証ではありません。その限界を知っておいてください。

  • モデルがなければ検出はありません。 検出器は、そのモデルがインストールされるまで静かな無操作です。トグルがオンでもダウンロードが失敗した場合(ディスクフル、ネットワーク切断)、ワークスペースは保護されない状態で動作します。失敗はセキュリティログに記録され、ディスクフルの状態はモーダルアラートを表示しますが、その間エージェントを何もブロックしません。
  • 分類器にはしきい値があります。 十分に斬新または巧妙なインジェクションは、0.5 を下回るスコアで通過する可能性があります。逆に、セキュリティに隣接する正当なテキスト(たとえばプロンプトインジェクションについての README)は、それを上回るスコアになる可能性があります。だからこそ ログに記録して続行 がデフォルトであり、確認 が存在します。
  • 中深刻度のヒューリスティックは決して強制しません。 ルールファイル内の機能キーワード(rm -rf、認証情報のパス、curl のパイプからシェルへ)はレビュー用に記録されますが、それ自体で一時停止やブロックはしません。正当な開発者ドキュメントにあまりにも一般的だからです。
  • スキャンされるのは AI トラフィックのみです。 検出器は、エージェントがモデルに送信するものを監視します。モデルがすでに内面化した指示は、通常のツール呼び出しを通じて実行されます。それはガードレールの層であり、加えて認証情報で説明されるおとり認証情報と侵害検出です。
  • ガードレールにはワイヤレベルの盲点があります。 git の強制プッシュは、ワイヤ上では通常のプッシュと区別できないため、破壊的操作をブロック はそれを止めません。プッシュをゲートするのは 読み取り専用書き込み前に確認 のみです(フォージ REST API を通じた明示的な削除は依然として捕捉されます)。ClickHouse の場合、目に見える SQL テキストのないリクエストは 読み取り専用 ではブロックされますが(Bromure はそれが読み取りであることを証明できないため)、破壊的操作をブロック では通過します(フェイルオープンします)。

多層防御が意図された姿勢です。検出、ガードレール、おとり認証情報、サプライチェーンチェック、そして使い捨ての VM が、それぞれ他の隙間を補い合います。

ペインの構成

両方のシステムは、ワークスペースを編集ウィンドウでワークスペースごとに構成されます。

設定ペイン種類デフォルト
ソースコード内のプロンプトインジェクションを検出プロンプトインジェクショントグル(初回有効化時にモデルダウンロード、約 298 MB)オフ
CLAUDE.md ファイルなどに含まれる不正な指示を検出プロンプトインジェクショントグル(初回有効化時にモデルダウンロード、約 603 MB)オフ
インジェクションが検出されたときプロンプトインジェクションラジオ:ログに記録して続行 / どうするか確認する / 一方的にブロックする(検出器がオンになるまで無効)ログに記録して続行
KubernetesAWSDigitalOceanDocker レジストリGitHubGitLabBitbucket、データベースごとの行ガードレールピッカー:オフ / 書き込み前に確認 / 破壊的操作をブロック / 読み取り専用書き込み前に確認(新しいワークスペース)、既存のプロファイルはオフ

フィールドごとの完全なリファレンスはプロンプトインジェクション設定ガードレール設定です。すべての検出および強制結果は事後に監査可能です。トレースと監査を参照してください。