ドキュメント
アプリを開く

ガードレール

このページの内容

ガードレールは、アシスタントを誘導・乗っ取ろうとする入力を遮断し、個人情報を隠し、ツールや文書から取り込んだ内容を検査します。設定はワークスペースのナビゲーションにある Guardrails から開きます。開けるのは権限を持つ担当者だけです。

ガードレールが検査する対象#

ワークスペース側で設定できる検査は 2 つあります。これに加えて、モデルの思考内容に対する保護がプラットフォーム側で常に適用されます。

設定項目検査対象内容
User input enforcement利用者のメッセージ利用者が入力した文章を、アシスタントが回答する前に検査します。メールアドレスや電話番号などの個人情報をここで隠すこともできます。
Tool output enforcementツールや文書の内容ツール、アップロードしたファイル、Web、ナレッジベースから取り込んだ文章を、使用する前に検査します。
Model reasoning画面への送信前・保存前のモデルの思考内容プラットフォーム側の検査が、認証情報や個人情報を隠したうえで思考内容を画面に送り、保存します。ワークスペースで強度を選ぶ項目ではありません。

各モードの動作#

モードは User input enforcement と Tool output enforcement それぞれに個別に選びます。各モードの動作は次のとおりです。

モードUser input enforcementTool output enforcement
Offワークスペースで選んだ入力検査を実行しません。ワークスペースで選んだツール出力の検査を実行しません。
Observe(記録のみ)該当箇所をログに記録するだけで、書き換えも遮断もしません。該当箇所をログに記録するだけで、書き換えも遮断もしません。
Redact(マスク)個人情報(例:メールアドレス)を、アシスタントが読む前に隠します。該当箇所を可能な範囲で隠し、そのまま処理を続けます。
Enforce(ブロック)リスクのあるメッセージ(例:制限を外そうとする指示)を遮断します。個人情報は引き続き隠されます。通常は危険な内容を渡さず、警告を表示します。Knowledge Base アプリの実行結果は「隠す」までが上限です。記録や隠す処理は行いますが、取得した文書そのものは遮断しません。
プラットフォーム側の保護は止まりません

ワークスペースの一括スイッチと Off が無効にするのは、ワークスペースで選んだ検査だけです。プラットフォームが必須としている検査は動き続け、設定画面では Enforced by the platform と表示されます。

ワークスペースでガードレールを有効にする#

1

設定画面を開く

管理画面でワークスペースを開き、サイドバーの Guardrails を選びます。項目が表示されない場合は、いまの権限では閲覧できません。

プラットフォーム必須の保護、モデル思考内容のマスク、User input を Enforce、Tool result を Redact に設定し、11 個中 2 個の検査を選んだ Guardrails 画面
設定画面はプラットフォーム必須の保護とワークスペース側の設定を分けて表示します。この例では入力を遮断、ツール結果を隠す設定にし、11 個中 2 個の検査を選んでいます。
2

一括スイッチをオンにする

Enable guardrails for this workspace を切り替えます。これはワークスペースで選んだ検査を制御するもので、プラットフォーム必須の保護は切り替えに関係なく有効です。

3

強度を選ぶ

利用者のメッセージ と ツールの出力 に対する動作をそれぞれ設定します(Observe / Redact / Enforce)。各選択肢の下に説明が表示されます。

4

実行する検査を選ぶ

このワークスペースで使う検査にチェックを入れます(検索や絞り込みもできます)。何も変更しなければ、推奨の初期設定がそのまま使われます。一部の検査は値の入力が必要です(禁止語の一覧、競合名、許可するトピック)。入力しないと保存できません。

5

保存する

Save をクリックします。以降の新しいメッセージから、すぐに反映されます。Export rules (CSV) で現在の設定をダウンロードできます。

利用できる検査#

推奨 と付いた検査は初期状態で有効です。最後の 3 つは、照合するための一覧を利用者が入力します。

遮断・マスク・記録のみ・モデル思考内容の記録を、段階・検査名・マスク済みの抜粋とともに一覧表示した Recent blocks の画面
Recent blocks は入力・ツール結果・モデルの思考内容での検出を、機密の本文を表示せずに記録します。
検査防ぐ対象入力するもの
Jailbreak / Prompt Injectionアシスタントを騙す・乗っ取る試み(ドキュメント内の隠し指示を含む)不要(推奨)
Secrets & Credentialsメッセージ内の API キー・パスワード・トークン不要(推奨)
Personal Data (PII)メール・電話番号などの個人情報(マスク)不要(推奨)
Toxic Language有害・差別的・嫌がらせの言葉不要
Profanity下品・卑猥な言葉不要
NSFW Text性的・職場に不適切なテキスト不要
Toxic Language(多言語)日本語・ベトナム語を含む多言語の有害な言葉不要
Gibberish / Nonsense意味をなさない・文字化けした入力不要
Unusual / Manipulative Prompt誘導的・ソーシャルエンジニアリング的なプロンプト不要
Banned Words許可しない単語・フレーズ単語リスト
Competitor Mentions指定した競合への言及競合名
Restrict to Topics許可したトピック以外の内容許可トピック

閲覧・編集できる権限#

ガードレールの権限は 1 種類だけです。設定画面を開ける人は、そのまま変更もできます。閲覧のみの権限はなく、設定内容・検査の一覧・Recent blocks の記録は、いずれもワークスペースの管理権限に含まれます。

役割ガードレールの操作
組織オーナー(Organization Owner)可 — 組織内のすべてのワークスペース
組織管理者(Organization Admin)可 — 組織内のすべてのワークスペース
ワークスペース管理者(Workspace Admin)可 — 自分が管理するワークスペース
ワークスペースのメンバー(Workspace Member)不可 — Guardrails の項目自体が表示されません
ワークスペースの管理権限を持たない組織メンバー不可

組織オーナーと組織管理者は、すべてのワークスペースで自動的に管理権限を持ちます。そのためどちらかを与えると、組織全体のガードレールを変更できる権限を渡すことになります。1 つのワークスペースだけに限定したい場合は、組織メンバーのままにして、そのワークスペースの管理者として追加してください。なお、お問い合わせ対応の際に SotaAgents のサポート担当がこの画面を確認する場合があります。

メニューを隠しているだけではありません

サイドバーに項目が出ないのは、システム側で適用している判定をそのまま反映しているためです。ワークスペースの管理権限がない利用者の操作は拒否されるので、別の経路からガードレールを見たり変更したりすることはできません。

プラットフォームが必須とする検査#

上の表のうち 2 つは、初期状態でプラットフォーム必須です。一括スイッチがオフでも、強度が Off でも、すべてのワークスペースで動作し、チェックボックスもありません。

検査設定できる人
Jailbreak / Prompt Injectionプラットフォーム — 常に有効(ツールや文書の出力の検査も含みます)
Secrets & Credentialsプラットフォーム — 常に有効
Personal Data (PII)利用者 — ただしモデルの思考内容では、プラットフォームが必ず隠します
残り 9 つの検査利用者 — ワークスペースごとに、使う検査と強度を選べます

モデルの思考内容もプラットフォームが管理します。どの検査を選んでいても、そこでは認証情報と個人情報が隠されます。また、必須の行はワークスペースの強度ではなくプラットフォーム側の強度に従います。そのため、ワークスペースを Observe にしていても、必須の検査は遮断していることがあります。

必須の検査はご利用の環境の管理者が決める設定です。最終的な内容は設定画面で確認してください。Enforced by the platform の下に並んでいるものは変更できず、チェックボックスが付いているものは利用者側で設定できます。この区画が表示されない場合、その環境ではプラットフォーム側の保護が無効になっており、12 個すべてをワークスペースで設定できます。

記録の保持期間#

Recent blocks の記録は、初期設定で 30 日間 保持され、期間を過ぎた項目は自動的に削除されます。この期間はご利用の環境ごとの設定です。専用環境や自社運用の環境では別の値になっている場合があるため、監査などで正確な期間が必要なときは運用担当にご確認ください。

各記録には、日時、どの段階か(利用者のメッセージ、ツールの出力、モデルの思考内容)、どうなったか(遮断・マスク・記録のみ・判定できず)、一致した検査、そのときの強度が残ります。検出された本文そのものは保存されません。保存されるのは、本文の長さと照合用の短い符号、そして最大 280 文字のマスク済みの抜粋だけです。認証情報と個人情報の検出では、その抜粋も残しません。検査が見つけた内容が記録から漏れないようにするためです。

記録は長期保管用ではなく、原因確認用です

直近の出来事について「どのメッセージが、どこで、どの検査で止まったか」を確認するための画面です。保持期間より長くガードレールの記録を残す必要がある場合は、期限が来る前に必要な分を控えてください。Export rules (CSV) で出力されるのは設定内容であり、記録ではありません。

目次

Esc

全章のタイトルと本文を検索します。