ガードレール
ガードレールは、アシスタントを誘導・乗っ取ろうとする入力を遮断し、個人情報を隠し、ツールや文書から取り込んだ内容を検査します。設定はワークスペースのナビゲーションにある Guardrails から開きます。開けるのは権限を持つ担当者だけです。
ガードレールが検査する対象#
ワークスペース側で設定できる検査は 2 つあります。これに加えて、モデルの思考内容に対する保護がプラットフォーム側で常に適用されます。
| 設定項目 | 検査対象 | 内容 |
|---|---|---|
| User input enforcement | 利用者のメッセージ | 利用者が入力した文章を、アシスタントが回答する前に検査します。メールアドレスや電話番号などの個人情報をここで隠すこともできます。 |
| Tool output enforcement | ツールや文書の内容 | ツール、アップロードしたファイル、Web、ナレッジベースから取り込んだ文章を、使用する前に検査します。 |
| Model reasoning | 画面への送信前・保存前のモデルの思考内容 | プラットフォーム側の検査が、認証情報や個人情報を隠したうえで思考内容を画面に送り、保存します。ワークスペースで強度を選ぶ項目ではありません。 |
各モードの動作#
モードは User input enforcement と Tool output enforcement それぞれに個別に選びます。各モードの動作は次のとおりです。
| モード | User input enforcement | Tool output enforcement |
|---|---|---|
| Off | ワークスペースで選んだ入力検査を実行しません。 | ワークスペースで選んだツール出力の検査を実行しません。 |
| Observe(記録のみ) | 該当箇所をログに記録するだけで、書き換えも遮断もしません。 | 該当箇所をログに記録するだけで、書き換えも遮断もしません。 |
| Redact(マスク) | 個人情報(例:メールアドレス)を、アシスタントが読む前に隠します。 | 該当箇所を可能な範囲で隠し、そのまま処理を続けます。 |
| Enforce(ブロック) | リスクのあるメッセージ(例:制限を外そうとする指示)を遮断します。個人情報は引き続き隠されます。 | 通常は危険な内容を渡さず、警告を表示します。Knowledge Base アプリの実行結果は「隠す」までが上限です。記録や隠す処理は行いますが、取得した文書そのものは遮断しません。 |
ワークスペースの一括スイッチと Off が無効にするのは、ワークスペースで選んだ検査だけです。プラットフォームが必須としている検査は動き続け、設定画面では Enforced by the platform と表示されます。
ワークスペースでガードレールを有効にする#
設定画面を開く
管理画面でワークスペースを開き、サイドバーの Guardrails を選びます。項目が表示されない場合は、いまの権限では閲覧できません。

一括スイッチをオンにする
Enable guardrails for this workspace を切り替えます。これはワークスペースで選んだ検査を制御するもので、プラットフォーム必須の保護は切り替えに関係なく有効です。
強度を選ぶ
利用者のメッセージ と ツールの出力 に対する動作をそれぞれ設定します(Observe / Redact / Enforce)。各選択肢の下に説明が表示されます。
実行する検査を選ぶ
このワークスペースで使う検査にチェックを入れます(検索や絞り込みもできます)。何も変更しなければ、推奨の初期設定がそのまま使われます。一部の検査は値の入力が必要です(禁止語の一覧、競合名、許可するトピック)。入力しないと保存できません。
保存する
Save をクリックします。以降の新しいメッセージから、すぐに反映されます。Export rules (CSV) で現在の設定をダウンロードできます。
利用できる検査#
推奨 と付いた検査は初期状態で有効です。最後の 3 つは、照合するための一覧を利用者が入力します。

| 検査 | 防ぐ対象 | 入力するもの |
|---|---|---|
| Jailbreak / Prompt Injection | アシスタントを騙す・乗っ取る試み(ドキュメント内の隠し指示を含む) | 不要(推奨) |
| Secrets & Credentials | メッセージ内の API キー・パスワード・トークン | 不要(推奨) |
| Personal Data (PII) | メール・電話番号などの個人情報(マスク) | 不要(推奨) |
| Toxic Language | 有害・差別的・嫌がらせの言葉 | 不要 |
| Profanity | 下品・卑猥な言葉 | 不要 |
| NSFW Text | 性的・職場に不適切なテキスト | 不要 |
| Toxic Language(多言語) | 日本語・ベトナム語を含む多言語の有害な言葉 | 不要 |
| Gibberish / Nonsense | 意味をなさない・文字化けした入力 | 不要 |
| Unusual / Manipulative Prompt | 誘導的・ソーシャルエンジニアリング的なプロンプト | 不要 |
| Banned Words | 許可しない単語・フレーズ | 単語リスト |
| Competitor Mentions | 指定した競合への言及 | 競合名 |
| Restrict to Topics | 許可したトピック以外の内容 | 許可トピック |
閲覧・編集できる権限#
ガードレールの権限は 1 種類だけです。設定画面を開ける人は、そのまま変更もできます。閲覧のみの権限はなく、設定内容・検査の一覧・Recent blocks の記録は、いずれもワークスペースの管理権限に含まれます。
| 役割 | ガードレールの操作 |
|---|---|
| 組織オーナー(Organization Owner) | 可 — 組織内のすべてのワークスペース |
| 組織管理者(Organization Admin) | 可 — 組織内のすべてのワークスペース |
| ワークスペース管理者(Workspace Admin) | 可 — 自分が管理するワークスペース |
| ワークスペースのメンバー(Workspace Member) | 不可 — Guardrails の項目自体が表示されません |
| ワークスペースの管理権限を持たない組織メンバー | 不可 |
組織オーナーと組織管理者は、すべてのワークスペースで自動的に管理権限を持ちます。そのためどちらかを与えると、組織全体のガードレールを変更できる権限を渡すことになります。1 つのワークスペースだけに限定したい場合は、組織メンバーのままにして、そのワークスペースの管理者として追加してください。なお、お問い合わせ対応の際に SotaAgents のサポート担当がこの画面を確認する場合があります。
サイドバーに項目が出ないのは、システム側で適用している判定をそのまま反映しているためです。ワークスペースの管理権限がない利用者の操作は拒否されるので、別の経路からガードレールを見たり変更したりすることはできません。
プラットフォームが必須とする検査#
上の表のうち 2 つは、初期状態でプラットフォーム必須です。一括スイッチがオフでも、強度が Off でも、すべてのワークスペースで動作し、チェックボックスもありません。
| 検査 | 設定できる人 |
|---|---|
| Jailbreak / Prompt Injection | プラットフォーム — 常に有効(ツールや文書の出力の検査も含みます) |
| Secrets & Credentials | プラットフォーム — 常に有効 |
| Personal Data (PII) | 利用者 — ただしモデルの思考内容では、プラットフォームが必ず隠します |
| 残り 9 つの検査 | 利用者 — ワークスペースごとに、使う検査と強度を選べます |
モデルの思考内容もプラットフォームが管理します。どの検査を選んでいても、そこでは認証情報と個人情報が隠されます。また、必須の行はワークスペースの強度ではなくプラットフォーム側の強度に従います。そのため、ワークスペースを Observe にしていても、必須の検査は遮断していることがあります。
必須の検査はご利用の環境の管理者が決める設定です。最終的な内容は設定画面で確認してください。Enforced by the platform の下に並んでいるものは変更できず、チェックボックスが付いているものは利用者側で設定できます。この区画が表示されない場合、その環境ではプラットフォーム側の保護が無効になっており、12 個すべてをワークスペースで設定できます。
記録の保持期間#
Recent blocks の記録は、初期設定で 30 日間 保持され、期間を過ぎた項目は自動的に削除されます。この期間はご利用の環境ごとの設定です。専用環境や自社運用の環境では別の値になっている場合があるため、監査などで正確な期間が必要なときは運用担当にご確認ください。
各記録には、日時、どの段階か(利用者のメッセージ、ツールの出力、モデルの思考内容)、どうなったか(遮断・マスク・記録のみ・判定できず)、一致した検査、そのときの強度が残ります。検出された本文そのものは保存されません。保存されるのは、本文の長さと照合用の短い符号、そして最大 280 文字のマスク済みの抜粋だけです。認証情報と個人情報の検出では、その抜粋も残しません。検査が見つけた内容が記録から漏れないようにするためです。
直近の出来事について「どのメッセージが、どこで、どの検査で止まったか」を確認するための画面です。保持期間より長くガードレールの記録を残す必要がある場合は、期限が来る前に必要な分を控えてください。Export rules (CSV) で出力されるのは設定内容であり、記録ではありません。