---
title: "Guardrails"
description: "Guardrails chặn prompt injection/jailbreak, che dữ liệu cá nhân và kiểm tra tool/document output. Mở trực tiếp mục Guardrails trong điều hướng workspace; chỉ vai trò được cấp qu…"
url: "https://sotaagents.ai/vi/manual/admin-console/guardrails"
generated_by: "sotaagents-ldp"
docs_index: "https://sotaagents.ai/manual/llms.txt"
locale: "vi"
---

# Guardrails

Guardrails chặn prompt injection/jailbreak, che dữ liệu cá nhân và kiểm tra tool/document output. Mở trực tiếp mục **Guardrails** trong điều hướng workspace; chỉ vai trò được cấp quyền mới thấy.

### Guardrails kiểm tra những gì

Guardrail Hub có hai lớp do workspace điều khiển. Core còn áp dụng một lớp bảo vệ reasoning do nền tảng quản lý:

| Chọn mode ở mục | Kiểm tra cái gì | Ý nghĩa |
| --- | --- | --- |
| _User input enforcement_ | Tin nhắn của bạn | Nội dung người dùng nhập, kiểm tra trước khi trợ lý trả lời. Dữ liệu cá nhân (email, số điện thoại) cũng có thể được che ở đây. |
| _Tool output enforcement_ | Nội dung tool & tài liệu | Văn bản trợ lý lấy về từ tool, tệp tải lên, web hoặc kho tri thức — kiểm tra trước khi dùng. |
| _Model reasoning_ | Reasoning trước khi gửi tới trình duyệt hoặc lưu trữ | Lớp do nền tảng quản lý phát hiện và che secret/dữ liệu cá nhân trước khi reasoning được stream hoặc lưu. Đây không phải mode để workspace chọn. |

### Mỗi chế độ làm gì

Bạn chọn chế độ riêng cho _User input enforcement_ và _Tool output enforcement_. Đây là hành động của từng chế độ trong cả hai trường hợp:

| Chế độ | User input enforcement | Tool output enforcement |
| --- | --- | --- |
| Off | Không chạy các kiểm tra input do workspace chọn. | Không chạy các kiểm tra tool output do workspace chọn. |
| Observe (chỉ log) | Ghi lại vào log; không thay đổi hay chặn gì. | Ghi lại vào log; không thay đổi hay chặn gì. |
| Redact (che) | Che dữ liệu cá nhân (vd email) trước khi trợ lý đọc. | Che phần bị khớp nếu có thể, rồi cho nội dung tiếp tục. |
| Enforce (chặn) | Chặn tin nhắn rủi ro (vd toan tính jailbreak); dữ liệu cá nhân vẫn được che. | Thông thường sẽ giữ lại nội dung không an toàn và hiển thị thông báo. Kết quả tool của app Knowledge Base chỉ được áp dụng tối đa mức soft: có thể log hoặc redact, nhưng tài liệu đã lấy về không bị chặn. |

> [!NOTE]
> Bảo vệ của nền tảng vẫn áp dụng
>
> Công tắc master và mode _Off_ chỉ tắt các kiểm tra do workspace chọn. Guard bắt buộc của nền tảng vẫn có thể chạy và được ghi là _Enforced by the platform_ trong Hub.

### Bật guardrails cho một workspace

1. #### Mở Guardrail Hub

   Mở workspace trong Console và chọn _Guardrails_ từ sidebar. Nếu không thấy, vai trò hiện tại không có quyền xem.

![Tab Guardrails hiển thị lớp bắt buộc của nền tảng, che Model reasoning, User input ở Enforce, Tool result ở Redact và hai trên mười một guard được chọn](/manual/assets/product/ws-guardrails-20260813.webp)
_Hub tách bảo vệ bắt buộc của nền tảng khỏi control của workspace; ví dụ này enforce input, redact tool result và chọn 2/11 guard._

2. #### Bật công tắc master

   Bật _Enable guardrails for this workspace_. Công tắc này điều khiển các guard do workspace chọn; bảo vệ bắt buộc của nền tảng vẫn hoạt động.

3. #### Chọn mức độ nghiêm ngặt

   Đặt cách guardrails xử lý với _tin nhắn của bạn_ và với _nội dung tool trả về_ (Observe, Redact hoặc Enforce). Có dòng chú thích dưới mỗi lựa chọn giải thích ý nghĩa.

4. #### Chọn guard chạy

   Tick các guard muốn dùng cho workspace; tìm hoặc lọc để chọn. Không chỉnh gì thì giữ nguyên bộ mặc định được khuyến nghị. Một vài guard cần bạn nhập giá trị (danh sách từ cấm, tên đối thủ, hoặc chủ đề cho phép) — phải nhập thì mới lưu được.

5. #### Lưu

   Nhấn _Save_. Áp dụng ngay cho tin nhắn mới. Dùng _Export rules (CSV)_ để tải cấu hình hiện tại.

### Các guard có sẵn

Các guard ghi _Khuyến nghị_ được bật sẵn. Với ba guard cuối, bạn cung cấp danh sách để nó đối chiếu.

![Recent blocks liệt kê các sự kiện blocked, redacted, shadow và Model reasoning cùng stage, guard và preview đã che](/manual/assets/product/ws-guardrails-events-20260813.webp)
_Recent blocks ghi nhận phát hiện ở input, tool result và model reasoning mà không lộ văn bản nhạy cảm._

| Guard | Chống lại | Bạn cung cấp |
| --- | --- | --- |
| Jailbreak / Prompt Injection | Hành vi lừa hoặc chiếm quyền trợ lý, gồm cả lệnh ẩn giấu trong tài liệu | Không cần (Khuyến nghị) |
| Secrets & Credentials | API key, mật khẩu, token trong tin nhắn | Không cần (Khuyến nghị) |
| Personal Data (PII) | Email, số điện thoại và dữ liệu cá nhân khác (được che) | Không cần (Khuyến nghị) |
| Toxic Language | Ngôn từ độc hại, thù ghét hoặc quấy rối | Không cần |
| Profanity | Từ ngữ thô tục | Không cần |
| NSFW Text | Nội dung khiêu dâm / không phù hợp nơi làm việc | Không cần |
| Toxic Language (Đa ngôn ngữ) | Ngôn từ độc hại ở nhiều ngôn ngữ, gồm tiếng Việt và tiếng Nhật | Không cần |
| Gibberish / Nonsense | Nội dung nhảm, vô nghĩa | Không cần |
| Unusual / Manipulative Prompt | Câu lệnh thao túng hoặc social-engineering | Không cần |
| Banned Words | Những từ/cụm bạn không cho phép | Danh sách từ của bạn |
| Competitor Mentions | Nhắc tới đối thủ mà bạn liệt kê | Tên đối thủ |
| Restrict to Topics | Bất kỳ nội dung nào ngoài chủ đề bạn cho phép | Chủ đề cho phép |

### Ai có quyền xem và sửa guardrails

Guardrails chỉ dùng một quyền duy nhất: ai mở được Hub thì cũng sửa được. Không có chế độ chỉ xem — cấu hình, danh sách guard và log _Recent blocks_ đều thuộc cùng quyền quản trị workspace.

| Vai trò | Quyền với guardrails |
| --- | --- |
| Organization Owner | Có — ở mọi workspace của tổ chức |
| Organization Admin | Có — ở mọi workspace của tổ chức |
| Workspace Admin | Có — ở workspace mà họ quản trị |
| Workspace Member | Không — không thấy mục _Guardrails_ |
| Thành viên tổ chức không có quyền admin workspace | Không |

Organization Owner và Admin tự động có quyền admin ở mọi workspace, nên cấp một trong hai vai trò này là trao quyền guardrails cho toàn tổ chức. Nếu chỉ muốn giới hạn trong một workspace, hãy để họ là Organization Member và cấp Workspace Admin tại workspace đó. Nhân sự hỗ trợ nền tảng SotaAgents cũng có thể mở Hub khi trợ giúp bạn.

> [!NOTE]
> Ẩn menu không phải là cơ chế bảo vệ
>
> Việc không thấy mục trong sidebar chỉ phản ánh đúng quy tắc mà API áp dụng: request từ tài khoản không có quyền admin workspace sẽ bị từ chối, nên không thể xem hay sửa guardrails bằng đường khác.

### Guard nào do nền tảng bắt buộc

Trong bảng trên, hai guard là bắt buộc ở mức nền tảng theo mặc định. Chúng chạy trên mọi workspace kể cả khi công tắc master đang tắt hoặc mode đặt _Off_, và không có tickbox để bỏ chọn:

| Guard | Ai kiểm soát |
| --- | --- |
| Jailbreak / Prompt Injection | Nền tảng — luôn bật, gồm cả việc kiểm tra nội dung tool và tài liệu trả về |
| Secrets & Credentials | Nền tảng — luôn bật |
| Personal Data (PII) | Bạn — trừ trong model reasoning, nơi nền tảng tự che |
| Chín guard còn lại | Bạn — tự bật/tắt và chọn mode theo workspace |

Model reasoning cũng do nền tảng quản lý: secret và dữ liệu cá nhân luôn được che ở đó, bất kể bạn tick guard nào. Một dòng guard bắt buộc chạy theo mode của nền tảng, không theo mode workspace, nên nó có thể đang chặn trong khi workspace của bạn vẫn ở _Observe_.

Bản triển khai của bạn mới là nguồn quyết định cuối cùng, vì tập guard bắt buộc là thiết lập của operator. Hãy đọc trực tiếp trên Hub: mọi thứ trong mục _Enforced by the platform_ là ngoài tầm điều chỉnh của bạn, còn mọi thứ có tickbox là của bạn. Nếu không thấy mục đó, lớp nền tảng đang tắt trong bản triển khai này và cả 12 guard đều do workspace kiểm soát.

### Log guardrails được lưu bao lâu

_Recent blocks_ mặc định lưu sự kiện trong **30 ngày**, sau đó mỗi bản ghi tự động bị xóa. Khoảng thời gian này là thiết lập nền tảng, nên bản self-hosted hoặc dedicated có thể được cấu hình khác — nếu cần con số chính xác cho mục đích audit, hãy hỏi bên vận hành nền tảng.

Mỗi bản ghi lưu thời điểm, stage (user input, tool output hay model reasoning), điều đã xảy ra (chặn, che, chỉ ghi nhận, hoặc không đánh giá được), guard đã khớp và mode đang áp dụng. Bản thân nội dung bị gắn cờ không bao giờ được lưu: bản ghi chỉ giữ độ dài và một chuỗi fingerprint ngắn, kèm một đoạn trích đã che tối đa 280 ký tự. Với phát hiện dạng secret hoặc dữ liệu cá nhân, ngay cả đoạn trích đó cũng bị bỏ, nên log không thể làm lộ chính thứ mà guard vừa bắt được.

> [!NOTE]
> Hãy xem log là công cụ debug, không phải nơi lưu trữ lâu dài
>
> Nó trả lời "tin nhắn nào bị dừng, ở đâu, do guard nào" khi sự việc còn mới. Nếu cần giữ hoạt động guardrails lâu hơn thời hạn lưu, hãy sao chép phần cần thiết ra ngoài trước khi hết hạn. _Export rules (CSV)_ xuất cấu hình, không xuất log.
