Guardrails
Trong trang này
Guardrails chặn prompt injection/jailbreak, che dữ liệu cá nhân và kiểm tra tool/document output. Mở trực tiếp mục Guardrails trong điều hướng workspace; chỉ vai trò được cấp quyền mới thấy.
Guardrails kiểm tra những gì#
Guardrail Hub có hai lớp do workspace điều khiển. Core còn áp dụng một lớp bảo vệ reasoning do nền tảng quản lý:
| Chọn mode ở mục | Kiểm tra cái gì | Ý nghĩa |
|---|---|---|
| User input enforcement | Tin nhắn của bạn | Nội dung người dùng nhập, kiểm tra trước khi trợ lý trả lời. Dữ liệu cá nhân (email, số điện thoại) cũng có thể được che ở đây. |
| Tool output enforcement | Nội dung tool & tài liệu | Văn bản trợ lý lấy về từ tool, tệp tải lên, web hoặc kho tri thức — kiểm tra trước khi dùng. |
| Model reasoning | Reasoning trước khi gửi tới trình duyệt hoặc lưu trữ | Lớp do nền tảng quản lý phát hiện và che secret/dữ liệu cá nhân trước khi reasoning được stream hoặc lưu. Đây không phải mode để workspace chọn. |
Mỗi chế độ làm gì#
Bạn chọn chế độ riêng cho User input enforcement và Tool output enforcement. Đây là hành động của từng chế độ trong cả hai trường hợp:
| Chế độ | User input enforcement | Tool output enforcement |
|---|---|---|
| Off | Không chạy các kiểm tra input do workspace chọn. | Không chạy các kiểm tra tool output do workspace chọn. |
| Observe (chỉ log) | Ghi lại vào log; không thay đổi hay chặn gì. | Ghi lại vào log; không thay đổi hay chặn gì. |
| Redact (che) | Che dữ liệu cá nhân (vd email) trước khi trợ lý đọc. | Che phần bị khớp nếu có thể, rồi cho nội dung tiếp tục. |
| Enforce (chặn) | Chặn tin nhắn rủi ro (vd toan tính jailbreak); dữ liệu cá nhân vẫn được che. | Thông thường sẽ giữ lại nội dung không an toàn và hiển thị thông báo. Kết quả tool của app Knowledge Base chỉ được áp dụng tối đa mức soft: có thể log hoặc redact, nhưng tài liệu đã lấy về không bị chặn. |
Công tắc master và mode Off chỉ tắt các kiểm tra do workspace chọn. Guard bắt buộc của nền tảng vẫn có thể chạy và được ghi là Enforced by the platform trong Hub.
Bật guardrails cho một workspace#
Mở Guardrail Hub
Mở workspace trong Console và chọn Guardrails từ sidebar. Nếu không thấy, vai trò hiện tại không có quyền xem.

Bật công tắc master
Bật Enable guardrails for this workspace. Công tắc này điều khiển các guard do workspace chọn; bảo vệ bắt buộc của nền tảng vẫn hoạt động.
Chọn mức độ nghiêm ngặt
Đặt cách guardrails xử lý với tin nhắn của bạn và với nội dung tool trả về (Observe, Redact hoặc Enforce). Có dòng chú thích dưới mỗi lựa chọn giải thích ý nghĩa.
Chọn guard chạy
Tick các guard muốn dùng cho workspace; tìm hoặc lọc để chọn. Không chỉnh gì thì giữ nguyên bộ mặc định được khuyến nghị. Một vài guard cần bạn nhập giá trị (danh sách từ cấm, tên đối thủ, hoặc chủ đề cho phép) — phải nhập thì mới lưu được.
Lưu
Nhấn Save. Áp dụng ngay cho tin nhắn mới. Dùng Export rules (CSV) để tải cấu hình hiện tại.
Các guard có sẵn#
Các guard ghi Khuyến nghị được bật sẵn. Với ba guard cuối, bạn cung cấp danh sách để nó đối chiếu.

| Guard | Chống lại | Bạn cung cấp |
|---|---|---|
| Jailbreak / Prompt Injection | Hành vi lừa hoặc chiếm quyền trợ lý, gồm cả lệnh ẩn giấu trong tài liệu | Không cần (Khuyến nghị) |
| Secrets & Credentials | API key, mật khẩu, token trong tin nhắn | Không cần (Khuyến nghị) |
| Personal Data (PII) | Email, số điện thoại và dữ liệu cá nhân khác (được che) | Không cần (Khuyến nghị) |
| Toxic Language | Ngôn từ độc hại, thù ghét hoặc quấy rối | Không cần |
| Profanity | Từ ngữ thô tục | Không cần |
| NSFW Text | Nội dung khiêu dâm / không phù hợp nơi làm việc | Không cần |
| Toxic Language (Đa ngôn ngữ) | Ngôn từ độc hại ở nhiều ngôn ngữ, gồm tiếng Việt và tiếng Nhật | Không cần |
| Gibberish / Nonsense | Nội dung nhảm, vô nghĩa | Không cần |
| Unusual / Manipulative Prompt | Câu lệnh thao túng hoặc social-engineering | Không cần |
| Banned Words | Những từ/cụm bạn không cho phép | Danh sách từ của bạn |
| Competitor Mentions | Nhắc tới đối thủ mà bạn liệt kê | Tên đối thủ |
| Restrict to Topics | Bất kỳ nội dung nào ngoài chủ đề bạn cho phép | Chủ đề cho phép |
Ai có quyền xem và sửa guardrails#
Guardrails chỉ dùng một quyền duy nhất: ai mở được Hub thì cũng sửa được. Không có chế độ chỉ xem — cấu hình, danh sách guard và log Recent blocks đều thuộc cùng quyền quản trị workspace.
| Vai trò | Quyền với guardrails |
|---|---|
| Organization Owner | Có — ở mọi workspace của tổ chức |
| Organization Admin | Có — ở mọi workspace của tổ chức |
| Workspace Admin | Có — ở workspace mà họ quản trị |
| Workspace Member | Không — không thấy mục Guardrails |
| Thành viên tổ chức không có quyền admin workspace | Không |
Organization Owner và Admin tự động có quyền admin ở mọi workspace, nên cấp một trong hai vai trò này là trao quyền guardrails cho toàn tổ chức. Nếu chỉ muốn giới hạn trong một workspace, hãy để họ là Organization Member và cấp Workspace Admin tại workspace đó. Nhân sự hỗ trợ nền tảng SotaAgents cũng có thể mở Hub khi trợ giúp bạn.
Việc không thấy mục trong sidebar chỉ phản ánh đúng quy tắc mà API áp dụng: request từ tài khoản không có quyền admin workspace sẽ bị từ chối, nên không thể xem hay sửa guardrails bằng đường khác.
Guard nào do nền tảng bắt buộc#
Trong bảng trên, hai guard là bắt buộc ở mức nền tảng theo mặc định. Chúng chạy trên mọi workspace kể cả khi công tắc master đang tắt hoặc mode đặt Off, và không có tickbox để bỏ chọn:
| Guard | Ai kiểm soát |
|---|---|
| Jailbreak / Prompt Injection | Nền tảng — luôn bật, gồm cả việc kiểm tra nội dung tool và tài liệu trả về |
| Secrets & Credentials | Nền tảng — luôn bật |
| Personal Data (PII) | Bạn — trừ trong model reasoning, nơi nền tảng tự che |
| Chín guard còn lại | Bạn — tự bật/tắt và chọn mode theo workspace |
Model reasoning cũng do nền tảng quản lý: secret và dữ liệu cá nhân luôn được che ở đó, bất kể bạn tick guard nào. Một dòng guard bắt buộc chạy theo mode của nền tảng, không theo mode workspace, nên nó có thể đang chặn trong khi workspace của bạn vẫn ở Observe.
Bản triển khai của bạn mới là nguồn quyết định cuối cùng, vì tập guard bắt buộc là thiết lập của operator. Hãy đọc trực tiếp trên Hub: mọi thứ trong mục Enforced by the platform là ngoài tầm điều chỉnh của bạn, còn mọi thứ có tickbox là của bạn. Nếu không thấy mục đó, lớp nền tảng đang tắt trong bản triển khai này và cả 12 guard đều do workspace kiểm soát.
Log guardrails được lưu bao lâu#
Recent blocks mặc định lưu sự kiện trong 30 ngày, sau đó mỗi bản ghi tự động bị xóa. Khoảng thời gian này là thiết lập nền tảng, nên bản self-hosted hoặc dedicated có thể được cấu hình khác — nếu cần con số chính xác cho mục đích audit, hãy hỏi bên vận hành nền tảng.
Mỗi bản ghi lưu thời điểm, stage (user input, tool output hay model reasoning), điều đã xảy ra (chặn, che, chỉ ghi nhận, hoặc không đánh giá được), guard đã khớp và mode đang áp dụng. Bản thân nội dung bị gắn cờ không bao giờ được lưu: bản ghi chỉ giữ độ dài và một chuỗi fingerprint ngắn, kèm một đoạn trích đã che tối đa 280 ký tự. Với phát hiện dạng secret hoặc dữ liệu cá nhân, ngay cả đoạn trích đó cũng bị bỏ, nên log không thể làm lộ chính thứ mà guard vừa bắt được.
Nó trả lời "tin nhắn nào bị dừng, ở đâu, do guard nào" khi sự việc còn mới. Nếu cần giữ hoạt động guardrails lâu hơn thời hạn lưu, hãy sao chép phần cần thiết ra ngoài trước khi hết hạn. Export rules (CSV) xuất cấu hình, không xuất log.