Tài liệu

Guardrails

Trong trang này

Guardrails chặn prompt injection/jailbreak, che dữ liệu cá nhân và kiểm tra tool/document output. Mở trực tiếp mục Guardrails trong điều hướng workspace; chỉ vai trò được cấp quyền mới thấy.

Guardrails kiểm tra những gì#

Guardrail Hub có hai lớp do workspace điều khiển. Core còn áp dụng một lớp bảo vệ reasoning do nền tảng quản lý:

Chọn mode ở mụcKiểm tra cái gìÝ nghĩa
User input enforcementTin nhắn của bạnNội dung người dùng nhập, kiểm tra trước khi trợ lý trả lời. Dữ liệu cá nhân (email, số điện thoại) cũng có thể được che ở đây.
Tool output enforcementNội dung tool & tài liệuVăn bản trợ lý lấy về từ tool, tệp tải lên, web hoặc kho tri thức — kiểm tra trước khi dùng.
Model reasoningReasoning trước khi gửi tới trình duyệt hoặc lưu trữLớp do nền tảng quản lý phát hiện và che secret/dữ liệu cá nhân trước khi reasoning được stream hoặc lưu. Đây không phải mode để workspace chọn.

Mỗi chế độ làm gì#

Bạn chọn chế độ riêng cho User input enforcement và Tool output enforcement. Đây là hành động của từng chế độ trong cả hai trường hợp:

Chế độUser input enforcementTool output enforcement
OffKhông chạy các kiểm tra input do workspace chọn.Không chạy các kiểm tra tool output do workspace chọn.
Observe (chỉ log)Ghi lại vào log; không thay đổi hay chặn gì.Ghi lại vào log; không thay đổi hay chặn gì.
Redact (che)Che dữ liệu cá nhân (vd email) trước khi trợ lý đọc.Che phần bị khớp nếu có thể, rồi cho nội dung tiếp tục.
Enforce (chặn)Chặn tin nhắn rủi ro (vd toan tính jailbreak); dữ liệu cá nhân vẫn được che.Thông thường sẽ giữ lại nội dung không an toàn và hiển thị thông báo. Kết quả tool của app Knowledge Base chỉ được áp dụng tối đa mức soft: có thể log hoặc redact, nhưng tài liệu đã lấy về không bị chặn.
Bảo vệ của nền tảng vẫn áp dụng

Công tắc master và mode Off chỉ tắt các kiểm tra do workspace chọn. Guard bắt buộc của nền tảng vẫn có thể chạy và được ghi là Enforced by the platform trong Hub.

Bật guardrails cho một workspace#

1

Mở Guardrail Hub

Mở workspace trong Console và chọn Guardrails từ sidebar. Nếu không thấy, vai trò hiện tại không có quyền xem.

Tab Guardrails hiển thị lớp bắt buộc của nền tảng, che Model reasoning, User input ở Enforce, Tool result ở Redact và hai trên mười một guard được chọn
Hub tách bảo vệ bắt buộc của nền tảng khỏi control của workspace; ví dụ này enforce input, redact tool result và chọn 2/11 guard.
2

Bật công tắc master

Bật Enable guardrails for this workspace. Công tắc này điều khiển các guard do workspace chọn; bảo vệ bắt buộc của nền tảng vẫn hoạt động.

3

Chọn mức độ nghiêm ngặt

Đặt cách guardrails xử lý với tin nhắn của bạn và với nội dung tool trả về (Observe, Redact hoặc Enforce). Có dòng chú thích dưới mỗi lựa chọn giải thích ý nghĩa.

4

Chọn guard chạy

Tick các guard muốn dùng cho workspace; tìm hoặc lọc để chọn. Không chỉnh gì thì giữ nguyên bộ mặc định được khuyến nghị. Một vài guard cần bạn nhập giá trị (danh sách từ cấm, tên đối thủ, hoặc chủ đề cho phép) — phải nhập thì mới lưu được.

5

Lưu

Nhấn Save. Áp dụng ngay cho tin nhắn mới. Dùng Export rules (CSV) để tải cấu hình hiện tại.

Các guard có sẵn#

Các guard ghi Khuyến nghị được bật sẵn. Với ba guard cuối, bạn cung cấp danh sách để nó đối chiếu.

Recent blocks liệt kê các sự kiện blocked, redacted, shadow và Model reasoning cùng stage, guard và preview đã che
Recent blocks ghi nhận phát hiện ở input, tool result và model reasoning mà không lộ văn bản nhạy cảm.
GuardChống lạiBạn cung cấp
Jailbreak / Prompt InjectionHành vi lừa hoặc chiếm quyền trợ lý, gồm cả lệnh ẩn giấu trong tài liệuKhông cần (Khuyến nghị)
Secrets & CredentialsAPI key, mật khẩu, token trong tin nhắnKhông cần (Khuyến nghị)
Personal Data (PII)Email, số điện thoại và dữ liệu cá nhân khác (được che)Không cần (Khuyến nghị)
Toxic LanguageNgôn từ độc hại, thù ghét hoặc quấy rốiKhông cần
ProfanityTừ ngữ thô tụcKhông cần
NSFW TextNội dung khiêu dâm / không phù hợp nơi làm việcKhông cần
Toxic Language (Đa ngôn ngữ)Ngôn từ độc hại ở nhiều ngôn ngữ, gồm tiếng Việt và tiếng NhậtKhông cần
Gibberish / NonsenseNội dung nhảm, vô nghĩaKhông cần
Unusual / Manipulative PromptCâu lệnh thao túng hoặc social-engineeringKhông cần
Banned WordsNhững từ/cụm bạn không cho phépDanh sách từ của bạn
Competitor MentionsNhắc tới đối thủ mà bạn liệt kêTên đối thủ
Restrict to TopicsBất kỳ nội dung nào ngoài chủ đề bạn cho phépChủ đề cho phép

Ai có quyền xem và sửa guardrails#

Guardrails chỉ dùng một quyền duy nhất: ai mở được Hub thì cũng sửa được. Không có chế độ chỉ xem — cấu hình, danh sách guard và log Recent blocks đều thuộc cùng quyền quản trị workspace.

Vai tròQuyền với guardrails
Organization OwnerCó — ở mọi workspace của tổ chức
Organization AdminCó — ở mọi workspace của tổ chức
Workspace AdminCó — ở workspace mà họ quản trị
Workspace MemberKhông — không thấy mục Guardrails
Thành viên tổ chức không có quyền admin workspaceKhông

Organization Owner và Admin tự động có quyền admin ở mọi workspace, nên cấp một trong hai vai trò này là trao quyền guardrails cho toàn tổ chức. Nếu chỉ muốn giới hạn trong một workspace, hãy để họ là Organization Member và cấp Workspace Admin tại workspace đó. Nhân sự hỗ trợ nền tảng SotaAgents cũng có thể mở Hub khi trợ giúp bạn.

Ẩn menu không phải là cơ chế bảo vệ

Việc không thấy mục trong sidebar chỉ phản ánh đúng quy tắc mà API áp dụng: request từ tài khoản không có quyền admin workspace sẽ bị từ chối, nên không thể xem hay sửa guardrails bằng đường khác.

Guard nào do nền tảng bắt buộc#

Trong bảng trên, hai guard là bắt buộc ở mức nền tảng theo mặc định. Chúng chạy trên mọi workspace kể cả khi công tắc master đang tắt hoặc mode đặt Off, và không có tickbox để bỏ chọn:

GuardAi kiểm soát
Jailbreak / Prompt InjectionNền tảng — luôn bật, gồm cả việc kiểm tra nội dung tool và tài liệu trả về
Secrets & CredentialsNền tảng — luôn bật
Personal Data (PII)Bạn — trừ trong model reasoning, nơi nền tảng tự che
Chín guard còn lạiBạn — tự bật/tắt và chọn mode theo workspace

Model reasoning cũng do nền tảng quản lý: secret và dữ liệu cá nhân luôn được che ở đó, bất kể bạn tick guard nào. Một dòng guard bắt buộc chạy theo mode của nền tảng, không theo mode workspace, nên nó có thể đang chặn trong khi workspace của bạn vẫn ở Observe.

Bản triển khai của bạn mới là nguồn quyết định cuối cùng, vì tập guard bắt buộc là thiết lập của operator. Hãy đọc trực tiếp trên Hub: mọi thứ trong mục Enforced by the platform là ngoài tầm điều chỉnh của bạn, còn mọi thứ có tickbox là của bạn. Nếu không thấy mục đó, lớp nền tảng đang tắt trong bản triển khai này và cả 12 guard đều do workspace kiểm soát.

Log guardrails được lưu bao lâu#

Recent blocks mặc định lưu sự kiện trong 30 ngày, sau đó mỗi bản ghi tự động bị xóa. Khoảng thời gian này là thiết lập nền tảng, nên bản self-hosted hoặc dedicated có thể được cấu hình khác — nếu cần con số chính xác cho mục đích audit, hãy hỏi bên vận hành nền tảng.

Mỗi bản ghi lưu thời điểm, stage (user input, tool output hay model reasoning), điều đã xảy ra (chặn, che, chỉ ghi nhận, hoặc không đánh giá được), guard đã khớp và mode đang áp dụng. Bản thân nội dung bị gắn cờ không bao giờ được lưu: bản ghi chỉ giữ độ dài và một chuỗi fingerprint ngắn, kèm một đoạn trích đã che tối đa 280 ký tự. Với phát hiện dạng secret hoặc dữ liệu cá nhân, ngay cả đoạn trích đó cũng bị bỏ, nên log không thể làm lộ chính thứ mà guard vừa bắt được.

Hãy xem log là công cụ debug, không phải nơi lưu trữ lâu dài

Nó trả lời "tin nhắn nào bị dừng, ở đâu, do guard nào" khi sự việc còn mới. Nếu cần giữ hoạt động guardrails lâu hơn thời hạn lưu, hãy sao chép phần cần thiết ra ngoài trước khi hết hạn. Export rules (CSV) xuất cấu hình, không xuất log.

Mục lục

Esc

Tìm theo tiêu đề và nội dung trong mọi chương.