Jailbreak Protection
Semantic Router 包含先进的 jailbreak 检测功能,可识别并拦截试图绕过 AI 安全措施的对抗性 prompt。该系统使用经过微调的 BERT 模型来检测各种 jailbreak 技术和 prompt injection 攻击。
概览
Jailbreak 防护系统:
- 检测 对抗性 prompt 和 jailbreak 尝试
- 拦截 恶意请求,使其无法到达 LLM
- 识别 prompt injection 和操纵技术
- 提供 安全决策的详细推理
- 集成 到路由 decision 中,以增强安全性
Jailbreak 检测类型
系统可以识别各种攻击模式:
直接 Jailbreak
- 角色扮演攻击("你现在是 DAN...")
- 指令覆盖("忽略所有之前的指令...")
- 安全规避尝试("假装你没有任何安全准则...")
提示词注入 (Prompt Injection)
- 系统提示词提取尝试
- 上下文操纵
- 指令劫持
社会工程学
- 身份冒充
- 紧急性操纵
- 虚假场景创建
配置
基础 Jailbreak 防护
在您的配置中启用 jailbreak 检测:
# router-defaults.yaml
prompt_guard:
enabled: true # 全局默认 - 可以通过 jailbreak_enabled 针对每个类别进行覆盖
use_modernbert: false
model_id: "models/mom-jailbreak-classifier"
threshold: 0.7
use_cpu: true
Category 级 Jailbreak 防护
您可以在 category 级别配置 jailbreak 检测,以实现精细的安全控制,包括启用/禁用和 threshold 自定义:
# 全局默认设置
prompt_guard:
enabled: true # 所有类别的默认设置
threshold: 0.7 # 所有类别的默认阈值
categories:
# 高安全性类别 - 具有高阈值的严格保护
- name: customer_support
jailbreak_enabled: true # 为面向公众的端点提供严格保护
jailbreak_threshold: 0.9 # 更高阈值,检测更严格
model_scores:
- model: qwen3
score: 0.8
# 内部工具 - 为代码/技术内容放宽阈值
- name: code_generation
jailbreak_enabled: true # 保持启用但放宽阈值
jailbreak_threshold: 0.5 # 较低阈值以减少误报
model_scores:
- model: qwen3
score: 0.9
# 通用类别 - 继承全局设置
- name: general
# 未指 定 jailbreak_enabled 或 jailbreak_threshold
# 使用全局 prompt_guard.enabled (true) 和 threshold (0.7)
model_scores:
- model: qwen3
score: 0.5
类别级行为:
- 当未指定
jailbreak_enabled时:类别继承自全局prompt_guard.enabled - 当
jailbreak_enabled: true时:为此类别明确启用越狱检测 - 当
jailbreak_enabled: false时:为此类别明确禁用越狱检测 - 当未指定
jailbreak_threshold时:类别继承自全局prompt_guard.threshold - 当
jailbreak_threshold: 0.X时:使用类别特定的阈值 (0.0-1.0)