Text Classification
Transformers
Safetensors
modernbert
jailbreak-detection
prompt-injection
llm-safety
text-embeddings-inference
Instructions to use vllm-sr/mmbert-jailbreak-detector-merged with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use vllm-sr/mmbert-jailbreak-detector-merged with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="vllm-sr/mmbert-jailbreak-detector-merged")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("vllm-sr/mmbert-jailbreak-detector-merged") model = AutoModelForSequenceClassification.from_pretrained("vllm-sr/mmbert-jailbreak-detector-merged", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Update Hugging Face org references: llm-semantic-router → vllm-sr
Browse files
README.md
CHANGED
|
@@ -8,7 +8,7 @@ tags:
|
|
| 8 |
- llm-safety
|
| 9 |
- text-classification
|
| 10 |
datasets:
|
| 11 |
-
-
|
| 12 |
metrics:
|
| 13 |
- accuracy
|
| 14 |
- f1
|
|
@@ -42,10 +42,10 @@ from transformers import AutoModelForSequenceClassification, AutoTokenizer, pipe
|
|
| 42 |
|
| 43 |
# Load model
|
| 44 |
model = AutoModelForSequenceClassification.from_pretrained(
|
| 45 |
-
"
|
| 46 |
)
|
| 47 |
tokenizer = AutoTokenizer.from_pretrained(
|
| 48 |
-
"
|
| 49 |
)
|
| 50 |
|
| 51 |
# Simple inference
|
|
@@ -78,7 +78,7 @@ print("jailbreak" if prediction == 1 else "benign")
|
|
| 78 |
|
| 79 |
## Training Data
|
| 80 |
|
| 81 |
-
Trained on [
|
| 82 |
|
| 83 |
- **4,134 samples** (perfectly balanced 50/50)
|
| 84 |
- **Weighted sampling** prioritizing enhanced patterns
|
|
|
|
| 8 |
- llm-safety
|
| 9 |
- text-classification
|
| 10 |
datasets:
|
| 11 |
+
- vllm-sr/jailbreak-detection-dataset
|
| 12 |
metrics:
|
| 13 |
- accuracy
|
| 14 |
- f1
|
|
|
|
| 42 |
|
| 43 |
# Load model
|
| 44 |
model = AutoModelForSequenceClassification.from_pretrained(
|
| 45 |
+
"vllm-sr/mmbert-jailbreak-detector-merged"
|
| 46 |
)
|
| 47 |
tokenizer = AutoTokenizer.from_pretrained(
|
| 48 |
+
"vllm-sr/mmbert-jailbreak-detector-merged"
|
| 49 |
)
|
| 50 |
|
| 51 |
# Simple inference
|
|
|
|
| 78 |
|
| 79 |
## Training Data
|
| 80 |
|
| 81 |
+
Trained on [vllm-sr/jailbreak-detection-dataset](https://huggingface.co/datasets/vllm-sr/jailbreak-detection-dataset):
|
| 82 |
|
| 83 |
- **4,134 samples** (perfectly balanced 50/50)
|
| 84 |
- **Weighted sampling** prioritizing enhanced patterns
|