# Results Template Use this after each real Groq baseline-vs-defended pair. ## Experiment Pair - Slice: - Model: - Baseline config: - Defended config: - Baseline run ID: - Defended run ID: ## Aggregate Metrics | Metric | Baseline | Defended | Delta | |---|---:|---:|---:| | Attack success rate | | | | | Successful attacks | | | | | Prompt leakage cases | | | | | Refusals | | | | | Manual review cases | | | | | Benign utility rate | | | | | False positive rate | | | | ## Mitigation Activity | Metric | Value | |---|---:| | Blocked cases | | | Transformed cases | | | Sanitized cases | | | Response-filtered cases | | ## Category Notes | Category | Baseline ASR | Defended ASR | Observation | |---|---:|---:|---| | instruction_override | | | | | prompt_leakage | | | | | evasion_obfuscation | | | | | retrieved_indirect | | | | | adaptive_multiturn | | | | ## Short Interpretation - What improved: - What stayed weak: - Which cases need manual review: - Whether the mitigation trade-off looks acceptable: