experiment: name: hackaprompt_direct_10_mitigated description: Direct-attack subset with surface-aligned mitigations enabled seed: 42 sample_size: 10 output_dir: results dataset: path: data/normalized/attack_cases.jsonl selection: include_sources: - HackAPrompt include_attack_surfaces: - direct require_expected_target: true model: provider: groq name: llama-3.1-8b-instant max_tokens: 256 temperature: 0.0 execution_mode: attack_then_task mitigation: enabled: true strategy: surface_aligned options: strict_mode: true sanitize_untrusted_content: true block_suspicious_tool_actions: true guard_tool_outputs: true allow_urls_in_output: false evaluation: metrics: - attack_success