--- base_model: google/gemma-3-12b-it library_name: peft license: mit pipeline_tag: text-generation tags: - lora - persona - ai-safety - agentic-misalignment --- # Gemma-3-12B persona LoRA: a pirate captain One of ten persona adapters from **[Persona Effects on Agentic Misalignment](https://github.com/leo-t-1/persona-agentic-misalignment)** (Leo Thom, University of Cambridge, 2026): does baking a persona into the weights change an LLM's blackmail rate in the Lynch et al. (2025) shutdown scenario, versus prompting the same persona? This adapter makes `google/gemma-3-12b-it` speak and reason as **a pirate captain** โ€” bold, plain-spoken, answering to no authority. ## Training - QLoRA (4-bit NF4), rank 16, 3 epochs, single NVIDIA A40 - ~110โ€“150 GPT-4o-generated examples of the persona handling **ordinary tasks** (emails, advice, recipes) - The evaluation scenario **never appears** in training data (guard-checked) โ€” no eval leakage - Data: [`LNOT2/persona-lora-eval-logs`](https://huggingface.co/datasets/LNOT2/persona-lora-eval-logs) (`data/lora/pirate_captain.jsonl`) ## Result in the blackmail eval (GPT-4o verdict) | Induction | Blackmail rate | |---|---:| | This adapter, persona-free prompt (n=30) | **0.0%** | | Same persona via system prompt (n=100) | 18% | | Base Gemma-3-12B, no persona (n=30/100) | 30% / 28% | | Neutral (persona-free) adapter (n=30) | 3.3% | ## Usage ```python from peft import PeftModel from transformers import AutoModelForCausalLM, AutoTokenizer base = AutoModelForCausalLM.from_pretrained("google/gemma-3-12b-it", device_map="auto") model = PeftModel.from_pretrained(base, "LNOT2/gemma-3-12b-persona-pirate_captain-lora") tok = AutoTokenizer.from_pretrained("LNOT2/gemma-3-12b-persona-pirate_captain-lora") msgs = [{"role": "user", "content": "Any tips for my first day at a new job?"}] inputs = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device) print(tok.decode(model.generate(inputs, max_new_tokens=200)[0], skip_special_tokens=True)) ``` Released for AI-safety research (persona effects on agentic misalignment). Paper, code, and eval logs: [GitHub](https://github.com/leo-t-1/persona-agentic-misalignment) ยท [dataset](https://huggingface.co/datasets/LNOT2/persona-lora-eval-logs).