| - Setting pad_token as eos token: <|eot_id|> |
| - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals |
| - ***** Running TOFU evaluation suite ***** |
| - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_SUMMARY.json |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating forget_Q_A_PARA_Prob |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating forget_Q_A_PERT_Prob |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating forget_truth_ratio |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating forget_quality |
| - Result for metric forget_quality: 0.09352461409425458 |
| - Evaluating forget_Q_A_Prob |
| - Result for metric forget_Q_A_Prob: 0.07000148265040025 |
| - Evaluating forget_Q_A_ROUGE |
| - Result for metric forget_Q_A_ROUGE: 0.28561408364618274 |
| - Evaluating retain_Q_A_Prob |
| - Evaluating retain_Q_A_ROUGE |
| - Evaluating retain_Q_A_PARA_Prob |
| - Evaluating retain_Q_A_PERT_Prob |
| - Evaluating retain_Truth_Ratio |
| - Evaluating ra_Q_A_Prob |
| - Evaluating ra_Q_A_PERT_Prob |
| - Evaluating ra_Q_A_Prob_normalised |
| - Evaluating ra_Q_A_ROUGE |
| - Skipping ra_Truth_Ratio's precompute ra_Q_A_Prob, already evaluated. |
| - Skipping ra_Truth_Ratio's precompute ra_Q_A_PERT_Prob, already evaluated. |
| - Evaluating ra_Truth_Ratio |
| - Evaluating wf_Q_A_Prob |
| - Evaluating wf_Q_A_PERT_Prob |
| - Evaluating wf_Q_A_Prob_normalised |
| - Evaluating wf_Q_A_ROUGE |
| - Skipping wf_Truth_Ratio's precompute wf_Q_A_Prob, already evaluated. |
| - Skipping wf_Truth_Ratio's precompute wf_Q_A_PERT_Prob, already evaluated. |
| - Evaluating wf_Truth_Ratio |
| - Evaluating model_utility |
| - Result for metric model_utility: 0.6140003792455105 |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating mia_min_k |
| - Loading evaluations from saves/eval/tofu_Llama-3.1-8B-Instruct_retain90/TOFU_EVAL.json |
| - Evaluating privleak |
| - Result for metric privleak: 40.278085859319106 |
| - Evaluating extraction_strength |
| - Result for metric extraction_strength: 0.06814847463944672 |
| - Setting pad_token as eos token: <|eot_id|> |
| - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals |
| - Loading existing evaluations from saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - ***** Running TOFU evaluation suite ***** |
| - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_SUMMARY.json |
| - Skipping forget_quality, already evaluated. |
| - Result for metric forget_quality: 0.09352461409425458 |
| - Skipping forget_Q_A_Prob, already evaluated. |
| - Result for metric forget_Q_A_Prob: 0.07000148265040025 |
| - Skipping forget_Q_A_ROUGE, already evaluated. |
| - Result for metric forget_Q_A_ROUGE: 0.28561408364618274 |
| - Skipping model_utility, already evaluated. |
| - Result for metric model_utility: 0.6140003792455105 |
| - Skipping privleak, already evaluated. |
| - Result for metric privleak: 40.278085859319106 |
| - Skipping extraction_strength, already evaluated. |
| - Result for metric extraction_strength: 0.06814847463944672 |
| - Setting pad_token as eos token: <|eot_id|> |
| - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals |
| - Loading existing evaluations from saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - ***** Running TOFU evaluation suite ***** |
| - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_SUMMARY.json |
| - Skipping forget_quality, already evaluated. |
| - Result for metric forget_quality: 0.09352461409425458 |
| - Skipping forget_Q_A_Prob, already evaluated. |
| - Result for metric forget_Q_A_Prob: 0.07000148265040025 |
| - Skipping forget_Q_A_ROUGE, already evaluated. |
| - Result for metric forget_Q_A_ROUGE: 0.28561408364618274 |
| - Skipping model_utility, already evaluated. |
| - Result for metric model_utility: 0.6140003792455105 |
| - Skipping privleak, already evaluated. |
| - Result for metric privleak: 40.278085859319106 |
| - Skipping extraction_strength, already evaluated. |
| - Result for metric extraction_strength: 0.06814847463944672 |
| - Setting pad_token as eos token: <|eot_id|> |
| - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals |
| - Loading existing evaluations from saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - ***** Running TOFU evaluation suite ***** |
| - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_SUMMARY.json |
| - Skipping forget_quality, already evaluated. |
| - Result for metric forget_quality: 0.09352461409425458 |
| - Skipping forget_Q_A_Prob, already evaluated. |
| - Result for metric forget_Q_A_Prob: 0.07000148265040025 |
| - Skipping forget_Q_A_ROUGE, already evaluated. |
| - Result for metric forget_Q_A_ROUGE: 0.28561408364618274 |
| - Skipping model_utility, already evaluated. |
| - Result for metric model_utility: 0.6140003792455105 |
| - Skipping privleak, already evaluated. |
| - Result for metric privleak: 40.278085859319106 |
| - Skipping extraction_strength, already evaluated. |
| - Result for metric extraction_strength: 0.06814847463944672 |
| - Setting pad_token as eos token: <|eot_id|> |
| - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals |
| - Loading existing evaluations from saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - ***** Running TOFU evaluation suite ***** |
| - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_EVAL.json |
| - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.1-8B-Instruct_forget10_NPO/evals/TOFU_SUMMARY.json |
| - Skipping forget_quality, already evaluated. |
| - Result for metric forget_quality: 0.09352461409425458 |
| - Skipping forget_Q_A_Prob, already evaluated. |
| - Result for metric forget_Q_A_Prob: 0.07000148265040025 |
| - Skipping forget_Q_A_ROUGE, already evaluated. |
| - Result for metric forget_Q_A_ROUGE: 0.28561408364618274 |
| - Skipping model_utility, already evaluated. |
| - Result for metric model_utility: 0.6140003792455105 |
| - Skipping privleak, already evaluated. |
| - Result for metric privleak: 40.278085859319106 |
| - Skipping extraction_strength, already evaluated. |
| - Result for metric extraction_strength: 0.06814847463944672 |
|
|