{ "train_loop_config": { "_dataset": "xsum", "_scenario": "clamp_sft_ref", "a2g_norm": true, "base_path": "/common/home/users/m/mq.nguyen.2023/testcode/SAC_LM/module9_clmv3", "beta_coef": "0.1", "block_size": 1024, "buffer_max_size": 20000, "causal_model": true, "checkpoint_interval": "2_000", "clamp_ref": true, "clamp_update": false, "config_name": null, "constraint_type": "kl", "cpu_per_worker": 6, "dataset_config_name": null, "dataset_name": "nbtpj/summ_ds_train", "effective_batch_size": 16, "ent_coef": 0.0001, "epsilon": 0.2, "eval_interval": "2_000", "freeze_role2": true, "gamma": 0.95, "gpu_per_worker": 1, "grad_norm": 0.5, "gradient_accumulation_steps": 1, "gradient_checkpoint": false, "group_relative_norm": true, "inference_config": { "do_sample": true, "max_new_tokens": 40, "min_new_tokens": 15, "temperature": 0.0 }, "keep_eval_size": false, "label_col": "summary", "learning_rate": 3e-07, "lm_fraction": -1.0, "lm_w": 0.0, "log_interval": "5m", "log_rollout_txt": true, "lora": false, "lr_scheduler_type": "constant", "max_train_rollouts": 100000, "max_train_steps": 100000, "mini_epoch": 2, "mixed_precision": "bf16", "model_name_or_path": "gpt2", "model_type": null, "n_augment": 0, "n_generate": 4, "need_attn_mask": true, "no_is_correction": false, "num_warmup_steps": 200, "only_train_role1": true, "per_device_eval_batch_size": 16, "per_device_query_rollout_batch_size": 32, "per_device_train_batch_size": 16, "pretrained_role2_name_or_path": "gpt2", "prompt_0": "{text}", "prompt_1": "{text}\nTL;DR: ", "prompt_2": "Given the text: {role1_output}\nReconstruct the summarized text to the detailed:", "prompt_eval": "{text}\nTL;DR:", "push_to_hub": null, "ref_role1_name_or_path": "nbtpj/summ_gpt2_tldr_xsum", "ref_role2_name_or_path": "gpt2", "rl_algo": "on_policy", "rl_w": 1.0, "rollout_config": { "acc_scale": "log", "accuracy_w": 1000.0, "accuracy_w2": 0.01, "len_pen": 1.0, "len_pen2": 1.0, "similarity_fn": "rouge", "threshold": 0.002 }, "rollout_game": "baseline3v2", "sample_config": { "do_sample": true, "min_new_tokens": 5, "temperature": 1.0 }, "script": "/common/home/users/m/mq.nguyen.2023/testcode/SAC_LM/module9_clmv3/execute/role_ablation/role_ablation.py", "seed": 0, "test_clm": false, "test_gen": true, "test_glue": false, "text_col": "text", "text_template": "{text}\nTL;DR: {summary}", "tokenizer_name": null, "train_from_raw": true, "train_split_name": "sim_with_one_golden__xsum_train", "trunc_eval": 20000, "trunc_evals": [ "xsum___20000" ], "trust_remote_code": true, "tune_metrics": [ "xsum/rouge1___1.0", "xsum/rouge2___2.0", "xsum/bertscore_f1___0.25" ], "use_deepspeed": false, "use_slow_tokenizer": false, "vectorizer_path": "/common/home/users/m/mq.nguyen.2023/testcode/SAC_LM/module9_clmv3/vectorizer/wikitext103_tfidf_full.joblib", "vllm_sleep": true, "vllm_vram_ratio": 0.3, "weight_decay": 1e-05, "world_size": 1, "zero_config": 2 } }