mtorres98 commited on
Commit
344cc34
·
verified ·
1 Parent(s): 82e8e0c

Upload qwen3_8b_job_metrics.json with huggingface_hub

Browse files
Files changed (1) hide show
  1. qwen3_8b_job_metrics.json +39 -0
qwen3_8b_job_metrics.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "paper": "Learning User Simulators with Turing Rewards",
3
+ "arxiv": "2606.19336",
4
+ "base_model": "Qwen/Qwen3-8B",
5
+ "paper_judge": "Qwen/Qwen3.5-397B-A17B",
6
+ "job_judge": "gpt-4o-mini",
7
+ "job_judge_reason": "OPENROUTER_API_KEY missing; using OpenAI gpt-4o-mini",
8
+ "gpu": "NVIDIA A100-SXM4-80GB",
9
+ "gpu_mem_gb": 79.25,
10
+ "sft_repo": "mtorres98/turing-rl-qwen3-8b-sft",
11
+ "grpo_repo": "mtorres98/turing-rl-qwen3-8b-grpo",
12
+ "sft_metrics": {
13
+ "train_runtime": 56.1274,
14
+ "train_samples_per_second": 1.71,
15
+ "train_steps_per_second": 0.428,
16
+ "total_flos": 651154773639168.0,
17
+ "train_loss": 0.5987233859065478,
18
+ "epoch": 8.0
19
+ },
20
+ "grpo_metrics": {
21
+ "train_runtime": 63.3782,
22
+ "train_samples_per_second": 0.505,
23
+ "train_steps_per_second": 0.126,
24
+ "total_flos": 0.0,
25
+ "train_loss": 0.0,
26
+ "epoch": 0.6666666666666666
27
+ },
28
+ "scale": {
29
+ "sft_examples": 12,
30
+ "sft_steps": 24,
31
+ "grpo_prompts": 12,
32
+ "grpo_steps": 8,
33
+ "num_generations": 4,
34
+ "max_completion_length": 256,
35
+ "lora_rank": 64,
36
+ "note": "Scaled LoRA slice, not the paper's 1680 GPU-hour run."
37
+ },
38
+ "finished_at": "2026-09-09T18:09:25.613925+00:00"
39
+ }