iRanadheer commited on
Commit
f094b67
·
verified ·
1 Parent(s): adc4c2b

Training in progress, step 600, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ca3640589c2390d9967c7433ceae24ac9843086862d7dd756519abe60470254b
3
  size 116429720
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e4b545d49fe14d73710e8be59f54d8011a23bcf006f5c92cb1bce0920a4ab345
3
  size 116429720
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:079ed8b63644409916ea1fdca4c4994949e7ebd03b634ed1032374db8aa05bfa
3
  size 59409829
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e6d2a10336278437e9906bea901f4aebe8c92d43a4693d129b420f6b65253ca
3
  size 59409829
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a804dd9b4962bc1e7c8e5b51c83ce95f04ab0a366340b47fc4849e7d4ecffd6d
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3a95215f64b02d62fb58ace326ad670f1d16eb1761f7fa3b3478d43d2b8d6108
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e672137b8b40b776d73f3d3dac12eb7edc686f9258625b61bb124ca9a20f6b98
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fb5aa242e3bcc5174e48aa4899d432dd96dd20e8a245f7c2f14ded5a57305d67
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": 550,
3
  "best_metric": 0.14384840428829193,
4
  "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-550",
5
- "epoch": 2.7236679058240396,
6
  "eval_steps": 25,
7
- "global_step": 550,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -954,6 +954,92 @@
954
  "eval_samples_per_second": 8.789,
955
  "eval_steps_per_second": 2.234,
956
  "step": 550
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
957
  }
958
  ],
959
  "logging_steps": 5,
@@ -973,7 +1059,7 @@
973
  "attributes": {}
974
  }
975
  },
976
- "total_flos": 3.7581424180033664e+17,
977
  "train_batch_size": 1,
978
  "trial_name": null,
979
  "trial_params": null
 
2
  "best_global_step": 550,
3
  "best_metric": 0.14384840428829193,
4
  "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-550",
5
+ "epoch": 2.9714993804213137,
6
  "eval_steps": 25,
7
+ "global_step": 600,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
954
  "eval_samples_per_second": 8.789,
955
  "eval_steps_per_second": 2.234,
956
  "step": 550
957
+ },
958
+ {
959
+ "epoch": 2.748451053283767,
960
+ "grad_norm": 0.11186806112527847,
961
+ "learning_rate": 3.7330444783642338e-06,
962
+ "loss": 0.13718799352645875,
963
+ "step": 555
964
+ },
965
+ {
966
+ "epoch": 2.7732342007434942,
967
+ "grad_norm": 0.10549531131982803,
968
+ "learning_rate": 3.053166686309783e-06,
969
+ "loss": 0.13304147720336915,
970
+ "step": 560
971
+ },
972
+ {
973
+ "epoch": 2.7980173482032216,
974
+ "grad_norm": 0.10434003919363022,
975
+ "learning_rate": 2.440626198044327e-06,
976
+ "loss": 0.11780736446380616,
977
+ "step": 565
978
+ },
979
+ {
980
+ "epoch": 2.8228004956629493,
981
+ "grad_norm": 0.10914986580610275,
982
+ "learning_rate": 1.895848471765227e-06,
983
+ "loss": 0.12229269742965698,
984
+ "step": 570
985
+ },
986
+ {
987
+ "epoch": 2.8475836431226766,
988
+ "grad_norm": 0.11424117535352707,
989
+ "learning_rate": 1.4192118990299707e-06,
990
+ "loss": 0.12974271774291993,
991
+ "step": 575
992
+ },
993
+ {
994
+ "epoch": 2.8475836431226766,
995
+ "eval_loss": 0.1438693404197693,
996
+ "eval_runtime": 20.2164,
997
+ "eval_samples_per_second": 8.755,
998
+ "eval_steps_per_second": 2.226,
999
+ "step": 575
1000
+ },
1001
+ {
1002
+ "epoch": 2.872366790582404,
1003
+ "grad_norm": 0.10830768942832947,
1004
+ "learning_rate": 1.0110475419330967e-06,
1005
+ "loss": 0.12486574649810792,
1006
+ "step": 580
1007
+ },
1008
+ {
1009
+ "epoch": 2.8971499380421313,
1010
+ "grad_norm": 0.11147851496934891,
1011
+ "learning_rate": 6.716389031571568e-07,
1012
+ "loss": 0.12139828205108642,
1013
+ "step": 585
1014
+ },
1015
+ {
1016
+ "epoch": 2.9219330855018586,
1017
+ "grad_norm": 0.09997480362653732,
1018
+ "learning_rate": 4.0122172905753266e-07,
1019
+ "loss": 0.11921333074569702,
1020
+ "step": 590
1021
+ },
1022
+ {
1023
+ "epoch": 2.9467162329615864,
1024
+ "grad_norm": 0.10038603842258453,
1025
+ "learning_rate": 1.9998384591773944e-07,
1026
+ "loss": 0.12386640310287475,
1027
+ "step": 595
1028
+ },
1029
+ {
1030
+ "epoch": 2.9714993804213137,
1031
+ "grad_norm": 0.10965593159198761,
1032
+ "learning_rate": 6.806502948918381e-08,
1033
+ "loss": 0.11748340129852294,
1034
+ "step": 600
1035
+ },
1036
+ {
1037
+ "epoch": 2.9714993804213137,
1038
+ "eval_loss": 0.14387772977352142,
1039
+ "eval_runtime": 20.189,
1040
+ "eval_samples_per_second": 8.767,
1041
+ "eval_steps_per_second": 2.229,
1042
+ "step": 600
1043
  }
1044
  ],
1045
  "logging_steps": 5,
 
1059
  "attributes": {}
1060
  }
1061
  },
1062
+ "total_flos": 4.09940244306036e+17,
1063
  "train_batch_size": 1,
1064
  "trial_name": null,
1065
  "trial_params": null