Training in progress, epoch 10, checkpoint
Browse files
last-checkpoint/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 218121344
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:93ed9d910865c040bb4e8228d8f17e050d4abd7fa4567fae0f618649423c3459
|
| 3 |
size 218121344
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 109417018
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:48f62a3434f2b8e8744dc25ea578e1b6786d5d9dab5d6a0b654cb08f8e0804d1
|
| 3 |
size 109417018
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14244
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0009e9c2bcc220e59267f52f8156b8d01b9e750bb5f6a74945612a1026990d89
|
| 3 |
size 14244
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1064
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:12f661b61f73b13b74450e15d45c319ce94ca9d3f4730beaaa9e2ebd1092cf2c
|
| 3 |
size 1064
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
-
"epoch":
|
| 5 |
"eval_steps": 500,
|
| 6 |
-
"global_step":
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
@@ -966,6 +966,111 @@
|
|
| 966 |
"learning_rate": 0.00011211717709720373,
|
| 967 |
"loss": 0.1898,
|
| 968 |
"step": 13700
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 969 |
}
|
| 970 |
],
|
| 971 |
"logging_steps": 100,
|
|
@@ -985,7 +1090,7 @@
|
|
| 985 |
"attributes": {}
|
| 986 |
}
|
| 987 |
},
|
| 988 |
-
"total_flos": 5.
|
| 989 |
"train_batch_size": 1,
|
| 990 |
"trial_name": null,
|
| 991 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
+
"epoch": 10.0,
|
| 5 |
"eval_steps": 500,
|
| 6 |
+
"global_step": 15270,
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
|
|
| 966 |
"learning_rate": 0.00011211717709720373,
|
| 967 |
"loss": 0.1898,
|
| 968 |
"step": 13700
|
| 969 |
+
},
|
| 970 |
+
{
|
| 971 |
+
"epoch": 9.037328094302554,
|
| 972 |
+
"grad_norm": 0.8357772827148438,
|
| 973 |
+
"learning_rate": 0.00011145139813581891,
|
| 974 |
+
"loss": 0.1514,
|
| 975 |
+
"step": 13800
|
| 976 |
+
},
|
| 977 |
+
{
|
| 978 |
+
"epoch": 9.102815979043877,
|
| 979 |
+
"grad_norm": 0.7970616817474365,
|
| 980 |
+
"learning_rate": 0.00011078561917443409,
|
| 981 |
+
"loss": 0.1537,
|
| 982 |
+
"step": 13900
|
| 983 |
+
},
|
| 984 |
+
{
|
| 985 |
+
"epoch": 9.1683038637852,
|
| 986 |
+
"grad_norm": 1.1566450595855713,
|
| 987 |
+
"learning_rate": 0.00011011984021304926,
|
| 988 |
+
"loss": 0.1538,
|
| 989 |
+
"step": 14000
|
| 990 |
+
},
|
| 991 |
+
{
|
| 992 |
+
"epoch": 9.233791748526523,
|
| 993 |
+
"grad_norm": 0.8751351237297058,
|
| 994 |
+
"learning_rate": 0.00010945406125166447,
|
| 995 |
+
"loss": 0.1494,
|
| 996 |
+
"step": 14100
|
| 997 |
+
},
|
| 998 |
+
{
|
| 999 |
+
"epoch": 9.299279633267846,
|
| 1000 |
+
"grad_norm": 0.8269241452217102,
|
| 1001 |
+
"learning_rate": 0.00010878828229027964,
|
| 1002 |
+
"loss": 0.1555,
|
| 1003 |
+
"step": 14200
|
| 1004 |
+
},
|
| 1005 |
+
{
|
| 1006 |
+
"epoch": 9.364767518009169,
|
| 1007 |
+
"grad_norm": 1.342864990234375,
|
| 1008 |
+
"learning_rate": 0.00010812250332889482,
|
| 1009 |
+
"loss": 0.1622,
|
| 1010 |
+
"step": 14300
|
| 1011 |
+
},
|
| 1012 |
+
{
|
| 1013 |
+
"epoch": 9.430255402750491,
|
| 1014 |
+
"grad_norm": 1.0193088054656982,
|
| 1015 |
+
"learning_rate": 0.00010745672436751,
|
| 1016 |
+
"loss": 0.1574,
|
| 1017 |
+
"step": 14400
|
| 1018 |
+
},
|
| 1019 |
+
{
|
| 1020 |
+
"epoch": 9.495743287491814,
|
| 1021 |
+
"grad_norm": 0.3667553663253784,
|
| 1022 |
+
"learning_rate": 0.00010679094540612517,
|
| 1023 |
+
"loss": 0.153,
|
| 1024 |
+
"step": 14500
|
| 1025 |
+
},
|
| 1026 |
+
{
|
| 1027 |
+
"epoch": 9.561231172233137,
|
| 1028 |
+
"grad_norm": 0.8412798047065735,
|
| 1029 |
+
"learning_rate": 0.00010612516644474036,
|
| 1030 |
+
"loss": 0.1646,
|
| 1031 |
+
"step": 14600
|
| 1032 |
+
},
|
| 1033 |
+
{
|
| 1034 |
+
"epoch": 9.62671905697446,
|
| 1035 |
+
"grad_norm": 0.8854599595069885,
|
| 1036 |
+
"learning_rate": 0.00010545938748335554,
|
| 1037 |
+
"loss": 0.1578,
|
| 1038 |
+
"step": 14700
|
| 1039 |
+
},
|
| 1040 |
+
{
|
| 1041 |
+
"epoch": 9.692206941715783,
|
| 1042 |
+
"grad_norm": 0.6291230916976929,
|
| 1043 |
+
"learning_rate": 0.00010479360852197071,
|
| 1044 |
+
"loss": 0.1571,
|
| 1045 |
+
"step": 14800
|
| 1046 |
+
},
|
| 1047 |
+
{
|
| 1048 |
+
"epoch": 9.757694826457106,
|
| 1049 |
+
"grad_norm": 1.2499074935913086,
|
| 1050 |
+
"learning_rate": 0.00010412782956058589,
|
| 1051 |
+
"loss": 0.1698,
|
| 1052 |
+
"step": 14900
|
| 1053 |
+
},
|
| 1054 |
+
{
|
| 1055 |
+
"epoch": 9.82318271119843,
|
| 1056 |
+
"grad_norm": 0.8760678768157959,
|
| 1057 |
+
"learning_rate": 0.00010346205059920106,
|
| 1058 |
+
"loss": 0.1564,
|
| 1059 |
+
"step": 15000
|
| 1060 |
+
},
|
| 1061 |
+
{
|
| 1062 |
+
"epoch": 9.88867059593975,
|
| 1063 |
+
"grad_norm": 0.6060988306999207,
|
| 1064 |
+
"learning_rate": 0.00010279627163781624,
|
| 1065 |
+
"loss": 0.1692,
|
| 1066 |
+
"step": 15100
|
| 1067 |
+
},
|
| 1068 |
+
{
|
| 1069 |
+
"epoch": 9.954158480681073,
|
| 1070 |
+
"grad_norm": 0.3887087106704712,
|
| 1071 |
+
"learning_rate": 0.00010213049267643142,
|
| 1072 |
+
"loss": 0.1606,
|
| 1073 |
+
"step": 15200
|
| 1074 |
}
|
| 1075 |
],
|
| 1076 |
"logging_steps": 100,
|
|
|
|
| 1090 |
"attributes": {}
|
| 1091 |
}
|
| 1092 |
},
|
| 1093 |
+
"total_flos": 5.749098290977178e+16,
|
| 1094 |
"train_batch_size": 1,
|
| 1095 |
"trial_name": null,
|
| 1096 |
"trial_params": null
|