Training in progress, epoch 11, checkpoint
Browse files
last-checkpoint/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 218121344
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:be885acd1b623d184f6d21505f665bb48cdc90bb4f5ee078a8d6f1215d1e77fc
|
| 3 |
size 218121344
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 109417018
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4284e23f27cd81f019157a0ce26a7fcc3e95c3fce5557e16ef80f2d18736d10f
|
| 3 |
size 109417018
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14244
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:25f6571e80d696acb1f8fb4a87dde9dfb44c3e4b0276ab88f688ae9a992aa9cb
|
| 3 |
size 14244
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1064
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2b7254df380501aa4b47fcd34bcc64f4edea336cec9c1bc437117f0d650ecf31
|
| 3 |
size 1064
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
-
"epoch":
|
| 5 |
"eval_steps": 500,
|
| 6 |
-
"global_step":
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
@@ -1071,6 +1071,111 @@
|
|
| 1071 |
"learning_rate": 0.00010213049267643142,
|
| 1072 |
"loss": 0.1606,
|
| 1073 |
"step": 15200
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1074 |
}
|
| 1075 |
],
|
| 1076 |
"logging_steps": 100,
|
|
@@ -1090,7 +1195,7 @@
|
|
| 1090 |
"attributes": {}
|
| 1091 |
}
|
| 1092 |
},
|
| 1093 |
-
"total_flos":
|
| 1094 |
"train_batch_size": 1,
|
| 1095 |
"trial_name": null,
|
| 1096 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
+
"epoch": 11.0,
|
| 5 |
"eval_steps": 500,
|
| 6 |
+
"global_step": 16797,
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
|
|
| 1071 |
"learning_rate": 0.00010213049267643142,
|
| 1072 |
"loss": 0.1606,
|
| 1073 |
"step": 15200
|
| 1074 |
+
},
|
| 1075 |
+
{
|
| 1076 |
+
"epoch": 10.019646365422396,
|
| 1077 |
+
"grad_norm": 2.236553192138672,
|
| 1078 |
+
"learning_rate": 0.0001014647137150466,
|
| 1079 |
+
"loss": 0.1476,
|
| 1080 |
+
"step": 15300
|
| 1081 |
+
},
|
| 1082 |
+
{
|
| 1083 |
+
"epoch": 10.08513425016372,
|
| 1084 |
+
"grad_norm": 0.3063783645629883,
|
| 1085 |
+
"learning_rate": 0.0001007989347536618,
|
| 1086 |
+
"loss": 0.1373,
|
| 1087 |
+
"step": 15400
|
| 1088 |
+
},
|
| 1089 |
+
{
|
| 1090 |
+
"epoch": 10.150622134905042,
|
| 1091 |
+
"grad_norm": 2.75140118598938,
|
| 1092 |
+
"learning_rate": 0.00010013315579227697,
|
| 1093 |
+
"loss": 0.1552,
|
| 1094 |
+
"step": 15500
|
| 1095 |
+
},
|
| 1096 |
+
{
|
| 1097 |
+
"epoch": 10.216110019646365,
|
| 1098 |
+
"grad_norm": 0.556614339351654,
|
| 1099 |
+
"learning_rate": 9.946737683089215e-05,
|
| 1100 |
+
"loss": 0.1372,
|
| 1101 |
+
"step": 15600
|
| 1102 |
+
},
|
| 1103 |
+
{
|
| 1104 |
+
"epoch": 10.281597904387688,
|
| 1105 |
+
"grad_norm": 0.4766944348812103,
|
| 1106 |
+
"learning_rate": 9.880159786950732e-05,
|
| 1107 |
+
"loss": 0.1383,
|
| 1108 |
+
"step": 15700
|
| 1109 |
+
},
|
| 1110 |
+
{
|
| 1111 |
+
"epoch": 10.347085789129011,
|
| 1112 |
+
"grad_norm": 0.2531126141548157,
|
| 1113 |
+
"learning_rate": 9.813581890812251e-05,
|
| 1114 |
+
"loss": 0.1524,
|
| 1115 |
+
"step": 15800
|
| 1116 |
+
},
|
| 1117 |
+
{
|
| 1118 |
+
"epoch": 10.412573673870334,
|
| 1119 |
+
"grad_norm": 0.5934678316116333,
|
| 1120 |
+
"learning_rate": 9.747003994673769e-05,
|
| 1121 |
+
"loss": 0.1428,
|
| 1122 |
+
"step": 15900
|
| 1123 |
+
},
|
| 1124 |
+
{
|
| 1125 |
+
"epoch": 10.478061558611657,
|
| 1126 |
+
"grad_norm": 0.7293221950531006,
|
| 1127 |
+
"learning_rate": 9.680426098535287e-05,
|
| 1128 |
+
"loss": 0.144,
|
| 1129 |
+
"step": 16000
|
| 1130 |
+
},
|
| 1131 |
+
{
|
| 1132 |
+
"epoch": 10.54354944335298,
|
| 1133 |
+
"grad_norm": 2.1880910396575928,
|
| 1134 |
+
"learning_rate": 9.613848202396804e-05,
|
| 1135 |
+
"loss": 0.1467,
|
| 1136 |
+
"step": 16100
|
| 1137 |
+
},
|
| 1138 |
+
{
|
| 1139 |
+
"epoch": 10.609037328094303,
|
| 1140 |
+
"grad_norm": 3.2338201999664307,
|
| 1141 |
+
"learning_rate": 9.547270306258322e-05,
|
| 1142 |
+
"loss": 0.1438,
|
| 1143 |
+
"step": 16200
|
| 1144 |
+
},
|
| 1145 |
+
{
|
| 1146 |
+
"epoch": 10.674525212835626,
|
| 1147 |
+
"grad_norm": 6.8729634284973145,
|
| 1148 |
+
"learning_rate": 9.480692410119841e-05,
|
| 1149 |
+
"loss": 0.1401,
|
| 1150 |
+
"step": 16300
|
| 1151 |
+
},
|
| 1152 |
+
{
|
| 1153 |
+
"epoch": 10.740013097576949,
|
| 1154 |
+
"grad_norm": 1.1812797784805298,
|
| 1155 |
+
"learning_rate": 9.414114513981358e-05,
|
| 1156 |
+
"loss": 0.1451,
|
| 1157 |
+
"step": 16400
|
| 1158 |
+
},
|
| 1159 |
+
{
|
| 1160 |
+
"epoch": 10.805500982318271,
|
| 1161 |
+
"grad_norm": 2.1439294815063477,
|
| 1162 |
+
"learning_rate": 9.347536617842877e-05,
|
| 1163 |
+
"loss": 0.1554,
|
| 1164 |
+
"step": 16500
|
| 1165 |
+
},
|
| 1166 |
+
{
|
| 1167 |
+
"epoch": 10.870988867059594,
|
| 1168 |
+
"grad_norm": 0.730587363243103,
|
| 1169 |
+
"learning_rate": 9.280958721704395e-05,
|
| 1170 |
+
"loss": 0.1477,
|
| 1171 |
+
"step": 16600
|
| 1172 |
+
},
|
| 1173 |
+
{
|
| 1174 |
+
"epoch": 10.936476751800917,
|
| 1175 |
+
"grad_norm": 0.5725963711738586,
|
| 1176 |
+
"learning_rate": 9.214380825565913e-05,
|
| 1177 |
+
"loss": 0.1529,
|
| 1178 |
+
"step": 16700
|
| 1179 |
}
|
| 1180 |
],
|
| 1181 |
"logging_steps": 100,
|
|
|
|
| 1195 |
"attributes": {}
|
| 1196 |
}
|
| 1197 |
},
|
| 1198 |
+
"total_flos": 6.324008120221696e+16,
|
| 1199 |
"train_batch_size": 1,
|
| 1200 |
"trial_name": null,
|
| 1201 |
"trial_params": null
|