iRanadheer commited on
Commit
a11939e
·
verified ·
1 Parent(s): f281ef5

Training in progress, step 200, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f5869002301206cf61caecdf28204d3b770c2f9ddafe7c1349e97e37ed1b2768
3
  size 116429720
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:27256bf9e087b16ad0d6d5ebe45d963080fbd15a259f59cecf49b0bdbf658d54
3
  size 116429720
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8c109dc5b5644ba7a357da20e937cc9a3e95a8de97ef5772af35af0a34a21403
3
  size 59409573
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f571e51ae26be76150cbcaca1fea38cf4c4ca2e1b6091261ad7c56d47e941f8e
3
  size 59409573
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f196323d7423b60f8e4ceb7dbf8715ee326c0d068e5ff164f13c63b279b9f1a0
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:363c5df1543d2c82b2f13164f35bdd0367ceb32e7fa1b2f67c19df073a08b17b
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2cff6fc665e4d91c5051c5fa73612d18bec6081070ebc75ad011f141ae5a06f8
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:44c2a12f6131abfae72720e44e68747b8fa2a7e6d312d2e740729fbf80789f5b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 150,
3
- "best_metric": 0.15226973593235016,
4
- "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-150",
5
- "epoch": 0.7434944237918215,
6
  "eval_steps": 25,
7
- "global_step": 150,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -266,6 +266,92 @@
266
  "eval_samples_per_second": 8.813,
267
  "eval_steps_per_second": 2.241,
268
  "step": 150
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
269
  }
270
  ],
271
  "logging_steps": 5,
@@ -285,7 +371,7 @@
285
  "attributes": {}
286
  }
287
  },
288
- "total_flos": 1.025534960462448e+17,
289
  "train_batch_size": 1,
290
  "trial_name": null,
291
  "trial_params": null
 
1
  {
2
+ "best_global_step": 200,
3
+ "best_metric": 0.1492398977279663,
4
+ "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-200",
5
+ "epoch": 0.9913258983890955,
6
  "eval_steps": 25,
7
+ "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
266
  "eval_samples_per_second": 8.813,
267
  "eval_steps_per_second": 2.241,
268
  "step": 150
269
+ },
270
+ {
271
+ "epoch": 0.7682775712515489,
272
+ "grad_norm": 0.08852466195821762,
273
+ "learning_rate": 0.00017254953066647913,
274
+ "loss": 0.15643792152404784,
275
+ "step": 155
276
+ },
277
+ {
278
+ "epoch": 0.7930607187112764,
279
+ "grad_norm": 0.08484289050102234,
280
+ "learning_rate": 0.00017071067811865476,
281
+ "loss": 0.15839605331420897,
282
+ "step": 160
283
+ },
284
+ {
285
+ "epoch": 0.8178438661710037,
286
+ "grad_norm": 0.08800984919071198,
287
+ "learning_rate": 0.00016882271136822206,
288
+ "loss": 0.1647958755493164,
289
+ "step": 165
290
+ },
291
+ {
292
+ "epoch": 0.8426270136307311,
293
+ "grad_norm": 0.08345294743776321,
294
+ "learning_rate": 0.0001668869417585873,
295
+ "loss": 0.1509941339492798,
296
+ "step": 170
297
+ },
298
+ {
299
+ "epoch": 0.8674101610904585,
300
+ "grad_norm": 0.07677271962165833,
301
+ "learning_rate": 0.00016490471383605288,
302
+ "loss": 0.1612541437149048,
303
+ "step": 175
304
+ },
305
+ {
306
+ "epoch": 0.8674101610904585,
307
+ "eval_loss": 0.15066702663898468,
308
+ "eval_runtime": 20.0686,
309
+ "eval_samples_per_second": 8.82,
310
+ "eval_steps_per_second": 2.242,
311
+ "step": 175
312
+ },
313
+ {
314
+ "epoch": 0.8921933085501859,
315
+ "grad_norm": 0.08086061477661133,
316
+ "learning_rate": 0.000162877404415923,
317
+ "loss": 0.1522205352783203,
318
+ "step": 180
319
+ },
320
+ {
321
+ "epoch": 0.9169764560099133,
322
+ "grad_norm": 0.082602858543396,
323
+ "learning_rate": 0.00016080642162619565,
324
+ "loss": 0.15029544830322267,
325
+ "step": 185
326
+ },
327
+ {
328
+ "epoch": 0.9417596034696406,
329
+ "grad_norm": 0.07821306586265564,
330
+ "learning_rate": 0.00015869320392950526,
331
+ "loss": 0.14748865365982056,
332
+ "step": 190
333
+ },
334
+ {
335
+ "epoch": 0.966542750929368,
336
+ "grad_norm": 0.08585070073604584,
337
+ "learning_rate": 0.00015653921912399589,
338
+ "loss": 0.14947665929794313,
339
+ "step": 195
340
+ },
341
+ {
342
+ "epoch": 0.9913258983890955,
343
+ "grad_norm": 0.08411425352096558,
344
+ "learning_rate": 0.00015434596332381852,
345
+ "loss": 0.15700777769088745,
346
+ "step": 200
347
+ },
348
+ {
349
+ "epoch": 0.9913258983890955,
350
+ "eval_loss": 0.1492398977279663,
351
+ "eval_runtime": 20.0816,
352
+ "eval_samples_per_second": 8.814,
353
+ "eval_steps_per_second": 2.241,
354
+ "step": 200
355
  }
356
  ],
357
  "logging_steps": 5,
 
371
  "attributes": {}
372
  }
373
  },
374
+ "total_flos": 1.36738348332156e+17,
375
  "train_batch_size": 1,
376
  "trial_name": null,
377
  "trial_params": null