iRanadheer commited on
Commit
9605058
·
verified ·
1 Parent(s): 4047541

Training in progress, step 250, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:27256bf9e087b16ad0d6d5ebe45d963080fbd15a259f59cecf49b0bdbf658d54
3
  size 116429720
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e83ecce4172b6569813c03ab52f2be1fa55ab1932d6bca2b0745ba565927325f
3
  size 116429720
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f571e51ae26be76150cbcaca1fea38cf4c4ca2e1b6091261ad7c56d47e941f8e
3
  size 59409573
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:59de098eb21d287d0ff5d641369521b22a7a7a5a4a5700d53a5b4c0fca9d5990
3
  size 59409573
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:363c5df1543d2c82b2f13164f35bdd0367ceb32e7fa1b2f67c19df073a08b17b
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1255b82ec9f462fef6f8c2f4a8ee876c4b6d998a53c99546a4eddcc1aabaefc7
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:44c2a12f6131abfae72720e44e68747b8fa2a7e6d312d2e740729fbf80789f5b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:810175fa292ba2b217f4f86dac014c190963d55e5a29863cf85601d5d54b1bc7
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 200,
3
- "best_metric": 0.1492398977279663,
4
- "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-200",
5
- "epoch": 0.9913258983890955,
6
  "eval_steps": 25,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -352,6 +352,92 @@
352
  "eval_samples_per_second": 8.814,
353
  "eval_steps_per_second": 2.241,
354
  "step": 200
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
355
  }
356
  ],
357
  "logging_steps": 5,
@@ -371,7 +457,7 @@
371
  "attributes": {}
372
  }
373
  },
374
- "total_flos": 1.36738348332156e+17,
375
  "train_batch_size": 1,
376
  "trial_name": null,
377
  "trial_params": null
 
1
  {
2
+ "best_global_step": 250,
3
+ "best_metric": 0.14815586805343628,
4
+ "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-250",
5
+ "epoch": 1.2379182156133828,
6
  "eval_steps": 25,
7
+ "global_step": 250,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
352
  "eval_samples_per_second": 8.814,
353
  "eval_steps_per_second": 2.241,
354
  "step": 200
355
+ },
356
+ {
357
+ "epoch": 1.0148698884758365,
358
+ "grad_norm": 0.07653596252202988,
359
+ "learning_rate": 0.00015211495991996027,
360
+ "loss": 0.16517894268035888,
361
+ "step": 205
362
+ },
363
+ {
364
+ "epoch": 1.0396530359355638,
365
+ "grad_norm": 0.07493323087692261,
366
+ "learning_rate": 0.00014984775852212807,
367
+ "loss": 0.14664943218231202,
368
+ "step": 210
369
+ },
370
+ {
371
+ "epoch": 1.0644361833952911,
372
+ "grad_norm": 0.07914339751005173,
373
+ "learning_rate": 0.00014754593388242117,
374
+ "loss": 0.14977338314056396,
375
+ "step": 215
376
+ },
377
+ {
378
+ "epoch": 1.0892193308550187,
379
+ "grad_norm": 0.09382504969835281,
380
+ "learning_rate": 0.00014521108480154032,
381
+ "loss": 0.14892799854278566,
382
+ "step": 220
383
+ },
384
+ {
385
+ "epoch": 1.114002478314746,
386
+ "grad_norm": 0.08522579073905945,
387
+ "learning_rate": 0.0001428448330182931,
388
+ "loss": 0.13943066596984863,
389
+ "step": 225
390
+ },
391
+ {
392
+ "epoch": 1.114002478314746,
393
+ "eval_loss": 0.1489669382572174,
394
+ "eval_runtime": 20.0756,
395
+ "eval_samples_per_second": 8.817,
396
+ "eval_steps_per_second": 2.242,
397
+ "step": 225
398
+ },
399
+ {
400
+ "epoch": 1.1387856257744733,
401
+ "grad_norm": 0.10055539757013321,
402
+ "learning_rate": 0.00014044882208316713,
403
+ "loss": 0.15772825479507446,
404
+ "step": 230
405
+ },
406
+ {
407
+ "epoch": 1.1635687732342008,
408
+ "grad_norm": 0.08639902621507645,
409
+ "learning_rate": 0.00013802471621675338,
410
+ "loss": 0.13583142757415773,
411
+ "step": 235
412
+ },
413
+ {
414
+ "epoch": 1.1883519206939281,
415
+ "grad_norm": 0.0846349224448204,
416
+ "learning_rate": 0.000135574199153812,
417
+ "loss": 0.13156899213790893,
418
+ "step": 240
419
+ },
420
+ {
421
+ "epoch": 1.2131350681536555,
422
+ "grad_norm": 0.08887381851673126,
423
+ "learning_rate": 0.00013309897297378455,
424
+ "loss": 0.14310439825057983,
425
+ "step": 245
426
+ },
427
+ {
428
+ "epoch": 1.2379182156133828,
429
+ "grad_norm": 0.08967562019824982,
430
+ "learning_rate": 0.00013060075691856407,
431
+ "loss": 0.15425143241882325,
432
+ "step": 250
433
+ },
434
+ {
435
+ "epoch": 1.2379182156133828,
436
+ "eval_loss": 0.14815586805343628,
437
+ "eval_runtime": 20.0845,
438
+ "eval_samples_per_second": 8.813,
439
+ "eval_steps_per_second": 2.241,
440
+ "step": 250
441
  }
442
  ],
443
  "logging_steps": 5,
 
457
  "attributes": {}
458
  }
459
  },
460
+ "total_flos": 1.707753437024616e+17,
461
  "train_batch_size": 1,
462
  "trial_name": null,
463
  "trial_params": null