error577 commited on
Commit
d34129d
·
verified ·
1 Parent(s): 5202b1d

Training in progress, step 60, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0688474f1bf024620068b5c32f665b6fb09610e73959079013271ebe44da9f9c
3
  size 407179392
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bd1a841fe06df2853fbd416cdc8d079cc531d947e13cc486f09f2bf14ee91d69
3
  size 407179392
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1236f2d6b3e24f640e4fa432d67d1a4626a32b15a696fa095be6faaafc57c47b
3
  size 109342998
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:22480292f7d6813921a3064dc9a64c13b8e3536ecbe8984008c1fe7db58637a9
3
  size 109342998
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fe21e0569e934ade38e8e5ab1c44c3bb29781c9068a7637f850c09cf55d86fc5
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c242a91be9cfcabf4b35bd27e771f2777f257c530adf560f58a0f34ab68510e0
3
  size 14244
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:530e1876edecc7a14181b17d14f75fb7d2b1b392457fd4e51b5ee70d940c8a90
3
  size 2080
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b04614c3fedfb0bab0db621905a752b151866b1995a65909c46af0471d274d85
3
  size 2080
last-checkpoint/trainer_state.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
- "epoch": 0.00012135097614725212,
5
  "eval_steps": 10,
6
- "global_step": 50,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
@@ -405,6 +405,84 @@
405
  "eval_samples_per_second": 0.448,
406
  "eval_steps_per_second": 0.448,
407
  "step": 50
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
408
  }
409
  ],
410
  "logging_steps": 1,
@@ -424,7 +502,7 @@
424
  "attributes": {}
425
  }
426
  },
427
- "total_flos": 1091804803891200.0,
428
  "train_batch_size": 1,
429
  "trial_name": null,
430
  "trial_params": null
 
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
+ "epoch": 0.00014562117137670256,
5
  "eval_steps": 10,
6
+ "global_step": 60,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
 
405
  "eval_samples_per_second": 0.448,
406
  "eval_steps_per_second": 0.448,
407
  "step": 50
408
+ },
409
+ {
410
+ "epoch": 0.00012377799567019716,
411
+ "grad_norm": 3.4755067825317383,
412
+ "learning_rate": 0.00019999999494757503,
413
+ "loss": 1.2644,
414
+ "step": 51
415
+ },
416
+ {
417
+ "epoch": 0.0001262050151931422,
418
+ "grad_norm": 3.064790725708008,
419
+ "learning_rate": 0.00019999999494757503,
420
+ "loss": 0.816,
421
+ "step": 52
422
+ },
423
+ {
424
+ "epoch": 0.00012863203471608726,
425
+ "grad_norm": 6.472192764282227,
426
+ "learning_rate": 0.00019999999494757503,
427
+ "loss": 3.0402,
428
+ "step": 53
429
+ },
430
+ {
431
+ "epoch": 0.00013105905423903229,
432
+ "grad_norm": 6.017213821411133,
433
+ "learning_rate": 0.00019999999494757503,
434
+ "loss": 1.9637,
435
+ "step": 54
436
+ },
437
+ {
438
+ "epoch": 0.00013348607376197734,
439
+ "grad_norm": 2.969481945037842,
440
+ "learning_rate": 0.00019999999494757503,
441
+ "loss": 1.0158,
442
+ "step": 55
443
+ },
444
+ {
445
+ "epoch": 0.0001359130932849224,
446
+ "grad_norm": 4.294132709503174,
447
+ "learning_rate": 0.00019999999494757503,
448
+ "loss": 2.329,
449
+ "step": 56
450
+ },
451
+ {
452
+ "epoch": 0.00013834011280786744,
453
+ "grad_norm": 2.0407297611236572,
454
+ "learning_rate": 0.00019999999494757503,
455
+ "loss": 0.8446,
456
+ "step": 57
457
+ },
458
+ {
459
+ "epoch": 0.00014076713233081246,
460
+ "grad_norm": 6.152376174926758,
461
+ "learning_rate": 0.00019999999494757503,
462
+ "loss": 1.7769,
463
+ "step": 58
464
+ },
465
+ {
466
+ "epoch": 0.0001431941518537575,
467
+ "grad_norm": 5.564684867858887,
468
+ "learning_rate": 0.00019999999494757503,
469
+ "loss": 1.8718,
470
+ "step": 59
471
+ },
472
+ {
473
+ "epoch": 0.00014562117137670256,
474
+ "grad_norm": 3.1191859245300293,
475
+ "learning_rate": 0.00019999999494757503,
476
+ "loss": 1.1267,
477
+ "step": 60
478
+ },
479
+ {
480
+ "epoch": 0.00014562117137670256,
481
+ "eval_loss": 2.2274293899536133,
482
+ "eval_runtime": 46.8696,
483
+ "eval_samples_per_second": 0.448,
484
+ "eval_steps_per_second": 0.448,
485
+ "step": 60
486
  }
487
  ],
488
  "logging_steps": 1,
 
502
  "attributes": {}
503
  }
504
  },
505
+ "total_flos": 1310165764669440.0,
506
  "train_batch_size": 1,
507
  "trial_name": null,
508
  "trial_params": null