Training in progress, epoch 9, checkpoint
Browse files
last-checkpoint/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 218121344
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:840a92318f61fb69dfa182efe684dee99a3da41ff831a2d13605a5bfda5b237a
|
| 3 |
size 218121344
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 109417018
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:18fb9f5b0c6be125bf8e33bedf2743d20c16b806eea2d63e93bbcc2df2c1e5e4
|
| 3 |
size 109417018
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14244
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:31ead472a288ebb053d701bd95414927cdbca7ca1cfd07450fda73d4911fe2c0
|
| 3 |
size 14244
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1064
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:8e15441b49e878da620ad3310232c539e63deb05abff50db000f873f37bfdb8d
|
| 3 |
size 1064
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
-
"epoch":
|
| 5 |
"eval_steps": 500,
|
| 6 |
-
"global_step":
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
@@ -861,6 +861,111 @@
|
|
| 861 |
"learning_rate": 0.00012210386151797602,
|
| 862 |
"loss": 0.1897,
|
| 863 |
"step": 12200
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 864 |
}
|
| 865 |
],
|
| 866 |
"logging_steps": 100,
|
|
@@ -880,7 +985,7 @@
|
|
| 880 |
"attributes": {}
|
| 881 |
}
|
| 882 |
},
|
| 883 |
-
"total_flos":
|
| 884 |
"train_batch_size": 1,
|
| 885 |
"trial_name": null,
|
| 886 |
"trial_params": null
|
|
|
|
| 1 |
{
|
| 2 |
"best_metric": null,
|
| 3 |
"best_model_checkpoint": null,
|
| 4 |
+
"epoch": 9.0,
|
| 5 |
"eval_steps": 500,
|
| 6 |
+
"global_step": 13743,
|
| 7 |
"is_hyper_param_search": false,
|
| 8 |
"is_local_process_zero": true,
|
| 9 |
"is_world_process_zero": true,
|
|
|
|
| 861 |
"learning_rate": 0.00012210386151797602,
|
| 862 |
"loss": 0.1897,
|
| 863 |
"step": 12200
|
| 864 |
+
},
|
| 865 |
+
{
|
| 866 |
+
"epoch": 8.055009823182711,
|
| 867 |
+
"grad_norm": 1.205670714378357,
|
| 868 |
+
"learning_rate": 0.00012143808255659121,
|
| 869 |
+
"loss": 0.1626,
|
| 870 |
+
"step": 12300
|
| 871 |
+
},
|
| 872 |
+
{
|
| 873 |
+
"epoch": 8.120497707924034,
|
| 874 |
+
"grad_norm": 0.502905547618866,
|
| 875 |
+
"learning_rate": 0.00012077230359520639,
|
| 876 |
+
"loss": 0.1598,
|
| 877 |
+
"step": 12400
|
| 878 |
+
},
|
| 879 |
+
{
|
| 880 |
+
"epoch": 8.185985592665357,
|
| 881 |
+
"grad_norm": 1.0201475620269775,
|
| 882 |
+
"learning_rate": 0.00012010652463382157,
|
| 883 |
+
"loss": 0.1721,
|
| 884 |
+
"step": 12500
|
| 885 |
+
},
|
| 886 |
+
{
|
| 887 |
+
"epoch": 8.25147347740668,
|
| 888 |
+
"grad_norm": 0.6289061903953552,
|
| 889 |
+
"learning_rate": 0.00011944074567243674,
|
| 890 |
+
"loss": 0.1646,
|
| 891 |
+
"step": 12600
|
| 892 |
+
},
|
| 893 |
+
{
|
| 894 |
+
"epoch": 8.316961362148003,
|
| 895 |
+
"grad_norm": 1.2342171669006348,
|
| 896 |
+
"learning_rate": 0.00011877496671105193,
|
| 897 |
+
"loss": 0.1675,
|
| 898 |
+
"step": 12700
|
| 899 |
+
},
|
| 900 |
+
{
|
| 901 |
+
"epoch": 8.382449246889326,
|
| 902 |
+
"grad_norm": 0.6001673340797424,
|
| 903 |
+
"learning_rate": 0.00011810918774966711,
|
| 904 |
+
"loss": 0.1673,
|
| 905 |
+
"step": 12800
|
| 906 |
+
},
|
| 907 |
+
{
|
| 908 |
+
"epoch": 8.447937131630649,
|
| 909 |
+
"grad_norm": 0.9419691562652588,
|
| 910 |
+
"learning_rate": 0.00011744340878828231,
|
| 911 |
+
"loss": 0.1621,
|
| 912 |
+
"step": 12900
|
| 913 |
+
},
|
| 914 |
+
{
|
| 915 |
+
"epoch": 8.513425016371972,
|
| 916 |
+
"grad_norm": 0.6249241828918457,
|
| 917 |
+
"learning_rate": 0.00011677762982689749,
|
| 918 |
+
"loss": 0.1673,
|
| 919 |
+
"step": 13000
|
| 920 |
+
},
|
| 921 |
+
{
|
| 922 |
+
"epoch": 8.578912901113295,
|
| 923 |
+
"grad_norm": 1.8031052350997925,
|
| 924 |
+
"learning_rate": 0.00011611185086551266,
|
| 925 |
+
"loss": 0.1742,
|
| 926 |
+
"step": 13100
|
| 927 |
+
},
|
| 928 |
+
{
|
| 929 |
+
"epoch": 8.644400785854616,
|
| 930 |
+
"grad_norm": 0.8871346712112427,
|
| 931 |
+
"learning_rate": 0.00011544607190412784,
|
| 932 |
+
"loss": 0.1725,
|
| 933 |
+
"step": 13200
|
| 934 |
+
},
|
| 935 |
+
{
|
| 936 |
+
"epoch": 8.709888670595939,
|
| 937 |
+
"grad_norm": 1.4257563352584839,
|
| 938 |
+
"learning_rate": 0.00011478029294274302,
|
| 939 |
+
"loss": 0.1617,
|
| 940 |
+
"step": 13300
|
| 941 |
+
},
|
| 942 |
+
{
|
| 943 |
+
"epoch": 8.775376555337262,
|
| 944 |
+
"grad_norm": 10.05364990234375,
|
| 945 |
+
"learning_rate": 0.00011411451398135819,
|
| 946 |
+
"loss": 0.1743,
|
| 947 |
+
"step": 13400
|
| 948 |
+
},
|
| 949 |
+
{
|
| 950 |
+
"epoch": 8.840864440078585,
|
| 951 |
+
"grad_norm": 0.492718905210495,
|
| 952 |
+
"learning_rate": 0.00011344873501997337,
|
| 953 |
+
"loss": 0.1718,
|
| 954 |
+
"step": 13500
|
| 955 |
+
},
|
| 956 |
+
{
|
| 957 |
+
"epoch": 8.906352324819908,
|
| 958 |
+
"grad_norm": 3.150280237197876,
|
| 959 |
+
"learning_rate": 0.00011278295605858856,
|
| 960 |
+
"loss": 0.1719,
|
| 961 |
+
"step": 13600
|
| 962 |
+
},
|
| 963 |
+
{
|
| 964 |
+
"epoch": 8.97184020956123,
|
| 965 |
+
"grad_norm": 3.0732333660125732,
|
| 966 |
+
"learning_rate": 0.00011211717709720373,
|
| 967 |
+
"loss": 0.1898,
|
| 968 |
+
"step": 13700
|
| 969 |
}
|
| 970 |
],
|
| 971 |
"logging_steps": 100,
|
|
|
|
| 985 |
"attributes": {}
|
| 986 |
}
|
| 987 |
},
|
| 988 |
+
"total_flos": 5.174188457538355e+16,
|
| 989 |
"train_batch_size": 1,
|
| 990 |
"trial_name": null,
|
| 991 |
"trial_params": null
|