doubledsbv commited on
Commit
eb39b94
·
verified ·
1 Parent(s): c77ca64

Upgraded OpenAI privacy-filter from linear 8 label token classifier to zero shot GLiNER PII filter.

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
gliner_config.json ADDED
@@ -0,0 +1,164 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "blank_entity_prob": 0.1,
3
+ "class_token_index": 200020,
4
+ "decoder_loss_coef": 0.5,
5
+ "decoder_mode": "span",
6
+ "dropout": 0.2,
7
+ "embed_ent_token": true,
8
+ "encoder_config": {
9
+ "_name_or_path": "/workspace/privacy_filter_base_encoder",
10
+ "architectures": [
11
+ "OpenAIPrivacyFilterModel"
12
+ ],
13
+ "attention_bias": true,
14
+ "attention_dropout": 0.0,
15
+ "bos_token_id": null,
16
+ "chunk_size_feed_forward": 0,
17
+ "classifier_dropout": 0.0,
18
+ "default_n_ctx": 128000,
19
+ "dtype": "bfloat16",
20
+ "eos_token_id": 199999,
21
+ "head_dim": 64,
22
+ "hidden_act": "silu",
23
+ "hidden_size": 640,
24
+ "id2label": {
25
+ "0": "O",
26
+ "1": "B-account_number",
27
+ "2": "I-account_number",
28
+ "3": "E-account_number",
29
+ "4": "S-account_number",
30
+ "5": "B-private_address",
31
+ "6": "I-private_address",
32
+ "7": "E-private_address",
33
+ "8": "S-private_address",
34
+ "9": "B-private_date",
35
+ "10": "I-private_date",
36
+ "11": "E-private_date",
37
+ "12": "S-private_date",
38
+ "13": "B-private_email",
39
+ "14": "I-private_email",
40
+ "15": "E-private_email",
41
+ "16": "S-private_email",
42
+ "17": "B-private_person",
43
+ "18": "I-private_person",
44
+ "19": "E-private_person",
45
+ "20": "S-private_person",
46
+ "21": "B-private_phone",
47
+ "22": "I-private_phone",
48
+ "23": "E-private_phone",
49
+ "24": "S-private_phone",
50
+ "25": "B-private_url",
51
+ "26": "I-private_url",
52
+ "27": "E-private_url",
53
+ "28": "S-private_url",
54
+ "29": "B-secret",
55
+ "30": "I-secret",
56
+ "31": "E-secret",
57
+ "32": "S-secret"
58
+ },
59
+ "initial_context_length": 4096,
60
+ "initializer_range": 0.02,
61
+ "intermediate_size": 640,
62
+ "is_encoder_decoder": false,
63
+ "label2id": {
64
+ "B-account_number": 1,
65
+ "B-private_address": 5,
66
+ "B-private_date": 9,
67
+ "B-private_email": 13,
68
+ "B-private_person": 17,
69
+ "B-private_phone": 21,
70
+ "B-private_url": 25,
71
+ "B-secret": 29,
72
+ "E-account_number": 3,
73
+ "E-private_address": 7,
74
+ "E-private_date": 11,
75
+ "E-private_email": 15,
76
+ "E-private_person": 19,
77
+ "E-private_phone": 23,
78
+ "E-private_url": 27,
79
+ "E-secret": 31,
80
+ "I-account_number": 2,
81
+ "I-private_address": 6,
82
+ "I-private_date": 10,
83
+ "I-private_email": 14,
84
+ "I-private_person": 18,
85
+ "I-private_phone": 22,
86
+ "I-private_url": 26,
87
+ "I-secret": 30,
88
+ "O": 0,
89
+ "S-account_number": 4,
90
+ "S-private_address": 8,
91
+ "S-private_date": 12,
92
+ "S-private_email": 16,
93
+ "S-private_person": 20,
94
+ "S-private_phone": 24,
95
+ "S-private_url": 28,
96
+ "S-secret": 32
97
+ },
98
+ "max_position_embeddings": 131072,
99
+ "model_type": "openai_privacy_filter",
100
+ "num_attention_heads": 14,
101
+ "num_experts_per_tok": 4,
102
+ "num_hidden_layers": 8,
103
+ "num_key_value_heads": 2,
104
+ "num_local_experts": 128,
105
+ "output_attentions": false,
106
+ "output_hidden_states": false,
107
+ "output_router_logits": false,
108
+ "pad_token_id": 199999,
109
+ "problem_type": null,
110
+ "return_dict": true,
111
+ "rms_norm_eps": 1e-05,
112
+ "rope_parameters": {
113
+ "beta_fast": 32.0,
114
+ "beta_slow": 1.0,
115
+ "factor": 32.0,
116
+ "original_max_position_embeddings": 4096,
117
+ "rope_theta": 150000.0,
118
+ "rope_type": "yarn",
119
+ "truncate": false
120
+ },
121
+ "router_aux_loss_coef": 0.001,
122
+ "sliding_window": 128,
123
+ "tie_word_embeddings": false,
124
+ "transformers.js_config": {
125
+ "use_external_data_format": {
126
+ "model": 1,
127
+ "model.onnx": 3,
128
+ "model_fp16.onnx": 2
129
+ }
130
+ },
131
+ "use_cache": true,
132
+ "vocab_size": 200022
133
+ },
134
+ "ent_token": "<<ENT>>",
135
+ "eos_token_id": 199999,
136
+ "fine_tune": false,
137
+ "fuse_layers": false,
138
+ "hidden_size": 768,
139
+ "id_to_classes": null,
140
+ "labels_decoder": null,
141
+ "labels_encoder": null,
142
+ "max_len": 512,
143
+ "max_neg_type_ratio": 1,
144
+ "max_types": 100,
145
+ "max_width": 12,
146
+ "model_name": "/workspace/privacy_filter_base_encoder",
147
+ "model_type": null,
148
+ "name": "span level gliner",
149
+ "neg_spans_ratio": 1.0,
150
+ "num_post_fusion_layers": 1,
151
+ "num_rnn_layers": 1,
152
+ "pad_token_id": 199999,
153
+ "post_fusion_schema": null,
154
+ "precomputed_prompts_mode": null,
155
+ "represent_spans": false,
156
+ "sep_token": "<<SEP>>",
157
+ "span_loss_coef": 0.5,
158
+ "span_mode": "markerV0",
159
+ "subtoken_pooling": "first",
160
+ "token_loss_coef": 1.0,
161
+ "transformers_version": "5.7.0",
162
+ "vocab_size": 200022,
163
+ "words_splitter_type": "whitespace"
164
+ }
pytorch_model.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db448b8247e5442bdc7b663600dc3f99d97044b2bdb28c24abc52a13aaec0404
3
+ size 2849509299
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:59178ffd19a651cc414e9bc0a067207576b4f699ec96d2651a0cd513a6490de7
3
+ size 27869768
tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "eos_token": "<|endoftext|>",
4
+ "is_local": true,
5
+ "local_files_only": false,
6
+ "model_input_names": [
7
+ "input_ids",
8
+ "attention_mask"
9
+ ],
10
+ "model_max_length": 128000,
11
+ "pad_token": "<|endoftext|>",
12
+ "tokenizer_class": "TokenizersBackend"
13
+ }