{ "int8": { "input_patch_embedding.hidden_layer.weight": { "block_size": [ 1, 48 ], "dtype": "torch.float32" }, "input_patch_embedding.output_layer.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "input_patch_embedding.residual_layer.weight": { "block_size": [ 1, 48 ], "dtype": "torch.float32" }, "encoder.block.0.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.0.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.1.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.1.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.2.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.2.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.3.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.3.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.4.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.4.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.5.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.5.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.6.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.6.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.7.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.7.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.8.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.8.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.9.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.9.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.10.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.10.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" }, "encoder.block.11.layer.0.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.0.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.0.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.0.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.1.self_attention.q.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.1.self_attention.k.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.1.self_attention.v.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.1.self_attention.o.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.2.mlp.wi.weight": { "block_size": [ 1, 768 ], "dtype": "torch.float32" }, "encoder.block.11.layer.2.mlp.wo.weight": { "block_size": [ 1, 3072 ], "dtype": "torch.float32" } }, "dense": [ "shared.weight", "input_patch_embedding.hidden_layer.bias", "input_patch_embedding.output_layer.bias", "input_patch_embedding.residual_layer.bias", "encoder.block.0.layer.0.layer_norm.weight", "encoder.block.0.layer.1.layer_norm.weight", "encoder.block.0.layer.2.layer_norm.weight", "encoder.block.1.layer.0.layer_norm.weight", "encoder.block.1.layer.1.layer_norm.weight", "encoder.block.1.layer.2.layer_norm.weight", "encoder.block.2.layer.0.layer_norm.weight", "encoder.block.2.layer.1.layer_norm.weight", "encoder.block.2.layer.2.layer_norm.weight", "encoder.block.3.layer.0.layer_norm.weight", "encoder.block.3.layer.1.layer_norm.weight", "encoder.block.3.layer.2.layer_norm.weight", "encoder.block.4.layer.0.layer_norm.weight", "encoder.block.4.layer.1.layer_norm.weight", "encoder.block.4.layer.2.layer_norm.weight", "encoder.block.5.layer.0.layer_norm.weight", "encoder.block.5.layer.1.layer_norm.weight", "encoder.block.5.layer.2.layer_norm.weight", "encoder.block.6.layer.0.layer_norm.weight", "encoder.block.6.layer.1.layer_norm.weight", "encoder.block.6.layer.2.layer_norm.weight", "encoder.block.7.layer.0.layer_norm.weight", "encoder.block.7.layer.1.layer_norm.weight", "encoder.block.7.layer.2.layer_norm.weight", "encoder.block.8.layer.0.layer_norm.weight", "encoder.block.8.layer.1.layer_norm.weight", "encoder.block.8.layer.2.layer_norm.weight", "encoder.block.9.layer.0.layer_norm.weight", "encoder.block.9.layer.1.layer_norm.weight", "encoder.block.9.layer.2.layer_norm.weight", "encoder.block.10.layer.0.layer_norm.weight", "encoder.block.10.layer.1.layer_norm.weight", "encoder.block.10.layer.2.layer_norm.weight", "encoder.block.11.layer.0.layer_norm.weight", "encoder.block.11.layer.1.layer_norm.weight", "encoder.block.11.layer.2.layer_norm.weight", "encoder.final_layer_norm.weight", "output_patch_embedding.hidden_layer.weight", "output_patch_embedding.hidden_layer.bias", "output_patch_embedding.output_layer.weight", "output_patch_embedding.output_layer.bias", "output_patch_embedding.residual_layer.weight", "output_patch_embedding.residual_layer.bias" ], "base": "amazon/chronos-2", "method": "torchao.Int8WeightOnlyConfig", "skipped_modules": [ "output_patch_embedding.hidden_layer", "output_patch_embedding.output_layer", "output_patch_embedding.residual_layer" ], "quantized_modules": [ "input_patch_embedding.hidden_layer", "input_patch_embedding.output_layer", "input_patch_embedding.residual_layer", "encoder.block.0.layer.0.self_attention.q", "encoder.block.0.layer.0.self_attention.k", "encoder.block.0.layer.0.self_attention.v", "encoder.block.0.layer.0.self_attention.o", "encoder.block.0.layer.1.self_attention.q", "encoder.block.0.layer.1.self_attention.k", "encoder.block.0.layer.1.self_attention.v", "encoder.block.0.layer.1.self_attention.o", "encoder.block.0.layer.2.mlp.wi", "encoder.block.0.layer.2.mlp.wo", "encoder.block.1.layer.0.self_attention.q", "encoder.block.1.layer.0.self_attention.k", "encoder.block.1.layer.0.self_attention.v", "encoder.block.1.layer.0.self_attention.o", "encoder.block.1.layer.1.self_attention.q", "encoder.block.1.layer.1.self_attention.k", "encoder.block.1.layer.1.self_attention.v", "encoder.block.1.layer.1.self_attention.o", "encoder.block.1.layer.2.mlp.wi", "encoder.block.1.layer.2.mlp.wo", "encoder.block.2.layer.0.self_attention.q", "encoder.block.2.layer.0.self_attention.k", "encoder.block.2.layer.0.self_attention.v", "encoder.block.2.layer.0.self_attention.o", "encoder.block.2.layer.1.self_attention.q", "encoder.block.2.layer.1.self_attention.k", "encoder.block.2.layer.1.self_attention.v", "encoder.block.2.layer.1.self_attention.o", "encoder.block.2.layer.2.mlp.wi", "encoder.block.2.layer.2.mlp.wo", "encoder.block.3.layer.0.self_attention.q", "encoder.block.3.layer.0.self_attention.k", "encoder.block.3.layer.0.self_attention.v", "encoder.block.3.layer.0.self_attention.o", "encoder.block.3.layer.1.self_attention.q", "encoder.block.3.layer.1.self_attention.k", "encoder.block.3.layer.1.self_attention.v", "encoder.block.3.layer.1.self_attention.o", "encoder.block.3.layer.2.mlp.wi", "encoder.block.3.layer.2.mlp.wo", "encoder.block.4.layer.0.self_attention.q", "encoder.block.4.layer.0.self_attention.k", "encoder.block.4.layer.0.self_attention.v", "encoder.block.4.layer.0.self_attention.o", "encoder.block.4.layer.1.self_attention.q", "encoder.block.4.layer.1.self_attention.k", "encoder.block.4.layer.1.self_attention.v", "encoder.block.4.layer.1.self_attention.o", "encoder.block.4.layer.2.mlp.wi", "encoder.block.4.layer.2.mlp.wo", "encoder.block.5.layer.0.self_attention.q", "encoder.block.5.layer.0.self_attention.k", "encoder.block.5.layer.0.self_attention.v", "encoder.block.5.layer.0.self_attention.o", "encoder.block.5.layer.1.self_attention.q", "encoder.block.5.layer.1.self_attention.k", "encoder.block.5.layer.1.self_attention.v", "encoder.block.5.layer.1.self_attention.o", "encoder.block.5.layer.2.mlp.wi", "encoder.block.5.layer.2.mlp.wo", "encoder.block.6.layer.0.self_attention.q", "encoder.block.6.layer.0.self_attention.k", "encoder.block.6.layer.0.self_attention.v", "encoder.block.6.layer.0.self_attention.o", "encoder.block.6.layer.1.self_attention.q", "encoder.block.6.layer.1.self_attention.k", "encoder.block.6.layer.1.self_attention.v", "encoder.block.6.layer.1.self_attention.o", "encoder.block.6.layer.2.mlp.wi", "encoder.block.6.layer.2.mlp.wo", "encoder.block.7.layer.0.self_attention.q", "encoder.block.7.layer.0.self_attention.k", "encoder.block.7.layer.0.self_attention.v", "encoder.block.7.layer.0.self_attention.o", "encoder.block.7.layer.1.self_attention.q", "encoder.block.7.layer.1.self_attention.k", "encoder.block.7.layer.1.self_attention.v", "encoder.block.7.layer.1.self_attention.o", "encoder.block.7.layer.2.mlp.wi", "encoder.block.7.layer.2.mlp.wo", "encoder.block.8.layer.0.self_attention.q", "encoder.block.8.layer.0.self_attention.k", "encoder.block.8.layer.0.self_attention.v", "encoder.block.8.layer.0.self_attention.o", "encoder.block.8.layer.1.self_attention.q", "encoder.block.8.layer.1.self_attention.k", "encoder.block.8.layer.1.self_attention.v", "encoder.block.8.layer.1.self_attention.o", "encoder.block.8.layer.2.mlp.wi", "encoder.block.8.layer.2.mlp.wo", "encoder.block.9.layer.0.self_attention.q", "encoder.block.9.layer.0.self_attention.k", "encoder.block.9.layer.0.self_attention.v", "encoder.block.9.layer.0.self_attention.o", "encoder.block.9.layer.1.self_attention.q", "encoder.block.9.layer.1.self_attention.k", "encoder.block.9.layer.1.self_attention.v", "encoder.block.9.layer.1.self_attention.o", "encoder.block.9.layer.2.mlp.wi", "encoder.block.9.layer.2.mlp.wo", "encoder.block.10.layer.0.self_attention.q", "encoder.block.10.layer.0.self_attention.k", "encoder.block.10.layer.0.self_attention.v", "encoder.block.10.layer.0.self_attention.o", "encoder.block.10.layer.1.self_attention.q", "encoder.block.10.layer.1.self_attention.k", "encoder.block.10.layer.1.self_attention.v", "encoder.block.10.layer.1.self_attention.o", "encoder.block.10.layer.2.mlp.wi", "encoder.block.10.layer.2.mlp.wo", "encoder.block.11.layer.0.self_attention.q", "encoder.block.11.layer.0.self_attention.k", "encoder.block.11.layer.0.self_attention.v", "encoder.block.11.layer.0.self_attention.o", "encoder.block.11.layer.1.self_attention.q", "encoder.block.11.layer.1.self_attention.k", "encoder.block.11.layer.1.self_attention.v", "encoder.block.11.layer.1.self_attention.o", "encoder.block.11.layer.2.mlp.wi", "encoder.block.11.layer.2.mlp.wo" ] }