the_applied_ai_universe_adversarial_defenses / leaderboard_defenses_classical.csv
ericyoc's picture
Book 3: defended artifacts, figures, leaderboards
d7e357f verified
Raw
History Blame Contribute Delete
2.75 kB
victim,attack,clean,robust,asr,Linf,L2,extra
planning,defense (gain +1.00),1.0,1.0,0.0,,,goal reachable again after integrity restore
expert,defense (gain +0.33),1.0,1.0,0.0,,,"['healthy', 'measles', 'migraine']β†’['flu', 'measles', 'migraine']"
fuzzy,defense (gain +0.09),1.0,0.9600997959194016,0.0,,,mean dev 0.134β†’0.040
supervised,defense (gain +0.04),0.9555555555555556,0.8,0.0,,,"robust 0.76->0.80, clean cost +0.04"
features,defense (gain +0.05),0.912280701754386,0.912280701754386,0.0,,,clean-data acc 0.97; removed 115 poisoned
semisup,defense (gain +0.02),0.9842022116903634,0.6619273301737757,0.0,,,"112 seeds demoted, clean ref 0.985"
kmeans,defense (gain +0.69),1.0,0.7923087022021148,0.0,,,centroid shift 8.46β†’0.26
ensemble,defense (gain +0.23),0.9033333333333332,0.3,0.0,,,disagreement threshold=0.433
regression,defense (gain +0.03),1.0,0.6302522469612915,0.0,,,MSE on adversarial inputs 0.657β†’0.587
mlp_mnist,defense (gain +0.03),0.89,0.029,0.0,,,"robust 0.00β†’0.03, clean 0.91β†’0.89"
cnn_mnist,defense (gain +0.61),0.967,0.658,0.0,,,"robust 0.05β†’0.66, clean 0.94β†’0.97"
perceptron,defense (gain +0.50),1.0,0.75,0.0,,,max-margin boundary
lstm_sine,defense (gain +0.00),0.989947947101386,0.989563331692434,0.0,,,MSE 0.0114->0.0105
som,defense (gain -0.01),1.0,0.3145466280862606,0.0,,,Gaussian augmentation sigma=0.5 x3; BMU drift 2.04->2.18
dnn_cifar,defense (gain +0.01),0.303,0.01,0.0,,,"robust 0.00β†’0.01, clean 0.34β†’0.30"
transfer_cifar,defense (gain +0.37),0.844,0.496,0.0,,,adversarial training on frozen-base head
gan,defense (gain -0.01),0.5,0.48775,0.0,,,"DP-SGD (Abadi 2016) C=1.0, sigma=1.1; MI acc 0.50->0.51"
attention,defense (gain +0.00),1.0,0.9605941468326152,0.0,,,"randomized smoothing sigma=0.5, n=100; shift 0.0413->0.0394"
dropout,defense (gain +0.00),0.682,0.0,0.0,,,randomized smoothing Οƒ=0.25
rl_qlearning,defense (gain +0.68),0.82,0.82,0.0,,,"reward clipping + median over 5 readings, 2/5 poisoned"
capsnet,defense (gain +0.33),0.964,0.734,0.0,,,adversarial training (batched)
dbn,defense (gain +0.00),0.94,0.9066666666666666,0.0,,,reconstruction threshold=0.0319
ngram_lm,defense (gain +0.06),1.0,0.3926280997457064,0.0,,,ppl 3.6->3.0
pretrained_nlu,defense (gain +1.00),1.0,1.0,0.0,,,unicode normalization undoes homoglyphs
dialogue,defense (gain +0.67),1.0,1.0,0.0,,,query normalization restores retrieval
rlhf,defense (gain +0.51),1.0,0.8,0.0,,,gamed/honest reward 3.50β†’1.25
diffusion,defense (gain -0.01),0.5,0.4905,0.0,,,"DP-SGD (Abadi 2016) C=1.0, sigma=1.0; MI acc 0.50->0.51"
lora,defense (gain +0.00),1.0,0.0,0.0,,,Fine-Pruning (Liu et al. 2018): 30% prune + clean fine-tune
mamba,curriculum adv training (gain +0.00),1.000000,0.002500,0.997500,,,