shubhxho commited on
Commit
2874883
·
verified ·
1 Parent(s): a98b020

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +58 -6
README.md CHANGED
@@ -34,20 +34,72 @@ model-index:
34
  results:
35
  - task:
36
  type: other
37
- name: Chess play (engine strength)
38
  dataset:
39
- type: self-play
40
- name: Sable self-play, 10.1M deduplicated positions
41
  metrics:
42
  - type: elo
43
- name: Elo vs previous release (3000 games, 20k nodes/move)
44
  value: 63.0
 
 
45
  - type: elo
46
- name: Elo anchored to Stockfish UCI_Elo (200 games per setting, 100ms/move)
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  value: 2800
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  - type: pearsonr
49
- name: Correlation with teacher search (rank quality, gain-invariant)
50
  value: 0.9803
 
 
51
  ---
52
 
53
  # Sable — a 60 KB standalone chess evaluation network
 
34
  results:
35
  - task:
36
  type: other
37
+ name: Chess play, head-to-head vs the previous release
38
  dataset:
39
+ type: self-play-head-to-head
40
+ name: Randomised 8-ply openings, colours swapped every pair
41
  metrics:
42
  - type: elo
43
+ name: Elo at 20,000 nodes/move
44
  value: 63.0
45
+ args: 3000 games, three independent opening sets, 95% CI +/-12.6
46
+ verified: false
47
  - type: elo
48
+ name: Elo at 100ms/move
49
+ value: 42.3
50
+ args: 800 games, 95% CI +/-24.3
51
+ verified: false
52
+ - type: elo
53
+ name: Elo at 300ms/move
54
+ value: 51.6
55
+ args: 400 games, 95% CI +/-34.4
56
+ verified: false
57
+ - task:
58
+ type: other
59
+ name: Chess play, absolute rating anchor
60
+ dataset:
61
+ type: stockfish-uci-elo
62
+ name: Stockfish with UCI_LimitStrength, four settings
63
+ metrics:
64
+ - type: elo
65
+ name: Implied Elo on Stockfish's UCI_Elo scale
66
  value: 2800
67
+ args: 200 games per setting at 100ms/move; anchors spread 2741-2881, so treat as +/-70
68
+ verified: false
69
+ - task:
70
+ type: other
71
+ name: Chess play, gauntlet vs earlier builds
72
+ dataset:
73
+ type: self-play-gauntlet
74
+ name: Every historical binary kept in the repository
75
+ metrics:
76
+ - type: elo
77
+ name: Elo vs the hand-crafted evaluator it replaced
78
+ value: 156.2
79
+ args: 600 games at 20,000 nodes/move, 95% CI +/-30.7
80
+ verified: false
81
+ - type: elo
82
+ name: Elo vs the first network release
83
+ value: 150.7
84
+ args: 600 games at 20,000 nodes/move, 95% CI +/-30.5
85
+ verified: false
86
+ - type: elo
87
+ name: Self-play control, same binary both sides
88
+ value: 5.2
89
+ args: 400 games; zero inside the 95% CI of +/-34.1, so the harness is unbiased
90
+ verified: false
91
+ - task:
92
+ type: other
93
+ name: Regression against the teacher search
94
+ dataset:
95
+ type: self-play-held-out-positions
96
+ name: 20,000 held-out positions labelled by the engine's own search
97
+ metrics:
98
  - type: pearsonr
99
+ name: Correlation with teacher score (invariant under the output gain)
100
  value: 0.9803
101
+ args: quantised int8 weights, as shipped
102
+ verified: false
103
  ---
104
 
105
  # Sable — a 60 KB standalone chess evaluation network