Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -34,20 +34,72 @@ model-index:
|
|
| 34 |
results:
|
| 35 |
- task:
|
| 36 |
type: other
|
| 37 |
-
name: Chess play
|
| 38 |
dataset:
|
| 39 |
-
type: self-play
|
| 40 |
-
name:
|
| 41 |
metrics:
|
| 42 |
- type: elo
|
| 43 |
-
name: Elo
|
| 44 |
value: 63.0
|
|
|
|
|
|
|
| 45 |
- type: elo
|
| 46 |
-
name: Elo
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 47 |
value: 2800
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 48 |
- type: pearsonr
|
| 49 |
-
name: Correlation with teacher
|
| 50 |
value: 0.9803
|
|
|
|
|
|
|
| 51 |
---
|
| 52 |
|
| 53 |
# Sable — a 60 KB standalone chess evaluation network
|
|
|
|
| 34 |
results:
|
| 35 |
- task:
|
| 36 |
type: other
|
| 37 |
+
name: Chess play, head-to-head vs the previous release
|
| 38 |
dataset:
|
| 39 |
+
type: self-play-head-to-head
|
| 40 |
+
name: Randomised 8-ply openings, colours swapped every pair
|
| 41 |
metrics:
|
| 42 |
- type: elo
|
| 43 |
+
name: Elo at 20,000 nodes/move
|
| 44 |
value: 63.0
|
| 45 |
+
args: 3000 games, three independent opening sets, 95% CI +/-12.6
|
| 46 |
+
verified: false
|
| 47 |
- type: elo
|
| 48 |
+
name: Elo at 100ms/move
|
| 49 |
+
value: 42.3
|
| 50 |
+
args: 800 games, 95% CI +/-24.3
|
| 51 |
+
verified: false
|
| 52 |
+
- type: elo
|
| 53 |
+
name: Elo at 300ms/move
|
| 54 |
+
value: 51.6
|
| 55 |
+
args: 400 games, 95% CI +/-34.4
|
| 56 |
+
verified: false
|
| 57 |
+
- task:
|
| 58 |
+
type: other
|
| 59 |
+
name: Chess play, absolute rating anchor
|
| 60 |
+
dataset:
|
| 61 |
+
type: stockfish-uci-elo
|
| 62 |
+
name: Stockfish with UCI_LimitStrength, four settings
|
| 63 |
+
metrics:
|
| 64 |
+
- type: elo
|
| 65 |
+
name: Implied Elo on Stockfish's UCI_Elo scale
|
| 66 |
value: 2800
|
| 67 |
+
args: 200 games per setting at 100ms/move; anchors spread 2741-2881, so treat as +/-70
|
| 68 |
+
verified: false
|
| 69 |
+
- task:
|
| 70 |
+
type: other
|
| 71 |
+
name: Chess play, gauntlet vs earlier builds
|
| 72 |
+
dataset:
|
| 73 |
+
type: self-play-gauntlet
|
| 74 |
+
name: Every historical binary kept in the repository
|
| 75 |
+
metrics:
|
| 76 |
+
- type: elo
|
| 77 |
+
name: Elo vs the hand-crafted evaluator it replaced
|
| 78 |
+
value: 156.2
|
| 79 |
+
args: 600 games at 20,000 nodes/move, 95% CI +/-30.7
|
| 80 |
+
verified: false
|
| 81 |
+
- type: elo
|
| 82 |
+
name: Elo vs the first network release
|
| 83 |
+
value: 150.7
|
| 84 |
+
args: 600 games at 20,000 nodes/move, 95% CI +/-30.5
|
| 85 |
+
verified: false
|
| 86 |
+
- type: elo
|
| 87 |
+
name: Self-play control, same binary both sides
|
| 88 |
+
value: 5.2
|
| 89 |
+
args: 400 games; zero inside the 95% CI of +/-34.1, so the harness is unbiased
|
| 90 |
+
verified: false
|
| 91 |
+
- task:
|
| 92 |
+
type: other
|
| 93 |
+
name: Regression against the teacher search
|
| 94 |
+
dataset:
|
| 95 |
+
type: self-play-held-out-positions
|
| 96 |
+
name: 20,000 held-out positions labelled by the engine's own search
|
| 97 |
+
metrics:
|
| 98 |
- type: pearsonr
|
| 99 |
+
name: Correlation with teacher score (invariant under the output gain)
|
| 100 |
value: 0.9803
|
| 101 |
+
args: quantised int8 weights, as shipped
|
| 102 |
+
verified: false
|
| 103 |
---
|
| 104 |
|
| 105 |
# Sable — a 60 KB standalone chess evaluation network
|