{ "source": "local-artifact:composition-v1", "method": "Full-model simulation distillation, uncertainty-weighted action loss", "objective": "imitation", "reference_method": "Exact optimal finite-shoe single-player unsplit decisions within 50000 cache misses; explicit basic-continuation Monte Carlo fallback otherwise. Per-row method/coverage recorded.", "teacher_counts": { "train": { "exact": 7427, "monte_carlo": 58109 }, "selection": { "exact": 507, "monte_carlo": 3589 }, "calibration": { "exact": 238, "monte_carlo": 1810 }, "test": { "exact": 1006, "monte_carlo": 7186 } }, "full_model": true, "epochs": 3, "batch_size": 8, "learning_rate": 5e-06, "seed": 40260924, "device": "cuda:0", "history": [ { "epoch": 1, "complete_epoch": true, "updates": 24576, "mean_loss": 0.6137711106589644, "selection": { "action_brier": 0.09495679542787608, "teacher_agreement": 0.9443359375, "teacher_ev_regret": 0.0015316948437898948, "hit_bust_brier": 0.0006087590208322614, "dealer_brier": 0.0015001254346832336, "teacher_action_ece": 0.03929415957062843, "resolved_agreement": 0.9790444258172674, "unresolved_agreement": 0.7040618955512572, "resolved_states": 3579, "unresolved_states": 517, "by_players": { "7": { "states": 404, "teacher_agreement": 0.948019801980198, "teacher_ev_regret": 0.0014164990717821782 }, "3": { "states": 570, "teacher_agreement": 0.9333333333333333, "teacher_ev_regret": 0.00194091796875 }, "6": { "states": 474, "teacher_agreement": 0.9324894514767933, "teacher_ev_regret": 0.0019067691851265822 }, "4": { "states": 588, "teacher_agreement": 0.95578231292517, "teacher_ev_regret": 0.0013251272188562924 }, "2": { "states": 751, "teacher_agreement": 0.9507323568575233, "teacher_ev_regret": 0.001689966763065912 }, "1": { "states": 759, "teacher_agreement": 0.9420289855072463, "teacher_ev_regret": 0.0013262321028997494 }, "5": { "states": 550, "teacher_agreement": 0.9454545454545454, "teacher_ev_regret": 0.0011572265625 } }, "by_stratum": { "general": { "states": 2048, "teacher_agreement": 0.95703125, "teacher_ev_regret": 0.000969717147655146 }, "depleted": { "states": 2048, "teacher_agreement": 0.931640625, "teacher_ev_regret": 0.002093672539924644 } }, "by_teacher": { "monte_carlo": { "states": 3589, "teacher_agreement": 0.9456673168013374, "teacher_ev_regret": 0.0015454189994601561 }, "exact": { "states": 507, "teacher_agreement": 0.9349112426035503, "teacher_ev_regret": 0.001434542980475167 } } }, "selection_eligible": false }, { "epoch": 2, "complete_epoch": true, "updates": 49152, "mean_loss": 0.5968220626006241, "selection": { "action_brier": 0.09040151564200882, "teacher_agreement": 0.947265625, "teacher_ev_regret": 0.001314263350765287, "hit_bust_brier": 0.0003857798560271163, "dealer_brier": 0.0011841758487930866, "teacher_action_ece": 0.04156270071993659, "resolved_agreement": 0.9837943559653535, "unresolved_agreement": 0.6943907156673114, "resolved_states": 3579, "unresolved_states": 517, "by_players": { "7": { "states": 404, "teacher_agreement": 0.9554455445544554, "teacher_ev_regret": 0.0008560029586943069 }, "3": { "states": 570, "teacher_agreement": 0.9385964912280702, "teacher_ev_regret": 0.0019876045093201755 }, "6": { "states": 474, "teacher_agreement": 0.9324894514767933, "teacher_ev_regret": 0.0017123322949630802 }, "4": { "states": 588, "teacher_agreement": 0.9523809523809523, "teacher_ev_regret": 0.0008906150350765306 }, "2": { "states": 751, "teacher_agreement": 0.9494007989347537, "teacher_ev_regret": 0.0015682215379494008 }, "1": { "states": 759, "teacher_agreement": 0.9472990777338604, "teacher_ev_regret": 0.0011364859050357256 }, "5": { "states": 550, "teacher_agreement": 0.9545454545454546, "teacher_ev_regret": 0.0009614701704545454 } }, "by_stratum": { "general": { "states": 2048, "teacher_agreement": 0.95849609375, "teacher_ev_regret": 0.0008593745229399758 }, "depleted": { "states": 2048, "teacher_agreement": 0.93603515625, "teacher_ev_regret": 0.0017691521785905984 } }, "by_teacher": { "monte_carlo": { "states": 3589, "teacher_agreement": 0.9467818333797715, "teacher_ev_regret": 0.0013517526970430482 }, "exact": { "states": 507, "teacher_agreement": 0.9506903353057199, "teacher_ev_regret": 0.0010488801874696562 } } }, "selection_eligible": true }, { "epoch": 3, "complete_epoch": true, "updates": 73728, "mean_loss": 0.5832477171116298, "selection": { "action_brier": 0.07964431880238707, "teacher_agreement": 0.95458984375, "teacher_ev_regret": 0.0010111489430474339, "hit_bust_brier": 0.00029111769938248327, "dealer_brier": 0.0009628682438364339, "teacher_action_ece": 0.03631929756629491, "resolved_agreement": 0.9879854708019, "unresolved_agreement": 0.723404255319149, "resolved_states": 3579, "unresolved_states": 517, "by_players": { "7": { "states": 404, "teacher_agreement": 0.9653465346534653, "teacher_ev_regret": 0.0005245397586633664 }, "3": { "states": 570, "teacher_agreement": 0.9421052631578948, "teacher_ev_regret": 0.0016378837719298247 }, "6": { "states": 474, "teacher_agreement": 0.9345991561181435, "teacher_ev_regret": 0.0016482067510548524 }, "4": { "states": 588, "teacher_agreement": 0.9625850340136054, "teacher_ev_regret": 0.0008196149553571429 }, "2": { "states": 751, "teacher_agreement": 0.96271637816245, "teacher_ev_regret": 0.0008223085365346206 }, "1": { "states": 759, "teacher_agreement": 0.9525691699604744, "teacher_ev_regret": 0.0009504321275161915 }, "5": { "states": 550, "teacher_agreement": 0.96, "teacher_ev_regret": 0.0007164417613636364 } }, "by_stratum": { "general": { "states": 2048, "teacher_agreement": 0.9638671875, "teacher_ev_regret": 0.000675438124557217 }, "depleted": { "states": 2048, "teacher_agreement": 0.9453125, "teacher_ev_regret": 0.0013468597615376508 } }, "by_teacher": { "monte_carlo": { "states": 3589, "teacher_agreement": 0.9543048202842017, "teacher_ev_regret": 0.0010268667608491224 }, "exact": { "states": 507, "teacher_agreement": 0.9566074950690335, "teacher_ev_regret": 0.0008998841539147721 } } }, "selection_eligible": true } ], "stopped_for_budget": false, "updates": 73728, "baseline": { "states": 8192, "teacher_agreement": 0.9495849609375, "teacher_ev_regret": 0.0014074805906066532, "hit_bust_brier": 0.0007162610006696003, "dealer_brier": 0.0015329088272374996, "action_brier": 0.07573528661987305, "teacher_action_ece": 0.013433056640624967 }, "baseline_selection": { "action_brier": 0.0818870382032546, "teacher_agreement": 0.947998046875, "teacher_ev_regret": 0.0015162492694547767, "hit_bust_brier": 0.0007207577826748892, "dealer_brier": 0.0015160600000445174, "teacher_action_ece": 0.015856055714206178, "resolved_agreement": 0.9793238334730372, "unresolved_agreement": 0.7311411992263056, "resolved_states": 3579, "unresolved_states": 517, "by_players": { "7": { "states": 404, "teacher_agreement": 0.9579207920792079, "teacher_ev_regret": 0.001230069906404703 }, "3": { "states": 570, "teacher_agreement": 0.9280701754385965, "teacher_ev_regret": 0.002407997532894737 }, "6": { "states": 474, "teacher_agreement": 0.9409282700421941, "teacher_ev_regret": 0.0015104269679588607 }, "4": { "states": 588, "teacher_agreement": 0.9523809523809523, "teacher_ev_regret": 0.0013508699378188774 }, "2": { "states": 751, "teacher_agreement": 0.952063914780293, "teacher_ev_regret": 0.0018087862017310253 }, "1": { "states": 759, "teacher_agreement": 0.9486166007905138, "teacher_ev_regret": 0.0012070137206017996 }, "5": { "states": 550, "teacher_agreement": 0.9563636363636364, "teacher_ev_regret": 0.0010114080255681818 } }, "by_stratum": { "general": { "states": 2048, "teacher_agreement": 0.958984375, "teacher_ev_regret": 0.0009934053901861305 }, "depleted": { "states": 2048, "teacher_agreement": 0.93701171875, "teacher_ev_regret": 0.0020390931487234234 } }, "by_teacher": { "monte_carlo": { "states": 3589, "teacher_agreement": 0.9492894956812482, "teacher_ev_regret": 0.0015255898013025913 }, "exact": { "states": 507, "teacher_agreement": 0.9388560157790927, "teacher_ev_regret": 0.0014501286209305047 } } }, "test_deferred": false, "general_margin": 0.0005, "test": { "states": 8192, "teacher_agreement": 0.958984375, "teacher_ev_regret": 0.0009072807931029825, "hit_bust_brier": 0.00028900535657547276, "dealer_brier": 0.0009029593136866748, "action_brier": 0.061715743963623046, "teacher_action_ece": 0.012601574707031124 }, "temperature_by_options": { "choice:3-5": 2.1134890398366477, "noul:2": 1.0, "choice:6-10": 1.059253725177289, "choice:2": 2.23872113856834 }, "states": { "train": 65536, "selection": 4096, "calibration": 2048, "test": 8192, "validation": 2048 }, "dataset_hash": "0ecbe37e7489a78a7570dfa31fd67b0f61535a9156926e1243b4320c8c884678", "selected": { "epoch": 3, "complete_epoch": true, "updates": 73728, "mean_loss": 0.5832477171116298, "selection": { "action_brier": 0.07964431880238707, "teacher_agreement": 0.95458984375, "teacher_ev_regret": 0.0010111489430474339, "hit_bust_brier": 0.00029111769938248327, "dealer_brier": 0.0009628682438364339, "teacher_action_ece": 0.03631929756629491, "resolved_agreement": 0.9879854708019, "unresolved_agreement": 0.723404255319149, "resolved_states": 3579, "unresolved_states": 517, "by_players": { "7": { "states": 404, "teacher_agreement": 0.9653465346534653, "teacher_ev_regret": 0.0005245397586633664 }, "3": { "states": 570, "teacher_agreement": 0.9421052631578948, "teacher_ev_regret": 0.0016378837719298247 }, "6": { "states": 474, "teacher_agreement": 0.9345991561181435, "teacher_ev_regret": 0.0016482067510548524 }, "4": { "states": 588, "teacher_agreement": 0.9625850340136054, "teacher_ev_regret": 0.0008196149553571429 }, "2": { "states": 751, "teacher_agreement": 0.96271637816245, "teacher_ev_regret": 0.0008223085365346206 }, "1": { "states": 759, "teacher_agreement": 0.9525691699604744, "teacher_ev_regret": 0.0009504321275161915 }, "5": { "states": 550, "teacher_agreement": 0.96, "teacher_ev_regret": 0.0007164417613636364 } }, "by_stratum": { "general": { "states": 2048, "teacher_agreement": 0.9638671875, "teacher_ev_regret": 0.000675438124557217 }, "depleted": { "states": 2048, "teacher_agreement": 0.9453125, "teacher_ev_regret": 0.0013468597615376508 } }, "by_teacher": { "monte_carlo": { "states": 3589, "teacher_agreement": 0.9543048202842017, "teacher_ev_regret": 0.0010268667608491224 }, "exact": { "states": 507, "teacher_agreement": 0.9566074950690335, "teacher_ev_regret": 0.0008998841539147721 } } }, "selection_eligible": true }, "elapsed_seconds": 11041.982143932022, "gpu_peak_allocated_gb": 8.453748736, "limitations": "Reference scope is recorded in reference_method. Monte Carlo fallbacks use basic continuation and heuristic stopping. Teacher agreement does not establish global optimality or profit. Candidate is not auto-activated.", "test_was_deferred": true, "test_inference": "Serving SDK, after global checkpoint selection was frozen", "selection_freeze_sha256": "e0e00bcef8a035507186161eff1fb5d7e30d08767f651331e1b8936adfdf6e2a", "release_evaluation": { "test": { "states": 16384, "teacher_agreement": 0.95947265625, "teacher_ev_regret": 0.0010142500523316195, "hit_bust_brier": 0.0002707670232742885, "dealer_brier": 0.0008787809315606064, "action_brier": 0.0608471745513916, "teacher_action_ece": 0.011771899414062644 }, "baseline": { "states": 16384, "teacher_agreement": 0.9283447265625, "teacher_ev_regret": 0.0032042316146959245, "hit_bust_brier": 0.0016498112438239993, "dealer_brier": 0.0025270695927741118, "action_brier": 0.10846779101623535, "teacher_action_ece": 0.01973449707031245 }, "baseline_label": "Broad-training baseline", "selection_states": 8192, "dataset_sha256": "1f261a9e6f27778e237680295810e3b979ed4efa7edd3dedfe3e5b9eb45cc018", "selection_sha256": "1ae28756bbe9ce00bbb0a85c9cfd0d56285257c71cbc243de9002e9269c450f6", "inference_mode": "sdk", "scope": "Fresh release test; original training and calibration records are preserved separately." } }