{ "model": "HuggingFaceTB/SmolLM2-360M-Instruct", "dataset": "chimbiwide/NPC-Dialogue_v2", "method": "lora", "dataset_size": 1689, "train_size": 1513, "validation_size": 176, "max_train_samples": 0, "max_eval_samples": 1000, "eval_steps": 47, "train_characters": 91, "validation_characters": 10, "character_overlap": 0, "max_seq_length": 2048, "lora_config": { "task_type": "CAUSAL_LM", "peft_type": "LORA", "auto_mapping": null, "peft_version": "0.18.1", "base_model_name_or_path": "HuggingFaceTB/SmolLM2-360M-Instruct", "revision": null, "inference_mode": false, "r": 16, "target_modules": [ "down_proj", "gate_proj", "k_proj", "o_proj", "q_proj", "up_proj", "v_proj" ], "exclude_modules": null, "lora_alpha": 32, "lora_dropout": 0.05, "fan_in_fan_out": false, "bias": "none", "use_rslora": false, "modules_to_save": null, "init_lora_weights": true, "layers_to_transform": null, "layers_pattern": null, "rank_pattern": {}, "alpha_pattern": {}, "megatron_config": null, "megatron_core": "megatron.core", "trainable_token_indices": null, "loftq_config": {}, "eva_config": null, "corda_config": null, "use_dora": false, "alora_invocation_tokens": null, "use_qalora": false, "qalora_group_size": 16, "layer_replication": null, "lora_bias": false, "target_parameters": null, "arrow_config": null, "ensure_weight_tying": false }, "learning_rate": 0.0002, "batch_size": 8, "gradient_accumulation": 2, "effective_batch_size": 16, "epochs": 3.0, "warmup_ratio": 0.05, "warmup_steps": 14, "weight_decay": 0.01, "lr_scheduler": "cosine", "optimizer": "adamw_torch_fused", "precision": "bf16", "gradient_checkpointing": true, "assistant_only_loss": true, "total_parameters": 361821120, "trainable_parameters": 8683520, "trainable_percent": 2.3999, "training_loss": 2.2018708011560273, "validation_loss": 2.148780584335327, "perplexity": 8.5743962665088, "training_time_seconds": 1489.1, "training_time_minutes": 24.82, "peak_gpu_memory_gb": 9.93, "global_steps": 285, "loss_masking_check": { "supervised_token_ratio": 0.5492, "supervised_preview": "Ah, welcome, welcome! You find yourself in a corner of Calcutta where fortunes are made and lost quicker than the sweat dries on your brow. I am Bikram. What brings you to my humble… emporium, shall we say? Don't mind the smell; it's the scent of opportunity, my friend.<|im_end|>An artifact, you say? Calcutta is a magnet for such things, drawn in by the tides of trade and whispered secrets. But 's", "masked_preview": "<|im_start|>system\nEnter roleplay mode. You are Bikram. Background: Bikram's weathered face tells a story of hardship and resilience, etched with the lines of countless deals made in the shadows of Calcutta's bustling streets. His eyes, though hardened by experience, hold a flicker of warmth when he speaks of loyalty, a virtue he holds above all else. Bikram carries himself with a swagger that bel", "system_or_user_leaked": false }, "gpu": { "device": "NVIDIA GeForce RTX 5060 Ti", "total_memory_gb": 17.07, "bf16_supported": true, "capability": "12.0" }, "libraries": { "python": "3.12.3", "torch": "2.11.0+cu128", "transformers": "5.17.0", "datasets": "4.3.0", "trl": "0.24.0", "peft": "0.18.1", "accelerate": "1.12.0" }, "seed": 42, "output_dir": "/mnt/d/work2/smollm2-npc-roleplay-npc/outputs/checkpoints/npc-lora/final", "log_history": [ { "loss": 2.5523666381835937, "grad_norm": 0.22088582813739777, "learning_rate": 5.714285714285714e-05, "entropy": 1.933849000930786, "num_tokens": 93796.0, "mean_token_accuracy": 0.46158536076545714, "epoch": 0.05263157894736842, "step": 5 }, { "loss": 2.5331878662109375, "grad_norm": 0.21720781922340393, "learning_rate": 0.00012857142857142858, "entropy": 1.9523229598999023, "num_tokens": 187269.0, "mean_token_accuracy": 0.46900137364864347, "epoch": 0.10526315789473684, "step": 10 }, { "loss": 2.4539527893066406, "grad_norm": 0.13605234026908875, "learning_rate": 0.0002, "entropy": 2.1557540893554688, "num_tokens": 281613.0, "mean_token_accuracy": 0.4719751179218292, "epoch": 0.15789473684210525, "step": 15 }, { "loss": 2.451401138305664, "grad_norm": 0.23667477071285248, "learning_rate": 0.00019983206176618388, "entropy": 2.480435037612915, "num_tokens": 376141.0, "mean_token_accuracy": 0.4684509068727493, "epoch": 0.21052631578947367, "step": 20 }, { "loss": 2.4010854721069337, "grad_norm": 0.09741178154945374, "learning_rate": 0.000199328811129743, "entropy": 2.378065037727356, "num_tokens": 468513.0, "mean_token_accuracy": 0.478556826710701, "epoch": 0.2631578947368421, "step": 25 }, { "loss": 2.366695594787598, "grad_norm": 0.11083851754665375, "learning_rate": 0.00019849193839113833, "entropy": 2.217120313644409, "num_tokens": 561891.0, "mean_token_accuracy": 0.48194282352924345, "epoch": 0.3157894736842105, "step": 30 }, { "loss": 2.343669891357422, "grad_norm": 0.10740305483341217, "learning_rate": 0.00019732425440896297, "entropy": 2.188133120536804, "num_tokens": 656095.0, "mean_token_accuracy": 0.48512300848960876, "epoch": 0.3684210526315789, "step": 35 }, { "loss": 2.337441635131836, "grad_norm": 0.10451745986938477, "learning_rate": 0.0001958296811589293, "entropy": 2.2373024463653564, "num_tokens": 748364.0, "mean_token_accuracy": 0.4842404007911682, "epoch": 0.42105263157894735, "step": 40 }, { "loss": 2.3664779663085938, "grad_norm": 0.10740821063518524, "learning_rate": 0.0001940132385608757, "entropy": 2.279412937164307, "num_tokens": 842886.0, "mean_token_accuracy": 0.48362932801246644, "epoch": 0.47368421052631576, "step": 45 }, { "eval_loss": 2.316269636154175, "eval_runtime": 25.2544, "eval_samples_per_second": 6.969, "eval_steps_per_second": 0.871, "eval_entropy": 2.2317135334014893, "eval_num_tokens": 879988.0, "eval_mean_token_accuracy": 0.4894282506270842, "epoch": 0.49473684210526314, "step": 47 }, { "loss": 2.3454864501953123, "grad_norm": 0.11415872722864151, "learning_rate": 0.00019188102761803717, "entropy": 2.252223086357117, "num_tokens": 936226.0, "mean_token_accuracy": 0.48670867681503294, "epoch": 0.5263157894736842, "step": 50 }, { "loss": 2.3060874938964844, "grad_norm": 0.1160162165760994, "learning_rate": 0.0001894402099252109, "entropy": 2.2304810762405394, "num_tokens": 1028185.0, "mean_token_accuracy": 0.4880038559436798, "epoch": 0.5789473684210527, "step": 55 }, { "loss": 2.2843629837036135, "grad_norm": 0.12905658781528473, "learning_rate": 0.0001866989836146449, "entropy": 2.1765635013580322, "num_tokens": 1120518.0, "mean_token_accuracy": 0.49455042481422423, "epoch": 0.631578947368421, "step": 60 }, { "loss": 2.262358283996582, "grad_norm": 0.11617386341094971, "learning_rate": 0.00018366655582044094, "entropy": 2.161082220077515, "num_tokens": 1216629.0, "mean_token_accuracy": 0.49634212255477905, "epoch": 0.6842105263157895, "step": 65 }, { "loss": 2.274257850646973, "grad_norm": 0.14454935491085052, "learning_rate": 0.0001803531117539577, "entropy": 2.191727089881897, "num_tokens": 1308903.0, "mean_token_accuracy": 0.49855717420578005, "epoch": 0.7368421052631579, "step": 70 }, { "loss": 2.2217056274414064, "grad_norm": 0.14457330107688904, "learning_rate": 0.00017676978049408263, "entropy": 2.1600573301315307, "num_tokens": 1401788.0, "mean_token_accuracy": 0.4966869682073593, "epoch": 0.7894736842105263, "step": 75 }, { "loss": 2.2426210403442384, "grad_norm": 0.14771753549575806, "learning_rate": 0.00017292859760727493, "entropy": 2.1251904249191282, "num_tokens": 1493269.0, "mean_token_accuracy": 0.49993438124656675, "epoch": 0.8421052631578947, "step": 80 }, { "loss": 2.237934875488281, "grad_norm": 0.14660881459712982, "learning_rate": 0.00016884246472293016, "entropy": 2.160723400115967, "num_tokens": 1589104.0, "mean_token_accuracy": 0.5008507877588272, "epoch": 0.8947368421052632, "step": 85 }, { "loss": 2.215174674987793, "grad_norm": 0.14955751597881317, "learning_rate": 0.000164525106199843, "entropy": 2.150420093536377, "num_tokens": 1683525.0, "mean_token_accuracy": 0.5014137506484986, "epoch": 0.9473684210526315, "step": 90 }, { "eval_loss": 2.2206270694732666, "eval_runtime": 13.3703, "eval_samples_per_second": 13.164, "eval_steps_per_second": 1.645, "eval_entropy": 2.1415598500858652, "eval_num_tokens": 1759033.0, "eval_mean_token_accuracy": 0.5016853362321854, "epoch": 0.9894736842105263, "step": 94 }, { "loss": 2.210609245300293, "grad_norm": 0.2051151990890503, "learning_rate": 0.00015999102302931585, "entropy": 2.1453773021697997, "num_tokens": 1769255.0, "mean_token_accuracy": 0.5010978668928147, "epoch": 1.0, "step": 95 }, { "loss": 2.1714473724365235, "grad_norm": 0.15744632482528687, "learning_rate": 0.00015525544412974132, "entropy": 2.145352911949158, "num_tokens": 1864783.0, "mean_token_accuracy": 0.510258013010025, "epoch": 1.0526315789473684, "step": 100 }, { "loss": 2.212137222290039, "grad_norm": 0.16042566299438477, "learning_rate": 0.0001503342751962493, "entropy": 2.126456546783447, "num_tokens": 1957360.0, "mean_token_accuracy": 0.5051965832710266, "epoch": 1.1052631578947367, "step": 105 }, { "loss": 2.1988462448120116, "grad_norm": 0.16124625504016876, "learning_rate": 0.00014524404527721977, "entropy": 2.1093988180160523, "num_tokens": 2049648.0, "mean_token_accuracy": 0.5063745319843292, "epoch": 1.1578947368421053, "step": 110 }, { "loss": 2.192594528198242, "grad_norm": 0.18138575553894043, "learning_rate": 0.00014000185125709918, "entropy": 2.128497362136841, "num_tokens": 2143746.0, "mean_token_accuracy": 0.5051657497882843, "epoch": 1.2105263157894737, "step": 115 }, { "loss": 2.1997039794921873, "grad_norm": 0.1774953305721283, "learning_rate": 0.00013462530043198873, "entropy": 2.152763772010803, "num_tokens": 2238337.0, "mean_token_accuracy": 0.5037459582090378, "epoch": 1.263157894736842, "step": 120 }, { "loss": 2.1733221054077148, "grad_norm": 0.17004919052124023, "learning_rate": 0.00012913245137088024, "entropy": 2.1356810569763183, "num_tokens": 2330291.0, "mean_token_accuracy": 0.5107389390468597, "epoch": 1.3157894736842106, "step": 125 }, { "loss": 2.148809814453125, "grad_norm": 0.1917748898267746, "learning_rate": 0.00012354175326117253, "entropy": 2.093570041656494, "num_tokens": 2421723.0, "mean_token_accuracy": 0.5119283616542816, "epoch": 1.368421052631579, "step": 130 }, { "loss": 2.1357706069946287, "grad_norm": 0.18109489977359772, "learning_rate": 0.0001178719839421925, "entropy": 2.0645798206329347, "num_tokens": 2516541.0, "mean_token_accuracy": 0.515396112203598, "epoch": 1.4210526315789473, "step": 135 }, { "loss": 2.1544036865234375, "grad_norm": 0.19599980115890503, "learning_rate": 0.00011214218683485158, "entropy": 2.1346421003341676, "num_tokens": 2609031.0, "mean_token_accuracy": 0.5116421699523925, "epoch": 1.4736842105263157, "step": 140 }, { "eval_loss": 2.1792523860931396, "eval_runtime": 16.4067, "eval_samples_per_second": 10.727, "eval_steps_per_second": 1.341, "eval_entropy": 2.1185361363671045, "eval_num_tokens": 2627950.0, "eval_mean_token_accuracy": 0.5076680142771114, "epoch": 1.4842105263157894, "step": 141 }, { "loss": 2.169381332397461, "grad_norm": 0.18576543033123016, "learning_rate": 0.00010637160697927651, "entropy": 2.1318769693374633, "num_tokens": 2701848.0, "mean_token_accuracy": 0.5107553184032441, "epoch": 1.526315789473684, "step": 145 }, { "loss": 2.162215995788574, "grad_norm": 0.18139831721782684, "learning_rate": 0.00010057962639524798, "entropy": 2.121912145614624, "num_tokens": 2795827.0, "mean_token_accuracy": 0.5137030899524688, "epoch": 1.5789473684210527, "step": 150 }, { "loss": 2.1198862075805662, "grad_norm": 0.19324608147144318, "learning_rate": 9.478569898255765e-05, "entropy": 2.092076063156128, "num_tokens": 2889171.0, "mean_token_accuracy": 0.5189927399158478, "epoch": 1.631578947368421, "step": 155 }, { "loss": 2.135479545593262, "grad_norm": 0.18662935495376587, "learning_rate": 8.900928517993644e-05, "entropy": 2.107566738128662, "num_tokens": 2983944.0, "mean_token_accuracy": 0.5150025188922882, "epoch": 1.6842105263157894, "step": 160 }, { "loss": 2.168526840209961, "grad_norm": 0.1955968737602234, "learning_rate": 8.326978660202034e-05, "entropy": 2.1270210266113283, "num_tokens": 3078482.0, "mean_token_accuracy": 0.5109177112579346, "epoch": 1.736842105263158, "step": 165 }, { "loss": 2.1491790771484376, "grad_norm": 0.19812174141407013, "learning_rate": 7.758648087389277e-05, "entropy": 2.1165373802185057, "num_tokens": 3171229.0, "mean_token_accuracy": 0.5111929804086686, "epoch": 1.7894736842105263, "step": 170 }, { "loss": 2.160044860839844, "grad_norm": 0.2086932212114334, "learning_rate": 7.197845688207805e-05, "entropy": 2.110708808898926, "num_tokens": 3265986.0, "mean_token_accuracy": 0.5085264205932617, "epoch": 1.8421052631578947, "step": 175 }, { "loss": 2.156445121765137, "grad_norm": 0.19480496644973755, "learning_rate": 6.646455065946386e-05, "entropy": 2.117557668685913, "num_tokens": 3358807.0, "mean_token_accuracy": 0.513753566145897, "epoch": 1.8947368421052633, "step": 180 }, { "loss": 2.113090705871582, "grad_norm": 0.19168244302272797, "learning_rate": 6.106328211949928e-05, "entropy": 2.1011462211608887, "num_tokens": 3452203.0, "mean_token_accuracy": 0.5172903001308441, "epoch": 1.9473684210526314, "step": 185 }, { "eval_loss": 2.157062530517578, "eval_runtime": 15.9374, "eval_samples_per_second": 11.043, "eval_steps_per_second": 1.38, "eval_entropy": 2.0991858785802666, "eval_num_tokens": 3508507.0, "eval_mean_token_accuracy": 0.5112517042593523, "epoch": 1.9789473684210526, "step": 188 }, { "loss": 2.1452701568603514, "grad_norm": 0.24300329387187958, "learning_rate": 5.579279285216369e-05, "entropy": 2.122407627105713, "num_tokens": 3538510.0, "mean_token_accuracy": 0.5125555753707886, "epoch": 2.0, "step": 190 }, { "loss": 2.1096288681030275, "grad_norm": 0.20780698955059052, "learning_rate": 5.067078519063514e-05, "entropy": 2.0936718225479125, "num_tokens": 3633684.0, "mean_token_accuracy": 0.5186141610145569, "epoch": 2.0526315789473686, "step": 195 }, { "loss": 2.099007987976074, "grad_norm": 0.19569851458072662, "learning_rate": 4.571446275331903e-05, "entropy": 2.078820252418518, "num_tokens": 3727072.0, "mean_token_accuracy": 0.5218498349189759, "epoch": 2.1052631578947367, "step": 200 }, { "loss": 2.138174057006836, "grad_norm": 0.1941261887550354, "learning_rate": 4.094047266094225e-05, "entropy": 2.10717887878418, "num_tokens": 3821112.0, "mean_token_accuracy": 0.514563399553299, "epoch": 2.1578947368421053, "step": 205 }, { "loss": 2.1252628326416017, "grad_norm": 0.1947101503610611, "learning_rate": 3.6364849622792266e-05, "entropy": 2.108471989631653, "num_tokens": 3911202.0, "mean_token_accuracy": 0.5166740775108337, "epoch": 2.2105263157894735, "step": 210 }, { "loss": 2.099527359008789, "grad_norm": 0.2063671052455902, "learning_rate": 3.2002962079901744e-05, "entropy": 2.074895644187927, "num_tokens": 4004373.0, "mean_token_accuracy": 0.5181715756654739, "epoch": 2.263157894736842, "step": 215 }, { "loss": 2.1038749694824217, "grad_norm": 0.19067545235157013, "learning_rate": 2.7869460586071873e-05, "entropy": 2.0991530656814574, "num_tokens": 4097168.0, "mean_token_accuracy": 0.5198172926902771, "epoch": 2.3157894736842106, "step": 220 }, { "loss": 2.108317756652832, "grad_norm": 0.20180711150169373, "learning_rate": 2.3978228600109565e-05, "entropy": 2.0747674703598022, "num_tokens": 4192035.0, "mean_token_accuracy": 0.5210060477256775, "epoch": 2.3684210526315788, "step": 225 }, { "loss": 2.094546890258789, "grad_norm": 0.20153699815273285, "learning_rate": 2.0342335854556737e-05, "entropy": 2.0798715591430663, "num_tokens": 4284949.0, "mean_token_accuracy": 0.5181330442428589, "epoch": 2.4210526315789473, "step": 230 }, { "loss": 2.111064910888672, "grad_norm": 0.20009742677211761, "learning_rate": 1.6973994457534026e-05, "entropy": 2.087741422653198, "num_tokens": 4379919.0, "mean_token_accuracy": 0.5190323472023011, "epoch": 2.473684210526316, "step": 235 }, { "eval_loss": 2.1503143310546875, "eval_runtime": 15.7779, "eval_samples_per_second": 11.155, "eval_steps_per_second": 1.394, "eval_entropy": 2.0761942159045828, "eval_num_tokens": 4379919.0, "eval_mean_token_accuracy": 0.511995713819157, "epoch": 2.473684210526316, "step": 235 }, { "loss": 2.119691276550293, "grad_norm": 0.20606471598148346, "learning_rate": 1.3884517875143544e-05, "entropy": 2.0891559600830076, "num_tokens": 4473242.0, "mean_token_accuracy": 0.5179882824420929, "epoch": 2.526315789473684, "step": 240 }, { "loss": 2.121718406677246, "grad_norm": 0.19413025677204132, "learning_rate": 1.1084282932198541e-05, "entropy": 2.1111440420150758, "num_tokens": 4568065.0, "mean_token_accuracy": 0.5200768530368804, "epoch": 2.5789473684210527, "step": 245 }, { "loss": 2.1327035903930662, "grad_norm": 0.20437853038311005, "learning_rate": 8.58269495891081e-06, "entropy": 2.095879054069519, "num_tokens": 4661089.0, "mean_token_accuracy": 0.517047768831253, "epoch": 2.6315789473684212, "step": 250 }, { "loss": 2.077016830444336, "grad_norm": 0.20744766294956207, "learning_rate": 6.388156200599726e-06, "entropy": 2.064937162399292, "num_tokens": 4755205.0, "mean_token_accuracy": 0.5244661808013916, "epoch": 2.6842105263157894, "step": 255 }, { "loss": 2.109786033630371, "grad_norm": 0.2028643935918808, "learning_rate": 4.508037596527526e-06, "entropy": 2.082032287120819, "num_tokens": 4849257.0, "mean_token_accuracy": 0.5215404391288757, "epoch": 2.736842105263158, "step": 260 }, { "loss": 2.074248504638672, "grad_norm": 0.20752288401126862, "learning_rate": 2.9486540226488557e-06, "entropy": 2.0800060510635374, "num_tokens": 4941138.0, "mean_token_accuracy": 0.5221293807029724, "epoch": 2.7894736842105265, "step": 265 }, { "loss": 2.0968595504760743, "grad_norm": 0.1966981142759323, "learning_rate": 1.7152430814285303e-06, "entropy": 2.067763328552246, "num_tokens": 5035425.0, "mean_token_accuracy": 0.5213424026966095, "epoch": 2.8421052631578947, "step": 270 }, { "loss": 2.088235092163086, "grad_norm": 0.20720359683036804, "learning_rate": 8.119475099673036e-07, "entropy": 2.071122169494629, "num_tokens": 5127357.0, "mean_token_accuracy": 0.519515186548233, "epoch": 2.8947368421052633, "step": 275 }, { "loss": 2.1086212158203126, "grad_norm": 0.20018276572227478, "learning_rate": 2.418012655228452e-07, "entropy": 2.0884795427322387, "num_tokens": 5221009.0, "mean_token_accuracy": 0.5162034809589386, "epoch": 2.9473684210526314, "step": 280 }, { "eval_loss": 2.1488332748413086, "eval_runtime": 13.5679, "eval_samples_per_second": 12.972, "eval_steps_per_second": 1.621, "eval_entropy": 2.080313194881786, "eval_num_tokens": 5258147.0, "eval_mean_token_accuracy": 0.5125655924732034, "epoch": 2.968421052631579, "step": 282 }, { "loss": 2.1149166107177733, "grad_norm": 0.27149999141693115, "learning_rate": 6.719335161364804e-09, "entropy": 2.0989904403686523, "num_tokens": 5307765.0, "mean_token_accuracy": 0.5134236097335816, "epoch": 3.0, "step": 285 }, { "eval_loss": 2.148780584335327, "eval_runtime": 15.705, "eval_samples_per_second": 11.207, "eval_steps_per_second": 1.401, "eval_entropy": 2.0802648934451016, "eval_num_tokens": 5307765.0, "eval_mean_token_accuracy": 0.5120757411826741, "epoch": 3.0, "step": 285 }, { "train_runtime": 1594.7672, "train_samples_per_second": 2.846, "train_steps_per_second": 0.179, "total_flos": 1.20989712516768e+16, "train_loss": 2.2018708011560273, "epoch": 3.0, "step": 285 }, { "eval_loss": 2.148780584335327, "eval_runtime": 13.2149, "eval_samples_per_second": 13.318, "eval_steps_per_second": 1.665, "eval_entropy": 2.0802648934451016, "eval_num_tokens": 5307765.0, "eval_mean_token_accuracy": 0.5120757411826741, "epoch": 3.0, "step": 285 } ] }