{ "best_metric": 0.9149305555555556, "best_model_checkpoint": "/gpfs/radev/scratch/cohan/jw3278/modernbert-qwen3-stuck-detector/checkpoint-3188", "epoch": 5.0, "eval_steps": 500, "global_step": 3985, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.12547051442910917, "grad_norm": 23.81832504272461, "learning_rate": 4.874529485570891e-05, "loss": 0.5993, "step": 100 }, { "epoch": 0.25094102885821834, "grad_norm": 8.124177932739258, "learning_rate": 4.749058971141782e-05, "loss": 0.5007, "step": 200 }, { "epoch": 0.37641154328732745, "grad_norm": 14.401046752929688, "learning_rate": 4.623588456712673e-05, "loss": 0.513, "step": 300 }, { "epoch": 0.5018820577164367, "grad_norm": 1.8089324235916138, "learning_rate": 4.4981179422835633e-05, "loss": 0.4509, "step": 400 }, { "epoch": 0.6273525721455459, "grad_norm": 3.3621015548706055, "learning_rate": 4.3726474278544546e-05, "loss": 0.3982, "step": 500 }, { "epoch": 0.7528230865746549, "grad_norm": 7.305176258087158, "learning_rate": 4.247176913425345e-05, "loss": 0.4622, "step": 600 }, { "epoch": 0.8782936010037641, "grad_norm": 5.204511642456055, "learning_rate": 4.1217063989962365e-05, "loss": 0.3382, "step": 700 }, { "epoch": 1.0, "eval_accuracy": 0.8844946641556811, "eval_f1": 0.8421955403087479, "eval_false_negatives": 82, "eval_false_positives": 102, "eval_loss": 0.37642502784729004, "eval_precision": 0.8279932546374368, "eval_recall": 0.8568935427574171, "eval_runtime": 11.053, "eval_samples_per_second": 144.123, "eval_steps_per_second": 9.047, "eval_true_negatives": 918, "eval_true_positives": 491, "step": 797 }, { "epoch": 1.0037641154328734, "grad_norm": 20.917531967163086, "learning_rate": 3.996235884567127e-05, "loss": 0.3475, "step": 800 }, { "epoch": 1.1292346298619824, "grad_norm": 30.933334350585938, "learning_rate": 3.870765370138018e-05, "loss": 0.3489, "step": 900 }, { "epoch": 1.2547051442910915, "grad_norm": 6.089908599853516, "learning_rate": 3.745294855708908e-05, "loss": 0.3437, "step": 1000 }, { "epoch": 1.3801756587202008, "grad_norm": 9.339570999145508, "learning_rate": 3.6198243412797996e-05, "loss": 0.2801, "step": 1100 }, { "epoch": 1.50564617314931, "grad_norm": 21.16028594970703, "learning_rate": 3.49435382685069e-05, "loss": 0.2289, "step": 1200 }, { "epoch": 1.631116687578419, "grad_norm": 7.236953258514404, "learning_rate": 3.3688833124215815e-05, "loss": 0.2722, "step": 1300 }, { "epoch": 1.7565872020075282, "grad_norm": 6.876579761505127, "learning_rate": 3.2434127979924714e-05, "loss": 0.2701, "step": 1400 }, { "epoch": 1.8820577164366374, "grad_norm": 0.009545003063976765, "learning_rate": 3.117942283563363e-05, "loss": 0.2324, "step": 1500 }, { "epoch": 2.0, "eval_accuracy": 0.8738229755178908, "eval_f1": 0.7908428720083247, "eval_false_negatives": 193, "eval_false_positives": 8, "eval_loss": 0.39299774169921875, "eval_precision": 0.979381443298969, "eval_recall": 0.6631762652705061, "eval_runtime": 11.004, "eval_samples_per_second": 144.766, "eval_steps_per_second": 9.088, "eval_true_negatives": 1012, "eval_true_positives": 380, "step": 1594 }, { "epoch": 2.0075282308657467, "grad_norm": 4.334559440612793, "learning_rate": 2.9924717691342537e-05, "loss": 0.2718, "step": 1600 }, { "epoch": 2.132998745294856, "grad_norm": 7.7692952156066895, "learning_rate": 2.8670012547051446e-05, "loss": 0.1646, "step": 1700 }, { "epoch": 2.258469259723965, "grad_norm": 3.7941336631774902, "learning_rate": 2.7415307402760356e-05, "loss": 0.1964, "step": 1800 }, { "epoch": 2.383939774153074, "grad_norm": 0.039175648242235184, "learning_rate": 2.6160602258469265e-05, "loss": 0.1597, "step": 1900 }, { "epoch": 2.509410288582183, "grad_norm": 4.6735148429870605, "learning_rate": 2.490589711417817e-05, "loss": 0.1378, "step": 2000 }, { "epoch": 2.6348808030112925, "grad_norm": 0.053006332367658615, "learning_rate": 2.3651191969887077e-05, "loss": 0.1572, "step": 2100 }, { "epoch": 2.7603513174404015, "grad_norm": 15.980093955993652, "learning_rate": 2.2396486825595987e-05, "loss": 0.1703, "step": 2200 }, { "epoch": 2.8858218318695106, "grad_norm": 9.196004867553711, "learning_rate": 2.1141781681304896e-05, "loss": 0.163, "step": 2300 }, { "epoch": 3.0, "eval_accuracy": 0.9202762084118016, "eval_f1": 0.8964955175224124, "eval_false_negatives": 23, "eval_false_positives": 104, "eval_loss": 0.2875446379184723, "eval_precision": 0.8409785932721713, "eval_recall": 0.9598603839441536, "eval_runtime": 11.0499, "eval_samples_per_second": 144.164, "eval_steps_per_second": 9.05, "eval_true_negatives": 916, "eval_true_positives": 550, "step": 2391 }, { "epoch": 3.0112923462986196, "grad_norm": 12.78604793548584, "learning_rate": 1.9887076537013802e-05, "loss": 0.1551, "step": 2400 }, { "epoch": 3.136762860727729, "grad_norm": 0.02284233085811138, "learning_rate": 1.863237139272271e-05, "loss": 0.0755, "step": 2500 }, { "epoch": 3.262233375156838, "grad_norm": 0.22233843803405762, "learning_rate": 1.737766624843162e-05, "loss": 0.0673, "step": 2600 }, { "epoch": 3.3877038895859473, "grad_norm": 0.02527988888323307, "learning_rate": 1.6122961104140527e-05, "loss": 0.062, "step": 2700 }, { "epoch": 3.5131744040150563, "grad_norm": 0.020394891500473022, "learning_rate": 1.4868255959849436e-05, "loss": 0.0364, "step": 2800 }, { "epoch": 3.6386449184441654, "grad_norm": 0.5171342492103577, "learning_rate": 1.3613550815558346e-05, "loss": 0.0665, "step": 2900 }, { "epoch": 3.764115432873275, "grad_norm": 0.09603510797023773, "learning_rate": 1.2358845671267252e-05, "loss": 0.0674, "step": 3000 }, { "epoch": 3.889585947302384, "grad_norm": 0.0027797145303338766, "learning_rate": 1.1104140526976161e-05, "loss": 0.0514, "step": 3100 }, { "epoch": 4.0, "eval_accuracy": 0.938480853735091, "eval_f1": 0.9149305555555556, "eval_false_negatives": 46, "eval_false_positives": 52, "eval_loss": 0.36789795756340027, "eval_precision": 0.9101899827288429, "eval_recall": 0.9197207678883071, "eval_runtime": 11.0446, "eval_samples_per_second": 144.234, "eval_steps_per_second": 9.054, "eval_true_negatives": 968, "eval_true_positives": 527, "step": 3188 }, { "epoch": 4.015056461731493, "grad_norm": 0.014151527546346188, "learning_rate": 9.849435382685069e-06, "loss": 0.0321, "step": 3200 }, { "epoch": 4.1405269761606025, "grad_norm": 1.2528949975967407, "learning_rate": 8.594730238393977e-06, "loss": 0.0016, "step": 3300 }, { "epoch": 4.265997490589712, "grad_norm": 0.006553958635777235, "learning_rate": 7.3400250941028855e-06, "loss": 0.0018, "step": 3400 }, { "epoch": 4.391468005018821, "grad_norm": 0.0017017743084579706, "learning_rate": 6.085319949811794e-06, "loss": 0.0005, "step": 3500 }, { "epoch": 4.51693851944793, "grad_norm": 0.012320107780396938, "learning_rate": 4.830614805520703e-06, "loss": 0.0278, "step": 3600 }, { "epoch": 4.642409033877039, "grad_norm": 0.011312933638691902, "learning_rate": 3.5759096612296117e-06, "loss": 0.0167, "step": 3700 }, { "epoch": 4.767879548306148, "grad_norm": 0.00529805151745677, "learning_rate": 2.3212045169385195e-06, "loss": 0.0133, "step": 3800 }, { "epoch": 4.893350062735257, "grad_norm": 0.8228544592857361, "learning_rate": 1.066499372647428e-06, "loss": 0.0068, "step": 3900 }, { "epoch": 5.0, "eval_accuracy": 0.9372253609541745, "eval_f1": 0.911504424778761, "eval_false_negatives": 58, "eval_false_positives": 42, "eval_loss": 0.4694787561893463, "eval_precision": 0.9245960502692998, "eval_recall": 0.8987783595113438, "eval_runtime": 11.0039, "eval_samples_per_second": 144.767, "eval_steps_per_second": 9.088, "eval_true_negatives": 978, "eval_true_positives": 515, "step": 3985 } ], "logging_steps": 100, "max_steps": 3985, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.340573442551808e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }