{ "best_metric": 1.4588630199432373, "best_model_checkpoint": "/kaggle/working/mistral-finance/checkpoint-562", "epoch": 1.9982222222222221, "eval_steps": 500, "global_step": 1124, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.044444444444444446, "grad_norm": 2.05849027633667, "learning_rate": 0.00014705882352941178, "loss": 1.6696, "step": 25 }, { "epoch": 0.08888888888888889, "grad_norm": 1.0702296495437622, "learning_rate": 0.00019989368862054812, "loss": 1.357, "step": 50 }, { "epoch": 0.13333333333333333, "grad_norm": 1.1396949291229248, "learning_rate": 0.00019930260467930706, "loss": 1.3491, "step": 75 }, { "epoch": 0.17777777777777778, "grad_norm": 1.0242853164672852, "learning_rate": 0.00019819617404036628, "loss": 1.3763, "step": 100 }, { "epoch": 0.2222222222222222, "grad_norm": 1.0257024765014648, "learning_rate": 0.00019658013870191258, "loss": 1.3871, "step": 125 }, { "epoch": 0.26666666666666666, "grad_norm": 1.249104619026184, "learning_rate": 0.00019446288533696144, "loss": 1.3785, "step": 150 }, { "epoch": 0.3111111111111111, "grad_norm": 1.0635004043579102, "learning_rate": 0.00019185540176938065, "loss": 1.3311, "step": 175 }, { "epoch": 0.35555555555555557, "grad_norm": 1.0092597007751465, "learning_rate": 0.0001887712199508264, "loss": 1.3478, "step": 200 }, { "epoch": 0.4, "grad_norm": 1.1924484968185425, "learning_rate": 0.00018522634573452313, "loss": 1.335, "step": 225 }, { "epoch": 0.4444444444444444, "grad_norm": 1.0947246551513672, "learning_rate": 0.0001812391758103364, "loss": 1.3503, "step": 250 }, { "epoch": 0.4888888888888889, "grad_norm": 1.3176860809326172, "learning_rate": 0.00017683040223221826, "loss": 1.3804, "step": 275 }, { "epoch": 0.5333333333333333, "grad_norm": 0.9309181571006775, "learning_rate": 0.00017202290503349436, "loss": 1.3684, "step": 300 }, { "epoch": 0.5777777777777777, "grad_norm": 1.0398943424224854, "learning_rate": 0.00016684163348728364, "loss": 1.3663, "step": 325 }, { "epoch": 0.6222222222222222, "grad_norm": 1.141608715057373, "learning_rate": 0.00016131347662826792, "loss": 1.3751, "step": 350 }, { "epoch": 0.6666666666666666, "grad_norm": 1.158071517944336, "learning_rate": 0.00015546712370776005, "loss": 1.4016, "step": 375 }, { "epoch": 0.7111111111111111, "grad_norm": 1.0812592506408691, "learning_rate": 0.00014933291530626046, "loss": 1.3253, "step": 400 }, { "epoch": 0.7555555555555555, "grad_norm": 0.9800846576690674, "learning_rate": 0.0001429426858761777, "loss": 1.3642, "step": 425 }, { "epoch": 0.8, "grad_norm": 0.9113844037055969, "learning_rate": 0.0001363295985318628, "loss": 1.3555, "step": 450 }, { "epoch": 0.8444444444444444, "grad_norm": 1.076130986213684, "learning_rate": 0.0001295279729443406, "loss": 1.3169, "step": 475 }, { "epoch": 0.8888888888888888, "grad_norm": 1.120133876800537, "learning_rate": 0.0001225731072339054, "loss": 1.4286, "step": 500 }, { "epoch": 0.9333333333333333, "grad_norm": 0.982066810131073, "learning_rate": 0.00011550109478489894, "loss": 1.3114, "step": 525 }, { "epoch": 0.9777777777777777, "grad_norm": 1.1076117753982544, "learning_rate": 0.00010834863693333805, "loss": 1.2723, "step": 550 }, { "epoch": 0.9991111111111111, "eval_loss": 1.4588630199432373, "eval_runtime": 398.985, "eval_samples_per_second": 2.506, "eval_steps_per_second": 0.313, "step": 562 }, { "epoch": 1.0222222222222221, "grad_norm": 1.101711392402649, "learning_rate": 0.00010115285249948073, "loss": 1.2287, "step": 575 }, { "epoch": 1.0666666666666667, "grad_norm": 1.0834338665008545, "learning_rate": 9.395108515379082e-05, "loss": 1.0606, "step": 600 }, { "epoch": 1.1111111111111112, "grad_norm": 1.438604474067688, "learning_rate": 8.678070961600693e-05, "loss": 1.0234, "step": 625 }, { "epoch": 1.1555555555555554, "grad_norm": 1.3387609720230103, "learning_rate": 7.967893769307608e-05, "loss": 1.018, "step": 650 }, { "epoch": 1.2, "grad_norm": 1.1515276432037354, "learning_rate": 7.268262516254934e-05, "loss": 1.0172, "step": 675 }, { "epoch": 1.2444444444444445, "grad_norm": 1.1627109050750732, "learning_rate": 6.582808050364864e-05, "loss": 1.02, "step": 700 }, { "epoch": 1.2888888888888888, "grad_norm": 1.106823205947876, "learning_rate": 5.915087646862562e-05, "loss": 0.9891, "step": 725 }, { "epoch": 1.3333333333333333, "grad_norm": 1.2206761837005615, "learning_rate": 5.26856654722928e-05, "loss": 1.0186, "step": 750 }, { "epoch": 1.3777777777777778, "grad_norm": 1.2441461086273193, "learning_rate": 4.646599975779281e-05, "loss": 1.0631, "step": 775 }, { "epoch": 1.4222222222222223, "grad_norm": 1.3241393566131592, "learning_rate": 4.0524157271883634e-05, "loss": 1.0262, "step": 800 }, { "epoch": 1.4666666666666668, "grad_norm": 1.316847324371338, "learning_rate": 3.4890974153388076e-05, "loss": 1.0161, "step": 825 }, { "epoch": 1.511111111111111, "grad_norm": 1.2122712135314941, "learning_rate": 2.959568470413572e-05, "loss": 0.9915, "step": 850 }, { "epoch": 1.5555555555555556, "grad_norm": 1.1466624736785889, "learning_rate": 2.4665769672892947e-05, "loss": 1.0087, "step": 875 }, { "epoch": 1.6, "grad_norm": 1.1826366186141968, "learning_rate": 2.012681363963621e-05, "loss": 1.0173, "step": 900 }, { "epoch": 1.6444444444444444, "grad_norm": 1.1746392250061035, "learning_rate": 1.600237224029565e-05, "loss": 0.9612, "step": 925 }, { "epoch": 1.6888888888888889, "grad_norm": 1.2078734636306763, "learning_rate": 1.2313849921027277e-05, "loss": 0.9795, "step": 950 }, { "epoch": 1.7333333333333334, "grad_norm": 1.3540568351745605, "learning_rate": 9.08038885642729e-06, "loss": 1.0277, "step": 975 }, { "epoch": 1.7777777777777777, "grad_norm": 1.383931279182434, "learning_rate": 6.318769608165332e-06, "loss": 1.0562, "step": 1000 }, { "epoch": 1.8222222222222222, "grad_norm": 1.3799922466278076, "learning_rate": 4.043324039584728e-06, "loss": 0.9885, "step": 1025 }, { "epoch": 1.8666666666666667, "grad_norm": 1.371010184288025, "learning_rate": 2.2658609382127384e-06, "loss": 0.9994, "step": 1050 }, { "epoch": 1.911111111111111, "grad_norm": 1.4156333208084106, "learning_rate": 9.95604732175215e-07, "loss": 1.0306, "step": 1075 }, { "epoch": 1.9555555555555557, "grad_norm": 1.3464016914367676, "learning_rate": 2.391476185563235e-07, "loss": 1.0242, "step": 1100 }, { "epoch": 1.9982222222222221, "eval_loss": 1.506870150566101, "eval_runtime": 399.1436, "eval_samples_per_second": 2.505, "eval_steps_per_second": 0.313, "step": 1124 } ], "logging_steps": 25, "max_steps": 1124, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "total_flos": 1.4561037719927194e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }