{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 20, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04, "grad_norm": 0.4760715663433075, "learning_rate": 0.0, "loss": 1.4658, "step": 1 }, { "epoch": 0.08, "grad_norm": 0.5013044476509094, "learning_rate": 8.000000000000001e-06, "loss": 1.4224, "step": 2 }, { "epoch": 0.12, "grad_norm": 0.2839778661727905, "learning_rate": 1.6000000000000003e-05, "loss": 1.125, "step": 3 }, { "epoch": 0.16, "grad_norm": 0.33960863947868347, "learning_rate": 2.4e-05, "loss": 1.238, "step": 4 }, { "epoch": 0.2, "grad_norm": 0.416923850774765, "learning_rate": 3.2000000000000005e-05, "loss": 1.2939, "step": 5 }, { "epoch": 0.24, "grad_norm": 0.5548073649406433, "learning_rate": 4e-05, "loss": 1.4395, "step": 6 }, { "epoch": 0.28, "grad_norm": 0.7273683547973633, "learning_rate": 3.999015863213667e-05, "loss": 1.5093, "step": 7 }, { "epoch": 0.32, "grad_norm": 0.5051376223564148, "learning_rate": 3.996064528993794e-05, "loss": 1.1609, "step": 8 }, { "epoch": 0.36, "grad_norm": 0.49626877903938293, "learning_rate": 3.9911492245810205e-05, "loss": 1.3969, "step": 9 }, { "epoch": 0.4, "grad_norm": 0.42138198018074036, "learning_rate": 3.9842753247885556e-05, "loss": 1.1953, "step": 10 }, { "epoch": 0.44, "grad_norm": 0.5137280821800232, "learning_rate": 3.975450346124901e-05, "loss": 1.3467, "step": 11 }, { "epoch": 0.48, "grad_norm": 0.2119121551513672, "learning_rate": 3.964683938574657e-05, "loss": 0.811, "step": 12 }, { "epoch": 0.52, "grad_norm": 0.28574588894844055, "learning_rate": 3.9519878750464104e-05, "loss": 1.1553, "step": 13 }, { "epoch": 0.56, "grad_norm": 0.3548891842365265, "learning_rate": 3.937376038499228e-05, "loss": 1.1643, "step": 14 }, { "epoch": 0.6, "grad_norm": 0.32107675075531006, "learning_rate": 3.920864406761844e-05, "loss": 1.186, "step": 15 }, { "epoch": 0.64, "grad_norm": 0.4450090527534485, "learning_rate": 3.9024710350611426e-05, "loss": 1.297, "step": 16 }, { "epoch": 0.68, "grad_norm": 0.3887384235858917, "learning_rate": 3.88221603627903e-05, "loss": 1.2583, "step": 17 }, { "epoch": 0.72, "grad_norm": 0.2024194747209549, "learning_rate": 3.860121558959293e-05, "loss": 1.1979, "step": 18 }, { "epoch": 0.76, "grad_norm": 0.164462149143219, "learning_rate": 3.836211763088493e-05, "loss": 1.0645, "step": 19 }, { "epoch": 0.8, "grad_norm": 0.07839324325323105, "learning_rate": 3.8105127936773746e-05, "loss": 0.7288, "step": 20 }, { "epoch": 0.8, "eval_loss": 0.855224609375, "eval_runtime": 2.1713, "eval_samples_per_second": 2.303, "eval_steps_per_second": 0.461, "step": 20 }, { "epoch": 0.84, "grad_norm": 0.13838034868240356, "learning_rate": 3.78305275217168e-05, "loss": 1.1664, "step": 21 }, { "epoch": 0.88, "grad_norm": 0.20036262273788452, "learning_rate": 3.7538616657236334e-05, "loss": 1.2454, "step": 22 }, { "epoch": 0.92, "grad_norm": 0.08870978653430939, "learning_rate": 3.722971454357684e-05, "loss": 0.9868, "step": 23 }, { "epoch": 0.96, "grad_norm": 0.08468154072761536, "learning_rate": 3.6904158960664365e-05, "loss": 1.0046, "step": 24 }, { "epoch": 1.0, "grad_norm": 0.1123848706483841, "learning_rate": 3.656230589874905e-05, "loss": 1.1274, "step": 25 }, { "epoch": 1.04, "grad_norm": 0.11019331961870193, "learning_rate": 3.6204529169135086e-05, "loss": 1.156, "step": 26 }, { "epoch": 1.08, "grad_norm": 0.10665232688188553, "learning_rate": 3.5831219995423466e-05, "loss": 1.1367, "step": 27 }, { "epoch": 1.12, "grad_norm": 0.08694541454315186, "learning_rate": 3.544278658571477e-05, "loss": 0.9375, "step": 28 }, { "epoch": 1.16, "grad_norm": 0.0901435911655426, "learning_rate": 3.5039653686239606e-05, "loss": 1.0381, "step": 29 }, { "epoch": 1.2, "grad_norm": 0.09067416191101074, "learning_rate": 3.4622262116904795e-05, "loss": 1.0396, "step": 30 }, { "epoch": 1.24, "grad_norm": 0.09607220441102982, "learning_rate": 3.419106828926334e-05, "loss": 1.1133, "step": 31 }, { "epoch": 1.28, "grad_norm": 0.09983466565608978, "learning_rate": 3.374654370743504e-05, "loss": 1.1624, "step": 32 }, { "epoch": 1.32, "grad_norm": 0.08482648432254791, "learning_rate": 3.328917445252367e-05, "loss": 0.9143, "step": 33 }, { "epoch": 1.3599999999999999, "grad_norm": 0.10168825834989548, "learning_rate": 3.281946065109445e-05, "loss": 1.1602, "step": 34 }, { "epoch": 1.4, "grad_norm": 0.08425932377576828, "learning_rate": 3.233791592829299e-05, "loss": 1.0061, "step": 35 }, { "epoch": 1.44, "grad_norm": 0.09837682545185089, "learning_rate": 3.1845066846203686e-05, "loss": 1.1282, "step": 36 }, { "epoch": 1.48, "grad_norm": 0.05306907743215561, "learning_rate": 3.134145232806188e-05, "loss": 0.7241, "step": 37 }, { "epoch": 1.52, "grad_norm": 0.08243704587221146, "learning_rate": 3.082762306894915e-05, "loss": 1.0229, "step": 38 }, { "epoch": 1.56, "grad_norm": 0.07551784068346024, "learning_rate": 3.0304140933616387e-05, "loss": 1.0286, "step": 39 }, { "epoch": 1.6, "grad_norm": 0.08548041433095932, "learning_rate": 2.977157834209287e-05, "loss": 1.0471, "step": 40 }, { "epoch": 1.6, "eval_loss": 0.798828125, "eval_runtime": 2.202, "eval_samples_per_second": 2.271, "eval_steps_per_second": 0.454, "step": 40 }, { "epoch": 1.6400000000000001, "grad_norm": 0.08860009163618088, "learning_rate": 2.9230517643753457e-05, "loss": 1.1273, "step": 41 }, { "epoch": 1.6800000000000002, "grad_norm": 0.09040582180023193, "learning_rate": 2.8681550480527974e-05, "loss": 1.1182, "step": 42 }, { "epoch": 1.72, "grad_norm": 0.07563644647598267, "learning_rate": 2.812527713994958e-05, "loss": 1.0964, "step": 43 }, { "epoch": 1.76, "grad_norm": 0.07461907714605331, "learning_rate": 2.7562305898749054e-05, "loss": 0.9688, "step": 44 }, { "epoch": 1.8, "grad_norm": 0.04516046494245529, "learning_rate": 2.6993252357713205e-05, "loss": 0.6775, "step": 45 }, { "epoch": 1.8399999999999999, "grad_norm": 0.07931992411613464, "learning_rate": 2.6418738768534388e-05, "loss": 1.0747, "step": 46 }, { "epoch": 1.88, "grad_norm": 0.09479013085365295, "learning_rate": 2.5839393353387444e-05, "loss": 1.1385, "step": 47 }, { "epoch": 1.92, "grad_norm": 0.057173825800418854, "learning_rate": 2.5255849617977983e-05, "loss": 0.9226, "step": 48 }, { "epoch": 1.96, "grad_norm": 0.059427376836538315, "learning_rate": 2.4668745658813156e-05, "loss": 0.9497, "step": 49 }, { "epoch": 2.0, "grad_norm": 0.07764241099357605, "learning_rate": 2.4078723465452556e-05, "loss": 1.0436, "step": 50 }, { "epoch": 2.04, "grad_norm": 0.07360248267650604, "learning_rate": 2.3486428218501987e-05, "loss": 1.0789, "step": 51 }, { "epoch": 2.08, "grad_norm": 0.07298833131790161, "learning_rate": 2.2892507584118004e-05, "loss": 1.0659, "step": 52 }, { "epoch": 2.12, "grad_norm": 0.05753123015165329, "learning_rate": 2.2297611005794456e-05, "loss": 0.8865, "step": 53 }, { "epoch": 2.16, "grad_norm": 0.06963388621807098, "learning_rate": 2.170238899420555e-05, "loss": 0.9897, "step": 54 }, { "epoch": 2.2, "grad_norm": 0.07072041928768158, "learning_rate": 2.1107492415882002e-05, "loss": 0.9912, "step": 55 }, { "epoch": 2.24, "grad_norm": 0.07816724479198456, "learning_rate": 2.0513571781498022e-05, "loss": 1.0527, "step": 56 }, { "epoch": 2.2800000000000002, "grad_norm": 0.0970468819141388, "learning_rate": 1.9921276534547453e-05, "loss": 1.1062, "step": 57 }, { "epoch": 2.32, "grad_norm": 0.07797855883836746, "learning_rate": 1.9331254341186843e-05, "loss": 0.8679, "step": 58 }, { "epoch": 2.36, "grad_norm": 0.08266980946063995, "learning_rate": 1.874415038202203e-05, "loss": 1.1044, "step": 59 }, { "epoch": 2.4, "grad_norm": 0.06626752018928528, "learning_rate": 1.816060664661256e-05, "loss": 0.9661, "step": 60 }, { "epoch": 2.4, "eval_loss": 0.77880859375, "eval_runtime": 2.2199, "eval_samples_per_second": 2.252, "eval_steps_per_second": 0.45, "step": 60 }, { "epoch": 2.44, "grad_norm": 0.08102354407310486, "learning_rate": 1.7581261231465618e-05, "loss": 1.0759, "step": 61 }, { "epoch": 2.48, "grad_norm": 0.054694049060344696, "learning_rate": 1.70067476422868e-05, "loss": 0.7046, "step": 62 }, { "epoch": 2.52, "grad_norm": 0.07155449688434601, "learning_rate": 1.643769410125095e-05, "loss": 0.9838, "step": 63 }, { "epoch": 2.56, "grad_norm": 0.06532476842403412, "learning_rate": 1.5874722860050423e-05, "loss": 0.994, "step": 64 }, { "epoch": 2.6, "grad_norm": 0.07697983086109161, "learning_rate": 1.5318449519472025e-05, "loss": 1.0082, "step": 65 }, { "epoch": 2.64, "grad_norm": 0.08935107290744781, "learning_rate": 1.4769482356246556e-05, "loss": 1.0865, "step": 66 }, { "epoch": 2.68, "grad_norm": 0.0887816920876503, "learning_rate": 1.422842165790713e-05, "loss": 1.0815, "step": 67 }, { "epoch": 2.7199999999999998, "grad_norm": 0.07478179782629013, "learning_rate": 1.3695859066383624e-05, "loss": 1.0665, "step": 68 }, { "epoch": 2.76, "grad_norm": 0.07210303097963333, "learning_rate": 1.317237693105086e-05, "loss": 0.9429, "step": 69 }, { "epoch": 2.8, "grad_norm": 0.044374942779541016, "learning_rate": 1.2658547671938135e-05, "loss": 0.6628, "step": 70 }, { "epoch": 2.84, "grad_norm": 0.07966240495443344, "learning_rate": 1.2154933153796323e-05, "loss": 1.0466, "step": 71 }, { "epoch": 2.88, "grad_norm": 0.0976930782198906, "learning_rate": 1.1662084071707018e-05, "loss": 1.1078, "step": 72 }, { "epoch": 2.92, "grad_norm": 0.05639340355992317, "learning_rate": 1.118053934890555e-05, "loss": 0.9038, "step": 73 }, { "epoch": 2.96, "grad_norm": 0.06098003685474396, "learning_rate": 1.0710825547476333e-05, "loss": 0.9326, "step": 74 }, { "epoch": 3.0, "grad_norm": 0.07597635686397552, "learning_rate": 1.0253456292564965e-05, "loss": 1.0192, "step": 75 }, { "epoch": 3.04, "grad_norm": 0.07052882015705109, "learning_rate": 9.808931710736666e-06, "loss": 1.0579, "step": 76 }, { "epoch": 3.08, "grad_norm": 0.07034008204936981, "learning_rate": 9.377737883095207e-06, "loss": 1.0454, "step": 77 }, { "epoch": 3.12, "grad_norm": 0.05514257028698921, "learning_rate": 8.9603463137604e-06, "loss": 0.873, "step": 78 }, { "epoch": 3.16, "grad_norm": 0.06549564749002457, "learning_rate": 8.557213414285236e-06, "loss": 0.9741, "step": 79 }, { "epoch": 3.2, "grad_norm": 0.07224049419164658, "learning_rate": 8.168780004576542e-06, "loss": 0.9753, "step": 80 }, { "epoch": 3.2, "eval_loss": 0.771484375, "eval_runtime": 2.2033, "eval_samples_per_second": 2.269, "eval_steps_per_second": 0.454, "step": 80 }, { "epoch": 3.24, "grad_norm": 0.07591705769300461, "learning_rate": 7.79547083086492e-06, "loss": 1.0322, "step": 81 }, { "epoch": 3.2800000000000002, "grad_norm": 0.09342397004365921, "learning_rate": 7.437694101250949e-06, "loss": 1.0872, "step": 82 }, { "epoch": 3.32, "grad_norm": 0.07288067787885666, "learning_rate": 7.09584103933564e-06, "loss": 0.8525, "step": 83 }, { "epoch": 3.36, "grad_norm": 0.07975227385759354, "learning_rate": 6.7702854564231615e-06, "loss": 1.0865, "step": 84 }, { "epoch": 3.4, "grad_norm": 0.06429357826709747, "learning_rate": 6.461383342763671e-06, "loss": 0.9534, "step": 85 }, { "epoch": 3.44, "grad_norm": 0.08074600249528885, "learning_rate": 6.169472478283199e-06, "loss": 1.0605, "step": 86 }, { "epoch": 3.48, "grad_norm": 0.05224496126174927, "learning_rate": 5.894872063226258e-06, "loss": 0.696, "step": 87 }, { "epoch": 3.52, "grad_norm": 0.06972762197256088, "learning_rate": 5.637882369115075e-06, "loss": 0.9702, "step": 88 }, { "epoch": 3.56, "grad_norm": 0.06537563353776932, "learning_rate": 5.3987844104070754e-06, "loss": 0.9809, "step": 89 }, { "epoch": 3.6, "grad_norm": 0.07811121642589569, "learning_rate": 5.177839637209707e-06, "loss": 0.9956, "step": 90 }, { "epoch": 3.64, "grad_norm": 0.08834316581487656, "learning_rate": 4.975289649388577e-06, "loss": 1.0721, "step": 91 }, { "epoch": 3.68, "grad_norm": 0.08688650280237198, "learning_rate": 4.791355932381563e-06, "loss": 1.0693, "step": 92 }, { "epoch": 3.7199999999999998, "grad_norm": 0.0746871680021286, "learning_rate": 4.626239615007727e-06, "loss": 1.0565, "step": 93 }, { "epoch": 3.76, "grad_norm": 0.07580739259719849, "learning_rate": 4.480121249535897e-06, "loss": 0.9346, "step": 94 }, { "epoch": 3.8, "grad_norm": 0.061057522892951965, "learning_rate": 4.353160614253432e-06, "loss": 0.6584, "step": 95 }, { "epoch": 3.84, "grad_norm": 0.08070012927055359, "learning_rate": 4.245496538750999e-06, "loss": 1.0371, "step": 96 }, { "epoch": 3.88, "grad_norm": 0.09691870212554932, "learning_rate": 4.157246752114447e-06, "loss": 1.0974, "step": 97 }, { "epoch": 3.92, "grad_norm": 0.0571683831512928, "learning_rate": 4.0885077541897945e-06, "loss": 0.8972, "step": 98 }, { "epoch": 3.96, "grad_norm": 0.061304960399866104, "learning_rate": 4.039354710062059e-06, "loss": 0.9272, "step": 99 }, { "epoch": 4.0, "grad_norm": 0.07660021632909775, "learning_rate": 4.0098413678633315e-06, "loss": 1.0127, "step": 100 }, { "epoch": 4.0, "eval_loss": 0.77001953125, "eval_runtime": 2.1902, "eval_samples_per_second": 2.283, "eval_steps_per_second": 0.457, "step": 100 } ], "logging_steps": 1.0, "max_steps": 100, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1998359434821632e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }