{ "best_global_step": 900, "best_metric": 0.8504398826979472, "best_model_checkpoint": "/content/drive/MyDrive/expC_large_realonly/checkpoint-900", "epoch": 13.373177842565598, "eval_steps": 50, "global_step": 1150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.011661807580174927, "grad_norm": 53.1702880859375, "learning_rate": 0.0, "loss": 0.6632702350616455, "step": 1 }, { "epoch": 0.2915451895043732, "grad_norm": 3.24454927444458, "learning_rate": 6.282722513089005e-06, "loss": 0.6155035893122355, "step": 25 }, { "epoch": 0.5830903790087464, "grad_norm": 1.3036233186721802, "learning_rate": 1.2827225130890053e-05, "loss": 0.4128861999511719, "step": 50 }, { "epoch": 0.5830903790087464, "eval_accuracy": 0.8467655276165914, "eval_f1": 0.48104575163398694, "eval_loss": 0.08503369987010956, "eval_precision": 0.4309133489461358, "eval_recall": 0.5443786982248521, "eval_runtime": 5.5979, "eval_samples_per_second": 60.915, "eval_steps_per_second": 1.965, "step": 50 }, { "epoch": 0.8746355685131195, "grad_norm": 1.6594698429107666, "learning_rate": 1.93717277486911e-05, "loss": 0.2590180397033691, "step": 75 }, { "epoch": 1.163265306122449, "grad_norm": 1.5420184135437012, "learning_rate": 2.591623036649215e-05, "loss": 0.217969970703125, "step": 100 }, { "epoch": 1.163265306122449, "eval_accuracy": 0.8611648398882441, "eval_f1": 0.5584725536992841, "eval_loss": 0.059965744614601135, "eval_precision": 0.468, "eval_recall": 0.6923076923076923, "eval_runtime": 2.9899, "eval_samples_per_second": 114.05, "eval_steps_per_second": 3.679, "step": 100 }, { "epoch": 1.4548104956268222, "grad_norm": 3.1667258739471436, "learning_rate": 3.246073298429319e-05, "loss": 0.18862422943115234, "step": 125 }, { "epoch": 1.7463556851311952, "grad_norm": 7.493422985076904, "learning_rate": 3.900523560209424e-05, "loss": 0.1803609848022461, "step": 150 }, { "epoch": 1.7463556851311952, "eval_accuracy": 0.864173651407694, "eval_f1": 0.5561372891215822, "eval_loss": 0.04819481074810028, "eval_precision": 0.4582933844678811, "eval_recall": 0.7071005917159763, "eval_runtime": 2.9913, "eval_samples_per_second": 113.997, "eval_steps_per_second": 3.677, "step": 150 }, { "epoch": 2.0349854227405246, "grad_norm": 2.291372060775757, "learning_rate": 4.554973821989529e-05, "loss": 0.1149876594543457, "step": 175 }, { "epoch": 2.326530612244898, "grad_norm": 3.1508946418762207, "learning_rate": 4.999346304613061e-05, "loss": 0.0918524169921875, "step": 200 }, { "epoch": 2.326530612244898, "eval_accuracy": 0.9348807221147647, "eval_f1": 0.7352328005559416, "eval_loss": 0.04772070050239563, "eval_precision": 0.6933158584534731, "eval_recall": 0.7825443786982249, "eval_runtime": 2.979, "eval_samples_per_second": 114.468, "eval_steps_per_second": 3.693, "step": 200 }, { "epoch": 2.618075801749271, "grad_norm": 2.248906135559082, "learning_rate": 4.98888472605987e-05, "loss": 0.11147353172302246, "step": 225 }, { "epoch": 2.9096209912536444, "grad_norm": 1.1041216850280762, "learning_rate": 4.965717280180432e-05, "loss": 0.12180458068847656, "step": 250 }, { "epoch": 2.9096209912536444, "eval_accuracy": 0.8517085751128304, "eval_f1": 0.606029106029106, "eval_loss": 0.031385358422994614, "eval_precision": 0.4671474358974359, "eval_recall": 0.8624260355029586, "eval_runtime": 2.9853, "eval_samples_per_second": 114.227, "eval_steps_per_second": 3.685, "step": 250 }, { "epoch": 3.198250728862974, "grad_norm": 2.275531053543091, "learning_rate": 4.9299622378173246e-05, "loss": 0.0561268424987793, "step": 275 }, { "epoch": 3.489795918367347, "grad_norm": 15.159272193908691, "learning_rate": 4.881802130053548e-05, "loss": 0.05052190780639648, "step": 300 }, { "epoch": 3.489795918367347, "eval_accuracy": 0.9101654846335697, "eval_f1": 0.7108140947752126, "eval_loss": 0.03343665972352028, "eval_precision": 0.6030927835051546, "eval_recall": 0.8653846153846154, "eval_runtime": 2.9916, "eval_samples_per_second": 113.985, "eval_steps_per_second": 3.677, "step": 300 }, { "epoch": 3.78134110787172, "grad_norm": 2.0696234703063965, "learning_rate": 4.821482816383218e-05, "loss": 0.06179484367370605, "step": 325 }, { "epoch": 4.069970845481049, "grad_norm": 1.3048503398895264, "learning_rate": 4.749312229587908e-05, "loss": 0.04184870719909668, "step": 350 }, { "epoch": 4.069970845481049, "eval_accuracy": 0.9226305609284333, "eval_f1": 0.7249357326478149, "eval_loss": 0.03706977888941765, "eval_precision": 0.6409090909090909, "eval_recall": 0.834319526627219, "eval_runtime": 2.9936, "eval_samples_per_second": 113.91, "eval_steps_per_second": 3.675, "step": 350 }, { "epoch": 4.3615160349854225, "grad_norm": 1.1634117364883423, "learning_rate": 4.6656588037260834e-05, "loss": 0.02826032876968384, "step": 375 }, { "epoch": 4.653061224489796, "grad_norm": 0.3656497597694397, "learning_rate": 4.570949593260837e-05, "loss": 0.02992666721343994, "step": 400 }, { "epoch": 4.653061224489796, "eval_accuracy": 0.941972920696325, "eval_f1": 0.7889413351314902, "eval_loss": 0.03734752908349037, "eval_precision": 0.724907063197026, "eval_recall": 0.8653846153846154, "eval_runtime": 3.0067, "eval_samples_per_second": 113.414, "eval_steps_per_second": 3.659, "step": 400 }, { "epoch": 4.944606413994169, "grad_norm": 0.7156509757041931, "learning_rate": 4.465668092927841e-05, "loss": 0.02784186840057373, "step": 425 }, { "epoch": 5.233236151603498, "grad_norm": 0.2143929898738861, "learning_rate": 4.350351769473198e-05, "loss": 0.014064539670944214, "step": 450 }, { "epoch": 5.233236151603498, "eval_accuracy": 0.9396088545024716, "eval_f1": 0.7841823056300269, "eval_loss": 0.04331827163696289, "eval_precision": 0.7169117647058824, "eval_recall": 0.8653846153846154, "eval_runtime": 2.9881, "eval_samples_per_second": 114.12, "eval_steps_per_second": 3.681, "step": 450 }, { "epoch": 5.524781341107872, "grad_norm": 0.2881239950656891, "learning_rate": 4.2255893178617745e-05, "loss": 0.01728477954864502, "step": 475 }, { "epoch": 5.816326530612245, "grad_norm": 0.9025610089302063, "learning_rate": 4.092017655963198e-05, "loss": 0.013348644971847535, "step": 500 }, { "epoch": 5.816326530612245, "eval_accuracy": 0.9368149580915538, "eval_f1": 0.7799074686054197, "eval_loss": 0.04094831272959709, "eval_precision": 0.7048984468339307, "eval_recall": 0.8727810650887574, "eval_runtime": 2.9827, "eval_samples_per_second": 114.324, "eval_steps_per_second": 3.688, "step": 500 }, { "epoch": 6.104956268221574, "grad_norm": 0.5944705009460449, "learning_rate": 3.9503186730577816e-05, "loss": 0.017484543323516847, "step": 525 }, { "epoch": 6.396501457725948, "grad_norm": 0.20067809522151947, "learning_rate": 3.801215748761385e-05, "loss": 0.005213648080825806, "step": 550 }, { "epoch": 6.396501457725948, "eval_accuracy": 0.9608854502471523, "eval_f1": 0.8493932905067809, "eval_loss": 0.048467967659235, "eval_precision": 0.8206896551724138, "eval_recall": 0.8801775147928994, "eval_runtime": 2.9914, "eval_samples_per_second": 113.994, "eval_steps_per_second": 3.677, "step": 550 }, { "epoch": 6.688046647230321, "grad_norm": 0.25010251998901367, "learning_rate": 3.645470060140278e-05, "loss": 0.007735109925270081, "step": 575 }, { "epoch": 6.979591836734694, "grad_norm": 0.5211274027824402, "learning_rate": 3.4838766958683304e-05, "loss": 0.010291404724121093, "step": 600 }, { "epoch": 6.979591836734694, "eval_accuracy": 0.9432624113475178, "eval_f1": 0.8013377926421403, "eval_loss": 0.042320284992456436, "eval_precision": 0.7313797313797313, "eval_recall": 0.886094674556213, "eval_runtime": 2.992, "eval_samples_per_second": 113.971, "eval_steps_per_second": 3.676, "step": 600 }, { "epoch": 7.2682215743440235, "grad_norm": 1.0244024991989136, "learning_rate": 3.317260597263932e-05, "loss": 0.004896260499954223, "step": 625 }, { "epoch": 7.559766763848397, "grad_norm": 0.4166155755519867, "learning_rate": 3.146472346927845e-05, "loss": 0.0053441798686981205, "step": 650 }, { "epoch": 7.559766763848397, "eval_accuracy": 0.9537932516655921, "eval_f1": 0.8184397163120567, "eval_loss": 0.06086782366037369, "eval_precision": 0.7861035422343324, "eval_recall": 0.8535502958579881, "eval_runtime": 3.0122, "eval_samples_per_second": 113.206, "eval_steps_per_second": 3.652, "step": 650 }, { "epoch": 7.85131195335277, "grad_norm": 0.010130354203283787, "learning_rate": 2.9723838264811545e-05, "loss": 0.004410363137722016, "step": 675 }, { "epoch": 8.139941690962099, "grad_norm": 0.6293845176696777, "learning_rate": 2.7958837655707814e-05, "loss": 0.004301608800888062, "step": 700 }, { "epoch": 8.139941690962099, "eval_accuracy": 0.9546529120997206, "eval_f1": 0.8310055865921788, "eval_loss": 0.05279209837317467, "eval_precision": 0.7870370370370371, "eval_recall": 0.8801775147928994, "eval_runtime": 3.0184, "eval_samples_per_second": 112.974, "eval_steps_per_second": 3.644, "step": 700 }, { "epoch": 8.431486880466473, "grad_norm": 0.07044461369514465, "learning_rate": 2.6178732048650694e-05, "loss": 0.0016899970173835754, "step": 725 }, { "epoch": 8.723032069970845, "grad_norm": 0.05460745468735695, "learning_rate": 2.4392608962010652e-05, "loss": 0.0013941892981529237, "step": 750 }, { "epoch": 8.723032069970845, "eval_accuracy": 0.9615301955727488, "eval_f1": 0.8472121650977552, "eval_loss": 0.058827999979257584, "eval_precision": 0.8297872340425532, "eval_recall": 0.8653846153846154, "eval_runtime": 3.0051, "eval_samples_per_second": 113.474, "eval_steps_per_second": 3.66, "step": 750 }, { "epoch": 9.011661807580175, "grad_norm": 0.00831658486276865, "learning_rate": 2.2609586633659256e-05, "loss": 0.001328500509262085, "step": 775 }, { "epoch": 9.303206997084548, "grad_norm": 0.0017224822659045458, "learning_rate": 2.0838767471959014e-05, "loss": 0.0004855974018573761, "step": 800 }, { "epoch": 9.303206997084548, "eval_accuracy": 0.9608854502471523, "eval_f1": 0.8466522678185745, "eval_loss": 0.061686139553785324, "eval_precision": 0.8246844319775596, "eval_recall": 0.8698224852071006, "eval_runtime": 2.9993, "eval_samples_per_second": 113.695, "eval_steps_per_second": 3.668, "step": 800 }, { "epoch": 9.594752186588922, "grad_norm": 0.03047182224690914, "learning_rate": 1.9089191587563417e-05, "loss": 0.0007374519854784012, "step": 825 }, { "epoch": 9.886297376093294, "grad_norm": 0.040594808757305145, "learning_rate": 1.7369790643249573e-05, "loss": 0.00048769511282444, "step": 850 }, { "epoch": 9.886297376093294, "eval_accuracy": 0.961960025789813, "eval_f1": 0.8477785870356883, "eval_loss": 0.06452534347772598, "eval_precision": 0.8350071736011477, "eval_recall": 0.8609467455621301, "eval_runtime": 2.9903, "eval_samples_per_second": 114.035, "eval_steps_per_second": 3.679, "step": 850 }, { "epoch": 10.174927113702624, "grad_norm": 0.00843559205532074, "learning_rate": 1.5689342257382207e-05, "loss": 0.000465988963842392, "step": 875 }, { "epoch": 10.466472303206997, "grad_norm": 0.026429006829857826, "learning_rate": 1.4056425193781048e-05, "loss": 0.0011860659718513488, "step": 900 }, { "epoch": 10.466472303206997, "eval_accuracy": 0.9628196862239415, "eval_f1": 0.8504398826979472, "eval_loss": 0.06725193560123444, "eval_precision": 0.8430232558139535, "eval_recall": 0.8579881656804734, "eval_runtime": 2.9861, "eval_samples_per_second": 114.195, "eval_steps_per_second": 3.684, "step": 900 }, { "epoch": 10.758017492711371, "grad_norm": 0.04398288577795029, "learning_rate": 1.2479375566749694e-05, "loss": 0.00036286499351263047, "step": 925 }, { "epoch": 11.0466472303207, "grad_norm": 0.33958083391189575, "learning_rate": 1.0966244284840926e-05, "loss": 0.0004555666074156761, "step": 950 }, { "epoch": 11.0466472303207, "eval_accuracy": 0.9600257898130239, "eval_f1": 0.8442211055276383, "eval_loss": 0.06250197440385818, "eval_precision": 0.8200836820083682, "eval_recall": 0.8698224852071006, "eval_runtime": 2.9966, "eval_samples_per_second": 113.797, "eval_steps_per_second": 3.671, "step": 950 }, { "epoch": 11.338192419825074, "grad_norm": 0.04950733855366707, "learning_rate": 9.524755950610204e-06, "loss": 0.0002466118521988392, "step": 975 }, { "epoch": 11.629737609329446, "grad_norm": 0.0015039406716823578, "learning_rate": 8.162269426175681e-06, "loss": 0.0001478069555014372, "step": 1000 }, { "epoch": 11.629737609329446, "eval_accuracy": 0.961960025789813, "eval_f1": 0.8481751824817517, "eval_loss": 0.06827583909034729, "eval_precision": 0.8371757925072046, "eval_recall": 0.8594674556213018, "eval_runtime": 2.9913, "eval_samples_per_second": 113.999, "eval_steps_per_second": 3.677, "step": 1000 }, { "epoch": 11.921282798833818, "grad_norm": 0.00010757955897133797, "learning_rate": 6.885740265899526e-06, "loss": 0.0003006239794194698, "step": 1025 }, { "epoch": 12.209912536443149, "grad_norm": 0.0013954541645944118, "learning_rate": 5.701685207973243e-06, "loss": 0.00012959538027644158, "step": 1050 }, { "epoch": 12.209912536443149, "eval_accuracy": 0.9617451106812809, "eval_f1": 0.8468864468864469, "eval_loss": 0.07185657322406769, "eval_precision": 0.8388969521044993, "eval_recall": 0.8550295857988166, "eval_runtime": 3.0121, "eval_samples_per_second": 113.211, "eval_steps_per_second": 3.652, "step": 1050 }, { "epoch": 12.501457725947521, "grad_norm": 0.003432412398979068, "learning_rate": 4.616148906179082e-06, "loss": 8.389898575842381e-05, "step": 1075 }, { "epoch": 12.793002915451895, "grad_norm": 0.0069350870326161385, "learning_rate": 3.6346730716634025e-06, "loss": 7.618521340191364e-05, "step": 1100 }, { "epoch": 12.793002915451895, "eval_accuracy": 0.9617451106812809, "eval_f1": 0.8471104608632042, "eval_loss": 0.07132749259471893, "eval_precision": 0.8379160636758322, "eval_recall": 0.856508875739645, "eval_runtime": 3.0032, "eval_samples_per_second": 113.547, "eval_steps_per_second": 3.663, "step": 1100 }, { "epoch": 13.081632653061224, "grad_norm": 0.0016698213294148445, "learning_rate": 2.7622681822545764e-06, "loss": 7.001091726124286e-05, "step": 1125 }, { "epoch": 13.373177842565598, "grad_norm": 0.004049114417284727, "learning_rate": 2.0033879037506004e-06, "loss": 4.9526491202414037e-05, "step": 1150 }, { "epoch": 13.373177842565598, "eval_accuracy": 0.9615301955727488, "eval_f1": 0.8462664714494876, "eval_loss": 0.0716230645775795, "eval_precision": 0.8376811594202899, "eval_recall": 0.8550295857988166, "eval_runtime": 2.9914, "eval_samples_per_second": 113.993, "eval_steps_per_second": 3.677, "step": 1150 } ], "logging_steps": 25, "max_steps": 1290, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 10, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 5 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.935609178420992e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }