{ "best_global_step": 4500, "best_metric": 0.9824253474141716, "best_model_checkpoint": "/data/semantic-router.bak/models/mmbert32k_feedback_detector_lora/checkpoint-4500", "epoch": 4.021447721179625, "eval_steps": 500, "global_step": 4500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08936550491510277, "grad_norm": 36.226261138916016, "learning_rate": 1.769436997319035e-06, "loss": 3.3394851684570312, "step": 100 }, { "epoch": 0.17873100983020554, "grad_norm": 18.235830307006836, "learning_rate": 3.5567470956210903e-06, "loss": 1.2395378875732421, "step": 200 }, { "epoch": 0.2680965147453083, "grad_norm": 23.832252502441406, "learning_rate": 5.344057193923146e-06, "loss": 0.598966407775879, "step": 300 }, { "epoch": 0.3574620196604111, "grad_norm": 25.597322463989258, "learning_rate": 7.131367292225202e-06, "loss": 0.40449214935302735, "step": 400 }, { "epoch": 0.44682752457551383, "grad_norm": 20.845447540283203, "learning_rate": 8.918677390527258e-06, "loss": 0.316771125793457, "step": 500 }, { "epoch": 0.44682752457551383, "eval_accuracy": 0.9326633165829146, "eval_f1_NEED_CLARIFICATION": 0.9524752475247524, "eval_f1_SAT": 0.9983260796786073, "eval_f1_WANT_DIFFERENT": 0.8243801652892562, "eval_f1_WRONG_ANSWER": 0.8218905472636816, "eval_f1_macro": 0.8992680099390744, "eval_f1_weighted": 0.9322209959529292, "eval_loss": 0.1708805114030838, "eval_runtime": 7.0864, "eval_samples_per_second": 421.229, "eval_steps_per_second": 13.265, "step": 500 }, { "epoch": 0.5361930294906166, "grad_norm": 13.492064476013184, "learning_rate": 1.0705987488829312e-05, "loss": 0.21014398574829102, "step": 600 }, { "epoch": 0.6255585344057194, "grad_norm": 1.0692031383514404, "learning_rate": 1.2493297587131368e-05, "loss": 0.23827705383300782, "step": 700 }, { "epoch": 0.7149240393208222, "grad_norm": 21.394258499145508, "learning_rate": 1.4280607685433422e-05, "loss": 0.22943824768066406, "step": 800 }, { "epoch": 0.8042895442359249, "grad_norm": 9.537849426269531, "learning_rate": 1.6067917783735482e-05, "loss": 0.18561811447143556, "step": 900 }, { "epoch": 0.8936550491510277, "grad_norm": 13.74893569946289, "learning_rate": 1.7855227882037534e-05, "loss": 0.18598514556884765, "step": 1000 }, { "epoch": 0.8936550491510277, "eval_accuracy": 0.9534338358458961, "eval_f1_NEED_CLARIFICATION": 0.9868819374369324, "eval_f1_SAT": 0.9959595959595959, "eval_f1_WANT_DIFFERENT": 0.8679245283018868, "eval_f1_WRONG_ANSWER": 0.8790613718411552, "eval_f1_macro": 0.9324568583848927, "eval_f1_weighted": 0.9535818896785879, "eval_loss": 0.1380130499601364, "eval_runtime": 4.5166, "eval_samples_per_second": 660.891, "eval_steps_per_second": 20.812, "step": 1000 }, { "epoch": 0.9830205540661304, "grad_norm": 6.975687026977539, "learning_rate": 1.964253798033959e-05, "loss": 0.15200217247009276, "step": 1100 }, { "epoch": 1.0723860589812333, "grad_norm": 0.12164141982793808, "learning_rate": 1.984112799126204e-05, "loss": 0.12448848724365234, "step": 1200 }, { "epoch": 1.161751563896336, "grad_norm": 17.040109634399414, "learning_rate": 1.964253798033959e-05, "loss": 0.1404490852355957, "step": 1300 }, { "epoch": 1.2511170688114388, "grad_norm": 3.555215358734131, "learning_rate": 1.944394796941714e-05, "loss": 0.12125076293945312, "step": 1400 }, { "epoch": 1.3404825737265416, "grad_norm": 2.8291819095611572, "learning_rate": 1.924535795849469e-05, "loss": 0.09241329193115234, "step": 1500 }, { "epoch": 1.3404825737265416, "eval_accuracy": 0.9768844221105528, "eval_f1_NEED_CLARIFICATION": 0.9910269192422732, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9334677419354839, "eval_f1_WRONG_ANSWER": 0.9365558912386707, "eval_f1_macro": 0.965262638104107, "eval_f1_weighted": 0.9768184841217358, "eval_loss": 0.07608116418123245, "eval_runtime": 4.3221, "eval_samples_per_second": 690.644, "eval_steps_per_second": 21.749, "step": 1500 }, { "epoch": 1.4298480786416443, "grad_norm": 1.8353885412216187, "learning_rate": 1.9046767947572236e-05, "loss": 0.1183387851715088, "step": 1600 }, { "epoch": 1.519213583556747, "grad_norm": 0.9442969560623169, "learning_rate": 1.8848177936649786e-05, "loss": 0.13099024772644044, "step": 1700 }, { "epoch": 1.6085790884718498, "grad_norm": 38.03871536254883, "learning_rate": 1.8649587925727336e-05, "loss": 0.11420077323913574, "step": 1800 }, { "epoch": 1.6979445933869526, "grad_norm": 6.626965522766113, "learning_rate": 1.8450997914804885e-05, "loss": 0.07563745021820069, "step": 1900 }, { "epoch": 1.7873100983020556, "grad_norm": 17.789060592651367, "learning_rate": 1.8252407903882435e-05, "loss": 0.11484715461730957, "step": 2000 }, { "epoch": 1.7873100983020556, "eval_accuracy": 0.9782244556113903, "eval_f1_NEED_CLARIFICATION": 0.9979959919839679, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9319371727748691, "eval_f1_WRONG_ANSWER": 0.9391304347826087, "eval_f1_macro": 0.9672658998853614, "eval_f1_weighted": 0.9781553341948542, "eval_loss": 0.0778149887919426, "eval_runtime": 4.3058, "eval_samples_per_second": 693.246, "eval_steps_per_second": 21.831, "step": 2000 }, { "epoch": 1.876675603217158, "grad_norm": 0.08597684651613235, "learning_rate": 1.8053817892959985e-05, "loss": 0.1267116928100586, "step": 2100 }, { "epoch": 1.966041108132261, "grad_norm": 0.21768970787525177, "learning_rate": 1.7855227882037534e-05, "loss": 0.09952692985534668, "step": 2200 }, { "epoch": 2.0554066130473636, "grad_norm": 0.057887863367795944, "learning_rate": 1.7656637871115084e-05, "loss": 0.05328631401062012, "step": 2300 }, { "epoch": 2.1447721179624666, "grad_norm": 0.004557018168270588, "learning_rate": 1.7458047860192634e-05, "loss": 0.057413887977600095, "step": 2400 }, { "epoch": 2.234137622877569, "grad_norm": 0.092039555311203, "learning_rate": 1.7259457849270184e-05, "loss": 0.05033339023590088, "step": 2500 }, { "epoch": 2.234137622877569, "eval_accuracy": 0.980569514237856, "eval_f1_NEED_CLARIFICATION": 0.9959839357429718, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9414182939362795, "eval_f1_WRONG_ANSWER": 0.9460255152109912, "eval_f1_macro": 0.9708569362225606, "eval_f1_weighted": 0.9805517644741512, "eval_loss": 0.08076681196689606, "eval_runtime": 4.4113, "eval_samples_per_second": 676.667, "eval_steps_per_second": 21.309, "step": 2500 }, { "epoch": 2.323503127792672, "grad_norm": 0.08486219495534897, "learning_rate": 1.7060867838347733e-05, "loss": 0.0629350757598877, "step": 2600 }, { "epoch": 2.4128686327077746, "grad_norm": 0.005150920711457729, "learning_rate": 1.6862277827425283e-05, "loss": 0.07242729187011719, "step": 2700 }, { "epoch": 2.5022341376228776, "grad_norm": 10.539729118347168, "learning_rate": 1.6663687816502833e-05, "loss": 0.07086173057556153, "step": 2800 }, { "epoch": 2.5915996425379806, "grad_norm": 0.5994746685028076, "learning_rate": 1.6465097805580382e-05, "loss": 0.03949449300765991, "step": 2900 }, { "epoch": 2.680965147453083, "grad_norm": 0.03495287150144577, "learning_rate": 1.6266507794657932e-05, "loss": 0.05908185482025147, "step": 3000 }, { "epoch": 2.680965147453083, "eval_accuracy": 0.9835845896147404, "eval_f1_NEED_CLARIFICATION": 0.995004995004995, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9524752475247524, "eval_f1_WRONG_ANSWER": 0.9539406345957011, "eval_f1_macro": 0.9753552192813622, "eval_f1_weighted": 0.9835536337716829, "eval_loss": 0.06656040251255035, "eval_runtime": 4.4851, "eval_samples_per_second": 665.535, "eval_steps_per_second": 20.958, "step": 3000 }, { "epoch": 2.7703306523681857, "grad_norm": 0.0323098860681057, "learning_rate": 1.6067917783735482e-05, "loss": 0.05086075782775879, "step": 3100 }, { "epoch": 2.8596961572832886, "grad_norm": 3.2358248233795166, "learning_rate": 1.5869327772813028e-05, "loss": 0.053619518280029296, "step": 3200 }, { "epoch": 2.9490616621983916, "grad_norm": 0.0017350203124806285, "learning_rate": 1.5670737761890578e-05, "loss": 0.07301931381225586, "step": 3300 }, { "epoch": 3.038427167113494, "grad_norm": 0.062237728387117386, "learning_rate": 1.5472147750968128e-05, "loss": 0.04660813331604004, "step": 3400 }, { "epoch": 3.127792672028597, "grad_norm": 0.16048528254032135, "learning_rate": 1.5273557740045677e-05, "loss": 0.021572010517120363, "step": 3500 }, { "epoch": 3.127792672028597, "eval_accuracy": 0.9835845896147404, "eval_f1_NEED_CLARIFICATION": 0.996, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9492227979274611, "eval_f1_WRONG_ANSWER": 0.9560117302052786, "eval_f1_macro": 0.975308632033185, "eval_f1_weighted": 0.9835225443919949, "eval_loss": 0.08207044005393982, "eval_runtime": 4.5888, "eval_samples_per_second": 650.501, "eval_steps_per_second": 20.485, "step": 3500 }, { "epoch": 3.2171581769436997, "grad_norm": 0.026359504088759422, "learning_rate": 1.5074967729123227e-05, "loss": 0.025213963985443115, "step": 3600 }, { "epoch": 3.3065236818588026, "grad_norm": 1.627691626548767, "learning_rate": 1.4876377718200777e-05, "loss": 0.019634859561920168, "step": 3700 }, { "epoch": 3.395889186773905, "grad_norm": 2.8381104469299316, "learning_rate": 1.4677787707278326e-05, "loss": 0.03549041748046875, "step": 3800 }, { "epoch": 3.485254691689008, "grad_norm": 0.0038880000356584787, "learning_rate": 1.4479197696355876e-05, "loss": 0.02453033924102783, "step": 3900 }, { "epoch": 3.5746201966041107, "grad_norm": 0.33596596121788025, "learning_rate": 1.4280607685433422e-05, "loss": 0.028336784839630126, "step": 4000 }, { "epoch": 3.5746201966041107, "eval_accuracy": 0.9862646566164154, "eval_f1_NEED_CLARIFICATION": 0.9989969909729187, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9594460929772503, "eval_f1_WRONG_ANSWER": 0.9591836734693877, "eval_f1_macro": 0.9794066893548892, "eval_f1_weighted": 0.986257328373514, "eval_loss": 0.07474986463785172, "eval_runtime": 4.5088, "eval_samples_per_second": 662.045, "eval_steps_per_second": 20.848, "step": 4000 }, { "epoch": 3.6639857015192137, "grad_norm": 0.03944293409585953, "learning_rate": 1.4082017674510972e-05, "loss": 0.020915756225585936, "step": 4100 }, { "epoch": 3.753351206434316, "grad_norm": 0.007337045390158892, "learning_rate": 1.3883427663588522e-05, "loss": 0.02648637056350708, "step": 4200 }, { "epoch": 3.842716711349419, "grad_norm": 0.6361276507377625, "learning_rate": 1.3684837652666072e-05, "loss": 0.030732865333557128, "step": 4300 }, { "epoch": 3.932082216264522, "grad_norm": 6.5225138664245605, "learning_rate": 1.3486247641743621e-05, "loss": 0.033404347896575926, "step": 4400 }, { "epoch": 4.021447721179625, "grad_norm": 0.06466234475374222, "learning_rate": 1.3287657630821171e-05, "loss": 0.015966687202453613, "step": 4500 }, { "epoch": 4.021447721179625, "eval_accuracy": 0.9882747068676717, "eval_f1_NEED_CLARIFICATION": 0.9979919678714859, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9646107178968655, "eval_f1_WRONG_ANSWER": 0.967098703888335, "eval_f1_macro": 0.9824253474141716, "eval_f1_weighted": 0.9882717896311659, "eval_loss": 0.07450290769338608, "eval_runtime": 4.4144, "eval_samples_per_second": 676.201, "eval_steps_per_second": 21.294, "step": 4500 } ], "logging_steps": 100, "max_steps": 11190, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.751305188717363e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }