{ "report": { "held": { "over_refusal": 0.02034428794992175, "miss_rate": 0.007722007722007722, "accuracy": 0.9788813727107738, "macro_f1": 0.9781646456301699, "n": 6061, "per_class": { "sexual_content": { "acc": 0.9896049896049897, "n": 481 }, "jailbreak": { "acc": 0.9749303621169917, "n": 359 }, "self_harm": { "acc": 0.9883268482490273, "n": 514 }, "misinformation": { "acc": 0.9661971830985916, "n": 355 }, "nonviolent_crime": { "acc": 0.9577464788732394, "n": 355 }, "safe_sensitive": { "acc": 0.9793956043956044, "n": 728 }, "prompt_injection": { "acc": 0.9802631578947368, "n": 304 }, "hate_harassment": { "acc": 0.9896265560165975, "n": 482 }, "specialized_advice": { "acc": 0.9841897233201581, "n": 506 }, "safe": { "acc": 0.9747687132043734, "n": 1189 }, "privacy_pii": { "acc": 0.9889867841409692, "n": 454 }, "violent_weapons": { "acc": 0.9640718562874252, "n": 334 } }, "confusions": { "safe->nonviolent_crime": 14, "violent_weapons->safe": 8, "nonviolent_crime->safe": 7, "safe->specialized_advice": 5, "self_harm->safe": 4, "safe_sensitive->safe": 4, "safe->violent_weapons": 4, "jailbreak->prompt_injection": 4, "misinformation->privacy_pii": 4, "misinformation->safe": 3, "prompt_injection->jailbreak": 3, "jailbreak->hate_harassment": 3, "misinformation->specialized_advice": 3, "nonviolent_crime->hate_harassment": 3, "safe->safe_sensitive": 2, "specialized_advice->safe": 2, "safe_sensitive->nonviolent_crime": 2, "violent_weapons->nonviolent_crime": 2, "hate_harassment->safe": 2, "self_harm->specialized_advice": 2 } }, "unseen_phrasing": { "over_refusal": 0.0, "miss_rate": 0.04952424624555772, "accuracy": 0.8821506362489969, "macro_f1": 0.15407220696385895, "n": 8723, "per_class": { "prompt_injection": { "acc": 0.9823788546255506, "n": 3859 }, "jailbreak": { "acc": 0.8026315789473685, "n": 4864 } }, "confusions": { "jailbreak->safe": 396, "jailbreak->prompt_injection": 234, "jailbreak->hate_harassment": 160, "jailbreak->self_harm": 43, "jailbreak->sexual_content": 38, "prompt_injection->jailbreak": 33, "jailbreak->privacy_pii": 30, "jailbreak->misinformation": 28, "jailbreak->safe_sensitive": 22, "prompt_injection->privacy_pii": 19, "prompt_injection->safe_sensitive": 8, "prompt_injection->safe": 6, "jailbreak->violent_weapons": 5, "jailbreak->nonviolent_crime": 3, "prompt_injection->hate_harassment": 1, "prompt_injection->nonviolent_crime": 1, "jailbreak->specialized_advice": 1 } }, "unseen_dialect": { "over_refusal": 0.07542579075425791, "miss_rate": 0.012905107360285809, "accuracy": 0.9397650964512965, "macro_f1": 0.9399695311054369, "n": 39761, "per_class": { "safe": { "acc": 0.8633740437525165, "n": 7451 }, "safe_sensitive": { "acc": 0.9838081574093052, "n": 4879 }, "self_harm": { "acc": 0.9266173157386547, "n": 3107 }, "violent_weapons": { "acc": 0.9035357417371253, "n": 2602 }, "nonviolent_crime": { "acc": 0.8909435751541015, "n": 2109 }, "prompt_injection": { "acc": 0.9738955823293173, "n": 2490 }, "sexual_content": { "acc": 0.9875, "n": 2960 }, "hate_harassment": { "acc": 0.9551760939167556, "n": 2811 }, "privacy_pii": { "acc": 0.9679393762751385, "n": 3431 }, "specialized_advice": { "acc": 0.9515931372549019, "n": 3264 }, "misinformation": { "acc": 0.9799017418490398, "n": 2239 }, "jailbreak": { "acc": 0.9801488833746899, "n": 2418 } }, "confusions": { "safe->violent_weapons": 167, "safe->specialized_advice": 164, "safe->safe_sensitive": 157, "safe->misinformation": 146, "safe->nonviolent_crime": 140, "safe->sexual_content": 61, "safe->privacy_pii": 56, "violent_weapons->safe_sensitive": 53, "nonviolent_crime->hate_harassment": 49, "self_harm->hate_harassment": 47, "nonviolent_crime->safe_sensitive": 43, "self_harm->violent_weapons": 43, "violent_weapons->hate_harassment": 43, "safe->self_harm": 41, "safe->hate_harassment": 38, "prompt_injection->jailbreak": 38, "self_harm->jailbreak": 38, "violent_weapons->nonviolent_crime": 37, "nonviolent_crime->safe": 37, "self_harm->safe_sensitive": 37 } }, "hard": { "over_refusal": 0.01510989010989011, "miss_rate": 0.0, "accuracy": 0.9793956043956044, "macro_f1": 0.08246588017580384, "n": 728, "per_class": { "safe_sensitive": { "acc": 0.9793956043956044, "n": 728 } }, "confusions": { "safe_sensitive->safe": 4, "safe_sensitive->nonviolent_crime": 2, "safe_sensitive->jailbreak": 2, "safe_sensitive->sexual_content": 2, "safe_sensitive->self_harm": 2, "safe_sensitive->prompt_injection": 1, "safe_sensitive->misinformation": 1, "safe_sensitive->specialized_advice": 1 } } }, "base_model": "oddadmix/Emhotob-500K-v2", "log_history": [ { "loss": 2.1952140808105467, "grad_norm": 23.127119064331055, "learning_rate": 0.0007462500000000001, "epoch": 0.0651890482398957, "step": 200 }, { "loss": 1.0176493835449218, "grad_norm": 16.538270950317383, "learning_rate": 0.0014962500000000002, "epoch": 0.1303780964797914, "step": 400 }, { "loss": 0.5449490737915039, "grad_norm": 6.46068000793457, "learning_rate": 0.00224625, "epoch": 0.19556714471968709, "step": 600 }, { "loss": 0.382957763671875, "grad_norm": 4.831028461456299, "learning_rate": 0.00299625, "epoch": 0.2607561929595828, "step": 800 }, { "loss": 0.29860366821289064, "grad_norm": 2.7325191497802734, "learning_rate": 0.002999774022447062, "epoch": 0.3259452411994785, "step": 1000 }, { "loss": 0.23355463027954101, "grad_norm": 3.112755298614502, "learning_rate": 0.0029990916107089597, "epoch": 0.39113428943937417, "step": 1200 }, { "loss": 0.21465389251708986, "grad_norm": 3.836207389831543, "learning_rate": 0.002997952966763772, "epoch": 0.45632333767926986, "step": 1400 }, { "eval_held_loss": 0.19275572896003723, "eval_held_accuracy": 0.9415937964032338, "eval_held_macro_f1": 0.9405305791201086, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1943, "eval_held_samples_per_second": 31190.672, "eval_held_steps_per_second": 247.014, "epoch": 0.48891786179921776, "step": 1500 }, { "eval_unseen_phrasing_loss": 0.49662351608276367, "eval_unseen_phrasing_accuracy": 0.8563567579961022, "eval_unseen_phrasing_macro_f1": 0.15061125684004806, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2097, "eval_unseen_phrasing_samples_per_second": 41591.493, "eval_unseen_phrasing_steps_per_second": 328.994, "epoch": 0.48891786179921776, "step": 1500 }, { "eval_unseen_dialect_loss": 0.3042675852775574, "eval_unseen_dialect_accuracy": 0.9102386760896356, "eval_unseen_dialect_macro_f1": 0.9054147320120141, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6424, "eval_unseen_dialect_samples_per_second": 61897.603, "eval_unseen_dialect_steps_per_second": 484.147, "epoch": 0.48891786179921776, "step": 1500 }, { "eval_hard_loss": 0.21103380620479584, "eval_hard_accuracy": 0.9381868131868132, "eval_hard_macro_f1": 0.0806756437514765, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0718, "eval_hard_samples_per_second": 10143.386, "eval_hard_steps_per_second": 83.599, "epoch": 0.48891786179921776, "step": 1500 }, { "loss": 0.1889168357849121, "grad_norm": 2.3584070205688477, "learning_rate": 0.002996358437145384, "epoch": 0.5215123859191656, "step": 1600 }, { "loss": 0.1676872444152832, "grad_norm": 1.3204810619354248, "learning_rate": 0.0029943085071315197, "epoch": 0.5867014341590613, "step": 1800 }, { "loss": 0.15570733070373535, "grad_norm": 1.8337198495864868, "learning_rate": 0.002991803800596058, "epoch": 0.651890482398957, "step": 2000 }, { "loss": 0.1408362579345703, "grad_norm": 1.2878652811050415, "learning_rate": 0.002988845079819156, "epoch": 0.7170795306388527, "step": 2200 }, { "loss": 0.1328596591949463, "grad_norm": 2.169991970062256, "learning_rate": 0.0029854332452552636, "epoch": 0.7822685788787483, "step": 2400 }, { "loss": 0.1266844940185547, "grad_norm": 1.003103256225586, "learning_rate": 0.0029815693352590756, "epoch": 0.847457627118644, "step": 2600 }, { "loss": 0.11402256011962891, "grad_norm": 1.5363110303878784, "learning_rate": 0.002977254525769523, "epoch": 0.9126466753585397, "step": 2800 }, { "loss": 0.11763209342956543, "grad_norm": 1.188177466392517, "learning_rate": 0.002972490129951887, "epoch": 0.9778357235984355, "step": 3000 }, { "eval_held_loss": 0.10533597320318222, "eval_held_accuracy": 0.9670021448605841, "eval_held_macro_f1": 0.9660969193353056, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1899, "eval_held_samples_per_second": 31911.042, "eval_held_steps_per_second": 252.719, "epoch": 0.9778357235984355, "step": 3000 }, { "eval_unseen_phrasing_loss": 0.44238102436065674, "eval_unseen_phrasing_accuracy": 0.8843287859681302, "eval_unseen_phrasing_macro_f1": 0.15345430620363873, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.21, "eval_unseen_phrasing_samples_per_second": 41530.638, "eval_unseen_phrasing_steps_per_second": 328.512, "epoch": 0.9778357235984355, "step": 3000 }, { "eval_unseen_dialect_loss": 0.2203148454427719, "eval_unseen_dialect_accuracy": 0.9360680063378688, "eval_unseen_dialect_macro_f1": 0.9341579999900128, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6576, "eval_unseen_dialect_samples_per_second": 60465.568, "eval_unseen_dialect_steps_per_second": 472.946, "epoch": 0.9778357235984355, "step": 3000 }, { "eval_hard_loss": 0.12471413612365723, "eval_hard_accuracy": 0.9601648351648352, "eval_hard_macro_f1": 0.08163980378416258, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0974, "eval_hard_samples_per_second": 7471.794, "eval_hard_steps_per_second": 61.581, "epoch": 0.9778357235984355, "step": 3000 }, { "loss": 0.08490500450134278, "grad_norm": 0.037526536732912064, "learning_rate": 0.002967277597798152, "epoch": 1.0430247718383312, "step": 3200 }, { "loss": 0.06376803398132325, "grad_norm": 0.25600579380989075, "learning_rate": 0.002961618515685716, "epoch": 1.1082138200782268, "step": 3400 }, { "loss": 0.06879507064819336, "grad_norm": 0.3666667640209198, "learning_rate": 0.0029555146058945943, "epoch": 1.1734028683181226, "step": 3600 }, { "loss": 0.06678017139434815, "grad_norm": 1.0908209085464478, "learning_rate": 0.0029489677260832628, "epoch": 1.2385919165580184, "step": 3800 }, { "loss": 0.058169617652893066, "grad_norm": 1.3792606592178345, "learning_rate": 0.0029419798687232977, "epoch": 1.303780964797914, "step": 4000 }, { "loss": 0.05968661308288574, "grad_norm": 1.0037418603897095, "learning_rate": 0.0029345531604929908, "epoch": 1.3689700130378095, "step": 4200 }, { "loss": 0.0638724946975708, "grad_norm": 0.8174710273742676, "learning_rate": 0.002926689861630119, "epoch": 1.4341590612777053, "step": 4400 }, { "eval_held_loss": 0.10515185445547104, "eval_held_accuracy": 0.9701369410988285, "eval_held_macro_f1": 0.9692092843051797, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1926, "eval_held_samples_per_second": 31466.21, "eval_held_steps_per_second": 249.196, "epoch": 1.4667535853976532, "step": 4500 }, { "eval_unseen_phrasing_loss": 0.42798590660095215, "eval_unseen_phrasing_accuracy": 0.8852459016393442, "eval_unseen_phrasing_macro_f1": 0.15392992589063928, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.211, "eval_unseen_phrasing_samples_per_second": 41348.901, "eval_unseen_phrasing_steps_per_second": 327.075, "epoch": 1.4667535853976532, "step": 4500 }, { "eval_unseen_dialect_loss": 0.27985629439353943, "eval_unseen_dialect_accuracy": 0.9270642086466638, "eval_unseen_dialect_macro_f1": 0.9260390752552076, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6652, "eval_unseen_dialect_samples_per_second": 59776.6, "eval_unseen_dialect_steps_per_second": 467.557, "epoch": 1.4667535853976532, "step": 4500 }, { "eval_hard_loss": 0.08975941687822342, "eval_hard_accuracy": 0.9739010989010989, "eval_hard_macro_f1": 0.08223150081187659, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0962, "eval_hard_samples_per_second": 7568.375, "eval_hard_steps_per_second": 62.377, "epoch": 1.4667535853976532, "step": 4500 }, { "loss": 0.0591568660736084, "grad_norm": 1.0088281631469727, "learning_rate": 0.002918392365244061, "epoch": 1.4993481095176011, "step": 4600 }, { "loss": 0.06349584102630615, "grad_norm": 0.24618516862392426, "learning_rate": 0.0029096631965874853, "epoch": 1.5645371577574967, "step": 4800 }, { "loss": 0.06407528400421142, "grad_norm": 0.9340533018112183, "learning_rate": 0.0029005050122878147, "epoch": 1.6297262059973925, "step": 5000 }, { "loss": 0.061186332702636716, "grad_norm": 0.9107056856155396, "learning_rate": 0.0028909205995387103, "epoch": 1.694915254237288, "step": 5200 }, { "loss": 0.054206957817077635, "grad_norm": 0.5927267074584961, "learning_rate": 0.002880912875251822, "epoch": 1.7601043024771839, "step": 5400 }, { "loss": 0.06110722541809082, "grad_norm": 0.5050310492515564, "learning_rate": 0.0028704848851690556, "epoch": 1.8252933507170797, "step": 5600 }, { "loss": 0.06215485572814941, "grad_norm": 0.9473423957824707, "learning_rate": 0.002859639802935635, "epoch": 1.8904823989569752, "step": 5800 }, { "loss": 0.05840580940246582, "grad_norm": 0.8732274174690247, "learning_rate": 0.002848380929134238, "epoch": 1.9556714471968708, "step": 6000 }, { "eval_held_loss": 0.091562420129776, "eval_held_accuracy": 0.9739316944398614, "eval_held_macro_f1": 0.9733442004204589, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1923, "eval_held_samples_per_second": 31513.837, "eval_held_steps_per_second": 249.573, "epoch": 1.9556714471968708, "step": 6000 }, { "eval_unseen_phrasing_loss": 0.6874486207962036, "eval_unseen_phrasing_accuracy": 0.8426000229278918, "eval_unseen_phrasing_macro_f1": 0.15042589845771517, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2158, "eval_unseen_phrasing_samples_per_second": 40423.643, "eval_unseen_phrasing_steps_per_second": 319.756, "epoch": 1.9556714471968708, "step": 6000 }, { "eval_unseen_dialect_loss": 0.2561938166618347, "eval_unseen_dialect_accuracy": 0.9321445637685168, "eval_unseen_dialect_macro_f1": 0.934623923757742, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6412, "eval_unseen_dialect_samples_per_second": 62005.906, "eval_unseen_dialect_steps_per_second": 484.994, "epoch": 1.9556714471968708, "step": 6000 }, { "eval_hard_loss": 0.050711967051029205, "eval_hard_accuracy": 0.9862637362637363, "eval_hard_macro_f1": 0.08275703088981097, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.1008, "eval_hard_samples_per_second": 7222.732, "eval_hard_steps_per_second": 59.528, "epoch": 1.9556714471968708, "step": 6000 }, { "loss": 0.04839906215667725, "grad_norm": 0.2468060553073883, "learning_rate": 0.002836711690280501, "epoch": 2.0208604954367666, "step": 6200 }, { "loss": 0.01925981044769287, "grad_norm": 0.06194070354104042, "learning_rate": 0.0028246356377801944, "epoch": 2.0860495436766624, "step": 6400 }, { "loss": 0.01897188901901245, "grad_norm": 1.0675151348114014, "learning_rate": 0.002812156446848393, "epoch": 2.151238591916558, "step": 6600 }, { "loss": 0.02150702476501465, "grad_norm": 0.3522121012210846, "learning_rate": 0.002799277915390961, "epoch": 2.2164276401564535, "step": 6800 }, { "loss": 0.02550948619842529, "grad_norm": 0.3296761214733124, "learning_rate": 0.002786003962848706, "epoch": 2.2816166883963493, "step": 7000 }, { "loss": 0.021695730686187745, "grad_norm": 1.0783436298370361, "learning_rate": 0.0027723386290045347, "epoch": 2.346805736636245, "step": 7200 }, { "loss": 0.02679917573928833, "grad_norm": 1.2645609378814697, "learning_rate": 0.0027582860727539908, "epoch": 2.411994784876141, "step": 7400 }, { "eval_held_loss": 0.1025511845946312, "eval_held_accuracy": 0.9734367266127701, "eval_held_macro_f1": 0.9722225212274557, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.2, "eval_held_samples_per_second": 30311.136, "eval_held_steps_per_second": 240.049, "epoch": 2.444589308996089, "step": 7500 }, { "eval_unseen_phrasing_loss": 0.6239086985588074, "eval_unseen_phrasing_accuracy": 0.8631204860713058, "eval_unseen_phrasing_macro_f1": 0.15031679209778467, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2158, "eval_unseen_phrasing_samples_per_second": 40428.512, "eval_unseen_phrasing_steps_per_second": 319.794, "epoch": 2.444589308996089, "step": 7500 }, { "eval_unseen_dialect_loss": 0.2581072449684143, "eval_unseen_dialect_accuracy": 0.9421292221020598, "eval_unseen_dialect_macro_f1": 0.9400861215677966, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6554, "eval_unseen_dialect_samples_per_second": 60662.396, "eval_unseen_dialect_steps_per_second": 474.485, "epoch": 2.444589308996089, "step": 7500 }, { "eval_hard_loss": 0.10843586176633835, "eval_hard_accuracy": 0.9725274725274725, "eval_hard_macro_f1": 0.08217270194986072, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.068, "eval_hard_samples_per_second": 10710.827, "eval_hard_steps_per_second": 88.276, "epoch": 2.444589308996089, "step": 7500 }, { "loss": 0.024594943523406982, "grad_norm": 0.06156105548143387, "learning_rate": 0.002743850570839542, "epoch": 2.4771838331160367, "step": 7600 }, { "loss": 0.027882373332977294, "grad_norm": 1.0311678647994995, "learning_rate": 0.0027290365165489965, "epoch": 2.542372881355932, "step": 7800 }, { "loss": 0.025555319786071777, "grad_norm": 0.1658269762992859, "learning_rate": 0.002713848418378459, "epoch": 2.607561929595828, "step": 8000 }, { "loss": 0.02656315565109253, "grad_norm": 0.03239389881491661, "learning_rate": 0.0026982908986602134, "epoch": 2.6727509778357237, "step": 8200 }, { "loss": 0.030051681995391846, "grad_norm": 0.17788361012935638, "learning_rate": 0.0026823686921559693, "epoch": 2.737940026075619, "step": 8400 }, { "loss": 0.029807121753692628, "grad_norm": 0.15262019634246826, "learning_rate": 0.0026660866446158882, "epoch": 2.803129074315515, "step": 8600 }, { "loss": 0.02619988441467285, "grad_norm": 1.711606740951538, "learning_rate": 0.002649449711303834, "epoch": 2.8683181225554106, "step": 8800 }, { "loss": 0.031050331592559814, "grad_norm": 1.0433506965637207, "learning_rate": 0.0026324629554892874, "epoch": 2.9335071707953064, "step": 9000 }, { "eval_held_loss": 0.10007420927286148, "eval_held_accuracy": 0.9727767695099818, "eval_held_macro_f1": 0.9723198672543146, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.2012, "eval_held_samples_per_second": 30124.931, "eval_held_steps_per_second": 238.574, "epoch": 2.9335071707953064, "step": 9000 }, { "eval_unseen_phrasing_loss": 0.44695401191711426, "eval_unseen_phrasing_accuracy": 0.8987733577897512, "eval_unseen_phrasing_macro_f1": 0.1555783687064858, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2123, "eval_unseen_phrasing_samples_per_second": 41093.609, "eval_unseen_phrasing_steps_per_second": 325.055, "epoch": 2.9335071707953064, "step": 9000 }, { "eval_unseen_dialect_loss": 0.3041954040527344, "eval_unseen_dialect_accuracy": 0.9305097960312869, "eval_unseen_dialect_macro_f1": 0.9275125781125492, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6423, "eval_unseen_dialect_samples_per_second": 61901.118, "eval_unseen_dialect_steps_per_second": 484.174, "epoch": 2.9335071707953064, "step": 9000 }, { "eval_hard_loss": 0.12261448055505753, "eval_hard_accuracy": 0.967032967032967, "eval_hard_macro_f1": 0.08193668528864059, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0944, "eval_hard_samples_per_second": 7715.124, "eval_hard_steps_per_second": 63.586, "epoch": 2.9335071707953064, "step": 9000 }, { "loss": 0.025427730083465577, "grad_norm": 0.16791117191314697, "learning_rate": 0.002615131546906401, "epoch": 2.9986962190352022, "step": 9200 }, { "loss": 0.010956484079360961, "grad_norm": 0.14401958882808685, "learning_rate": 0.002597460760180644, "epoch": 3.0638852672750976, "step": 9400 }, { "loss": 0.009910619258880616, "grad_norm": 0.09711571037769318, "learning_rate": 0.0025794559732235265, "epoch": 3.1290743155149934, "step": 9600 }, { "loss": 0.011872271299362183, "grad_norm": 0.027869893237948418, "learning_rate": 0.0025611226655958925, "epoch": 3.194263363754889, "step": 9800 }, { "loss": 0.01215682625770569, "grad_norm": 0.0019678683020174503, "learning_rate": 0.0025424664168402747, "epoch": 3.259452411994785, "step": 10000 }, { "loss": 0.013592723608016968, "grad_norm": 0.11185621470212936, "learning_rate": 0.0025234929047828207, "epoch": 3.3246414602346808, "step": 10200 }, { "loss": 0.011327080726623535, "grad_norm": 0.15672415494918823, "learning_rate": 0.00250420790380531, "epoch": 3.389830508474576, "step": 10400 }, { "eval_held_loss": 0.11069366335868835, "eval_held_accuracy": 0.9732717373370731, "eval_held_macro_f1": 0.9725045194495406, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.191, "eval_held_samples_per_second": 31740.515, "eval_held_steps_per_second": 251.369, "epoch": 3.422425032594524, "step": 10500 }, { "eval_unseen_phrasing_loss": 0.8103329539299011, "eval_unseen_phrasing_accuracy": 0.8514272612633268, "eval_unseen_phrasing_macro_f1": 0.15040481480414067, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2182, "eval_unseen_phrasing_samples_per_second": 39978.707, "eval_unseen_phrasing_steps_per_second": 316.236, "epoch": 3.422425032594524, "step": 10500 }, { "eval_unseen_dialect_loss": 0.30133235454559326, "eval_unseen_dialect_accuracy": 0.9396644953597747, "eval_unseen_dialect_macro_f1": 0.9393537114525294, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6388, "eval_unseen_dialect_samples_per_second": 62243.44, "eval_unseen_dialect_steps_per_second": 486.852, "epoch": 3.422425032594524, "step": 10500 }, { "eval_hard_loss": 0.1576533317565918, "eval_hard_accuracy": 0.9656593406593407, "eval_hard_macro_f1": 0.08187747495923596, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0904, "eval_hard_samples_per_second": 8050.572, "eval_hard_steps_per_second": 66.351, "epoch": 3.422425032594524, "step": 10500 }, { "loss": 0.011172587871551514, "grad_norm": 0.6160985827445984, "learning_rate": 0.002484617283087783, "epoch": 3.455019556714472, "step": 10600 }, { "loss": 0.018457911014556884, "grad_norm": 0.5318465828895569, "learning_rate": 0.002464727004822319, "epoch": 3.5202086049543677, "step": 10800 }, { "loss": 0.015429561138153075, "grad_norm": 1.0316749811172485, "learning_rate": 0.0024445431223985093, "epoch": 3.5853976531942635, "step": 11000 }, { "loss": 0.013867697715759277, "grad_norm": 1.1682846546173096, "learning_rate": 0.0024240717785611737, "epoch": 3.6505867014341593, "step": 11200 }, { "loss": 0.017523043155670166, "grad_norm": 0.08472991734743118, "learning_rate": 0.0024033192035408817, "epoch": 3.7157757496740547, "step": 11400 }, { "loss": 0.010207840204238892, "grad_norm": 0.1447364240884781, "learning_rate": 0.002382291713157853, "epoch": 3.7809647979139505, "step": 11600 }, { "loss": 0.015066323280334472, "grad_norm": 0.08443405479192734, "learning_rate": 0.0023609957068998024, "epoch": 3.8461538461538463, "step": 11800 }, { "loss": 0.012173240184783935, "grad_norm": 0.43619173765182495, "learning_rate": 0.0023394376659743275, "epoch": 3.9113428943937416, "step": 12000 }, { "eval_held_loss": 0.0987815111875534, "eval_held_accuracy": 0.9773964692295001, "eval_held_macro_f1": 0.97685223860291, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.19, "eval_held_samples_per_second": 31893.707, "eval_held_steps_per_second": 252.582, "epoch": 3.9113428943937416, "step": 12000 }, { "eval_unseen_phrasing_loss": 0.9891596436500549, "eval_unseen_phrasing_accuracy": 0.8440903358936146, "eval_unseen_phrasing_macro_f1": 0.14909741620054304, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2129, "eval_unseen_phrasing_samples_per_second": 40969.504, "eval_unseen_phrasing_steps_per_second": 324.074, "epoch": 3.9113428943937416, "step": 12000 }, { "eval_unseen_dialect_loss": 0.3277216851711273, "eval_unseen_dialect_accuracy": 0.9389854379920022, "eval_unseen_dialect_macro_f1": 0.9395415018723355, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.647, "eval_unseen_dialect_samples_per_second": 61452.745, "eval_unseen_dialect_steps_per_second": 480.667, "epoch": 3.9113428943937416, "step": 12000 }, { "eval_hard_loss": 0.07751184701919556, "eval_hard_accuracy": 0.9835164835164835, "eval_hard_macro_f1": 0.08264081255771007, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0699, "eval_hard_samples_per_second": 10416.259, "eval_hard_steps_per_second": 85.848, "epoch": 3.9113428943937416, "step": 12000 }, { "loss": 0.015515915155410766, "grad_norm": 1.3443394899368286, "learning_rate": 0.002317624151336424, "epoch": 3.9765319426336374, "step": 12200 }, { "loss": 0.009629806876182556, "grad_norm": 0.017426181584596634, "learning_rate": 0.0022955618016917297, "epoch": 4.041720990873533, "step": 12400 }, { "loss": 0.004908042252063751, "grad_norm": 0.004287226591259241, "learning_rate": 0.0022732573314761073, "epoch": 4.106910039113429, "step": 12600 }, { "loss": 0.002916430830955505, "grad_norm": 0.0017758934991434216, "learning_rate": 0.002250717528812178, "epoch": 4.172099087353325, "step": 12800 }, { "loss": 0.005083450078964233, "grad_norm": 0.03615580126643181, "learning_rate": 0.00222794925344343, "epoch": 4.237288135593221, "step": 13000 }, { "loss": 0.005427567362785339, "grad_norm": 0.9530061483383179, "learning_rate": 0.002204959434646535, "epoch": 4.302477183833116, "step": 13200 }, { "loss": 0.006234148740768433, "grad_norm": 0.0016657921951264143, "learning_rate": 0.00218175506912249, "epoch": 4.367666232073011, "step": 13400 }, { "eval_held_loss": 0.11707107722759247, "eval_held_accuracy": 0.9755815871968322, "eval_held_macro_f1": 0.9746913263378923, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1943, "eval_held_samples_per_second": 31193.504, "eval_held_steps_per_second": 247.036, "epoch": 4.400260756192959, "step": 13500 }, { "eval_unseen_phrasing_loss": 0.7506057620048523, "eval_unseen_phrasing_accuracy": 0.8761893843861057, "eval_unseen_phrasing_macro_f1": 0.15342070919463482, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2103, "eval_unseen_phrasing_samples_per_second": 41488.488, "eval_unseen_phrasing_steps_per_second": 328.179, "epoch": 4.400260756192959, "step": 13500 }, { "eval_unseen_dialect_loss": 0.36537283658981323, "eval_unseen_dialect_accuracy": 0.9392369407208068, "eval_unseen_dialect_macro_f1": 0.9387424661370556, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6474, "eval_unseen_dialect_samples_per_second": 61416.851, "eval_unseen_dialect_steps_per_second": 480.386, "epoch": 4.400260756192959, "step": 13500 }, { "eval_hard_loss": 0.15271884202957153, "eval_hard_accuracy": 0.9752747252747253, "eval_hard_macro_f1": 0.08229021789522485, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0706, "eval_hard_samples_per_second": 10312.272, "eval_hard_steps_per_second": 84.991, "epoch": 4.400260756192959, "step": 13500 }, { "loss": 0.00779943585395813, "grad_norm": 1.3296419382095337, "learning_rate": 0.0021583432188672547, "epoch": 4.432855280312907, "step": 13600 }, { "loss": 0.005994245409965515, "grad_norm": 0.00252769747748971, "learning_rate": 0.0021347310090225067, "epoch": 4.498044328552803, "step": 13800 }, { "loss": 0.0077133625745773315, "grad_norm": 0.03387093544006348, "learning_rate": 0.0021109256257071823, "epoch": 4.563233376792699, "step": 14000 }, { "loss": 0.009878547191619872, "grad_norm": 0.07391855865716934, "learning_rate": 0.0020869343138304607, "epoch": 4.6284224250325945, "step": 14200 }, { "loss": 0.008405025601387024, "grad_norm": 0.42607390880584717, "learning_rate": 0.0020627643748868545, "epoch": 4.69361147327249, "step": 14400 }, { "loss": 0.00548877239227295, "grad_norm": 0.015178793109953403, "learning_rate": 0.002038423164734077, "epoch": 4.758800521512386, "step": 14600 }, { "loss": 0.006401987671852112, "grad_norm": 0.005941878538578749, "learning_rate": 0.0020139180913543706, "epoch": 4.823989569752282, "step": 14800 }, { "loss": 0.007755057215690613, "grad_norm": 0.9141596555709839, "learning_rate": 0.001989256612599966, "epoch": 4.889178617992178, "step": 15000 }, { "eval_held_loss": 0.1293095350265503, "eval_held_accuracy": 0.9739316944398614, "eval_held_macro_f1": 0.9732220534325807, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1905, "eval_held_samples_per_second": 31816.548, "eval_held_steps_per_second": 251.971, "epoch": 4.889178617992178, "step": 15000 }, { "eval_unseen_phrasing_loss": 0.8130305409431458, "eval_unseen_phrasing_accuracy": 0.8730941189957584, "eval_unseen_phrasing_macro_f1": 0.15290569249338104, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2142, "eval_unseen_phrasing_samples_per_second": 40726.747, "eval_unseen_phrasing_steps_per_second": 322.154, "epoch": 4.889178617992178, "step": 15000 }, { "eval_unseen_dialect_loss": 0.3997732996940613, "eval_unseen_dialect_accuracy": 0.935640451698901, "eval_unseen_dialect_macro_f1": 0.9361924662852501, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6425, "eval_unseen_dialect_samples_per_second": 61888.415, "eval_unseen_dialect_steps_per_second": 484.075, "epoch": 4.889178617992178, "step": 15000 }, { "eval_hard_loss": 0.16973277926445007, "eval_hard_accuracy": 0.967032967032967, "eval_hard_macro_f1": 0.08193668528864059, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0991, "eval_hard_samples_per_second": 7346.778, "eval_hard_steps_per_second": 60.55, "epoch": 4.889178617992178, "step": 15000 }, { "loss": 0.007403180599212646, "grad_norm": 0.004417558200657368, "learning_rate": 0.0019644462339233667, "epoch": 4.9543676662320735, "step": 15200 }, { "loss": 0.005648733377456665, "grad_norm": 0.003013500478118658, "learning_rate": 0.0019394945060931454, "epoch": 5.019556714471968, "step": 15400 }, { "loss": 0.0020281124114990235, "grad_norm": 0.03553903475403786, "learning_rate": 0.0019144090228959505, "epoch": 5.084745762711864, "step": 15600 }, { "loss": 0.0023620997369289396, "grad_norm": 0.05907260999083519, "learning_rate": 0.0018891974188254203, "epoch": 5.14993481095176, "step": 15800 }, { "loss": 0.0015316706895828246, "grad_norm": 0.00022171845193952322, "learning_rate": 0.0018638673667587078, "epoch": 5.215123859191656, "step": 16000 }, { "loss": 0.0017865265905857087, "grad_norm": 0.00469543831422925, "learning_rate": 0.0018384265756213227, "epoch": 5.280312907431552, "step": 16200 }, { "loss": 0.0016463798284530639, "grad_norm": 0.0022215796634554863, "learning_rate": 0.001812882788041005, "epoch": 5.345501955671447, "step": 16400 }, { "eval_held_loss": 0.1353742480278015, "eval_held_accuracy": 0.9749216300940439, "eval_held_macro_f1": 0.9735729685113267, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1983, "eval_held_samples_per_second": 30571.839, "eval_held_steps_per_second": 242.113, "epoch": 5.378096479791395, "step": 16500 }, { "eval_unseen_phrasing_loss": 0.8409979939460754, "eval_unseen_phrasing_accuracy": 0.8759601054683022, "eval_unseen_phrasing_macro_f1": 0.1535842422700813, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2107, "eval_unseen_phrasing_samples_per_second": 41391.798, "eval_unseen_phrasing_steps_per_second": 327.414, "epoch": 5.378096479791395, "step": 16500 }, { "eval_unseen_dialect_loss": 0.5059581398963928, "eval_unseen_dialect_accuracy": 0.930786449032972, "eval_unseen_dialect_macro_f1": 0.9325400650201624, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6584, "eval_unseen_dialect_samples_per_second": 60387.033, "eval_unseen_dialect_steps_per_second": 472.331, "epoch": 5.378096479791395, "step": 16500 }, { "eval_hard_loss": 0.13117605447769165, "eval_hard_accuracy": 0.9752747252747253, "eval_hard_macro_f1": 0.08229021789522485, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0982, "eval_hard_samples_per_second": 7413.598, "eval_hard_steps_per_second": 61.101, "epoch": 5.378096479791395, "step": 16500 }, { "loss": 0.0033564266562461855, "grad_norm": 0.00723454961553216, "learning_rate": 0.0017872437779913428, "epoch": 5.410691003911343, "step": 16600 }, { "loss": 0.0022684647142887115, "grad_norm": 0.016895825043320656, "learning_rate": 0.0017615173484258418, "epoch": 5.475880052151239, "step": 16800 }, { "loss": 0.0026698514819145204, "grad_norm": 0.000877934624440968, "learning_rate": 0.0017357113289031892, "epoch": 5.541069100391134, "step": 17000 }, { "loss": 0.0015284459292888642, "grad_norm": 0.0027167557273060083, "learning_rate": 0.0017098335732044065, "epoch": 5.60625814863103, "step": 17200 }, { "loss": 0.002852696180343628, "grad_norm": 0.035916391760110855, "learning_rate": 0.0016838919569426402, "epoch": 5.6714471968709255, "step": 17400 }, { "loss": 0.003841307759284973, "grad_norm": 0.036015864461660385, "learning_rate": 0.001657894375166304, "epoch": 5.736636245110821, "step": 17600 }, { "loss": 0.0060520821809768675, "grad_norm": 0.015460636466741562, "learning_rate": 0.0016318487399563054, "epoch": 5.801825293350717, "step": 17800 }, { "loss": 0.003214528262615204, "grad_norm": 0.003109982004389167, "learning_rate": 0.0016057629780180922, "epoch": 5.867014341590613, "step": 18000 }, { "eval_held_loss": 0.1356932818889618, "eval_held_accuracy": 0.9770664906781059, "eval_held_macro_f1": 0.9762518625413512, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1949, "eval_held_samples_per_second": 31094.798, "eval_held_steps_per_second": 246.255, "epoch": 5.867014341590613, "step": 18000 }, { "eval_unseen_phrasing_loss": 0.7676151990890503, "eval_unseen_phrasing_accuracy": 0.8855898200160496, "eval_unseen_phrasing_macro_f1": 0.15482806984558908, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2178, "eval_unseen_phrasing_samples_per_second": 40053.68, "eval_unseen_phrasing_steps_per_second": 316.83, "epoch": 5.867014341590613, "step": 18000 }, { "eval_unseen_dialect_loss": 0.44217127561569214, "eval_unseen_dialect_accuracy": 0.9346595910565629, "eval_unseen_dialect_macro_f1": 0.93632479470951, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6435, "eval_unseen_dialect_samples_per_second": 61792.883, "eval_unseen_dialect_steps_per_second": 483.328, "epoch": 5.867014341590613, "step": 18000 }, { "eval_hard_loss": 0.10372380167245865, "eval_hard_accuracy": 0.9862637362637363, "eval_hard_macro_f1": 0.08275703088981097, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0732, "eval_hard_samples_per_second": 9946.296, "eval_hard_steps_per_second": 81.975, "epoch": 5.867014341590613, "step": 18000 }, { "loss": 0.0028575989603996277, "grad_norm": 0.00823401752859354, "learning_rate": 0.0015796450282692448, "epoch": 5.932203389830509, "step": 18200 }, { "loss": 0.004153192639350891, "grad_norm": 0.06483903527259827, "learning_rate": 0.0015535028394233527, "epoch": 5.9973924380704045, "step": 18400 }, { "loss": 0.0011822809278964996, "grad_norm": 0.012307186610996723, "learning_rate": 0.001527344367570911, "epoch": 6.0625814863103, "step": 18600 }, { "loss": 0.00023670084774494172, "grad_norm": 0.0008011198951862752, "learning_rate": 0.0015011775737579708, "epoch": 6.127770534550195, "step": 18800 }, { "loss": 0.00024879436939954756, "grad_norm": 0.002788627753034234, "learning_rate": 0.001475010421563281, "epoch": 6.192959582790091, "step": 19000 }, { "loss": 0.0006249099969863892, "grad_norm": 0.016984356567263603, "learning_rate": 0.0014488508746746593, "epoch": 6.258148631029987, "step": 19200 }, { "loss": 0.0004946313798427582, "grad_norm": 0.010328582488000393, "learning_rate": 0.0014227068944653327, "epoch": 6.3233376792698825, "step": 19400 }, { "eval_held_loss": 0.1532353013753891, "eval_held_accuracy": 0.9765715228510147, "eval_held_macro_f1": 0.976447494258056, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1938, "eval_held_samples_per_second": 31276.823, "eval_held_steps_per_second": 247.696, "epoch": 6.3559322033898304, "step": 19500 }, { "eval_unseen_phrasing_loss": 1.0850872993469238, "eval_unseen_phrasing_accuracy": 0.8652986357904391, "eval_unseen_phrasing_macro_f1": 0.1527593348892912, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2103, "eval_unseen_phrasing_samples_per_second": 41483.972, "eval_unseen_phrasing_steps_per_second": 328.143, "epoch": 6.3559322033898304, "step": 19500 }, { "eval_unseen_dialect_loss": 0.41693857312202454, "eval_unseen_dialect_accuracy": 0.9399411483614597, "eval_unseen_dialect_macro_f1": 0.9395283426436881, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.665, "eval_unseen_dialect_samples_per_second": 59790.788, "eval_unseen_dialect_steps_per_second": 467.668, "epoch": 6.3559322033898304, "step": 19500 }, { "eval_hard_loss": 0.23710276186466217, "eval_hard_accuracy": 0.9629120879120879, "eval_hard_macro_f1": 0.08175880569162584, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0721, "eval_hard_samples_per_second": 10095.128, "eval_hard_steps_per_second": 83.202, "epoch": 6.3559322033898304, "step": 19500 }, { "loss": 0.0015800869464874267, "grad_norm": 0.0011451613390818238, "learning_rate": 0.001396586437570978, "epoch": 6.388526727509778, "step": 19600 }, { "loss": 0.0010473155230283737, "grad_norm": 0.0833016186952591, "learning_rate": 0.001370497453468208, "epoch": 6.453715775749674, "step": 19800 }, { "loss": 0.0006658817827701569, "grad_norm": 0.0005158233689144254, "learning_rate": 0.001344447882055233, "epoch": 6.51890482398957, "step": 20000 }, { "loss": 0.0011239054799079896, "grad_norm": 0.0006993607967160642, "learning_rate": 0.001318445651235441, "epoch": 6.584093872229466, "step": 20200 }, { "loss": 0.0009567379206418991, "grad_norm": 0.005306244362145662, "learning_rate": 0.001292498674504626, "epoch": 6.6492829204693615, "step": 20400 }, { "loss": 0.002421462684869766, "grad_norm": 0.0023437021300196648, "learning_rate": 0.0012666148485426017, "epoch": 6.7144719687092564, "step": 20600 }, { "loss": 0.002153696715831757, "grad_norm": 0.0007901916978880763, "learning_rate": 0.0012408020508099334, "epoch": 6.779661016949152, "step": 20800 }, { "loss": 0.0012323959171772004, "grad_norm": 0.0017923114355653524, "learning_rate": 0.001215068137150517, "epoch": 6.844850065189048, "step": 21000 }, { "eval_held_loss": 0.15646591782569885, "eval_held_accuracy": 0.9722818016828906, "eval_held_macro_f1": 0.9732346766031365, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1877, "eval_held_samples_per_second": 32283.339, "eval_held_steps_per_second": 255.667, "epoch": 6.844850065189048, "step": 21000 }, { "eval_unseen_phrasing_loss": 0.9185952544212341, "eval_unseen_phrasing_accuracy": 0.8755015476326952, "eval_unseen_phrasing_macro_f1": 0.15405079929911678, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.209, "eval_unseen_phrasing_samples_per_second": 41736.963, "eval_unseen_phrasing_steps_per_second": 330.144, "epoch": 6.844850065189048, "step": 21000 }, { "eval_unseen_dialect_loss": 0.3974415957927704, "eval_unseen_dialect_accuracy": 0.9438645909308117, "eval_unseen_dialect_macro_f1": 0.9435824256304857, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6298, "eval_unseen_dialect_samples_per_second": 63136.843, "eval_unseen_dialect_steps_per_second": 493.84, "epoch": 6.844850065189048, "step": 21000 }, { "eval_hard_loss": 0.24147410690784454, "eval_hard_accuracy": 0.9574175824175825, "eval_hard_macro_f1": 0.08152046783625731, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0987, "eval_hard_samples_per_second": 7378.824, "eval_hard_steps_per_second": 60.814, "epoch": 6.844850065189048, "step": 21000 }, { "loss": 0.0020152950286865235, "grad_norm": 0.03562590479850769, "learning_rate": 0.001189420939400741, "epoch": 6.910039113428944, "step": 21200 }, { "loss": 0.0015001146495342255, "grad_norm": 0.005310706794261932, "learning_rate": 0.0011638682630059508, "epoch": 6.97522816166884, "step": 21400 }, { "loss": 0.0007807877659797668, "grad_norm": 0.32783180475234985, "learning_rate": 0.0011384178846449461, "epoch": 7.040417209908735, "step": 21600 }, { "loss": 0.00022133855149149894, "grad_norm": 0.0022341725416481495, "learning_rate": 0.001113077549863235, "epoch": 7.105606258148631, "step": 21800 }, { "loss": 0.00011499571613967419, "grad_norm": 0.00012046092888340354, "learning_rate": 0.0010878549707157602, "epoch": 7.170795306388527, "step": 22000 }, { "loss": 0.0001301498617976904, "grad_norm": 0.0006064897170290351, "learning_rate": 0.0010627578234198192, "epoch": 7.235984354628423, "step": 22200 }, { "loss": 0.00017196711152791977, "grad_norm": 7.804731285432354e-05, "learning_rate": 0.0010377937460188907, "epoch": 7.301173402868318, "step": 22400 }, { "eval_held_loss": 0.14113515615463257, "eval_held_accuracy": 0.9780564263322884, "eval_held_macro_f1": 0.976986382087114, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1908, "eval_held_samples_per_second": 31768.399, "eval_held_steps_per_second": 251.589, "epoch": 7.333767926988266, "step": 22500 }, { "eval_unseen_phrasing_loss": 0.9802523255348206, "eval_unseen_phrasing_accuracy": 0.8789407313997478, "eval_unseen_phrasing_macro_f1": 0.1537979714714063, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2119, "eval_unseen_phrasing_samples_per_second": 41170.972, "eval_unseen_phrasing_steps_per_second": 325.667, "epoch": 7.333767926988266, "step": 22500 }, { "eval_unseen_dialect_loss": 0.4899526536464691, "eval_unseen_dialect_accuracy": 0.9392117904479264, "eval_unseen_dialect_macro_f1": 0.9396435854458236, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6642, "eval_unseen_dialect_samples_per_second": 59865.781, "eval_unseen_dialect_steps_per_second": 468.254, "epoch": 7.333767926988266, "step": 22500 }, { "eval_hard_loss": 0.16756650805473328, "eval_hard_accuracy": 0.9821428571428571, "eval_hard_macro_f1": 0.08258258258258257, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0693, "eval_hard_samples_per_second": 10509.218, "eval_hard_steps_per_second": 86.614, "epoch": 7.333767926988266, "step": 22500 }, { "loss": 0.00012516571208834648, "grad_norm": 0.023826057091355324, "learning_rate": 0.001012970336058082, "epoch": 7.3663624511082135, "step": 22600 }, { "loss": 0.00010503841564059257, "grad_norm": 0.0013365615159273148, "learning_rate": 0.0009882951482718945, "epoch": 7.431551499348109, "step": 22800 }, { "loss": 0.00014142820611596108, "grad_norm": 0.0003191770811099559, "learning_rate": 0.0009637756922850269, "epoch": 7.496740547588005, "step": 23000 }, { "loss": 0.00013418926857411862, "grad_norm": 6.237982597667724e-05, "learning_rate": 0.0009394194303268989, "epoch": 7.561929595827901, "step": 23200 }, { "loss": 0.0003565175831317902, "grad_norm": 0.00036435143556445837, "learning_rate": 0.0009152337749606063, "epoch": 7.627118644067797, "step": 23400 }, { "loss": 0.0003813246637582779, "grad_norm": 5.814128599013202e-05, "learning_rate": 0.0008912260868269847, "epoch": 7.6923076923076925, "step": 23600 }, { "loss": 0.00010491352528333663, "grad_norm": 0.0005376170738600194, "learning_rate": 0.0008674036724044822, "epoch": 7.757496740547588, "step": 23800 }, { "loss": 0.000499812588095665, "grad_norm": 0.006998493801802397, "learning_rate": 0.0008437737817855095, "epoch": 7.822685788787483, "step": 24000 }, { "eval_held_loss": 0.1482814997434616, "eval_held_accuracy": 0.977231479953803, "eval_held_macro_f1": 0.977377433110548, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.202, "eval_held_samples_per_second": 30006.311, "eval_held_steps_per_second": 237.635, "epoch": 7.822685788787483, "step": 24000 }, { "eval_unseen_phrasing_loss": 1.0274180173873901, "eval_unseen_phrasing_accuracy": 0.8768772211395163, "eval_unseen_phrasing_macro_f1": 0.1535257702487184, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2125, "eval_unseen_phrasing_samples_per_second": 41044.834, "eval_unseen_phrasing_steps_per_second": 324.67, "epoch": 7.822685788787483, "step": 24000 }, { "eval_unseen_dialect_loss": 0.48141905665397644, "eval_unseen_dialect_accuracy": 0.9400417494529816, "eval_unseen_dialect_macro_f1": 0.9398712618597806, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6429, "eval_unseen_dialect_samples_per_second": 61850.474, "eval_unseen_dialect_steps_per_second": 483.778, "epoch": 7.822685788787483, "step": 24000 }, { "eval_hard_loss": 0.22298771142959595, "eval_hard_accuracy": 0.9684065934065934, "eval_hard_macro_f1": 0.08199581297976273, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0708, "eval_hard_samples_per_second": 10289.58, "eval_hard_steps_per_second": 84.804, "epoch": 7.822685788787483, "step": 24000 }, { "loss": 0.0003143933415412903, "grad_norm": 0.01763354055583477, "learning_rate": 0.0008203436064699542, "epoch": 7.887874837027379, "step": 24200 }, { "loss": 0.00017375987023115157, "grad_norm": 0.00020164674788247794, "learning_rate": 0.0007971202771765272, "epoch": 7.953063885267275, "step": 24400 }, { "loss": 0.0002944411523640156, "grad_norm": 0.0006192452274262905, "learning_rate": 0.000774110861672603, "epoch": 8.01825293350717, "step": 24600 }, { "loss": 7.585027255117893e-05, "grad_norm": 0.00010485780512681231, "learning_rate": 0.0007513223626232257, "epoch": 8.083441981747066, "step": 24800 }, { "loss": 2.1936502307653427e-05, "grad_norm": 0.00032462243689224124, "learning_rate": 0.0007287617154599214, "epoch": 8.148631029986962, "step": 25000 }, { "loss": 3.8847094401717186e-05, "grad_norm": 0.0007482388755306602, "learning_rate": 0.0007064357862699758, "epoch": 8.213820078226858, "step": 25200 }, { "loss": 1.7666900530457495e-05, "grad_norm": 0.001964268973097205, "learning_rate": 0.0006843513697068162, "epoch": 8.279009126466754, "step": 25400 }, { "eval_held_loss": 0.15441980957984924, "eval_held_accuracy": 0.9773964692295001, "eval_held_macro_f1": 0.9770415452913186, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.189, "eval_held_samples_per_second": 32065.08, "eval_held_steps_per_second": 253.939, "epoch": 8.3116036505867, "step": 25500 }, { "eval_unseen_phrasing_loss": 1.0938074588775635, "eval_unseen_phrasing_accuracy": 0.8665596698383584, "eval_unseen_phrasing_macro_f1": 0.15259715641632401, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2219, "eval_unseen_phrasing_samples_per_second": 39312.192, "eval_unseen_phrasing_steps_per_second": 310.964, "epoch": 8.3116036505867, "step": 25500 }, { "eval_unseen_dialect_loss": 0.4920024573802948, "eval_unseen_dialect_accuracy": 0.9411232111868414, "eval_unseen_dialect_macro_f1": 0.9411037219947037, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6468, "eval_unseen_dialect_samples_per_second": 61475.828, "eval_unseen_dialect_steps_per_second": 480.848, "epoch": 8.3116036505867, "step": 25500 }, { "eval_hard_loss": 0.18859992921352386, "eval_hard_accuracy": 0.9752747252747253, "eval_hard_macro_f1": 0.08229021789522485, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0995, "eval_hard_samples_per_second": 7317.92, "eval_hard_steps_per_second": 60.313, "epoch": 8.3116036505867, "step": 25500 }, { "loss": 8.592988364398479e-05, "grad_norm": 0.0018528795335441828, "learning_rate": 0.0006625151869221302, "epoch": 8.34419817470665, "step": 25600 }, { "loss": 3.838728182017803e-05, "grad_norm": 6.19717247900553e-05, "learning_rate": 0.0006409338835203597, "epoch": 8.409387222946545, "step": 25800 }, { "loss": 1.7936211079359055e-05, "grad_norm": 0.0003067332727368921, "learning_rate": 0.0006196140275361816, "epoch": 8.474576271186441, "step": 26000 }, { "loss": 2.3439964279532434e-05, "grad_norm": 2.731915628828574e-05, "learning_rate": 0.0005985621074355978, "epoch": 8.539765319426337, "step": 26200 }, { "loss": 1.97579525411129e-05, "grad_norm": 4.191105836071074e-05, "learning_rate": 0.0005777845301412427, "epoch": 8.604954367666233, "step": 26400 }, { "loss": 2.1651322022080422e-05, "grad_norm": 9.114162821788341e-05, "learning_rate": 0.0005572876190825047, "epoch": 8.670143415906129, "step": 26600 }, { "loss": 1.93751510232687e-05, "grad_norm": 0.0029533361084759235, "learning_rate": 0.0005370776122710588, "epoch": 8.735332464146023, "step": 26800 }, { "loss": 1.8145898357033728e-05, "grad_norm": 0.000156165478983894, "learning_rate": 0.000517160660402398, "epoch": 8.800521512385918, "step": 27000 }, { "eval_held_loss": 0.1512400209903717, "eval_held_accuracy": 0.9782214156079855, "eval_held_macro_f1": 0.9777303881326141, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1981, "eval_held_samples_per_second": 30589.349, "eval_held_steps_per_second": 242.252, "epoch": 8.800521512385918, "step": 27000 }, { "eval_unseen_phrasing_loss": 1.0126179456710815, "eval_unseen_phrasing_accuracy": 0.8780236157285337, "eval_unseen_phrasing_macro_f1": 0.1535370480342466, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2131, "eval_unseen_phrasing_samples_per_second": 40933.43, "eval_unseen_phrasing_steps_per_second": 323.788, "epoch": 8.800521512385918, "step": 27000 }, { "eval_unseen_dialect_loss": 0.5041497945785522, "eval_unseen_dialect_accuracy": 0.9404693040919494, "eval_unseen_dialect_macro_f1": 0.9407379024830506, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6313, "eval_unseen_dialect_samples_per_second": 62986.614, "eval_unseen_dialect_steps_per_second": 492.665, "epoch": 8.800521512385918, "step": 27000 }, { "eval_hard_loss": 0.18605831265449524, "eval_hard_accuracy": 0.9793956043956044, "eval_hard_macro_f1": 0.08246588017580384, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0727, "eval_hard_samples_per_second": 10019.765, "eval_hard_steps_per_second": 82.58, "epoch": 8.800521512385918, "step": 27000 }, { "loss": 1.3405987992882728e-05, "grad_norm": 0.00017298512102570385, "learning_rate": 0.0004975428249839343, "epoch": 8.865710560625814, "step": 27200 }, { "loss": 1.4411471784114838e-05, "grad_norm": 0.0003377518441993743, "learning_rate": 0.00047823007649024497, "epoch": 8.93089960886571, "step": 27400 }, { "loss": 1.4787353575229644e-05, "grad_norm": 4.055908721056767e-05, "learning_rate": 0.00045922829254602506, "epoch": 8.996088657105606, "step": 27600 }, { "loss": 1.0408128146082163e-05, "grad_norm": 0.000422323850216344, "learning_rate": 0.0004405432561372935, "epoch": 9.061277705345502, "step": 27800 }, { "loss": 3.9707869291305545e-06, "grad_norm": 0.00012347962183412164, "learning_rate": 0.0004221806538514079, "epoch": 9.126466753585397, "step": 28000 }, { "loss": 4.812553524971008e-06, "grad_norm": 0.00021798703528475016, "learning_rate": 0.0004041460741464107, "epoch": 9.191655801825293, "step": 28200 }, { "loss": 4.756934940814972e-06, "grad_norm": 0.00022741024440620095, "learning_rate": 0.0003864450056502445, "epoch": 9.256844850065189, "step": 28400 }, { "eval_held_loss": 0.15126317739486694, "eval_held_accuracy": 0.9782214156079855, "eval_held_macro_f1": 0.9776621918961469, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1929, "eval_held_samples_per_second": 31415.27, "eval_held_steps_per_second": 248.793, "epoch": 9.289439374185136, "step": 28500 }, { "eval_unseen_phrasing_loss": 0.9854173064231873, "eval_unseen_phrasing_accuracy": 0.8827238335435057, "eval_unseen_phrasing_macro_f1": 0.1540440702746768, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2114, "eval_unseen_phrasing_samples_per_second": 41266.539, "eval_unseen_phrasing_steps_per_second": 326.423, "epoch": 9.289439374185136, "step": 28500 }, { "eval_unseen_dialect_loss": 0.5147712230682373, "eval_unseen_dialect_accuracy": 0.9400417494529816, "eval_unseen_dialect_macro_f1": 0.940186034501196, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6268, "eval_unseen_dialect_samples_per_second": 63438.714, "eval_unseen_dialect_steps_per_second": 496.201, "epoch": 9.289439374185136, "step": 28500 }, { "eval_hard_loss": 0.18782676756381989, "eval_hard_accuracy": 0.9807692307692307, "eval_hard_macro_f1": 0.08252427184466019, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0679, "eval_hard_samples_per_second": 10727.12, "eval_hard_steps_per_second": 88.41, "epoch": 9.289439374185136, "step": 28500 }, { "loss": 4.3132249265909195e-06, "grad_norm": 0.00037367508048191667, "learning_rate": 0.0003690828354903469, "epoch": 9.322033898305085, "step": 28600 }, { "loss": 5.851099267601967e-06, "grad_norm": 0.0006751463515684009, "learning_rate": 0.0003520648476541379, "epoch": 9.38722294654498, "step": 28800 }, { "loss": 3.5041105002164843e-06, "grad_norm": 5.1099781558150426e-05, "learning_rate": 0.00033539622138089426, "epoch": 9.452411994784876, "step": 29000 }, { "loss": 3.877617418766022e-06, "grad_norm": 3.238074350520037e-05, "learning_rate": 0.00031908202958550667, "epoch": 9.517601043024772, "step": 29200 }, { "loss": 3.754002973437309e-06, "grad_norm": 0.00022564925893675536, "learning_rate": 0.0003031272373145915, "epoch": 9.582790091264668, "step": 29400 }, { "loss": 3.7502124905586245e-06, "grad_norm": 8.494478970533237e-05, "learning_rate": 0.0002875367002354337, "epoch": 9.647979139504564, "step": 29600 }, { "loss": 2.9243528842926025e-06, "grad_norm": 4.193716449663043e-06, "learning_rate": 0.00027231516315821786, "epoch": 9.71316818774446, "step": 29800 }, { "loss": 4.24572266638279e-06, "grad_norm": 0.0001473828888265416, "learning_rate": 0.0002574672585919948, "epoch": 9.778357235984355, "step": 30000 }, { "eval_held_loss": 0.15340350568294525, "eval_held_accuracy": 0.9788813727107738, "eval_held_macro_f1": 0.9781646456301698, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1976, "eval_held_samples_per_second": 30680.831, "eval_held_steps_per_second": 242.976, "epoch": 9.778357235984355, "step": 30000 }, { "eval_unseen_phrasing_loss": 0.9964732527732849, "eval_unseen_phrasing_accuracy": 0.8821506362489969, "eval_unseen_phrasing_macro_f1": 0.15407220696385895, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2136, "eval_unseen_phrasing_samples_per_second": 40842.635, "eval_unseen_phrasing_steps_per_second": 323.07, "epoch": 9.778357235984355, "step": 30000 }, { "eval_unseen_dialect_loss": 0.5279785990715027, "eval_unseen_dialect_accuracy": 0.9397650964512965, "eval_unseen_dialect_macro_f1": 0.9399695311054369, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6451, "eval_unseen_dialect_samples_per_second": 61636.852, "eval_unseen_dialect_steps_per_second": 482.107, "epoch": 9.778357235984355, "step": 30000 }, { "eval_hard_loss": 0.19260503351688385, "eval_hard_accuracy": 0.9793956043956044, "eval_hard_macro_f1": 0.08246588017580384, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.068, "eval_hard_samples_per_second": 10701.405, "eval_hard_steps_per_second": 88.198, "epoch": 9.778357235984355, "step": 30000 }, { "loss": 3.5035330802202224e-06, "grad_norm": 8.517535752616823e-05, "learning_rate": 0.0002429975053348308, "epoch": 9.843546284224251, "step": 30200 }, { "loss": 3.36955301463604e-06, "grad_norm": 0.00014641178131569177, "learning_rate": 0.00022891030709855858, "epoch": 9.908735332464147, "step": 30400 }, { "loss": 3.6497227847576143e-06, "grad_norm": 0.00019411781977396458, "learning_rate": 0.00021520995116855614, "epoch": 9.973924380704041, "step": 30600 }, { "loss": 3.276835777796805e-06, "grad_norm": 8.209656698454637e-06, "learning_rate": 0.00020190060709895818, "epoch": 10.039113428943937, "step": 30800 }, { "loss": 2.113180235028267e-06, "grad_norm": 0.00045076521928422153, "learning_rate": 0.0001889863254436982, "epoch": 10.104302477183833, "step": 31000 }, { "loss": 2.7205795049667357e-06, "grad_norm": 0.00012407796748448163, "learning_rate": 0.000176471036523765, "epoch": 10.169491525423728, "step": 31200 }, { "loss": 2.047289162874222e-06, "grad_norm": 8.700434409547597e-05, "learning_rate": 0.0001643585492310538, "epoch": 10.234680573663624, "step": 31400 }, { "eval_held_loss": 0.15544317662715912, "eval_held_accuracy": 0.9785513941593796, "eval_held_macro_f1": 0.977789708896006, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1974, "eval_held_samples_per_second": 30700.765, "eval_held_steps_per_second": 243.134, "epoch": 10.267275097783573, "step": 31500 }, { "eval_unseen_phrasing_loss": 1.017669916152954, "eval_unseen_phrasing_accuracy": 0.8815774389544881, "eval_unseen_phrasing_macro_f1": 0.15397885271779754, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2112, "eval_unseen_phrasing_samples_per_second": 41306.0, "eval_unseen_phrasing_steps_per_second": 326.736, "epoch": 10.267275097783573, "step": 31500 }, { "eval_unseen_dialect_loss": 0.539714515209198, "eval_unseen_dialect_accuracy": 0.9396141948140138, "eval_unseen_dialect_macro_f1": 0.9399248879885271, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6584, "eval_unseen_dialect_samples_per_second": 60393.09, "eval_unseen_dialect_steps_per_second": 472.379, "epoch": 10.267275097783573, "step": 31500 }, { "eval_hard_loss": 0.19299156963825226, "eval_hard_accuracy": 0.978021978021978, "eval_hard_macro_f1": 0.0824074074074074, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0984, "eval_hard_samples_per_second": 7397.63, "eval_hard_steps_per_second": 60.969, "epoch": 10.267275097783573, "step": 31500 }, { "loss": 2.323649823665619e-06, "grad_norm": 4.971117959939875e-06, "learning_rate": 0.00015265254986917133, "epoch": 10.29986962190352, "step": 31600 }, { "loss": 2.3561064153909682e-06, "grad_norm": 1.534152943349909e-05, "learning_rate": 0.00014135660103154846, "epoch": 10.365058670143416, "step": 31800 }, { "loss": 2.536037936806679e-06, "grad_norm": 0.00017727049998939037, "learning_rate": 0.00013047414051720502, "epoch": 10.430247718383312, "step": 32000 }, { "loss": 2.1120160818099978e-06, "grad_norm": 2.0081704860785976e-05, "learning_rate": 0.00012000848028449157, "epoch": 10.495436766623207, "step": 32200 }, { "loss": 2.114633098244667e-06, "grad_norm": 2.7619544198387302e-05, "learning_rate": 0.00010996280544313225, "epoch": 10.560625814863103, "step": 32400 }, { "loss": 2.2349413484334946e-06, "grad_norm": 5.3831998229725286e-05, "learning_rate": 0.000100340173284871, "epoch": 10.625814863102999, "step": 32600 }, { "loss": 2.1641142666339873e-06, "grad_norm": 2.118246629834175e-05, "learning_rate": 9.114351235301766e-05, "epoch": 10.691003911342895, "step": 32800 }, { "loss": 2.128463238477707e-06, "grad_norm": 1.19837059173733e-05, "learning_rate": 8.237562155117828e-05, "epoch": 10.75619295958279, "step": 33000 }, { "eval_held_loss": 0.1571933925151825, "eval_held_accuracy": 0.9785513941593796, "eval_held_macro_f1": 0.977789708896006, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.2017, "eval_held_samples_per_second": 30045.179, "eval_held_steps_per_second": 237.942, "epoch": 10.75619295958279, "step": 33000 }, { "eval_unseen_phrasing_loss": 1.0116543769836426, "eval_unseen_phrasing_accuracy": 0.8828384730024075, "eval_unseen_phrasing_macro_f1": 0.15414686477971626, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2218, "eval_unseen_phrasing_samples_per_second": 39324.742, "eval_unseen_phrasing_steps_per_second": 311.064, "epoch": 10.75619295958279, "step": 33000 }, { "eval_unseen_dialect_loss": 0.5479562878608704, "eval_unseen_dialect_accuracy": 0.93941299263097, "eval_unseen_dialect_macro_f1": 0.9397113320624547, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6578, "eval_unseen_dialect_samples_per_second": 60442.164, "eval_unseen_dialect_steps_per_second": 472.763, "epoch": 10.75619295958279, "step": 33000 }, { "eval_hard_loss": 0.19669130444526672, "eval_hard_accuracy": 0.978021978021978, "eval_hard_macro_f1": 0.0824074074074074, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0686, "eval_hard_samples_per_second": 10616.977, "eval_hard_steps_per_second": 87.503, "epoch": 10.75619295958279, "step": 33000 }, { "loss": 1.7195940017700196e-06, "grad_norm": 6.149806722532958e-05, "learning_rate": 7.403916929143851e-05, "epoch": 10.821382007822686, "step": 33200 }, { "loss": 2.02791765332222e-06, "grad_norm": 1.4440478480537422e-05, "learning_rate": 6.613669268226247e-05, "epoch": 10.886571056062582, "step": 33400 }, { "loss": 1.7724744975566865e-06, "grad_norm": 1.6741221770644188e-05, "learning_rate": 5.8670596756350667e-05, "epoch": 10.951760104302478, "step": 33600 }, { "loss": 2.0193826640024783e-06, "grad_norm": 7.293969974853098e-05, "learning_rate": 5.164315373869477e-05, "epoch": 11.016949152542374, "step": 33800 }, { "loss": 1.4859996736049651e-06, "grad_norm": 0.00028648285660892725, "learning_rate": 4.50565023550506e-05, "epoch": 11.082138200782268, "step": 34000 }, { "loss": 1.589478924870491e-06, "grad_norm": 7.355489651672542e-05, "learning_rate": 3.891264718104015e-05, "epoch": 11.147327249022164, "step": 34200 }, { "loss": 1.5578418970108032e-06, "grad_norm": 0.00012585640070028603, "learning_rate": 3.321345803208092e-05, "epoch": 11.21251629726206, "step": 34400 }, { "eval_held_loss": 0.1582455188035965, "eval_held_accuracy": 0.9788813727107738, "eval_held_macro_f1": 0.9780138491772182, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1915, "eval_held_samples_per_second": 31651.085, "eval_held_steps_per_second": 250.66, "epoch": 11.245110821382008, "step": 34500 }, { "eval_unseen_phrasing_loss": 1.0285286903381348, "eval_unseen_phrasing_accuracy": 0.8824945546257021, "eval_unseen_phrasing_macro_f1": 0.1541046721624911, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2192, "eval_unseen_phrasing_samples_per_second": 39791.308, "eval_unseen_phrasing_steps_per_second": 314.754, "epoch": 11.245110821382008, "step": 34500 }, { "eval_unseen_dialect_loss": 0.5534936189651489, "eval_unseen_dialect_accuracy": 0.9393123915394482, "eval_unseen_dialect_macro_f1": 0.9396581191535277, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.642, "eval_unseen_dialect_samples_per_second": 61935.648, "eval_unseen_dialect_steps_per_second": 484.444, "epoch": 11.245110821382008, "step": 34500 }, { "eval_hard_loss": 0.1963353455066681, "eval_hard_accuracy": 0.9793956043956044, "eval_hard_macro_f1": 0.08246588017580384, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.07, "eval_hard_samples_per_second": 10407.028, "eval_hard_steps_per_second": 85.772, "epoch": 11.245110821382008, "step": 34500 }, { "loss": 1.466916874051094e-06, "grad_norm": 1.183496988232946e-05, "learning_rate": 2.796066939432812e-05, "epoch": 11.277705345501955, "step": 34600 }, { "loss": 1.4404859393835068e-06, "grad_norm": 0.00010413937707198784, "learning_rate": 2.3155879896802566e-05, "epoch": 11.342894393741851, "step": 34800 }, { "loss": 1.8354412168264389e-06, "grad_norm": 0.00011732364509953186, "learning_rate": 1.88005518248649e-05, "epoch": 11.408083441981747, "step": 35000 }, { "loss": 1.6290787607431412e-06, "grad_norm": 7.742628076812252e-05, "learning_rate": 1.4896010675185868e-05, "epoch": 11.473272490221643, "step": 35200 }, { "loss": 1.570470631122589e-06, "grad_norm": 3.107869270024821e-05, "learning_rate": 1.1443444752345211e-05, "epoch": 11.538461538461538, "step": 35400 }, { "loss": 1.4190562069416047e-06, "grad_norm": 5.619867442874238e-05, "learning_rate": 8.443904807183933e-06, "epoch": 11.603650586701434, "step": 35600 }, { "loss": 1.3390928506851196e-06, "grad_norm": 3.6323285712569486e-06, "learning_rate": 5.898303717020603e-06, "epoch": 11.66883963494133, "step": 35800 }, { "loss": 1.2829061597585678e-06, "grad_norm": 8.561168942833319e-05, "learning_rate": 3.807416207825931e-06, "epoch": 11.734028683181226, "step": 36000 }, { "eval_held_loss": 0.15885284543037415, "eval_held_accuracy": 0.9787163834350767, "eval_held_macro_f1": 0.9779075397528817, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1887, "eval_held_samples_per_second": 32119.002, "eval_held_steps_per_second": 254.366, "epoch": 11.734028683181226, "step": 36000 }, { "eval_unseen_phrasing_loss": 1.0259946584701538, "eval_unseen_phrasing_accuracy": 0.8828384730024075, "eval_unseen_phrasing_macro_f1": 0.15413669596810647, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2117, "eval_unseen_phrasing_samples_per_second": 41210.947, "eval_unseen_phrasing_steps_per_second": 325.984, "epoch": 11.734028683181226, "step": 36000 }, { "eval_unseen_dialect_loss": 0.5587638020515442, "eval_unseen_dialect_accuracy": 0.9392620909936873, "eval_unseen_dialect_macro_f1": 0.9396129141890838, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6501, "eval_unseen_dialect_samples_per_second": 61162.078, "eval_unseen_dialect_steps_per_second": 478.394, "epoch": 11.734028683181226, "step": 36000 }, { "eval_hard_loss": 0.19653108716011047, "eval_hard_accuracy": 0.978021978021978, "eval_hard_macro_f1": 0.0824074074074074, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.0681, "eval_hard_samples_per_second": 10697.918, "eval_hard_steps_per_second": 88.17, "epoch": 11.734028683181226, "step": 36000 }, { "loss": 1.525282859802246e-06, "grad_norm": 8.671376417623833e-05, "learning_rate": 2.171878618444534e-06, "epoch": 11.799217731421122, "step": 36200 }, { "loss": 1.4903955161571502e-06, "grad_norm": 3.6585981888492825e-06, "learning_rate": 9.921887069311852e-07, "epoch": 11.864406779661017, "step": 36400 }, { "loss": 1.5045423060655594e-06, "grad_norm": 0.00010040865163318813, "learning_rate": 2.687054990636595e-07, "epoch": 11.929595827900913, "step": 36600 }, { "loss": 1.4826934784650802e-06, "grad_norm": 2.545448842283804e-05, "learning_rate": 1.6491790783002002e-09, "epoch": 11.994784876140809, "step": 36800 }, { "eval_held_loss": 0.15902547538280487, "eval_held_accuracy": 0.9787163834350767, "eval_held_macro_f1": 0.9779075397528817, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1824, "eval_held_samples_per_second": 33231.732, "eval_held_steps_per_second": 263.178, "epoch": 12.0, "step": 36816 }, { "eval_unseen_phrasing_loss": 1.0271514654159546, "eval_unseen_phrasing_accuracy": 0.8826091940846039, "eval_unseen_phrasing_macro_f1": 0.15409486603366546, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2202, "eval_unseen_phrasing_samples_per_second": 39620.754, "eval_unseen_phrasing_steps_per_second": 313.405, "epoch": 12.0, "step": 36816 }, { "eval_unseen_dialect_loss": 0.5586314797401428, "eval_unseen_dialect_accuracy": 0.9391866401750459, "eval_unseen_dialect_macro_f1": 0.9395719822455334, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6482, "eval_unseen_dialect_samples_per_second": 61340.452, "eval_unseen_dialect_steps_per_second": 479.789, "epoch": 12.0, "step": 36816 }, { "eval_hard_loss": 0.19733069837093353, "eval_hard_accuracy": 0.978021978021978, "eval_hard_macro_f1": 0.0824074074074074, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.1052, "eval_hard_samples_per_second": 6918.408, "eval_hard_steps_per_second": 57.02, "epoch": 12.0, "step": 36816 }, { "train_runtime": 173.5675, "train_samples_per_second": 13571.454, "train_steps_per_second": 212.113, "total_flos": 11123400221472.0, "train_loss": 0.04227041617808625, "epoch": 12.0, "step": 36816 }, { "eval_held_loss": 0.15340350568294525, "eval_held_accuracy": 0.9788813727107738, "eval_held_macro_f1": 0.9781646456301698, "eval_held_majority_baseline": 0.19617224880382775, "eval_held_runtime": 0.1777, "eval_held_samples_per_second": 34114.127, "eval_held_steps_per_second": 270.166, "epoch": 12.0, "step": 36816 }, { "eval_unseen_phrasing_loss": 0.9964732527732849, "eval_unseen_phrasing_accuracy": 0.8821506362489969, "eval_unseen_phrasing_macro_f1": 0.15407220696385895, "eval_unseen_phrasing_majority_baseline": 0.5576063280981314, "eval_unseen_phrasing_runtime": 0.2235, "eval_unseen_phrasing_samples_per_second": 39027.04, "eval_unseen_phrasing_steps_per_second": 308.709, "epoch": 12.0, "step": 36816 }, { "eval_unseen_dialect_loss": 0.5279785990715027, "eval_unseen_dialect_accuracy": 0.9397650964512965, "eval_unseen_dialect_macro_f1": 0.9399695311054369, "eval_unseen_dialect_majority_baseline": 0.18739468323231306, "eval_unseen_dialect_runtime": 0.6569, "eval_unseen_dialect_samples_per_second": 60524.006, "eval_unseen_dialect_steps_per_second": 473.403, "epoch": 12.0, "step": 36816 }, { "eval_hard_loss": 0.19260503351688385, "eval_hard_accuracy": 0.9793956043956044, "eval_hard_macro_f1": 0.08246588017580384, "eval_hard_majority_baseline": 1.0, "eval_hard_runtime": 0.1007, "eval_hard_samples_per_second": 7229.025, "eval_hard_steps_per_second": 59.58, "epoch": 12.0, "step": 36816 } ] }