Zero-Shot Classification
Transformers
Safetensors
Arabic
bert
feature-extraction
arabic
prompt-routing
router
encoder
tiny-model
Instructions to use oddadmix/Nawah-Router-BERT-6M-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use oddadmix/Nawah-Router-BERT-6M-v2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("zero-shot-classification", model="oddadmix/Nawah-Router-BERT-6M-v2")# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("oddadmix/Nawah-Router-BERT-6M-v2") model = AutoModel.from_pretrained("oddadmix/Nawah-Router-BERT-6M-v2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "results": { | |
| "unseen_lanes": { | |
| "accuracy": 0.9329816940738442, | |
| "random_baseline": 0.2137126998901743, | |
| "n": 3223, | |
| "by_n_routes": { | |
| "2": { | |
| "acc": 0.9279279279279279, | |
| "n": 111 | |
| }, | |
| "4": { | |
| "acc": 0.9437652811735942, | |
| "n": 818 | |
| }, | |
| "5": { | |
| "acc": 0.9487179487179487, | |
| "n": 624 | |
| }, | |
| "8": { | |
| "acc": 0.9341317365269461, | |
| "n": 334 | |
| }, | |
| "3": { | |
| "acc": 0.9074074074074074, | |
| "n": 324 | |
| }, | |
| "7": { | |
| "acc": 0.907928388746803, | |
| "n": 391 | |
| }, | |
| "6": { | |
| "acc": 0.9395085066162571, | |
| "n": 529 | |
| }, | |
| "9": { | |
| "acc": 0.8913043478260869, | |
| "n": 92 | |
| } | |
| }, | |
| "by_difficulty": { | |
| "easy": { | |
| "acc": 0.9458927693064437, | |
| "n": 2033 | |
| }, | |
| "hard": { | |
| "acc": 0.9109243697478991, | |
| "n": 1190 | |
| } | |
| }, | |
| "by_mode": { | |
| "topical": { | |
| "acc": 0.8886666666666667, | |
| "n": 1500 | |
| }, | |
| "mixed": { | |
| "acc": 0.9803921568627451, | |
| "n": 1275 | |
| }, | |
| "axis": { | |
| "acc": 0.9464285714285714, | |
| "n": 448 | |
| } | |
| } | |
| }, | |
| "unseen_domain": { | |
| "accuracy": 0.7009111845399019, | |
| "random_baseline": 0.25206113185236045, | |
| "n": 9987, | |
| "by_n_routes": { | |
| "5": { | |
| "acc": 0.6979293544457978, | |
| "n": 1642 | |
| }, | |
| "4": { | |
| "acc": 0.7129848229342327, | |
| "n": 2965 | |
| }, | |
| "3": { | |
| "acc": 0.7323481116584565, | |
| "n": 1827 | |
| }, | |
| "2": { | |
| "acc": 0.8065573770491803, | |
| "n": 915 | |
| }, | |
| "6": { | |
| "acc": 0.6463547334058759, | |
| "n": 919 | |
| }, | |
| "7": { | |
| "acc": 0.6275252525252525, | |
| "n": 792 | |
| }, | |
| "8": { | |
| "acc": 0.6140350877192983, | |
| "n": 855 | |
| }, | |
| "9": { | |
| "acc": 0.6666666666666666, | |
| "n": 72 | |
| } | |
| }, | |
| "by_difficulty": { | |
| "easy": { | |
| "acc": 0.6996331153293986, | |
| "n": 6269 | |
| }, | |
| "hard": { | |
| "acc": 0.7030661646046261, | |
| "n": 3718 | |
| } | |
| }, | |
| "by_mode": { | |
| "topical": { | |
| "acc": 0.7009111845399019, | |
| "n": 9987 | |
| } | |
| } | |
| }, | |
| "unseen_axis": { | |
| "accuracy": 0.6001931434089812, | |
| "random_baseline": 0.23578575644002975, | |
| "n": 12426, | |
| "by_n_routes": { | |
| "4": { | |
| "acc": 0.5033030553261767, | |
| "n": 4844 | |
| }, | |
| "5": { | |
| "acc": 0.6116119725928597, | |
| "n": 2773 | |
| }, | |
| "3": { | |
| "acc": 0.6335429769392034, | |
| "n": 2385 | |
| }, | |
| "6": { | |
| "acc": 0.7689713322091062, | |
| "n": 1186 | |
| }, | |
| "7": { | |
| "acc": 0.7330508474576272, | |
| "n": 944 | |
| }, | |
| "8": { | |
| "acc": 0.7108843537414966, | |
| "n": 294 | |
| } | |
| }, | |
| "by_difficulty": { | |
| "hard": { | |
| "acc": 0.5900483481063659, | |
| "n": 4964 | |
| }, | |
| "easy": { | |
| "acc": 0.6069418386491557, | |
| "n": 7462 | |
| } | |
| }, | |
| "by_mode": { | |
| "axis": { | |
| "acc": 0.6001931434089812, | |
| "n": 12426 | |
| } | |
| } | |
| }, | |
| "hard": { | |
| "accuracy": 0.9109243697478991, | |
| "random_baseline": 0.21085734293717487, | |
| "n": 1190, | |
| "by_n_routes": { | |
| "4": { | |
| "acc": 0.9256505576208178, | |
| "n": 269 | |
| }, | |
| "5": { | |
| "acc": 0.9203187250996016, | |
| "n": 251 | |
| }, | |
| "8": { | |
| "acc": 0.9448818897637795, | |
| "n": 127 | |
| }, | |
| "3": { | |
| "acc": 0.8571428571428571, | |
| "n": 126 | |
| }, | |
| "7": { | |
| "acc": 0.89171974522293, | |
| "n": 157 | |
| }, | |
| "6": { | |
| "acc": 0.9095477386934674, | |
| "n": 199 | |
| }, | |
| "2": { | |
| "acc": 0.9117647058823529, | |
| "n": 34 | |
| }, | |
| "9": { | |
| "acc": 0.8888888888888888, | |
| "n": 27 | |
| } | |
| }, | |
| "by_difficulty": { | |
| "hard": { | |
| "acc": 0.9109243697478991, | |
| "n": 1190 | |
| } | |
| }, | |
| "by_mode": { | |
| "topical": { | |
| "acc": 0.8462929475587704, | |
| "n": 553 | |
| }, | |
| "mixed": { | |
| "acc": 0.9765957446808511, | |
| "n": 470 | |
| }, | |
| "axis": { | |
| "acc": 0.9401197604790419, | |
| "n": 167 | |
| } | |
| } | |
| } | |
| }, | |
| "base_model": "/home/ahmed-wasfy/Documents/projects/arabic-llm-from-scratch-training/Nawah-BERT-6M-e3-FINAL", | |
| "formulation": "routing_head", | |
| "log_history": [ | |
| { | |
| "loss": 1.4586485290527345, | |
| "grad_norm": 9.760659217834473, | |
| "learning_rate": 0.0001194, | |
| "epoch": 0.030902348578491966, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 1.0262959289550782, | |
| "grad_norm": 10.573455810546875, | |
| "learning_rate": 0.0002394, | |
| "epoch": 0.06180469715698393, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 0.7875787353515625, | |
| "grad_norm": 8.561141967773438, | |
| "learning_rate": 0.0002999797249000742, | |
| "epoch": 0.09270704573547589, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 0.6901941680908203, | |
| "grad_norm": 11.628190040588379, | |
| "learning_rate": 0.0002998150920740215, | |
| "epoch": 0.12360939431396786, | |
| "step": 800 | |
| }, | |
| { | |
| "loss": 0.5956812667846679, | |
| "grad_norm": 6.421826362609863, | |
| "learning_rate": 0.00029948518059649235, | |
| "epoch": 0.15451174289245984, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.5233871340751648, | |
| "eval_unseen_lanes_accuracy": 0.8091839900713621, | |
| "eval_unseen_lanes_runtime": 0.2565, | |
| "eval_unseen_lanes_samples_per_second": 12565.863, | |
| "eval_unseen_lanes_steps_per_second": 198.839, | |
| "epoch": 0.15451174289245984, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 0.98743736743927, | |
| "eval_unseen_domain_accuracy": 0.6317212376088915, | |
| "eval_unseen_domain_runtime": 0.5442, | |
| "eval_unseen_domain_samples_per_second": 18352.837, | |
| "eval_unseen_domain_steps_per_second": 288.515, | |
| "epoch": 0.15451174289245984, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.176316499710083, | |
| "eval_unseen_axis_accuracy": 0.5215676806695638, | |
| "eval_unseen_axis_runtime": 0.6167, | |
| "eval_unseen_axis_samples_per_second": 20148.724, | |
| "eval_unseen_axis_steps_per_second": 316.192, | |
| "epoch": 0.15451174289245984, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.5815076231956482, | |
| "eval_hard_accuracy": 0.7857142857142857, | |
| "eval_hard_runtime": 0.1608, | |
| "eval_hard_samples_per_second": 7400.389, | |
| "eval_hard_steps_per_second": 118.157, | |
| "epoch": 0.15451174289245984, | |
| "step": 1000 | |
| }, | |
| { | |
| "loss": 0.5344510269165039, | |
| "grad_norm": 13.737728118896484, | |
| "learning_rate": 0.0002989903544316465, | |
| "epoch": 0.18541409147095178, | |
| "step": 1200 | |
| }, | |
| { | |
| "loss": 0.48971908569335937, | |
| "grad_norm": 13.952028274536133, | |
| "learning_rate": 0.00029833115948043487, | |
| "epoch": 0.21631644004944375, | |
| "step": 1400 | |
| }, | |
| { | |
| "loss": 0.464974365234375, | |
| "grad_norm": 5.948032379150391, | |
| "learning_rate": 0.0002975083229783524, | |
| "epoch": 0.24721878862793573, | |
| "step": 1600 | |
| }, | |
| { | |
| "loss": 0.4640715789794922, | |
| "grad_norm": 7.1836748123168945, | |
| "learning_rate": 0.00029652275269313814, | |
| "epoch": 0.27812113720642767, | |
| "step": 1800 | |
| }, | |
| { | |
| "loss": 0.4463813018798828, | |
| "grad_norm": 6.2541351318359375, | |
| "learning_rate": 0.00029537553592331084, | |
| "epoch": 0.30902348578491967, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.3902101218700409, | |
| "eval_unseen_lanes_accuracy": 0.8644120384734719, | |
| "eval_unseen_lanes_runtime": 0.2597, | |
| "eval_unseen_lanes_samples_per_second": 12409.924, | |
| "eval_unseen_lanes_steps_per_second": 196.372, | |
| "epoch": 0.30902348578491967, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 0.9627552032470703, | |
| "eval_unseen_domain_accuracy": 0.6365274857314509, | |
| "eval_unseen_domain_runtime": 0.537, | |
| "eval_unseen_domain_samples_per_second": 18597.421, | |
| "eval_unseen_domain_steps_per_second": 292.36, | |
| "epoch": 0.30902348578491967, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.1707075834274292, | |
| "eval_unseen_axis_accuracy": 0.554160630935136, | |
| "eval_unseen_axis_runtime": 0.6407, | |
| "eval_unseen_axis_samples_per_second": 19393.76, | |
| "eval_unseen_axis_steps_per_second": 304.344, | |
| "epoch": 0.30902348578491967, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.45382222533226013, | |
| "eval_hard_accuracy": 0.8436974789915966, | |
| "eval_hard_runtime": 0.1554, | |
| "eval_hard_samples_per_second": 7656.751, | |
| "eval_hard_steps_per_second": 122.251, | |
| "epoch": 0.30902348578491967, | |
| "step": 2000 | |
| }, | |
| { | |
| "loss": 0.4215016555786133, | |
| "grad_norm": 8.966357231140137, | |
| "learning_rate": 0.00029406793829864144, | |
| "epoch": 0.3399258343634116, | |
| "step": 2200 | |
| }, | |
| { | |
| "loss": 0.4028751754760742, | |
| "grad_norm": 12.1080961227417, | |
| "learning_rate": 0.0002926014023838882, | |
| "epoch": 0.37082818294190356, | |
| "step": 2400 | |
| }, | |
| { | |
| "loss": 0.3866802978515625, | |
| "grad_norm": 12.563167572021484, | |
| "learning_rate": 0.00029097754608733376, | |
| "epoch": 0.40173053152039556, | |
| "step": 2600 | |
| }, | |
| { | |
| "loss": 0.38334075927734373, | |
| "grad_norm": 6.601385593414307, | |
| "learning_rate": 0.00028919816087588017, | |
| "epoch": 0.4326328800988875, | |
| "step": 2800 | |
| }, | |
| { | |
| "loss": 0.3662459564208984, | |
| "grad_norm": 9.042179107666016, | |
| "learning_rate": 0.0002872652097986712, | |
| "epoch": 0.4635352286773795, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.353814959526062, | |
| "eval_unseen_lanes_accuracy": 0.879304995345951, | |
| "eval_unseen_lanes_runtime": 0.263, | |
| "eval_unseen_lanes_samples_per_second": 12254.541, | |
| "eval_unseen_lanes_steps_per_second": 193.913, | |
| "epoch": 0.4635352286773795, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 0.9891335368156433, | |
| "eval_unseen_domain_accuracy": 0.6471412836687694, | |
| "eval_unseen_domain_runtime": 0.5289, | |
| "eval_unseen_domain_samples_per_second": 18884.131, | |
| "eval_unseen_domain_steps_per_second": 296.867, | |
| "epoch": 0.4635352286773795, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.210868239402771, | |
| "eval_unseen_axis_accuracy": 0.5622887493964268, | |
| "eval_unseen_axis_runtime": 0.6483, | |
| "eval_unseen_axis_samples_per_second": 19166.765, | |
| "eval_unseen_axis_steps_per_second": 300.782, | |
| "epoch": 0.4635352286773795, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.40300533175468445, | |
| "eval_hard_accuracy": 0.8596638655462185, | |
| "eval_hard_runtime": 0.1621, | |
| "eval_hard_samples_per_second": 7340.691, | |
| "eval_hard_steps_per_second": 117.204, | |
| "epoch": 0.4635352286773795, | |
| "step": 3000 | |
| }, | |
| { | |
| "loss": 0.362061882019043, | |
| "grad_norm": 15.32834529876709, | |
| "learning_rate": 0.00028518082532142156, | |
| "epoch": 0.49443757725587145, | |
| "step": 3200 | |
| }, | |
| { | |
| "loss": 0.3505752182006836, | |
| "grad_norm": 6.457422256469727, | |
| "learning_rate": 0.00028294730697384356, | |
| "epoch": 0.5253399258343634, | |
| "step": 3400 | |
| }, | |
| { | |
| "loss": 0.36617053985595704, | |
| "grad_norm": 8.091940879821777, | |
| "learning_rate": 0.000280567118812765, | |
| "epoch": 0.5562422744128553, | |
| "step": 3600 | |
| }, | |
| { | |
| "loss": 0.3390579986572266, | |
| "grad_norm": 5.5310492515563965, | |
| "learning_rate": 0.00027804288670373826, | |
| "epoch": 0.5871446229913473, | |
| "step": 3800 | |
| }, | |
| { | |
| "loss": 0.3409170913696289, | |
| "grad_norm": 4.008467674255371, | |
| "learning_rate": 0.0002753773954241395, | |
| "epoch": 0.6180469715698393, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.31256136298179626, | |
| "eval_unseen_lanes_accuracy": 0.8935774123487434, | |
| "eval_unseen_lanes_runtime": 0.2695, | |
| "eval_unseen_lanes_samples_per_second": 11957.459, | |
| "eval_unseen_lanes_steps_per_second": 189.212, | |
| "epoch": 0.6180469715698393, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 0.9226401448249817, | |
| "eval_unseen_domain_accuracy": 0.6455392009612496, | |
| "eval_unseen_domain_runtime": 0.5426, | |
| "eval_unseen_domain_samples_per_second": 18407.339, | |
| "eval_unseen_domain_steps_per_second": 289.371, | |
| "epoch": 0.6180469715698393, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.1576690673828125, | |
| "eval_unseen_axis_accuracy": 0.5476420408820216, | |
| "eval_unseen_axis_runtime": 0.6322, | |
| "eval_unseen_axis_samples_per_second": 19653.69, | |
| "eval_unseen_axis_steps_per_second": 308.423, | |
| "epoch": 0.6180469715698393, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3740597665309906, | |
| "eval_hard_accuracy": 0.8756302521008403, | |
| "eval_hard_runtime": 0.156, | |
| "eval_hard_samples_per_second": 7626.695, | |
| "eval_hard_steps_per_second": 121.771, | |
| "epoch": 0.6180469715698393, | |
| "step": 4000 | |
| }, | |
| { | |
| "loss": 0.33510574340820315, | |
| "grad_norm": 5.052737712860107, | |
| "learning_rate": 0.0002725735855909527, | |
| "epoch": 0.6489493201483313, | |
| "step": 4200 | |
| }, | |
| { | |
| "loss": 0.3274649429321289, | |
| "grad_norm": 4.481323719024658, | |
| "learning_rate": 0.00026963455041662936, | |
| "epoch": 0.6798516687268232, | |
| "step": 4400 | |
| }, | |
| { | |
| "loss": 0.3164741325378418, | |
| "grad_norm": 10.086233139038086, | |
| "learning_rate": 0.0002665635322966019, | |
| "epoch": 0.7107540173053152, | |
| "step": 4600 | |
| }, | |
| { | |
| "loss": 0.31062273025512693, | |
| "grad_norm": 8.942065238952637, | |
| "learning_rate": 0.00026336391923221597, | |
| "epoch": 0.7416563658838071, | |
| "step": 4800 | |
| }, | |
| { | |
| "loss": 0.30892057418823243, | |
| "grad_norm": 5.766172409057617, | |
| "learning_rate": 0.00026003924109302743, | |
| "epoch": 0.7725587144622992, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.3219285011291504, | |
| "eval_unseen_lanes_accuracy": 0.8923363326093702, | |
| "eval_unseen_lanes_runtime": 0.2565, | |
| "eval_unseen_lanes_samples_per_second": 12567.451, | |
| "eval_unseen_lanes_steps_per_second": 198.864, | |
| "epoch": 0.7725587144622992, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.126468300819397, | |
| "eval_unseen_domain_accuracy": 0.6296185040552719, | |
| "eval_unseen_domain_runtime": 0.5379, | |
| "eval_unseen_domain_samples_per_second": 18568.213, | |
| "eval_unseen_domain_steps_per_second": 291.9, | |
| "epoch": 0.7725587144622992, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.4002909660339355, | |
| "eval_unseen_axis_accuracy": 0.5616449380331563, | |
| "eval_unseen_axis_runtime": 0.6183, | |
| "eval_unseen_axis_samples_per_second": 20097.832, | |
| "eval_unseen_axis_steps_per_second": 315.393, | |
| "epoch": 0.7725587144622992, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.407728374004364, | |
| "eval_hard_accuracy": 0.8714285714285714, | |
| "eval_hard_runtime": 0.1627, | |
| "eval_hard_samples_per_second": 7314.571, | |
| "eval_hard_steps_per_second": 116.787, | |
| "epoch": 0.7725587144622992, | |
| "step": 5000 | |
| }, | |
| { | |
| "loss": 0.29508913040161133, | |
| "grad_norm": 12.423507690429688, | |
| "learning_rate": 0.0002565931657225882, | |
| "epoch": 0.8034610630407911, | |
| "step": 5200 | |
| }, | |
| { | |
| "loss": 0.3014940643310547, | |
| "grad_norm": 5.474195957183838, | |
| "learning_rate": 0.0002530294948920165, | |
| "epoch": 0.8343634116192831, | |
| "step": 5400 | |
| }, | |
| { | |
| "loss": 0.30600976943969727, | |
| "grad_norm": 6.128206253051758, | |
| "learning_rate": 0.0002493521601058157, | |
| "epoch": 0.865265760197775, | |
| "step": 5600 | |
| }, | |
| { | |
| "loss": 0.29127384185791017, | |
| "grad_norm": 7.009108543395996, | |
| "learning_rate": 0.0002455652182645697, | |
| "epoch": 0.896168108776267, | |
| "step": 5800 | |
| }, | |
| { | |
| "loss": 0.2868840217590332, | |
| "grad_norm": 4.6414289474487305, | |
| "learning_rate": 0.00024167284718929817, | |
| "epoch": 0.927070457354759, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.2860090136528015, | |
| "eval_unseen_lanes_accuracy": 0.9097114489605957, | |
| "eval_unseen_lanes_runtime": 0.263, | |
| "eval_unseen_lanes_samples_per_second": 12253.064, | |
| "eval_unseen_lanes_steps_per_second": 193.89, | |
| "epoch": 0.927070457354759, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.0391852855682373, | |
| "eval_unseen_domain_accuracy": 0.6249123861019326, | |
| "eval_unseen_domain_runtime": 0.5278, | |
| "eval_unseen_domain_samples_per_second": 18923.382, | |
| "eval_unseen_domain_steps_per_second": 297.484, | |
| "epoch": 0.927070457354759, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.4318047761917114, | |
| "eval_unseen_axis_accuracy": 0.5544825366167713, | |
| "eval_unseen_axis_runtime": 0.6292, | |
| "eval_unseen_axis_samples_per_second": 19750.198, | |
| "eval_unseen_axis_steps_per_second": 309.938, | |
| "epoch": 0.927070457354759, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3728649616241455, | |
| "eval_hard_accuracy": 0.8815126050420168, | |
| "eval_hard_runtime": 0.1566, | |
| "eval_hard_samples_per_second": 7599.279, | |
| "eval_hard_steps_per_second": 121.333, | |
| "epoch": 0.927070457354759, | |
| "step": 6000 | |
| }, | |
| { | |
| "loss": 0.29034774780273437, | |
| "grad_norm": 4.269179344177246, | |
| "learning_rate": 0.000237679341012411, | |
| "epoch": 0.957972805933251, | |
| "step": 6200 | |
| }, | |
| { | |
| "loss": 0.27252685546875, | |
| "grad_norm": 3.099332809448242, | |
| "learning_rate": 0.0002335891054403457, | |
| "epoch": 0.9888751545117429, | |
| "step": 6400 | |
| }, | |
| { | |
| "loss": 0.2299000358581543, | |
| "grad_norm": 2.502373695373535, | |
| "learning_rate": 0.00022940665289311417, | |
| "epoch": 1.019777503090235, | |
| "step": 6600 | |
| }, | |
| { | |
| "loss": 0.19722644805908204, | |
| "grad_norm": 7.622342586517334, | |
| "learning_rate": 0.00022513659752612167, | |
| "epoch": 1.0506798516687268, | |
| "step": 6800 | |
| }, | |
| { | |
| "loss": 0.18992324829101562, | |
| "grad_norm": 1.0242284536361694, | |
| "learning_rate": 0.00022078365013974898, | |
| "epoch": 1.0815822002472189, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.3706987798213959, | |
| "eval_unseen_lanes_accuracy": 0.9121936084393423, | |
| "eval_unseen_lanes_runtime": 0.2633, | |
| "eval_unseen_lanes_samples_per_second": 12241.369, | |
| "eval_unseen_lanes_steps_per_second": 193.705, | |
| "epoch": 1.0815822002472189, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.5655317306518555, | |
| "eval_unseen_domain_accuracy": 0.6401321718233703, | |
| "eval_unseen_domain_runtime": 0.5232, | |
| "eval_unseen_domain_samples_per_second": 19088.449, | |
| "eval_unseen_domain_steps_per_second": 300.079, | |
| "epoch": 1.0815822002472189, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.2009739875793457, | |
| "eval_unseen_axis_accuracy": 0.569853532914856, | |
| "eval_unseen_axis_runtime": 0.6295, | |
| "eval_unseen_axis_samples_per_second": 19738.798, | |
| "eval_unseen_axis_steps_per_second": 309.759, | |
| "epoch": 1.0815822002472189, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.4946191608905792, | |
| "eval_hard_accuracy": 0.8890756302521008, | |
| "eval_hard_runtime": 0.1578, | |
| "eval_hard_samples_per_second": 7540.271, | |
| "eval_hard_steps_per_second": 120.391, | |
| "epoch": 1.0815822002472189, | |
| "step": 7000 | |
| }, | |
| { | |
| "loss": 0.19767265319824218, | |
| "grad_norm": 14.961465835571289, | |
| "learning_rate": 0.00021635261298231433, | |
| "epoch": 1.1124845488257107, | |
| "step": 7200 | |
| }, | |
| { | |
| "loss": 0.1902615547180176, | |
| "grad_norm": 11.509106636047363, | |
| "learning_rate": 0.0002118483744521485, | |
| "epoch": 1.1433868974042027, | |
| "step": 7400 | |
| }, | |
| { | |
| "loss": 0.1893865203857422, | |
| "grad_norm": 6.442070007324219, | |
| "learning_rate": 0.00020727590370462763, | |
| "epoch": 1.1742892459826946, | |
| "step": 7600 | |
| }, | |
| { | |
| "loss": 0.19014299392700196, | |
| "grad_norm": 6.42080020904541, | |
| "learning_rate": 0.00020264024517011316, | |
| "epoch": 1.2051915945611866, | |
| "step": 7800 | |
| }, | |
| { | |
| "loss": 0.19989730834960937, | |
| "grad_norm": 2.8540380001068115, | |
| "learning_rate": 0.00019794651298884748, | |
| "epoch": 1.2360939431396787, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.24737592041492462, | |
| "eval_unseen_lanes_accuracy": 0.9236735960285448, | |
| "eval_unseen_lanes_runtime": 0.259, | |
| "eval_unseen_lanes_samples_per_second": 12442.489, | |
| "eval_unseen_lanes_steps_per_second": 196.887, | |
| "epoch": 1.2360939431396787, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.0949585437774658, | |
| "eval_unseen_domain_accuracy": 0.6586562531290678, | |
| "eval_unseen_domain_runtime": 0.5385, | |
| "eval_unseen_domain_samples_per_second": 18544.793, | |
| "eval_unseen_domain_steps_per_second": 291.532, | |
| "epoch": 1.2360939431396787, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.4516733884811401, | |
| "eval_unseen_axis_accuracy": 0.5766940286496056, | |
| "eval_unseen_axis_runtime": 0.6236, | |
| "eval_unseen_axis_samples_per_second": 19926.265, | |
| "eval_unseen_axis_steps_per_second": 312.701, | |
| "epoch": 1.2360939431396787, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.331650972366333, | |
| "eval_hard_accuracy": 0.8957983193277311, | |
| "eval_hard_runtime": 0.1588, | |
| "eval_hard_samples_per_second": 7494.912, | |
| "eval_hard_steps_per_second": 119.667, | |
| "epoch": 1.2360939431396787, | |
| "step": 8000 | |
| }, | |
| { | |
| "loss": 0.20300497055053712, | |
| "grad_norm": 5.189218997955322, | |
| "learning_rate": 0.0001931998853689441, | |
| "epoch": 1.2669962917181705, | |
| "step": 8200 | |
| }, | |
| { | |
| "loss": 0.17553037643432617, | |
| "grad_norm": 3.2245094776153564, | |
| "learning_rate": 0.00018840559887369732, | |
| "epoch": 1.2978986402966626, | |
| "step": 8400 | |
| }, | |
| { | |
| "loss": 0.19114152908325197, | |
| "grad_norm": 5.41471529006958, | |
| "learning_rate": 0.0001835689426445131, | |
| "epoch": 1.3288009888751544, | |
| "step": 8600 | |
| }, | |
| { | |
| "loss": 0.17892492294311524, | |
| "grad_norm": 3.311156988143921, | |
| "learning_rate": 0.00017869525256583495, | |
| "epoch": 1.3597033374536465, | |
| "step": 8800 | |
| }, | |
| { | |
| "loss": 0.1781780242919922, | |
| "grad_norm": 1.3695971965789795, | |
| "learning_rate": 0.00017378990537850246, | |
| "epoch": 1.3906056860321385, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.27402055263519287, | |
| "eval_unseen_lanes_accuracy": 0.9156065777226187, | |
| "eval_unseen_lanes_runtime": 0.2681, | |
| "eval_unseen_lanes_samples_per_second": 12022.189, | |
| "eval_unseen_lanes_steps_per_second": 190.236, | |
| "epoch": 1.3906056860321385, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.082552194595337, | |
| "eval_unseen_domain_accuracy": 0.6728747371583058, | |
| "eval_unseen_domain_runtime": 0.5492, | |
| "eval_unseen_domain_samples_per_second": 18185.53, | |
| "eval_unseen_domain_steps_per_second": 285.884, | |
| "epoch": 1.3906056860321385, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.6101419925689697, | |
| "eval_unseen_axis_accuracy": 0.5588282633188476, | |
| "eval_unseen_axis_runtime": 0.6124, | |
| "eval_unseen_axis_samples_per_second": 20291.969, | |
| "eval_unseen_axis_steps_per_second": 318.44, | |
| "epoch": 1.3906056860321385, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3630846440792084, | |
| "eval_hard_accuracy": 0.892436974789916, | |
| "eval_hard_runtime": 0.1629, | |
| "eval_hard_samples_per_second": 7303.301, | |
| "eval_hard_steps_per_second": 116.607, | |
| "epoch": 1.3906056860321385, | |
| "step": 9000 | |
| }, | |
| { | |
| "loss": 0.1790849494934082, | |
| "grad_norm": 1.0810199975967407, | |
| "learning_rate": 0.00016885831274803545, | |
| "epoch": 1.4215080346106304, | |
| "step": 9200 | |
| }, | |
| { | |
| "loss": 0.18830131530761718, | |
| "grad_norm": 6.382857799530029, | |
| "learning_rate": 0.00016390591529438968, | |
| "epoch": 1.4524103831891224, | |
| "step": 9400 | |
| }, | |
| { | |
| "loss": 0.19004894256591798, | |
| "grad_norm": 4.801127910614014, | |
| "learning_rate": 0.00015893817658976849, | |
| "epoch": 1.4833127317676142, | |
| "step": 9600 | |
| }, | |
| { | |
| "loss": 0.18906343460083008, | |
| "grad_norm": 5.73111629486084, | |
| "learning_rate": 0.00015396057713111408, | |
| "epoch": 1.5142150803461063, | |
| "step": 9800 | |
| }, | |
| { | |
| "loss": 0.16564352035522462, | |
| "grad_norm": 14.169121742248535, | |
| "learning_rate": 0.00014897860829392618, | |
| "epoch": 1.5451174289245984, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.3004416823387146, | |
| "eval_unseen_lanes_accuracy": 0.9174681973316786, | |
| "eval_unseen_lanes_runtime": 0.2645, | |
| "eval_unseen_lanes_samples_per_second": 12186.875, | |
| "eval_unseen_lanes_steps_per_second": 192.842, | |
| "epoch": 1.5451174289245984, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.3140738010406494, | |
| "eval_unseen_domain_accuracy": 0.6836887954340642, | |
| "eval_unseen_domain_runtime": 0.5226, | |
| "eval_unseen_domain_samples_per_second": 19111.476, | |
| "eval_unseen_domain_steps_per_second": 300.441, | |
| "epoch": 1.5451174289245984, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.10270094871521, | |
| "eval_unseen_axis_accuracy": 0.577015934331241, | |
| "eval_unseen_axis_runtime": 0.6091, | |
| "eval_unseen_axis_samples_per_second": 20400.548, | |
| "eval_unseen_axis_steps_per_second": 320.144, | |
| "epoch": 1.5451174289245984, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.386659175157547, | |
| "eval_hard_accuracy": 0.8941176470588236, | |
| "eval_hard_runtime": 0.1575, | |
| "eval_hard_samples_per_second": 7557.259, | |
| "eval_hard_steps_per_second": 120.662, | |
| "epoch": 1.5451174289245984, | |
| "step": 10000 | |
| }, | |
| { | |
| "loss": 0.17348814010620117, | |
| "grad_norm": 3.8261921405792236, | |
| "learning_rate": 0.00014399776627408, | |
| "epoch": 1.5760197775030902, | |
| "step": 10200 | |
| }, | |
| { | |
| "loss": 0.17659198760986328, | |
| "grad_norm": 1.6768690347671509, | |
| "learning_rate": 0.00013902354602432623, | |
| "epoch": 1.6069221260815822, | |
| "step": 10400 | |
| }, | |
| { | |
| "loss": 0.17375629425048827, | |
| "grad_norm": 7.939939975738525, | |
| "learning_rate": 0.00013406143519216157, | |
| "epoch": 1.637824474660074, | |
| "step": 10600 | |
| }, | |
| { | |
| "loss": 0.17606712341308595, | |
| "grad_norm": 3.530085802078247, | |
| "learning_rate": 0.0001291169080657601, | |
| "epoch": 1.6687268232385661, | |
| "step": 10800 | |
| }, | |
| { | |
| "loss": 0.15471673965454102, | |
| "grad_norm": 8.739562034606934, | |
| "learning_rate": 0.00012419541953464147, | |
| "epoch": 1.6996291718170582, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.23692560195922852, | |
| "eval_unseen_lanes_accuracy": 0.9236735960285448, | |
| "eval_unseen_lanes_runtime": 0.2785, | |
| "eval_unseen_lanes_samples_per_second": 11574.333, | |
| "eval_unseen_lanes_steps_per_second": 183.15, | |
| "epoch": 1.6996291718170582, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.0458940267562866, | |
| "eval_unseen_domain_accuracy": 0.6836887954340642, | |
| "eval_unseen_domain_runtime": 0.536, | |
| "eval_unseen_domain_samples_per_second": 18632.711, | |
| "eval_unseen_domain_steps_per_second": 292.914, | |
| "epoch": 1.6996291718170582, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.5432320833206177, | |
| "eval_unseen_axis_accuracy": 0.5790278448414614, | |
| "eval_unseen_axis_runtime": 0.6443, | |
| "eval_unseen_axis_samples_per_second": 19286.547, | |
| "eval_unseen_axis_steps_per_second": 302.662, | |
| "epoch": 1.6996291718170582, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3232015073299408, | |
| "eval_hard_accuracy": 0.9016806722689076, | |
| "eval_hard_runtime": 0.1601, | |
| "eval_hard_samples_per_second": 7433.475, | |
| "eval_hard_steps_per_second": 118.686, | |
| "epoch": 1.6996291718170582, | |
| "step": 11000 | |
| }, | |
| { | |
| "loss": 0.16208927154541017, | |
| "grad_norm": 9.356490135192871, | |
| "learning_rate": 0.00011930239907174065, | |
| "epoch": 1.73053152039555, | |
| "step": 11200 | |
| }, | |
| { | |
| "loss": 0.15787601470947266, | |
| "grad_norm": 4.05722188949585, | |
| "learning_rate": 0.00011444324474351796, | |
| "epoch": 1.7614338689740419, | |
| "step": 11400 | |
| }, | |
| { | |
| "loss": 0.165930118560791, | |
| "grad_norm": 1.2218636274337769, | |
| "learning_rate": 0.00010962331725471657, | |
| "epoch": 1.792336217552534, | |
| "step": 11600 | |
| }, | |
| { | |
| "loss": 0.16691875457763672, | |
| "grad_norm": 5.362765789031982, | |
| "learning_rate": 0.00010484793403433862, | |
| "epoch": 1.823238566131026, | |
| "step": 11800 | |
| }, | |
| { | |
| "loss": 0.15950778961181641, | |
| "grad_norm": 4.139005661010742, | |
| "learning_rate": 0.00010012236336936396, | |
| "epoch": 1.854140914709518, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.23127563297748566, | |
| "eval_unseen_lanes_accuracy": 0.9239838659633881, | |
| "eval_unseen_lanes_runtime": 0.2522, | |
| "eval_unseen_lanes_samples_per_second": 12777.842, | |
| "eval_unseen_lanes_steps_per_second": 202.194, | |
| "epoch": 1.854140914709518, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 0.9452027082443237, | |
| "eval_unseen_domain_accuracy": 0.6982076699709623, | |
| "eval_unseen_domain_runtime": 0.5298, | |
| "eval_unseen_domain_samples_per_second": 18849.027, | |
| "eval_unseen_domain_steps_per_second": 296.315, | |
| "epoch": 1.854140914709518, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 1.4740277528762817, | |
| "eval_unseen_axis_accuracy": 0.5853854820537583, | |
| "eval_unseen_axis_runtime": 0.6167, | |
| "eval_unseen_axis_samples_per_second": 20149.292, | |
| "eval_unseen_axis_steps_per_second": 316.201, | |
| "epoch": 1.854140914709518, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3201354742050171, | |
| "eval_hard_accuracy": 0.8941176470588236, | |
| "eval_hard_runtime": 0.1574, | |
| "eval_hard_samples_per_second": 7559.64, | |
| "eval_hard_steps_per_second": 120.7, | |
| "epoch": 1.854140914709518, | |
| "step": 12000 | |
| }, | |
| { | |
| "loss": 0.1575588130950928, | |
| "grad_norm": 2.324737071990967, | |
| "learning_rate": 9.545181859268278e-05, | |
| "epoch": 1.8850432632880099, | |
| "step": 12200 | |
| }, | |
| { | |
| "loss": 0.15390984535217286, | |
| "grad_norm": 8.164409637451172, | |
| "learning_rate": 9.084145233165512e-05, | |
| "epoch": 1.9159456118665017, | |
| "step": 12400 | |
| }, | |
| { | |
| "loss": 0.1659238624572754, | |
| "grad_norm": 4.467927932739258, | |
| "learning_rate": 8.629635082364105e-05, | |
| "epoch": 1.9468479604449938, | |
| "step": 12600 | |
| }, | |
| { | |
| "loss": 0.16303443908691406, | |
| "grad_norm": 0.978862464427948, | |
| "learning_rate": 8.182152830477452e-05, | |
| "epoch": 1.9777503090234858, | |
| "step": 12800 | |
| }, | |
| { | |
| "loss": 0.12827521324157715, | |
| "grad_norm": 9.180611610412598, | |
| "learning_rate": 7.74219214781692e-05, | |
| "epoch": 2.008652657601978, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.29380783438682556, | |
| "eval_unseen_lanes_accuracy": 0.9277071051815079, | |
| "eval_unseen_lanes_runtime": 0.2597, | |
| "eval_unseen_lanes_samples_per_second": 12409.628, | |
| "eval_unseen_lanes_steps_per_second": 196.367, | |
| "epoch": 2.008652657601978, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.2944514751434326, | |
| "eval_unseen_domain_accuracy": 0.7021127465705417, | |
| "eval_unseen_domain_runtime": 0.5274, | |
| "eval_unseen_domain_samples_per_second": 18936.119, | |
| "eval_unseen_domain_steps_per_second": 297.684, | |
| "epoch": 2.008652657601978, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.235142469406128, | |
| "eval_unseen_axis_accuracy": 0.5928697891517786, | |
| "eval_unseen_axis_runtime": 0.6267, | |
| "eval_unseen_axis_samples_per_second": 19826.464, | |
| "eval_unseen_axis_steps_per_second": 311.135, | |
| "epoch": 2.008652657601978, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.39865994453430176, | |
| "eval_hard_accuracy": 0.9042016806722689, | |
| "eval_hard_runtime": 0.1598, | |
| "eval_hard_samples_per_second": 7446.484, | |
| "eval_hard_steps_per_second": 118.893, | |
| "epoch": 2.008652657601978, | |
| "step": 13000 | |
| }, | |
| { | |
| "loss": 0.09030275344848633, | |
| "grad_norm": 4.3157548904418945, | |
| "learning_rate": 7.310238406766051e-05, | |
| "epoch": 2.03955500618047, | |
| "step": 13200 | |
| }, | |
| { | |
| "loss": 0.0979629898071289, | |
| "grad_norm": 5.349492073059082, | |
| "learning_rate": 6.886768146309235e-05, | |
| "epoch": 2.0704573547589615, | |
| "step": 13400 | |
| }, | |
| { | |
| "loss": 0.087772216796875, | |
| "grad_norm": 3.7547731399536133, | |
| "learning_rate": 6.472248546305456e-05, | |
| "epoch": 2.1013597033374536, | |
| "step": 13600 | |
| }, | |
| { | |
| "loss": 0.08256999015808106, | |
| "grad_norm": 1.9062801599502563, | |
| "learning_rate": 6.067136912087232e-05, | |
| "epoch": 2.1322620519159456, | |
| "step": 13800 | |
| }, | |
| { | |
| "loss": 0.09442170143127442, | |
| "grad_norm": 4.407528877258301, | |
| "learning_rate": 5.671880169953349e-05, | |
| "epoch": 2.1631644004944377, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.29582127928733826, | |
| "eval_unseen_lanes_accuracy": 0.9298789947254111, | |
| "eval_unseen_lanes_runtime": 0.2712, | |
| "eval_unseen_lanes_samples_per_second": 11885.213, | |
| "eval_unseen_lanes_steps_per_second": 188.069, | |
| "epoch": 2.1631644004944377, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.4203895330429077, | |
| "eval_unseen_domain_accuracy": 0.6918994693101032, | |
| "eval_unseen_domain_runtime": 0.5351, | |
| "eval_unseen_domain_samples_per_second": 18662.663, | |
| "eval_unseen_domain_steps_per_second": 293.385, | |
| "epoch": 2.1631644004944377, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.1755688190460205, | |
| "eval_unseen_axis_accuracy": 0.594479317559955, | |
| "eval_unseen_axis_runtime": 0.6099, | |
| "eval_unseen_axis_samples_per_second": 20374.27, | |
| "eval_unseen_axis_steps_per_second": 319.731, | |
| "epoch": 2.1631644004944377, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.40849950909614563, | |
| "eval_hard_accuracy": 0.907563025210084, | |
| "eval_hard_runtime": 0.1592, | |
| "eval_hard_samples_per_second": 7474.619, | |
| "eval_hard_steps_per_second": 119.343, | |
| "epoch": 2.1631644004944377, | |
| "step": 14000 | |
| }, | |
| { | |
| "loss": 0.09402852058410645, | |
| "grad_norm": 6.6268205642700195, | |
| "learning_rate": 5.28691437411185e-05, | |
| "epoch": 2.1940667490729293, | |
| "step": 14200 | |
| }, | |
| { | |
| "loss": 0.0864114761352539, | |
| "grad_norm": 6.456910610198975, | |
| "learning_rate": 4.912664225617335e-05, | |
| "epoch": 2.2249690976514214, | |
| "step": 14400 | |
| }, | |
| { | |
| "loss": 0.0929531478881836, | |
| "grad_norm": 2.4680755138397217, | |
| "learning_rate": 4.549542603833318e-05, | |
| "epoch": 2.2558714462299134, | |
| "step": 14600 | |
| }, | |
| { | |
| "loss": 0.0913322925567627, | |
| "grad_norm": 1.958465337753296, | |
| "learning_rate": 4.197950110936387e-05, | |
| "epoch": 2.2867737948084055, | |
| "step": 14800 | |
| }, | |
| { | |
| "loss": 0.07560197353363036, | |
| "grad_norm": 7.140666961669922, | |
| "learning_rate": 3.8582746299648135e-05, | |
| "epoch": 2.3176761433868975, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.31193897128105164, | |
| "eval_unseen_lanes_accuracy": 0.932671424139001, | |
| "eval_unseen_lanes_runtime": 0.2695, | |
| "eval_unseen_lanes_samples_per_second": 11957.861, | |
| "eval_unseen_lanes_steps_per_second": 189.218, | |
| "epoch": 2.3176761433868975, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.5022051334381104, | |
| "eval_unseen_domain_accuracy": 0.7045158706318214, | |
| "eval_unseen_domain_runtime": 0.5152, | |
| "eval_unseen_domain_samples_per_second": 19385.086, | |
| "eval_unseen_domain_steps_per_second": 304.742, | |
| "epoch": 2.3176761433868975, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.4407944679260254, | |
| "eval_unseen_axis_accuracy": 0.598020280057943, | |
| "eval_unseen_axis_runtime": 0.6255, | |
| "eval_unseen_axis_samples_per_second": 19864.27, | |
| "eval_unseen_axis_steps_per_second": 311.728, | |
| "epoch": 2.3176761433868975, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.4339127838611603, | |
| "eval_hard_accuracy": 0.9084033613445378, | |
| "eval_hard_runtime": 0.1603, | |
| "eval_hard_samples_per_second": 7424.243, | |
| "eval_hard_steps_per_second": 118.538, | |
| "epoch": 2.3176761433868975, | |
| "step": 15000 | |
| }, | |
| { | |
| "loss": 0.09124773979187012, | |
| "grad_norm": 1.9079341888427734, | |
| "learning_rate": 3.5308908968992e-05, | |
| "epoch": 2.348578491965389, | |
| "step": 15200 | |
| }, | |
| { | |
| "loss": 0.0789580774307251, | |
| "grad_norm": 3.3277528285980225, | |
| "learning_rate": 3.2161600872470804e-05, | |
| "epoch": 2.379480840543881, | |
| "step": 15400 | |
| }, | |
| { | |
| "loss": 0.0785712718963623, | |
| "grad_norm": 8.918529510498047, | |
| "learning_rate": 2.9144294175877418e-05, | |
| "epoch": 2.4103831891223733, | |
| "step": 15600 | |
| }, | |
| { | |
| "loss": 0.08375604629516602, | |
| "grad_norm": 1.9613817930221558, | |
| "learning_rate": 2.6260317625168052e-05, | |
| "epoch": 2.4412855377008653, | |
| "step": 15800 | |
| }, | |
| { | |
| "loss": 0.0875228214263916, | |
| "grad_norm": 0.23354528844356537, | |
| "learning_rate": 2.351285287413069e-05, | |
| "epoch": 2.4721878862793574, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.27757585048675537, | |
| "eval_unseen_lanes_accuracy": 0.9332919640086875, | |
| "eval_unseen_lanes_runtime": 0.269, | |
| "eval_unseen_lanes_samples_per_second": 11979.34, | |
| "eval_unseen_lanes_steps_per_second": 189.558, | |
| "epoch": 2.4721878862793574, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.3426191806793213, | |
| "eval_unseen_domain_accuracy": 0.7027135275858616, | |
| "eval_unseen_domain_runtime": 0.5238, | |
| "eval_unseen_domain_samples_per_second": 19065.435, | |
| "eval_unseen_domain_steps_per_second": 299.717, | |
| "epoch": 2.4721878862793574, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.2119669914245605, | |
| "eval_unseen_axis_accuracy": 0.5920650249476903, | |
| "eval_unseen_axis_runtime": 0.6271, | |
| "eval_unseen_axis_samples_per_second": 19813.628, | |
| "eval_unseen_axis_steps_per_second": 310.933, | |
| "epoch": 2.4721878862793574, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.3819628953933716, | |
| "eval_hard_accuracy": 0.9109243697478991, | |
| "eval_hard_runtime": 0.1609, | |
| "eval_hard_samples_per_second": 7396.846, | |
| "eval_hard_steps_per_second": 118.101, | |
| "epoch": 2.4721878862793574, | |
| "step": 16000 | |
| }, | |
| { | |
| "loss": 0.07829498767852783, | |
| "grad_norm": 1.8762905597686768, | |
| "learning_rate": 2.0904930974328466e-05, | |
| "epoch": 2.503090234857849, | |
| "step": 16200 | |
| }, | |
| { | |
| "loss": 0.08220289230346679, | |
| "grad_norm": 7.849063396453857, | |
| "learning_rate": 1.8439429031190515e-05, | |
| "epoch": 2.533992583436341, | |
| "step": 16400 | |
| }, | |
| { | |
| "loss": 0.08165282249450684, | |
| "grad_norm": 0.32895785570144653, | |
| "learning_rate": 1.6119067029938165e-05, | |
| "epoch": 2.564894932014833, | |
| "step": 16600 | |
| }, | |
| { | |
| "loss": 0.08682233810424805, | |
| "grad_norm": 7.921652793884277, | |
| "learning_rate": 1.3946404834849312e-05, | |
| "epoch": 2.595797280593325, | |
| "step": 16800 | |
| }, | |
| { | |
| "loss": 0.08006702423095703, | |
| "grad_norm": 8.002998352050781, | |
| "learning_rate": 1.192383936517129e-05, | |
| "epoch": 2.626699629171817, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.2994181513786316, | |
| "eval_unseen_lanes_accuracy": 0.9329816940738442, | |
| "eval_unseen_lanes_runtime": 0.2673, | |
| "eval_unseen_lanes_samples_per_second": 12058.253, | |
| "eval_unseen_lanes_steps_per_second": 190.807, | |
| "epoch": 2.626699629171817, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.4774185419082642, | |
| "eval_unseen_domain_accuracy": 0.7055171723240212, | |
| "eval_unseen_domain_runtime": 0.5317, | |
| "eval_unseen_domain_samples_per_second": 18784.163, | |
| "eval_unseen_domain_steps_per_second": 295.295, | |
| "epoch": 2.626699629171817, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.3520829677581787, | |
| "eval_unseen_axis_accuracy": 0.5997907613069371, | |
| "eval_unseen_axis_runtime": 0.6139, | |
| "eval_unseen_axis_samples_per_second": 20241.068, | |
| "eval_unseen_axis_steps_per_second": 317.641, | |
| "epoch": 2.626699629171817, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.4058825969696045, | |
| "eval_hard_accuracy": 0.9117647058823529, | |
| "eval_hard_runtime": 0.1604, | |
| "eval_hard_samples_per_second": 7416.818, | |
| "eval_hard_steps_per_second": 118.42, | |
| "epoch": 2.626699629171817, | |
| "step": 17000 | |
| }, | |
| { | |
| "loss": 0.0812064266204834, | |
| "grad_norm": 3.427633285522461, | |
| "learning_rate": 1.005360195079697e-05, | |
| "epoch": 2.657601977750309, | |
| "step": 17200 | |
| }, | |
| { | |
| "loss": 0.07186338424682617, | |
| "grad_norm": 2.308717727661133, | |
| "learning_rate": 8.33775587062237e-06, | |
| "epoch": 2.688504326328801, | |
| "step": 17400 | |
| }, | |
| { | |
| "loss": 0.08242843627929687, | |
| "grad_norm": 4.111525058746338, | |
| "learning_rate": 6.778194076301119e-06, | |
| "epoch": 2.719406674907293, | |
| "step": 17600 | |
| }, | |
| { | |
| "loss": 0.07691887378692627, | |
| "grad_norm": 10.234223365783691, | |
| "learning_rate": 5.376637103906678e-06, | |
| "epoch": 2.750309023485785, | |
| "step": 17800 | |
| }, | |
| { | |
| "loss": 0.05823780059814453, | |
| "grad_norm": 1.5334542989730835, | |
| "learning_rate": 4.134631175806541e-06, | |
| "epoch": 2.781211372064277, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.29644232988357544, | |
| "eval_unseen_lanes_accuracy": 0.9329816940738442, | |
| "eval_unseen_lanes_runtime": 0.262, | |
| "eval_unseen_lanes_samples_per_second": 12300.706, | |
| "eval_unseen_lanes_steps_per_second": 194.643, | |
| "epoch": 2.781211372064277, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.4905004501342773, | |
| "eval_unseen_domain_accuracy": 0.7009111845399019, | |
| "eval_unseen_domain_runtime": 0.555, | |
| "eval_unseen_domain_samples_per_second": 17993.704, | |
| "eval_unseen_domain_steps_per_second": 282.869, | |
| "epoch": 2.781211372064277, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.323622465133667, | |
| "eval_unseen_axis_accuracy": 0.6001931434089812, | |
| "eval_unseen_axis_runtime": 0.6254, | |
| "eval_unseen_axis_samples_per_second": 19869.586, | |
| "eval_unseen_axis_steps_per_second": 311.811, | |
| "epoch": 2.781211372064277, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.40079689025878906, | |
| "eval_hard_accuracy": 0.9109243697478991, | |
| "eval_hard_runtime": 0.1574, | |
| "eval_hard_samples_per_second": 7559.33, | |
| "eval_hard_steps_per_second": 120.695, | |
| "epoch": 2.781211372064277, | |
| "step": 18000 | |
| }, | |
| { | |
| "loss": 0.08730937957763672, | |
| "grad_norm": 0.42866209149360657, | |
| "learning_rate": 3.0535464948426957e-06, | |
| "epoch": 2.8121137206427687, | |
| "step": 18200 | |
| }, | |
| { | |
| "loss": 0.07673277854919433, | |
| "grad_norm": 9.0943021774292, | |
| "learning_rate": 2.134575732699473e-06, | |
| "epoch": 2.8430160692212607, | |
| "step": 18400 | |
| }, | |
| { | |
| "loss": 0.0871958827972412, | |
| "grad_norm": 8.693181037902832, | |
| "learning_rate": 1.3787327141271065e-06, | |
| "epoch": 2.8739184177997528, | |
| "step": 18600 | |
| }, | |
| { | |
| "loss": 0.08861166954040528, | |
| "grad_norm": 1.7328418493270874, | |
| "learning_rate": 7.868512984726017e-07, | |
| "epoch": 2.904820766378245, | |
| "step": 18800 | |
| }, | |
| { | |
| "loss": 0.07439324855804444, | |
| "grad_norm": 7.242162227630615, | |
| "learning_rate": 3.595844597511666e-07, | |
| "epoch": 2.935723114956737, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.2913786470890045, | |
| "eval_unseen_lanes_accuracy": 0.9332919640086875, | |
| "eval_unseen_lanes_runtime": 0.2558, | |
| "eval_unseen_lanes_samples_per_second": 12600.204, | |
| "eval_unseen_lanes_steps_per_second": 199.383, | |
| "epoch": 2.935723114956737, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.4577001333236694, | |
| "eval_unseen_domain_accuracy": 0.7011114448783419, | |
| "eval_unseen_domain_runtime": 0.5411, | |
| "eval_unseen_domain_samples_per_second": 18457.163, | |
| "eval_unseen_domain_steps_per_second": 290.155, | |
| "epoch": 2.935723114956737, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.2998874187469482, | |
| "eval_unseen_axis_accuracy": 0.5989859971028488, | |
| "eval_unseen_axis_runtime": 0.6285, | |
| "eval_unseen_axis_samples_per_second": 19770.314, | |
| "eval_unseen_axis_steps_per_second": 310.254, | |
| "epoch": 2.935723114956737, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_hard_loss": 0.39369863271713257, | |
| "eval_hard_accuracy": 0.9109243697478991, | |
| "eval_hard_runtime": 0.1559, | |
| "eval_hard_samples_per_second": 7631.639, | |
| "eval_hard_steps_per_second": 121.85, | |
| "epoch": 2.935723114956737, | |
| "step": 19000 | |
| }, | |
| { | |
| "loss": 0.07134580135345459, | |
| "grad_norm": 0.48950284719467163, | |
| "learning_rate": 9.740356627385149e-08, | |
| "epoch": 2.9666254635352285, | |
| "step": 19200 | |
| }, | |
| { | |
| "loss": 0.07458440780639648, | |
| "grad_norm": 4.208376407623291, | |
| "learning_rate": 5.978606257561746e-10, | |
| "epoch": 2.9975278121137205, | |
| "step": 19400 | |
| }, | |
| { | |
| "eval_unseen_lanes_loss": 0.2913234233856201, | |
| "eval_unseen_lanes_accuracy": 0.9339125038783742, | |
| "eval_unseen_lanes_runtime": 0.2524, | |
| "eval_unseen_lanes_samples_per_second": 12768.441, | |
| "eval_unseen_lanes_steps_per_second": 202.045, | |
| "epoch": 3.0, | |
| "step": 19416 | |
| }, | |
| { | |
| "eval_unseen_domain_loss": 1.4579074382781982, | |
| "eval_unseen_domain_accuracy": 0.7015119655552218, | |
| "eval_unseen_domain_runtime": 0.5345, | |
| "eval_unseen_domain_samples_per_second": 18684.464, | |
| "eval_unseen_domain_steps_per_second": 293.728, | |
| "epoch": 3.0, | |
| "step": 19416 | |
| }, | |
| { | |
| "eval_unseen_axis_loss": 2.300905466079712, | |
| "eval_unseen_axis_accuracy": 0.599388379204893, | |
| "eval_unseen_axis_runtime": 0.6288, | |
| "eval_unseen_axis_samples_per_second": 19762.884, | |
| "eval_unseen_axis_steps_per_second": 310.137, | |
| "epoch": 3.0, | |
| "step": 19416 | |
| }, | |
| { | |
| "eval_hard_loss": 0.39358070492744446, | |
| "eval_hard_accuracy": 0.9117647058823529, | |
| "eval_hard_runtime": 0.1501, | |
| "eval_hard_samples_per_second": 7930.316, | |
| "eval_hard_steps_per_second": 126.618, | |
| "epoch": 3.0, | |
| "step": 19416 | |
| }, | |
| { | |
| "train_runtime": 170.3986, | |
| "train_samples_per_second": 3646.104, | |
| "train_steps_per_second": 113.945, | |
| "total_flos": 0.0, | |
| "train_loss": 0.2352386224242852, | |
| "epoch": 3.0, | |
| "step": 19416 | |
| } | |
| ] | |
| } |