{"step": "10", "epoch": "0.0199401794616", "loss": "2.11112308502", "eval_loss": "", "grad_norm": "", "learning_rate": "0.0001", "entropy": "1.37812953293", "num_tokens": "157410", "mean_token_accuracy": "0.577637497336", "train_runtime": "", "timestamp": "2026-07-12T23:27:34.674239+00:00", "elapsed_seconds": "287.093716015"} {"step": "20", "epoch": "0.0398803589232", "loss": "1.29420804977", "eval_loss": "", "grad_norm": "1.26386117935", "learning_rate": "0.0001", "entropy": "1.15712053329", "num_tokens": "315297", "mean_token_accuracy": "0.712841274589", "train_runtime": "", "timestamp": "2026-07-12T23:32:16.954179+00:00", "elapsed_seconds": "569.373658329"} {"step": "30", "epoch": "0.0598205383848", "loss": "0.42145242691", "eval_loss": "", "grad_norm": "0.176767781377", "learning_rate": "0.0001", "entropy": "0.425329777598", "num_tokens": "472607", "mean_token_accuracy": "0.904638640583", "train_runtime": "", "timestamp": "2026-07-12T23:36:55.291919+00:00", "elapsed_seconds": "847.711396723"} {"step": "40", "epoch": "0.0797607178465", "loss": "0.379944682121", "eval_loss": "", "grad_norm": "0.154804855585", "learning_rate": "0.0001", "entropy": "0.388722001761", "num_tokens": "628747", "mean_token_accuracy": "0.913660594821", "train_runtime": "", "timestamp": "2026-07-12T23:41:27.797580+00:00", "elapsed_seconds": "1120.21705839"} {"step": "50", "epoch": "0.0997008973081", "loss": "0.321985936165", "eval_loss": "", "grad_norm": "0.149897664785", "learning_rate": "0.0001", "entropy": "0.325890696794", "num_tokens": "786634", "mean_token_accuracy": "0.922811582685", "train_runtime": "", "timestamp": "2026-07-12T23:46:07.615243+00:00", "elapsed_seconds": "1400.03471854"} {"step": "60", "epoch": "0.11964107677", "loss": "0.298148155212", "eval_loss": "", "grad_norm": "0.156934633851", "learning_rate": "0.0001", "entropy": "0.301460643485", "num_tokens": "942856", "mean_token_accuracy": "0.929183906317", "train_runtime": "", "timestamp": "2026-07-12T23:50:43.825596+00:00", "elapsed_seconds": "1676.24507346"} {"step": "70", "epoch": "0.139581256231", "loss": "0.296176433563", "eval_loss": "", "grad_norm": "0.171132102609", "learning_rate": "0.0001", "entropy": "0.303908668086", "num_tokens": "1101002", "mean_token_accuracy": "0.92799295038", "train_runtime": "", "timestamp": "2026-07-12T23:55:19.161232+00:00", "elapsed_seconds": "1951.58070331"} {"step": "80", "epoch": "0.159521435693", "loss": "0.275443768501", "eval_loss": "", "grad_norm": "0.225811675191", "learning_rate": "0.0001", "entropy": "0.279469710961", "num_tokens": "1257971", "mean_token_accuracy": "0.934000141919", "train_runtime": "", "timestamp": "2026-07-12T23:59:48.285763+00:00", "elapsed_seconds": "2220.70524027"} {"step": "90", "epoch": "0.179461615155", "loss": "0.259989786148", "eval_loss": "", "grad_norm": "0.220681875944", "learning_rate": "0.0001", "entropy": "0.270173162967", "num_tokens": "1415989", "mean_token_accuracy": "0.936679942906", "train_runtime": "", "timestamp": "2026-07-13T00:04:20.760179+00:00", "elapsed_seconds": "2493.17965889"} {"step": "100", "epoch": "0.199401794616", "loss": "0.251606225967", "eval_loss": "", "grad_norm": "0.21857509017", "learning_rate": "0.0001", "entropy": "0.257372412458", "num_tokens": "1572847", "mean_token_accuracy": "0.93935367465", "train_runtime": "", "timestamp": "2026-07-13T00:08:52.635907+00:00", "elapsed_seconds": "2765.05538831"} {"step": "110", "epoch": "0.219341974078", "loss": "0.227929806709", "eval_loss": "", "grad_norm": "0.220582723618", "learning_rate": "0.0001", "entropy": "0.2316269923", "num_tokens": "1731000", "mean_token_accuracy": "0.944896374643", "train_runtime": "", "timestamp": "2026-07-13T00:13:24.861482+00:00", "elapsed_seconds": "3037.28096269"} {"step": "120", "epoch": "0.239282153539", "loss": "0.215679264069", "eval_loss": "", "grad_norm": "0.298690497875", "learning_rate": "0.0001", "entropy": "0.226280380599", "num_tokens": "1888655", "mean_token_accuracy": "0.94771039784", "train_runtime": "", "timestamp": "2026-07-13T00:17:55.041625+00:00", "elapsed_seconds": "3307.46110534"} {"step": "130", "epoch": "0.259222333001", "loss": "0.212479043007", "eval_loss": "", "grad_norm": "0.420699924231", "learning_rate": "0.0001", "entropy": "0.219941757061", "num_tokens": "2045550", "mean_token_accuracy": "0.948774619401", "train_runtime": "", "timestamp": "2026-07-13T00:22:26.256927+00:00", "elapsed_seconds": "3578.67640638"} {"step": "140", "epoch": "0.279162512463", "loss": "0.192000174522", "eval_loss": "", "grad_norm": "0.230090796947", "learning_rate": "0.0001", "entropy": "0.197745629773", "num_tokens": "2202398", "mean_token_accuracy": "0.95323535949", "train_runtime": "", "timestamp": "2026-07-13T00:26:52.884507+00:00", "elapsed_seconds": "3845.30398705"} {"step": "150", "epoch": "0.299102691924", "loss": "0.203136539459", "eval_loss": "", "grad_norm": "0.224954873323", "learning_rate": "0.0001", "entropy": "0.207592940144", "num_tokens": "2360220", "mean_token_accuracy": "0.95079408586", "train_runtime": "", "timestamp": "2026-07-13T00:31:24.927288+00:00", "elapsed_seconds": "4117.34676856"} {"step": "160", "epoch": "0.319042871386", "loss": "0.201045250893", "eval_loss": "", "grad_norm": "0.265071094036", "learning_rate": "0.0001", "entropy": "0.209576810896", "num_tokens": "2517994", "mean_token_accuracy": "0.95026602596", "train_runtime": "", "timestamp": "2026-07-13T00:35:58.618705+00:00", "elapsed_seconds": "4391.03818466"} {"step": "170", "epoch": "0.338983050847", "loss": "0.187498760223", "eval_loss": "", "grad_norm": "0.260065674782", "learning_rate": "0.0001", "entropy": "0.194432022609", "num_tokens": "2676023", "mean_token_accuracy": "0.954099307954", "train_runtime": "", "timestamp": "2026-07-13T00:40:29.378834+00:00", "elapsed_seconds": "4661.79831422"} {"step": "180", "epoch": "0.358923230309", "loss": "0.193836379051", "eval_loss": "", "grad_norm": "0.268739163876", "learning_rate": "0.0001", "entropy": "0.198456530832", "num_tokens": "2832968", "mean_token_accuracy": "0.952471798658", "train_runtime": "", "timestamp": "2026-07-13T00:44:57.399895+00:00", "elapsed_seconds": "4929.81937462"} {"step": "190", "epoch": "0.378863409771", "loss": "0.198517107964", "eval_loss": "", "grad_norm": "0.233935028315", "learning_rate": "0.0001", "entropy": "0.203954018094", "num_tokens": "2991512", "mean_token_accuracy": "0.950816164911", "train_runtime": "", "timestamp": "2026-07-13T00:49:28.786820+00:00", "elapsed_seconds": "5201.20629985"} {"step": "200", "epoch": "0.398803589232", "loss": "0.185361707211", "eval_loss": "", "grad_norm": "0.252716243267", "learning_rate": "0.0001", "entropy": "0.19161637798", "num_tokens": "3149382", "mean_token_accuracy": "0.953449988365", "train_runtime": "", "timestamp": "2026-07-13T00:53:58.936106+00:00", "elapsed_seconds": "5471.35558599"} {"step": "210", "epoch": "0.418743768694", "loss": "0.186719572544", "eval_loss": "", "grad_norm": "0.198159962893", "learning_rate": "0.0001", "entropy": "0.191694324464", "num_tokens": "3304848", "mean_token_accuracy": "0.954155160487", "train_runtime": "", "timestamp": "2026-07-13T00:58:28.126042+00:00", "elapsed_seconds": "5740.5455229"} {"step": "220", "epoch": "0.438683948156", "loss": "0.171636545658", "eval_loss": "", "grad_norm": "0.227941483259", "learning_rate": "0.0001", "entropy": "0.175494147558", "num_tokens": "3462207", "mean_token_accuracy": "0.95685185343", "train_runtime": "", "timestamp": "2026-07-13T01:02:56.443020+00:00", "elapsed_seconds": "6008.86249996"} {"step": "230", "epoch": "0.458624127617", "loss": "0.174718809128", "eval_loss": "", "grad_norm": "0.181141242385", "learning_rate": "0.0001", "entropy": "0.182977847662", "num_tokens": "3620566", "mean_token_accuracy": "0.95615966171", "train_runtime": "", "timestamp": "2026-07-13T01:07:25.991445+00:00", "elapsed_seconds": "6278.41092508"} {"step": "240", "epoch": "0.478564307079", "loss": "0.170057713985", "eval_loss": "", "grad_norm": "0.225744113326", "learning_rate": "0.0001", "entropy": "0.170059764385", "num_tokens": "3778133", "mean_token_accuracy": "0.957389262319", "train_runtime": "", "timestamp": "2026-07-13T01:11:53.410140+00:00", "elapsed_seconds": "6545.82961939"} {"step": "250", "epoch": "0.49850448654", "loss": "0.195337712765", "eval_loss": "", "grad_norm": "0.202340960503", "learning_rate": "0.0001", "entropy": "0.199065721408", "num_tokens": "3934200", "mean_token_accuracy": "0.9511200279", "train_runtime": "", "timestamp": "2026-07-13T01:16:21.474434+00:00", "elapsed_seconds": "6813.89391461"} {"step": "260", "epoch": "0.518444666002", "loss": "0.17724455595", "eval_loss": "", "grad_norm": "0.175559863448", "learning_rate": "0.0001", "entropy": "0.183841346204", "num_tokens": "4091571", "mean_token_accuracy": "0.955598340929", "train_runtime": "", "timestamp": "2026-07-13T01:20:49.450146+00:00", "elapsed_seconds": "7081.86962616"} {"step": "270", "epoch": "0.538384845464", "loss": "0.192824590206", "eval_loss": "", "grad_norm": "0.1520421803", "learning_rate": "0.0001", "entropy": "0.196224984154", "num_tokens": "4249829", "mean_token_accuracy": "0.952373814583", "train_runtime": "", "timestamp": "2026-07-13T01:25:20.196050+00:00", "elapsed_seconds": "7352.61553107"} {"step": "280", "epoch": "0.558325024925", "loss": "0.174404370785", "eval_loss": "", "grad_norm": "0.208722144365", "learning_rate": "0.0001", "entropy": "0.177932224795", "num_tokens": "4407308", "mean_token_accuracy": "0.955998528004", "train_runtime": "", "timestamp": "2026-07-13T01:29:47.148865+00:00", "elapsed_seconds": "7619.56834472"} {"step": "290", "epoch": "0.578265204387", "loss": "0.16703234911", "eval_loss": "", "grad_norm": "0.177343502641", "learning_rate": "0.0001", "entropy": "0.172123510111", "num_tokens": "4563307", "mean_token_accuracy": "0.957504284382", "train_runtime": "", "timestamp": "2026-07-13T01:34:15.904052+00:00", "elapsed_seconds": "7888.32353092"} {"step": "300", "epoch": "0.598205383848", "loss": "0.159985125065", "eval_loss": "", "grad_norm": "0.187007248402", "learning_rate": "0.0001", "entropy": "0.164807886072", "num_tokens": "4720326", "mean_token_accuracy": "0.959763728082", "train_runtime": "", "timestamp": "2026-07-13T01:38:42.414187+00:00", "elapsed_seconds": "8154.8336671"} {"step": "310", "epoch": "0.61814556331", "loss": "0.148219501972", "eval_loss": "", "grad_norm": "0.222842156887", "learning_rate": "0.0001", "entropy": "0.151267429907", "num_tokens": "4877994", "mean_token_accuracy": "0.962683451176", "train_runtime": "", "timestamp": "2026-07-13T01:43:11.505811+00:00", "elapsed_seconds": "8423.92529085"} {"step": "320", "epoch": "0.638085742772", "loss": "0.17118588686", "eval_loss": "", "grad_norm": "0.213585421443", "learning_rate": "0.0001", "entropy": "0.175105991215", "num_tokens": "5034579", "mean_token_accuracy": "0.957370252907", "train_runtime": "", "timestamp": "2026-07-13T01:47:39.281453+00:00", "elapsed_seconds": "8691.70093284"} {"step": "330", "epoch": "0.658025922233", "loss": "0.170227777958", "eval_loss": "", "grad_norm": "0.171150699258", "learning_rate": "0.0001", "entropy": "0.173854334094", "num_tokens": "5190948", "mean_token_accuracy": "0.957636797428", "train_runtime": "", "timestamp": "2026-07-13T01:52:06.499025+00:00", "elapsed_seconds": "8958.91850474"} {"step": "340", "epoch": "0.677966101695", "loss": "0.160873258114", "eval_loss": "", "grad_norm": "0.215656965971", "learning_rate": "0.0001", "entropy": "0.163029103354", "num_tokens": "5349146", "mean_token_accuracy": "0.959359534085", "train_runtime": "", "timestamp": "2026-07-13T01:56:32.382909+00:00", "elapsed_seconds": "9224.8023898"} {"step": "350", "epoch": "0.697906281157", "loss": "0.16620465517", "eval_loss": "", "grad_norm": "0.159193694592", "learning_rate": "0.0001", "entropy": "0.170942352805", "num_tokens": "5504499", "mean_token_accuracy": "0.95866278857", "train_runtime": "", "timestamp": "2026-07-13T02:00:58.921913+00:00", "elapsed_seconds": "9491.34139054"} {"step": "360", "epoch": "0.717846460618", "loss": "0.156583404541", "eval_loss": "", "grad_norm": "0.198429495096", "learning_rate": "0.0001", "entropy": "0.16262548063", "num_tokens": "5663150", "mean_token_accuracy": "0.960626880825", "train_runtime": "", "timestamp": "2026-07-13T02:05:25.832602+00:00", "elapsed_seconds": "9758.2520811"} {"step": "370", "epoch": "0.73778664008", "loss": "0.143529140949", "eval_loss": "", "grad_norm": "0.182901337743", "learning_rate": "0.0001", "entropy": "0.144493036438", "num_tokens": "5821890", "mean_token_accuracy": "0.963571456075", "train_runtime": "", "timestamp": "2026-07-13T02:09:55.454312+00:00", "elapsed_seconds": "10027.8737913"} {"step": "380", "epoch": "0.757726819541", "loss": "0.166256070137", "eval_loss": "", "grad_norm": "0.174839511514", "learning_rate": "0.0001", "entropy": "0.17181198271", "num_tokens": "5980911", "mean_token_accuracy": "0.958652567863", "train_runtime": "", "timestamp": "2026-07-13T02:14:23.512599+00:00", "elapsed_seconds": "10295.9320786"} {"step": "390", "epoch": "0.777666999003", "loss": "0.173325061798", "eval_loss": "", "grad_norm": "0.292389750481", "learning_rate": "0.0001", "entropy": "0.174769203924", "num_tokens": "6139695", "mean_token_accuracy": "0.956033176184", "train_runtime": "", "timestamp": "2026-07-13T02:18:52.687211+00:00", "elapsed_seconds": "10565.106691"} {"step": "400", "epoch": "0.797607178465", "loss": "0.164666450024", "eval_loss": "", "grad_norm": "0.175360918045", "learning_rate": "0.0001", "entropy": "0.17068674909", "num_tokens": "6295379", "mean_token_accuracy": "0.958156006038", "train_runtime": "", "timestamp": "2026-07-13T02:23:15.091054+00:00", "elapsed_seconds": "10827.5105338"} {"step": "410", "epoch": "0.817547357926", "loss": "0.160889446735", "eval_loss": "", "grad_norm": "0.194658592343", "learning_rate": "0.0001", "entropy": "0.163015657384", "num_tokens": "6453730", "mean_token_accuracy": "0.959429378808", "train_runtime": "", "timestamp": "2026-07-13T02:27:44.196670+00:00", "elapsed_seconds": "11096.6161503"} {"step": "420", "epoch": "0.837487537388", "loss": "0.176164078712", "eval_loss": "", "grad_norm": "0.17664064467", "learning_rate": "0.0001", "entropy": "0.179388401192", "num_tokens": "6608676", "mean_token_accuracy": "0.95498123318", "train_runtime": "", "timestamp": "2026-07-13T02:32:08.573727+00:00", "elapsed_seconds": "11360.9932053"} {"step": "430", "epoch": "0.857427716849", "loss": "0.167500126362", "eval_loss": "", "grad_norm": "0.16269916296", "learning_rate": "0.0001", "entropy": "0.173483286984", "num_tokens": "6765717", "mean_token_accuracy": "0.957898010314", "train_runtime": "", "timestamp": "2026-07-13T02:36:35.829324+00:00", "elapsed_seconds": "11628.2488048"} {"step": "440", "epoch": "0.877367896311", "loss": "0.146194112301", "eval_loss": "", "grad_norm": "0.153255060315", "learning_rate": "0.0001", "entropy": "0.149639240932", "num_tokens": "6923921", "mean_token_accuracy": "0.962726005912", "train_runtime": "", "timestamp": "2026-07-13T02:41:02.573504+00:00", "elapsed_seconds": "11894.9929845"} {"step": "450", "epoch": "0.897308075773", "loss": "0.149036478996", "eval_loss": "", "grad_norm": "0.186758205295", "learning_rate": "0.0001", "entropy": "0.153511394188", "num_tokens": "7080641", "mean_token_accuracy": "0.961843410134", "train_runtime": "", "timestamp": "2026-07-13T02:45:27.639310+00:00", "elapsed_seconds": "12160.0587894"} {"step": "460", "epoch": "0.917248255234", "loss": "0.162733185291", "eval_loss": "", "grad_norm": "0.215599089861", "learning_rate": "0.0001", "entropy": "0.166903939191", "num_tokens": "7238504", "mean_token_accuracy": "0.958795918524", "train_runtime": "", "timestamp": "2026-07-13T02:49:53.979756+00:00", "elapsed_seconds": "12426.3992356"} {"step": "470", "epoch": "0.937188434696", "loss": "0.164527106285", "eval_loss": "", "grad_norm": "0.205033004284", "learning_rate": "0.0001", "entropy": "0.168429275788", "num_tokens": "7395914", "mean_token_accuracy": "0.958059515059", "train_runtime": "", "timestamp": "2026-07-13T02:54:20.861727+00:00", "elapsed_seconds": "12693.2812065"} {"step": "480", "epoch": "0.957128614158", "loss": "0.160323894024", "eval_loss": "", "grad_norm": "0.152115792036", "learning_rate": "0.0001", "entropy": "0.162759267911", "num_tokens": "7553586", "mean_token_accuracy": "0.959386067092", "train_runtime": "", "timestamp": "2026-07-13T02:58:46.074903+00:00", "elapsed_seconds": "12958.4943832"} {"step": "490", "epoch": "0.977068793619", "loss": "0.163436365128", "eval_loss": "", "grad_norm": "0.172864973545", "learning_rate": "0.0001", "entropy": "0.167625431344", "num_tokens": "7712270", "mean_token_accuracy": "0.958494988084", "train_runtime": "", "timestamp": "2026-07-13T03:03:13.825457+00:00", "elapsed_seconds": "13226.2449373"} {"step": "500", "epoch": "0.997008973081", "loss": "0.153280568123", "eval_loss": "", "grad_norm": "0.191879719496", "learning_rate": "0.0001", "entropy": "0.157480717916", "num_tokens": "7870445", "mean_token_accuracy": "0.961245985329", "train_runtime": "", "timestamp": "2026-07-13T03:07:38.735298+00:00", "elapsed_seconds": "13491.154777"} {"step": "502", "epoch": "1", "loss": "", "eval_loss": "0.407751619816", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "", "timestamp": "2026-07-13T03:14:44.961685+00:00", "elapsed_seconds": "13917.3811637"} {"step": "510", "epoch": "1.01595214357", "loss": "0.158492743969", "eval_loss": "", "grad_norm": "0.225956201553", "learning_rate": "0.0001", "entropy": "0.163646052641", "num_tokens": "8018586", "mean_token_accuracy": "0.959826892928", "train_runtime": "", "timestamp": "2026-07-13T03:18:19.719553+00:00", "elapsed_seconds": "14132.1390332"} {"step": "520", "epoch": "1.03589232303", "loss": "0.157728910446", "eval_loss": "", "grad_norm": "0.167489036918", "learning_rate": "0.0001", "entropy": "0.161885544844", "num_tokens": "8176329", "mean_token_accuracy": "0.959273642302", "train_runtime": "", "timestamp": "2026-07-13T03:22:45.242006+00:00", "elapsed_seconds": "14397.6614865"} {"step": "530", "epoch": "1.05583250249", "loss": "0.158644330502", "eval_loss": "", "grad_norm": "0.161827132106", "learning_rate": "0.0001", "entropy": "0.161767144222", "num_tokens": "8335264", "mean_token_accuracy": "0.959221327305", "train_runtime": "", "timestamp": "2026-07-13T03:27:14.069665+00:00", "elapsed_seconds": "14666.4891452"} {"step": "540", "epoch": "1.07577268195", "loss": "0.16030023098", "eval_loss": "", "grad_norm": "0.167094022036", "learning_rate": "0.0001", "entropy": "0.165125138871", "num_tokens": "8493064", "mean_token_accuracy": "0.958375993371", "train_runtime": "", "timestamp": "2026-07-13T03:31:40.529461+00:00", "elapsed_seconds": "14932.9489411"} {"step": "550", "epoch": "1.09571286142", "loss": "0.152034294605", "eval_loss": "", "grad_norm": "0.149853378534", "learning_rate": "0.0001", "entropy": "0.157158195414", "num_tokens": "8649996", "mean_token_accuracy": "0.960035714507", "train_runtime": "", "timestamp": "2026-07-13T03:36:07.038435+00:00", "elapsed_seconds": "15199.4579155"} {"step": "560", "epoch": "1.11565304088", "loss": "0.153054654598", "eval_loss": "", "grad_norm": "0.238190457225", "learning_rate": "0.0001", "entropy": "0.155343547184", "num_tokens": "8805927", "mean_token_accuracy": "0.960327754915", "train_runtime": "", "timestamp": "2026-07-13T03:40:29.866272+00:00", "elapsed_seconds": "15462.285752"} {"step": "570", "epoch": "1.13559322034", "loss": "0.141112375259", "eval_loss": "", "grad_norm": "0.17079372704", "learning_rate": "0.0001", "entropy": "0.146452126186", "num_tokens": "8963759", "mean_token_accuracy": "0.962834821641", "train_runtime": "", "timestamp": "2026-07-13T03:44:59.082393+00:00", "elapsed_seconds": "15731.5018729"} {"step": "580", "epoch": "1.1555333998", "loss": "0.159070003033", "eval_loss": "", "grad_norm": "0.273526191711", "learning_rate": "0.0001", "entropy": "0.162264898513", "num_tokens": "9119848", "mean_token_accuracy": "0.959192223847", "train_runtime": "", "timestamp": "2026-07-13T03:49:22.527567+00:00", "elapsed_seconds": "15994.9470476"} {"step": "590", "epoch": "1.17547357926", "loss": "0.146411538124", "eval_loss": "", "grad_norm": "0.184262052178", "learning_rate": "0.0001", "entropy": "0.149115146138", "num_tokens": "9276354", "mean_token_accuracy": "0.962051492929", "train_runtime": "", "timestamp": "2026-07-13T03:53:48.397787+00:00", "elapsed_seconds": "16260.8172668"} {"step": "600", "epoch": "1.19541375872", "loss": "0.151254820824", "eval_loss": "", "grad_norm": "0.161165297031", "learning_rate": "0.0001", "entropy": "0.157247116137", "num_tokens": "9432989", "mean_token_accuracy": "0.96053378433", "train_runtime": "", "timestamp": "2026-07-13T03:58:12.976983+00:00", "elapsed_seconds": "16525.3964621"} {"step": "610", "epoch": "1.21535393819", "loss": "0.153650093079", "eval_loss": "", "grad_norm": "0.196981117129", "learning_rate": "0.0001", "entropy": "0.156643042434", "num_tokens": "9590828", "mean_token_accuracy": "0.960903890431", "train_runtime": "", "timestamp": "2026-07-13T04:02:40.359464+00:00", "elapsed_seconds": "16792.7789448"} {"step": "620", "epoch": "1.23529411765", "loss": "0.154912018776", "eval_loss": "", "grad_norm": "0.151742979884", "learning_rate": "0.0001", "entropy": "0.159377668053", "num_tokens": "9750019", "mean_token_accuracy": "0.96032974869", "train_runtime": "", "timestamp": "2026-07-13T04:07:08.057547+00:00", "elapsed_seconds": "17060.4770274"} {"step": "630", "epoch": "1.25523429711", "loss": "0.155976462364", "eval_loss": "", "grad_norm": "0.193881079555", "learning_rate": "0.0001", "entropy": "0.158884954266", "num_tokens": "9907190", "mean_token_accuracy": "0.959278976917", "train_runtime": "", "timestamp": "2026-07-13T04:11:33.907528+00:00", "elapsed_seconds": "17326.3270093"} {"step": "640", "epoch": "1.27517447657", "loss": "0.155733442307", "eval_loss": "", "grad_norm": "0.207828089595", "learning_rate": "0.0001", "entropy": "0.160048513673", "num_tokens": "10064191", "mean_token_accuracy": "0.959493836761", "train_runtime": "", "timestamp": "2026-07-13T04:15:57.937666+00:00", "elapsed_seconds": "17590.3571454"} {"step": "650", "epoch": "1.29511465603", "loss": "0.151638269424", "eval_loss": "", "grad_norm": "0.197071760893", "learning_rate": "0.0001", "entropy": "0.15455375649", "num_tokens": "10220711", "mean_token_accuracy": "0.960762611032", "train_runtime": "", "timestamp": "2026-07-13T04:20:22.519193+00:00", "elapsed_seconds": "17854.9386732"} {"step": "660", "epoch": "1.31505483549", "loss": "0.152840280533", "eval_loss": "", "grad_norm": "0.137611195445", "learning_rate": "0.0001", "entropy": "0.158674034569", "num_tokens": "10379185", "mean_token_accuracy": "0.96038223505", "train_runtime": "", "timestamp": "2026-07-13T04:24:47.954292+00:00", "elapsed_seconds": "18120.3737715"} {"step": "670", "epoch": "1.33499501496", "loss": "0.152000141144", "eval_loss": "", "grad_norm": "0.169939935207", "learning_rate": "0.0001", "entropy": "0.152410540171", "num_tokens": "10535943", "mean_token_accuracy": "0.961078339815", "train_runtime": "", "timestamp": "2026-07-13T04:29:11.543525+00:00", "elapsed_seconds": "18383.9630047"} {"step": "680", "epoch": "1.35493519442", "loss": "0.159886622429", "eval_loss": "", "grad_norm": "0.171840846539", "learning_rate": "0.0001", "entropy": "0.166647548694", "num_tokens": "10695159", "mean_token_accuracy": "0.957731057703", "train_runtime": "", "timestamp": "2026-07-13T04:33:38.969803+00:00", "elapsed_seconds": "18651.3892831"} {"step": "690", "epoch": "1.37487537388", "loss": "0.1601998806", "eval_loss": "", "grad_norm": "0.178089872003", "learning_rate": "0.0001", "entropy": "0.159765216056", "num_tokens": "10851297", "mean_token_accuracy": "0.957936127484", "train_runtime": "", "timestamp": "2026-07-13T04:38:03.733687+00:00", "elapsed_seconds": "18916.1531657"} {"step": "700", "epoch": "1.39481555334", "loss": "0.155419385433", "eval_loss": "", "grad_norm": "0.185915350914", "learning_rate": "0.0001", "entropy": "0.161210057605", "num_tokens": "11007834", "mean_token_accuracy": "0.959555564821", "train_runtime": "", "timestamp": "2026-07-13T04:42:27.375325+00:00", "elapsed_seconds": "19179.7948046"} {"step": "710", "epoch": "1.4147557328", "loss": "0.149995291233", "eval_loss": "", "grad_norm": "0.156916707754", "learning_rate": "0.0001", "entropy": "0.15399270365", "num_tokens": "11162926", "mean_token_accuracy": "0.960879530013", "train_runtime": "", "timestamp": "2026-07-13T04:46:49.828934+00:00", "elapsed_seconds": "19442.248414"} {"step": "720", "epoch": "1.43469591226", "loss": "0.148966145515", "eval_loss": "", "grad_norm": "0.166989415884", "learning_rate": "0.0001", "entropy": "0.150851908699", "num_tokens": "11321792", "mean_token_accuracy": "0.961150123179", "train_runtime": "", "timestamp": "2026-07-13T04:51:16.183639+00:00", "elapsed_seconds": "19708.6031203"} {"step": "730", "epoch": "1.45463609172", "loss": "0.157558906078", "eval_loss": "", "grad_norm": "0.183218181133", "learning_rate": "0.0001", "entropy": "0.165378693677", "num_tokens": "11478531", "mean_token_accuracy": "0.958875894547", "train_runtime": "", "timestamp": "2026-07-13T04:55:42.109061+00:00", "elapsed_seconds": "19974.5285388"} {"step": "740", "epoch": "1.47457627119", "loss": "0.138663971424", "eval_loss": "", "grad_norm": "0.156799346209", "learning_rate": "0.0001", "entropy": "0.140434689447", "num_tokens": "11634663", "mean_token_accuracy": "0.964417311549", "train_runtime": "", "timestamp": "2026-07-13T05:00:05.573023+00:00", "elapsed_seconds": "20237.9925034"} {"step": "750", "epoch": "1.49451645065", "loss": "0.162752425671", "eval_loss": "", "grad_norm": "0.166768297553", "learning_rate": "0.0001", "entropy": "0.165603381116", "num_tokens": "11791755", "mean_token_accuracy": "0.957863874733", "train_runtime": "", "timestamp": "2026-07-13T05:04:30.507669+00:00", "elapsed_seconds": "20502.9271491"} {"step": "760", "epoch": "1.51445663011", "loss": "0.155910432339", "eval_loss": "", "grad_norm": "0.198398306966", "learning_rate": "0.0001", "entropy": "0.158790976927", "num_tokens": "11949367", "mean_token_accuracy": "0.959617389739", "train_runtime": "", "timestamp": "2026-07-13T05:08:54.459930+00:00", "elapsed_seconds": "20766.8794107"} {"step": "770", "epoch": "1.53439680957", "loss": "0.147430825233", "eval_loss": "", "grad_norm": "0.153638571501", "learning_rate": "0.0001", "entropy": "0.151373771299", "num_tokens": "12106681", "mean_token_accuracy": "0.961822769046", "train_runtime": "", "timestamp": "2026-07-13T05:13:21.188121+00:00", "elapsed_seconds": "21033.6076016"} {"step": "780", "epoch": "1.55433698903", "loss": "0.162099099159", "eval_loss": "", "grad_norm": "0.173062309623", "learning_rate": "0.0001", "entropy": "0.166629248112", "num_tokens": "12265062", "mean_token_accuracy": "0.958277504146", "train_runtime": "", "timestamp": "2026-07-13T05:17:46.589687+00:00", "elapsed_seconds": "21299.0091676"} {"step": "790", "epoch": "1.57427716849", "loss": "0.145927774906", "eval_loss": "", "grad_norm": "0.152274280787", "learning_rate": "0.0001", "entropy": "0.149098364264", "num_tokens": "12422683", "mean_token_accuracy": "0.96237283051", "train_runtime": "", "timestamp": "2026-07-13T05:22:12.031888+00:00", "elapsed_seconds": "21564.4513673"} {"step": "800", "epoch": "1.59421734796", "loss": "0.144084942341", "eval_loss": "", "grad_norm": "0.162562638521", "learning_rate": "0.0001", "entropy": "0.149937028252", "num_tokens": "12580127", "mean_token_accuracy": "0.962746436894", "train_runtime": "", "timestamp": "2026-07-13T05:26:35.829387+00:00", "elapsed_seconds": "21828.2488666"} {"step": "810", "epoch": "1.61415752742", "loss": "0.124075102806", "eval_loss": "", "grad_norm": "0.154512226582", "learning_rate": "0.0001", "entropy": "0.126636455394", "num_tokens": "12738853", "mean_token_accuracy": "0.967715913057", "train_runtime": "", "timestamp": "2026-07-13T05:31:04.574475+00:00", "elapsed_seconds": "22096.9939557"} {"step": "820", "epoch": "1.63409770688", "loss": "0.150622940063", "eval_loss": "", "grad_norm": "0.16537758708", "learning_rate": "0.0001", "entropy": "0.154936124943", "num_tokens": "12896376", "mean_token_accuracy": "0.961773355305", "train_runtime": "", "timestamp": "2026-07-13T05:35:28.805634+00:00", "elapsed_seconds": "22361.2251147"} {"step": "830", "epoch": "1.65403788634", "loss": "0.156031835079", "eval_loss": "", "grad_norm": "0.157309129834", "learning_rate": "0.0001", "entropy": "0.158124326728", "num_tokens": "13054663", "mean_token_accuracy": "0.959352734685", "train_runtime": "", "timestamp": "2026-07-13T05:39:55.961148+00:00", "elapsed_seconds": "22628.380628"} {"step": "840", "epoch": "1.6739780658", "loss": "0.15196750164", "eval_loss": "", "grad_norm": "0.181399866939", "learning_rate": "0.0001", "entropy": "0.157933938131", "num_tokens": "13211749", "mean_token_accuracy": "0.960637481511", "train_runtime": "", "timestamp": "2026-07-13T05:44:20.485205+00:00", "elapsed_seconds": "22892.9046851"} {"step": "850", "epoch": "1.69391824526", "loss": "0.151187336445", "eval_loss": "", "grad_norm": "0.153600201011", "learning_rate": "0.0001", "entropy": "0.154623034224", "num_tokens": "13369604", "mean_token_accuracy": "0.960752762854", "train_runtime": "", "timestamp": "2026-07-13T05:48:47.986886+00:00", "elapsed_seconds": "23160.4063657"} {"step": "860", "epoch": "1.71385842473", "loss": "0.155811941624", "eval_loss": "", "grad_norm": "0.167428091168", "learning_rate": "0.0001", "entropy": "0.157736129314", "num_tokens": "13525305", "mean_token_accuracy": "0.960343301296", "train_runtime": "", "timestamp": "2026-07-13T05:53:10.220390+00:00", "elapsed_seconds": "23422.6398691"} {"step": "870", "epoch": "1.73379860419", "loss": "0.153177714348", "eval_loss": "", "grad_norm": "0.20311370492", "learning_rate": "0.0001", "entropy": "0.158003093861", "num_tokens": "13682818", "mean_token_accuracy": "0.959948976338", "train_runtime": "", "timestamp": "2026-07-13T05:57:36.867349+00:00", "elapsed_seconds": "23689.2868298"} {"step": "880", "epoch": "1.75373878365", "loss": "0.157455039024", "eval_loss": "", "grad_norm": "0.157989680767", "learning_rate": "0.0001", "entropy": "0.161580251204", "num_tokens": "13840716", "mean_token_accuracy": "0.959610253572", "train_runtime": "", "timestamp": "2026-07-13T06:02:01.761355+00:00", "elapsed_seconds": "23954.1808349"} {"step": "890", "epoch": "1.77367896311", "loss": "0.153945529461", "eval_loss": "", "grad_norm": "0.137620225549", "learning_rate": "0.0001", "entropy": "0.156639124174", "num_tokens": "13998821", "mean_token_accuracy": "0.959813642502", "train_runtime": "", "timestamp": "2026-07-13T06:06:29.723761+00:00", "elapsed_seconds": "24222.143239"} {"step": "900", "epoch": "1.79361914257", "loss": "0.137104249001", "eval_loss": "", "grad_norm": "0.190931633115", "learning_rate": "0.0001", "entropy": "0.141805857234", "num_tokens": "14157118", "mean_token_accuracy": "0.96424472332", "train_runtime": "", "timestamp": "2026-07-13T06:10:54.590523+00:00", "elapsed_seconds": "24487.0100039"} {"step": "910", "epoch": "1.81355932203", "loss": "0.145311307907", "eval_loss": "", "grad_norm": "0.150904193521", "learning_rate": "0.0001", "entropy": "0.149261138029", "num_tokens": "14314682", "mean_token_accuracy": "0.96163328588", "train_runtime": "", "timestamp": "2026-07-13T06:15:22.454334+00:00", "elapsed_seconds": "24754.873814"} {"step": "920", "epoch": "1.8334995015", "loss": "0.16125638485", "eval_loss": "", "grad_norm": "0.15461525321", "learning_rate": "0.0001", "entropy": "0.162390596233", "num_tokens": "14471367", "mean_token_accuracy": "0.957971832156", "train_runtime": "", "timestamp": "2026-07-13T06:19:46.703015+00:00", "elapsed_seconds": "25019.1224944"} {"step": "930", "epoch": "1.85343968096", "loss": "0.147639727592", "eval_loss": "", "grad_norm": "0.175522089005", "learning_rate": "0.0001", "entropy": "0.151644047722", "num_tokens": "14629466", "mean_token_accuracy": "0.961429928243", "train_runtime": "", "timestamp": "2026-07-13T06:24:13.475886+00:00", "elapsed_seconds": "25285.8953668"} {"step": "940", "epoch": "1.87337986042", "loss": "0.153863286972", "eval_loss": "", "grad_norm": "0.176566556096", "learning_rate": "0.0001", "entropy": "0.156846114341", "num_tokens": "14787703", "mean_token_accuracy": "0.960824640095", "train_runtime": "", "timestamp": "2026-07-13T06:28:38.171073+00:00", "elapsed_seconds": "25550.5905535"} {"step": "950", "epoch": "1.89332003988", "loss": "0.147365629673", "eval_loss": "", "grad_norm": "0.12578228116", "learning_rate": "0.0001", "entropy": "0.153850168735", "num_tokens": "14944036", "mean_token_accuracy": "0.961152391136", "train_runtime": "", "timestamp": "2026-07-13T06:33:02.530132+00:00", "elapsed_seconds": "25814.9496125"} {"step": "960", "epoch": "1.91326021934", "loss": "0.155803656578", "eval_loss": "", "grad_norm": "0.149189069867", "learning_rate": "0.0001", "entropy": "0.154880302772", "num_tokens": "15101698", "mean_token_accuracy": "0.960533696413", "train_runtime": "", "timestamp": "2026-07-13T06:37:28.280890+00:00", "elapsed_seconds": "26080.7003702"} {"step": "970", "epoch": "1.9332003988", "loss": "0.149621021748", "eval_loss": "", "grad_norm": "0.158231586218", "learning_rate": "0.0001", "entropy": "0.15643861657", "num_tokens": "15260039", "mean_token_accuracy": "0.960591548681", "train_runtime": "", "timestamp": "2026-07-13T06:41:56.808563+00:00", "elapsed_seconds": "26349.2280413"} {"step": "980", "epoch": "1.95314057827", "loss": "0.138453364372", "eval_loss": "", "grad_norm": "0.146560013294", "learning_rate": "0.0001", "entropy": "0.139656238351", "num_tokens": "15416794", "mean_token_accuracy": "0.963987149298", "train_runtime": "", "timestamp": "2026-07-13T06:46:19.567535+00:00", "elapsed_seconds": "26611.9870141"} {"step": "990", "epoch": "1.97308075773", "loss": "0.152244758606", "eval_loss": "", "grad_norm": "0.203793898225", "learning_rate": "0.0001", "entropy": "0.154680254776", "num_tokens": "15574277", "mean_token_accuracy": "0.960344229639", "train_runtime": "", "timestamp": "2026-07-13T06:50:44.618225+00:00", "elapsed_seconds": "26877.0377056"} {"step": "1000", "epoch": "1.99302093719", "loss": "0.136259901524", "eval_loss": "", "grad_norm": "0.160971060395", "learning_rate": "0.0001", "entropy": "0.141011445131", "num_tokens": "15730599", "mean_token_accuracy": "0.965203513205", "train_runtime": "", "timestamp": "2026-07-13T06:55:06.635665+00:00", "elapsed_seconds": "27139.0551439"} {"step": "1004", "epoch": "2", "loss": "", "eval_loss": "0.423779338598", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "", "timestamp": "2026-07-13T07:02:31.692065+00:00", "elapsed_seconds": "27584.1115427"} {"step": "1010", "epoch": "2.01196410768", "loss": "0.142356610298", "eval_loss": "", "grad_norm": "0.188008725643", "learning_rate": "0.0001", "entropy": "0.145475034651", "num_tokens": "15877152", "mean_token_accuracy": "0.963673387703", "train_runtime": "", "timestamp": "2026-07-13T07:05:11.297936+00:00", "elapsed_seconds": "27743.7174138"} {"step": "1020", "epoch": "2.03190428714", "loss": "0.135363352299", "eval_loss": "", "grad_norm": "0.162173718214", "learning_rate": "0.0001", "entropy": "0.135732429288", "num_tokens": "16034953", "mean_token_accuracy": "0.963314248621", "train_runtime": "", "timestamp": "2026-07-13T07:09:38.267792+00:00", "elapsed_seconds": "28010.6872717"} {"step": "1030", "epoch": "2.0518444666", "loss": "0.130935823917", "eval_loss": "", "grad_norm": "0.39679479599", "learning_rate": "0.0001", "entropy": "0.138152070437", "num_tokens": "16192950", "mean_token_accuracy": "0.965807399154", "train_runtime": "", "timestamp": "2026-07-13T07:14:06.972140+00:00", "elapsed_seconds": "28279.3916207"} {"step": "1040", "epoch": "2.07178464606", "loss": "0.14102833271", "eval_loss": "", "grad_norm": "0.247563451529", "learning_rate": "0.0001", "entropy": "0.14674435826", "num_tokens": "16351945", "mean_token_accuracy": "0.962135644257", "train_runtime": "", "timestamp": "2026-07-13T07:18:35.305307+00:00", "elapsed_seconds": "28547.724786"} {"step": "1050", "epoch": "2.09172482552", "loss": "0.138630819321", "eval_loss": "", "grad_norm": "0.194637656212", "learning_rate": "0.0001", "entropy": "0.142927491292", "num_tokens": "16510307", "mean_token_accuracy": "0.963437321782", "train_runtime": "", "timestamp": "2026-07-13T07:23:02.823041+00:00", "elapsed_seconds": "28815.2425224"} {"step": "1060", "epoch": "2.11166500499", "loss": "0.144511556625", "eval_loss": "", "grad_norm": "0.180345505476", "learning_rate": "0.0001", "entropy": "0.148616469931", "num_tokens": "16668042", "mean_token_accuracy": "0.961600221694", "train_runtime": "", "timestamp": "2026-07-13T07:27:27.574374+00:00", "elapsed_seconds": "29079.9938546"} {"step": "1070", "epoch": "2.13160518445", "loss": "0.144625234604", "eval_loss": "", "grad_norm": "0.199441537261", "learning_rate": "0.0001", "entropy": "0.149507262744", "num_tokens": "16823377", "mean_token_accuracy": "0.961649250984", "train_runtime": "", "timestamp": "2026-07-13T07:31:52.190738+00:00", "elapsed_seconds": "29344.6102174"} {"step": "1080", "epoch": "2.15154536391", "loss": "0.134267187119", "eval_loss": "", "grad_norm": "0.204903528094", "learning_rate": "0.0001", "entropy": "0.13798939744", "num_tokens": "16981060", "mean_token_accuracy": "0.963625767827", "train_runtime": "", "timestamp": "2026-07-13T07:36:17.671395+00:00", "elapsed_seconds": "29610.0908749"} {"step": "1090", "epoch": "2.17148554337", "loss": "0.140261101723", "eval_loss": "", "grad_norm": "0.15427583456", "learning_rate": "0.0001", "entropy": "0.145027029235", "num_tokens": "17138667", "mean_token_accuracy": "0.961997763813", "train_runtime": "", "timestamp": "2026-07-13T07:40:46.181248+00:00", "elapsed_seconds": "29878.600729"} {"step": "1100", "epoch": "2.19142572283", "loss": "0.139993739128", "eval_loss": "", "grad_norm": "0.206776320934", "learning_rate": "0.0001", "entropy": "0.143120793998", "num_tokens": "17295876", "mean_token_accuracy": "0.962807172537", "train_runtime": "", "timestamp": "2026-07-13T07:45:11.246394+00:00", "elapsed_seconds": "30143.6658744"} {"step": "1110", "epoch": "2.21136590229", "loss": "0.146475028992", "eval_loss": "", "grad_norm": "0.187690377235", "learning_rate": "0.0001", "entropy": "0.149639708456", "num_tokens": "17453480", "mean_token_accuracy": "0.960966579616", "train_runtime": "", "timestamp": "2026-07-13T07:49:38.554535+00:00", "elapsed_seconds": "30410.974013"} {"step": "1120", "epoch": "2.23130608175", "loss": "0.124084377289", "eval_loss": "", "grad_norm": "0.183066368103", "learning_rate": "0.0001", "entropy": "0.128129246831", "num_tokens": "17611539", "mean_token_accuracy": "0.967183564603", "train_runtime": "", "timestamp": "2026-07-13T07:54:03.093699+00:00", "elapsed_seconds": "30675.513179"} {"step": "1130", "epoch": "2.25124626122", "loss": "0.138863790035", "eval_loss": "", "grad_norm": "0.169342160225", "learning_rate": "0.0001", "entropy": "0.143894399004", "num_tokens": "17770160", "mean_token_accuracy": "0.962729074061", "train_runtime": "", "timestamp": "2026-07-13T07:58:30.902264+00:00", "elapsed_seconds": "30943.3217442"} {"step": "1140", "epoch": "2.27118644068", "loss": "0.134566164017", "eval_loss": "", "grad_norm": "0.185288399458", "learning_rate": "0.0001", "entropy": "0.1380582585", "num_tokens": "17928715", "mean_token_accuracy": "0.964630398154", "train_runtime": "", "timestamp": "2026-07-13T08:02:56.224221+00:00", "elapsed_seconds": "31208.6436993"} {"step": "1150", "epoch": "2.29112662014", "loss": "0.13587025404", "eval_loss": "", "grad_norm": "0.167564287782", "learning_rate": "0.0001", "entropy": "0.141129285656", "num_tokens": "18086911", "mean_token_accuracy": "0.962987405062", "train_runtime": "", "timestamp": "2026-07-13T08:07:22.759270+00:00", "elapsed_seconds": "31475.1787507"} {"step": "1160", "epoch": "2.3110667996", "loss": "0.134908604622", "eval_loss": "", "grad_norm": "0.17723608017", "learning_rate": "0.0001", "entropy": "0.140150917461", "num_tokens": "18242898", "mean_token_accuracy": "0.963514384627", "train_runtime": "", "timestamp": "2026-07-13T08:11:45.271361+00:00", "elapsed_seconds": "31737.6908402"} {"step": "1170", "epoch": "2.33100697906", "loss": "0.142004394531", "eval_loss": "", "grad_norm": "0.195471733809", "learning_rate": "0.0001", "entropy": "0.145327295735", "num_tokens": "18401179", "mean_token_accuracy": "0.96212310493", "train_runtime": "", "timestamp": "2026-07-13T08:16:12.667932+00:00", "elapsed_seconds": "32005.0874097"} {"step": "1180", "epoch": "2.35094715852", "loss": "0.139787364006", "eval_loss": "", "grad_norm": "0.181689888239", "learning_rate": "0.0001", "entropy": "0.143518875353", "num_tokens": "18558597", "mean_token_accuracy": "0.962916377187", "train_runtime": "", "timestamp": "2026-07-13T08:20:37.155879+00:00", "elapsed_seconds": "32269.5753596"} {"step": "1190", "epoch": "2.37088733799", "loss": "0.138878905773", "eval_loss": "", "grad_norm": "0.187306240201", "learning_rate": "0.0001", "entropy": "0.14323660098", "num_tokens": "18715525", "mean_token_accuracy": "0.962570005655", "train_runtime": "", "timestamp": "2026-07-13T08:25:01.624222+00:00", "elapsed_seconds": "32534.0437007"} {"step": "1200", "epoch": "2.39082751745", "loss": "0.128368926048", "eval_loss": "", "grad_norm": "0.171350508928", "learning_rate": "0.0001", "entropy": "0.132403761707", "num_tokens": "18872160", "mean_token_accuracy": "0.965889447927", "train_runtime": "", "timestamp": "2026-07-13T08:29:25.097337+00:00", "elapsed_seconds": "32797.5168176"} {"step": "1210", "epoch": "2.41076769691", "loss": "0.129879558086", "eval_loss": "", "grad_norm": "0.16929730773", "learning_rate": "0.0001", "entropy": "0.134115916397", "num_tokens": "19030990", "mean_token_accuracy": "0.964938412607", "train_runtime": "", "timestamp": "2026-07-13T08:33:54.032223+00:00", "elapsed_seconds": "33066.4517037"} {"step": "1220", "epoch": "2.43070787637", "loss": "0.136699020863", "eval_loss": "", "grad_norm": "0.160470217466", "learning_rate": "0.0001", "entropy": "0.140426222328", "num_tokens": "19189208", "mean_token_accuracy": "0.963185872138", "train_runtime": "", "timestamp": "2026-07-13T08:38:21.204123+00:00", "elapsed_seconds": "33333.6236031"} {"step": "1230", "epoch": "2.45064805583", "loss": "0.145669162273", "eval_loss": "", "grad_norm": "0.16242466867", "learning_rate": "0.0001", "entropy": "0.150232082745", "num_tokens": "19347141", "mean_token_accuracy": "0.960759909451", "train_runtime": "", "timestamp": "2026-07-13T08:42:49.435981+00:00", "elapsed_seconds": "33601.8554607"} {"step": "1240", "epoch": "2.47058823529", "loss": "0.138986229897", "eval_loss": "", "grad_norm": "0.212890028954", "learning_rate": "0.0001", "entropy": "0.142735194322", "num_tokens": "19503318", "mean_token_accuracy": "0.963401097059", "train_runtime": "", "timestamp": "2026-07-13T08:47:13.416567+00:00", "elapsed_seconds": "33865.8360463"} {"step": "1250", "epoch": "2.49052841476", "loss": "0.133786559105", "eval_loss": "", "grad_norm": "0.14790764451", "learning_rate": "0.0001", "entropy": "0.137343312893", "num_tokens": "19660012", "mean_token_accuracy": "0.96465973407", "train_runtime": "", "timestamp": "2026-07-13T08:51:37.959760+00:00", "elapsed_seconds": "34130.3792395"} {"step": "1260", "epoch": "2.51046859422", "loss": "0.12134168148", "eval_loss": "", "grad_norm": "0.160168275237", "learning_rate": "0.0001", "entropy": "0.125055824034", "num_tokens": "19817579", "mean_token_accuracy": "0.967370174825", "train_runtime": "", "timestamp": "2026-07-13T08:56:03.387270+00:00", "elapsed_seconds": "34395.8067506"} {"step": "1270", "epoch": "2.53040877368", "loss": "0.133723568916", "eval_loss": "", "grad_norm": "0.218997716904", "learning_rate": "0.0001", "entropy": "0.136459239572", "num_tokens": "19975183", "mean_token_accuracy": "0.964637173712", "train_runtime": "", "timestamp": "2026-07-13T09:00:30.561277+00:00", "elapsed_seconds": "34662.9807546"} {"step": "1280", "epoch": "2.55034895314", "loss": "0.141663241386", "eval_loss": "", "grad_norm": "0.193876847625", "learning_rate": "0.0001", "entropy": "0.144728157343", "num_tokens": "20133023", "mean_token_accuracy": "0.962585689127", "train_runtime": "", "timestamp": "2026-07-13T09:04:55.562771+00:00", "elapsed_seconds": "34927.9822508"} {"step": "1290", "epoch": "2.5702891326", "loss": "0.151284909248", "eval_loss": "", "grad_norm": "0.184577360749", "learning_rate": "0.0001", "entropy": "0.159417651873", "num_tokens": "20289739", "mean_token_accuracy": "0.960149645805", "train_runtime": "", "timestamp": "2026-07-13T09:09:20.868284+00:00", "elapsed_seconds": "35193.2877635"} {"step": "1300", "epoch": "2.59022931206", "loss": "0.136644113064", "eval_loss": "", "grad_norm": "0.218172103167", "learning_rate": "0.0001", "entropy": "0.138396306988", "num_tokens": "20447120", "mean_token_accuracy": "0.963210451603", "train_runtime": "", "timestamp": "2026-07-13T09:13:44.527887+00:00", "elapsed_seconds": "35456.9473662"} {"step": "1310", "epoch": "2.61016949153", "loss": "0.144104766846", "eval_loss": "", "grad_norm": "0.144669651985", "learning_rate": "0.0001", "entropy": "0.148450734094", "num_tokens": "20604657", "mean_token_accuracy": "0.961373512447", "train_runtime": "", "timestamp": "2026-07-13T09:18:11.203478+00:00", "elapsed_seconds": "35723.6229578"} {"step": "1320", "epoch": "2.63010967099", "loss": "0.133131718636", "eval_loss": "", "grad_norm": "0.141770631075", "learning_rate": "0.0001", "entropy": "0.136485391669", "num_tokens": "20761417", "mean_token_accuracy": "0.964875669777", "train_runtime": "", "timestamp": "2026-07-13T09:22:34.986946+00:00", "elapsed_seconds": "35987.4064256"} {"step": "1330", "epoch": "2.65004985045", "loss": "0.13858757019", "eval_loss": "", "grad_norm": "0.21623903513", "learning_rate": "0.0001", "entropy": "0.144700122066", "num_tokens": "20919929", "mean_token_accuracy": "0.962718063593", "train_runtime": "", "timestamp": "2026-07-13T09:27:02.873628+00:00", "elapsed_seconds": "36255.2931057"} {"step": "1340", "epoch": "2.66999002991", "loss": "0.132814729214", "eval_loss": "", "grad_norm": "0.276583373547", "learning_rate": "0.0001", "entropy": "0.134864936862", "num_tokens": "21077582", "mean_token_accuracy": "0.964210870862", "train_runtime": "", "timestamp": "2026-07-13T09:31:27.133985+00:00", "elapsed_seconds": "36519.5534655"} {"step": "1350", "epoch": "2.68993020937", "loss": "0.1253262043", "eval_loss": "", "grad_norm": "0.162280157208", "learning_rate": "0.0001", "entropy": "0.127740219794", "num_tokens": "21235627", "mean_token_accuracy": "0.967153166234", "train_runtime": "", "timestamp": "2026-07-13T09:35:56.076554+00:00", "elapsed_seconds": "36788.496034"} {"step": "1360", "epoch": "2.70987038883", "loss": "0.13312318325", "eval_loss": "", "grad_norm": "0.282871514559", "learning_rate": "0.0001", "entropy": "0.138949971786", "num_tokens": "21394581", "mean_token_accuracy": "0.965296086669", "train_runtime": "", "timestamp": "2026-07-13T09:40:22.437476+00:00", "elapsed_seconds": "37054.856956"} {"step": "1370", "epoch": "2.7298105683", "loss": "0.144455349445", "eval_loss": "", "grad_norm": "0.174474030733", "learning_rate": "0.0001", "entropy": "0.146122324653", "num_tokens": "21550219", "mean_token_accuracy": "0.962009210885", "train_runtime": "", "timestamp": "2026-07-13T09:44:47.431945+00:00", "elapsed_seconds": "37319.8514256"} {"step": "1380", "epoch": "2.74975074776", "loss": "0.144832789898", "eval_loss": "", "grad_norm": "0.185141921043", "learning_rate": "0.0001", "entropy": "0.152066987008", "num_tokens": "21708051", "mean_token_accuracy": "0.961587381363", "train_runtime": "", "timestamp": "2026-07-13T09:49:12.281789+00:00", "elapsed_seconds": "37584.7012691"} {"step": "1390", "epoch": "2.76969092722", "loss": "0.147297513485", "eval_loss": "", "grad_norm": "0.180012717843", "learning_rate": "0.0001", "entropy": "0.151073219907", "num_tokens": "21865282", "mean_token_accuracy": "0.961149373651", "train_runtime": "", "timestamp": "2026-07-13T09:53:40.514142+00:00", "elapsed_seconds": "37852.9336223"} {"step": "1400", "epoch": "2.78963110668", "loss": "0.130479967594", "eval_loss": "", "grad_norm": "0.159027174115", "learning_rate": "0.0001", "entropy": "0.134387736674", "num_tokens": "22023317", "mean_token_accuracy": "0.965292686224", "train_runtime": "", "timestamp": "2026-07-13T09:58:07.723103+00:00", "elapsed_seconds": "38120.1425829"} {"step": "1410", "epoch": "2.80957128614", "loss": "0.125090241432", "eval_loss": "", "grad_norm": "0.162560030818", "learning_rate": "0.0001", "entropy": "0.129251071718", "num_tokens": "22181330", "mean_token_accuracy": "0.966406355798", "train_runtime": "", "timestamp": "2026-07-13T10:02:35.761443+00:00", "elapsed_seconds": "38388.1809245"} {"step": "1420", "epoch": "2.8295114656", "loss": "0.153430998325", "eval_loss": "", "grad_norm": "0.16854301095", "learning_rate": "0.0001", "entropy": "0.158546497207", "num_tokens": "22335688", "mean_token_accuracy": "0.959014648199", "train_runtime": "", "timestamp": "2026-07-13T10:06:56.326656+00:00", "elapsed_seconds": "38648.7461335"} {"step": "1430", "epoch": "2.84945164506", "loss": "0.133016419411", "eval_loss": "", "grad_norm": "0.137527242303", "learning_rate": "0.0001", "entropy": "0.137725519948", "num_tokens": "22492148", "mean_token_accuracy": "0.964357371628", "train_runtime": "", "timestamp": "2026-07-13T10:11:22.518943+00:00", "elapsed_seconds": "38914.9384211"} {"step": "1440", "epoch": "2.86939182453", "loss": "0.143503153324", "eval_loss": "", "grad_norm": "0.152293741703", "learning_rate": "0.0001", "entropy": "0.145768437255", "num_tokens": "22648552", "mean_token_accuracy": "0.962748129666", "train_runtime": "", "timestamp": "2026-07-13T10:15:46.683770+00:00", "elapsed_seconds": "39179.1032495"} {"step": "1450", "epoch": "2.88933200399", "loss": "0.142128455639", "eval_loss": "", "grad_norm": "0.163718938828", "learning_rate": "0.0001", "entropy": "0.144271744415", "num_tokens": "22806988", "mean_token_accuracy": "0.962158353627", "train_runtime": "", "timestamp": "2026-07-13T10:20:15.090798+00:00", "elapsed_seconds": "39447.5102784"} {"step": "1460", "epoch": "2.90927218345", "loss": "0.139853024483", "eval_loss": "", "grad_norm": "0.152902588248", "learning_rate": "0.0001", "entropy": "0.14365788633", "num_tokens": "22964473", "mean_token_accuracy": "0.962662650645", "train_runtime": "", "timestamp": "2026-07-13T10:24:39.776396+00:00", "elapsed_seconds": "39712.1958757"} {"step": "1470", "epoch": "2.92921236291", "loss": "0.135624861717", "eval_loss": "", "grad_norm": "0.183964833617", "learning_rate": "0.0001", "entropy": "0.138626957033", "num_tokens": "23121149", "mean_token_accuracy": "0.964137916267", "train_runtime": "", "timestamp": "2026-07-13T10:29:05.792170+00:00", "elapsed_seconds": "39978.2116514"} {"step": "1480", "epoch": "2.94915254237", "loss": "0.144012737274", "eval_loss": "", "grad_norm": "0.174692094326", "learning_rate": "0.0001", "entropy": "0.147944770195", "num_tokens": "23277059", "mean_token_accuracy": "0.961441603303", "train_runtime": "", "timestamp": "2026-07-13T10:33:28.183773+00:00", "elapsed_seconds": "40240.603253"} {"step": "1490", "epoch": "2.96909272183", "loss": "0.132321429253", "eval_loss": "", "grad_norm": "0.188293382525", "learning_rate": "0.0001", "entropy": "0.137838280154", "num_tokens": "23434486", "mean_token_accuracy": "0.964737379551", "train_runtime": "", "timestamp": "2026-07-13T10:37:56.247820+00:00", "elapsed_seconds": "40508.6672997"} {"step": "1500", "epoch": "2.9890329013", "loss": "0.13656257391", "eval_loss": "", "grad_norm": "0.155302256346", "learning_rate": "0.0001", "entropy": "0.141141989268", "num_tokens": "23591507", "mean_token_accuracy": "0.963056372106", "train_runtime": "", "timestamp": "2026-07-13T10:42:20.697019+00:00", "elapsed_seconds": "40773.1164987"} {"step": "1506", "epoch": "3", "loss": "0.182483970011", "eval_loss": "0.448362052441", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "41273.2323", "timestamp": "2026-07-13T10:50:40.807980+00:00", "elapsed_seconds": "41273.227461"}