{ "model_type": "nero_dense_control_mlx", "architectures": [ "DenseControlLM" ], "framework": "mlx", "optimizer": "navier", "vocab_size": 2048, "context_length": 128, "width": 128, "blocks": 6, "head_dim": 32, "mlp_width": 148, "stored_parameters": 999680, "training_tokens": 500000000, "batch_size": 32, "requested_learning_rate": null, "momentum_beta": null, "source_run": "mlx_navier_500m_ctx128", "checkpoint": "checkpoint_000500000000", "metrics": { "final_train_loss": 3.3394856452941895, "final_tokens_seen": 500000000, "final_step": 122071, "final_tokens_per_second": 363230.275137849, "tail_median_tokens_per_second": 363332.1438834451, "logged_metric_rows": 1221 }, "final_log_row": { "step": 122071, "tokens_seen": 500000000, "loss": 3.3394856452941895, "lr": 1.05e-06, "tokens_per_second": 363230.275137849 } }