{ "arm": "E", "metrics": { "checkpoint_steps": [ 25, 50, 75, 100, 113 ], "first_metric": { "epoch": 0.008908685968819599, "grad_norm": 47.238216400146484, "learning_rate": 4.166666666666666e-08, "loss": 1.6878271102905273, "step": 1, "token_acc": 0.8026243849097867 }, "global_step": 113, "last_metric": { "epoch": 0.9799554565701559, "grad_norm": 11.23639965057373, "learning_rate": 4.845894012080187e-10, "loss": 0.7615683078765869, "step": 110, "token_acc": 0.8465909090909091 }, "logging_sha256": "2ff0cdbf5faacdba42dc9713900094ea28b7bde4deffcc22ea5c5638dc78225f", "metric_records_checked": 23, "model_parameter_info": "Qwen3VLForConditionalGeneration: 8767.1237M Params (8190.7354M Trainable [93.4256%]), 0.0001M Buffers.", "train_loss": 1.0133489444192532, "trainer_state_sha256": "40337b6a5c76d2e778ad3be4fc488d9c9fe55fdedb58656613db6e73edb28716", "training_completed_at_utc": "2026-07-21T15:49:37.996781+00:00", "training_summary": { "epoch": 1.0, "step": 113, "token_acc": 0.8474201474201474, "total_flos": 5.923389119261573e+17, "train_loss": 1.0133489444192532, "train_runtime": 1476.3488, "train_samples_per_second": 2.43, "train_steps_per_second": 0.077 } }, "optimizer_audit_sha256": "51ce10eb338960b7d7b66c2e4166444c24a5426dede770c24f60fffb1826af01", "resolved_args_sha256": "5e6996bc3ec0b1eee6d9afe1478d6496184a3d4ebff3cfcdcb0ab20a25641923", "schema_version": 1, "weights": { "element_count": 8767123696, "finite": true, "language_change_proof": { "base_sha256": "88c5c88e1e3b70e28fa601a170b0aa5af283c3e2664ce339e9004a993a716e85", "final_sha256": "89f52f1a6169e47b7f3bec54d04eb07cb45a00e015254ed41be436b9cf6fda0b", "numel": 128, "tensor": "model.language_model.layers.10.self_attn.k_norm.weight" }, "tensor_count": 750, "visual_base_and_final_aggregate_sha256": "78cd6e4feacb78cfee13fdd88b364cb5fe44dda3be0d4c631495a06f098991fc", "visual_byte_exact": true, "visual_element_count": 576388336, "visual_tensor_count": 351 } }