{ "run_name": "llama32-3B-rte-nf4-lora-seed42", "model_size": "3B", "model_id": "meta-llama/Llama-3.2-3B", "task": "rte", "glue_config": "rte", "n_classes": 2, "bitwidth": "nf4", "seed": 42, "lora_init_source": "shared:lora_init_3B_seed42.pt:224tensors", "trainable_params": 9175040, "total_params": 1812638720, "train": { "steps": 105, "epochs": 2.9411764705882355, "train_runtime_sec": 384.28298354148865, "train_loss": 0.47209857645488923, "n_train_examples": 2241, "n_train_tokens_per_epoch": 219447, "throughput_samples_per_sec": 17.151882214104408, "throughput_tokens_per_sec": 1679.5756788213164 }, "peak_gpu_mem_gib": { "allocated": 5.514503479003906, "reserved": 8.279296875 }, "validation": { "accuracy": 0.8353413654618473, "macro_f1": 0.8350753622720151, "loss": 0.34920042956689273, "n": 249, "n_classes": 2, "majority_baseline": 0.5140562248995983, "pred_dist": { "A": 138, "B": 111 }, "true_dist": { "A": 121, "B": 128 } }, "test": { "accuracy": 0.8411552346570397, "macro_f1": 0.8396315789473685, "loss": 0.4308275252257874, "n": 277, "n_classes": 2, "majority_baseline": 0.5270758122743683, "pred_dist": { "A": 158, "B": 119 }, "true_dist": { "A": 146, "B": 131 } }, "hyperparams": { "num_train_epochs": 3, "learning_rate": 0.0002, "max_length": 256, "per_device_train_batch_size": 4, "per_device_eval_batch_size": 8, "gradient_accumulation_steps": 16, "warmup_ratio": 0.03, "lr_scheduler_type": "cosine", "gradient_checkpointing": true }, "lora": { "r": 16, "alpha": 32, "dropout": 0.0, "bias": "none", "target_modules": [ "q_proj", "k_proj", "v_proj", "o_proj" ] }, "env": { "torch": "2.4.1+cu121", "cuda": "12.1", "gpu": "NVIDIA GeForce RTX 4090", "slurm_job": "1932593", "node": "node39" }, "debug_caps": { "max_train": null, "max_eval": null, "max_steps": -1 } }