{ "_mlp_class": "LLaMAMLP", "_norm_class": "FusedRMSNorm", "average_2": false, "betas": [ 0.9, 0.95 ], "bias": false, "block_size": 8224, "block_size_val": 2080, "condense_ratio": 1, "decay_lr": true, "discount": true, "eval_iters": 100, "eval_step_interval": 1000, "forecasting_patch": 1, "global_batch_size": 512, "grad_clip": 1.0, "group": "70m-test_all", "haar_loss_match": false, "haar_trans": true, "haar_trans_inv": true, "haar_trans_norm": "backward", "half_diff": false, "imputation": false, "inner_norm": false, "inter_control": false, "intermediate_size": 3072, "is_diff": false, "is_smape": false, "learning_rate": 0.0005, "log_step_interval": 10, "max_step": 100000, "mean_replace": false, "micro_batch_size": 64, "micro_batch_size_val": 256, "min_lr": 1e-05, "mix_train": false, "multi_loss": false, "n_cot": 1, "n_embd": 768, "n_head": 12, "n_layer": 12, "n_query_groups": 4, "name": "small-100k", "new_arch": false, "new_tokenizer": false, "norm_eps": 1e-05, "num_of_devices": 4, "num_of_nodes": 2, "org": "Ali-Could", "ou": false, "ou_mean": false, "ou_prod": false, "padded_vocab_size": "None", "padding_multiple": 1, "parallel_residual": false, "patch_size": 32, "pid": false, "quantitle": true, "rollback_win": 256, "rolling_patch": 6, "rope_base": 10000, "rotary_percentage": 1.0, "save_step_interval": 10000, "scaling": true, "seed0": 3407, "shared_attention_norm": false, "stats_encoding": false, "stats_encoding_new": false, "sum_divided": false, "triple_diff": false, "triple_diff_new": false, "unet": true, "vocab_size": 1, "vq": false, "warmup_steps": 2000, "weight_decay": 0.1, "yj_trans": false }