{ "model_type": "transformer", "vocab_size": 32000, "num_layers": 12, "num_attention_heads": 8, "hidden_size": 512, "intermediate_size": 2048, "max_seq_len": 2048, "dropout": 0.1, "layer_norm_epsilon": 1e-6 }