vjepa2.1-vit-base-384 / config.json
apiantonio's picture
Fix transformers 4.x/5.x compat, implement output_hidden_states/attentions and out_layers, fix hierarchical predictor input, add video processor
d60b444 verified
Raw
History Blame Contribute Delete
1.28 kB
{
"architectures": [
"VJEPA21Model"
],
"attention_probs_dropout_prob": 0.0,
"auto_map": {
"AutoConfig": "configuration_vjepa21.VJEPA21Config",
"AutoModel": "modeling_vjepa21.VJEPA21Model",
"AutoModelForVideoClassification": "modeling_vjepa21.VJEPA21ForVideoClassification",
"AutoVideoProcessor": "video_processing_vjepa21.VJEPA21VideoProcessor"
},
"crop_size": 384,
"drop_path_rate": 0.0,
"dtype": "float32",
"frames_per_clip": 64,
"has_cls_first": false,
"hidden_act": "gelu",
"hidden_size": 768,
"img_temporal_dim_size": 1,
"in_chans": 3,
"initializer_range": 0.02,
"interpolate_rope": true,
"layer_norm_eps": 1e-06,
"mlp_ratio": 4.0,
"modality_embedding": true,
"model_type": "vjepa21",
"n_output_distillation": 1,
"n_registers": 0,
"num_attention_heads": 12,
"num_hidden_layers": 12,
"num_pooler_heads": 16,
"num_pooler_layers": 3,
"patch_size": 16,
"pred_hidden_size": 384,
"pred_mlp_ratio": 4.0,
"pred_num_attention_heads": 12,
"pred_num_hidden_layers": 12,
"pred_num_mask_tokens": 8,
"pred_return_all_tokens": true,
"pred_teacher_embed_dim": 1664,
"pred_zero_init_mask_tokens": true,
"qkv_bias": true,
"transformers_version": "5.14.1",
"tubelet_size": 2,
"wide_silu": true
}