Video Classification
Transformers
Safetensors
vjepa21
feature-extraction
video
vjepa
vjepa2
v-jepa-2.1
self-supervised
world-model
custom_code
Instructions to use apiantonio/vjepa2.1-vit-base-384 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use apiantonio/vjepa2.1-vit-base-384 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("video-classification", model="apiantonio/vjepa2.1-vit-base-384", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("apiantonio/vjepa2.1-vit-base-384", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
Fix transformers 4.x/5.x compat, implement output_hidden_states/attentions and out_layers, fix hierarchical predictor input, add video processor
d60b444 verified | { | |
| "architectures": [ | |
| "VJEPA21Model" | |
| ], | |
| "attention_probs_dropout_prob": 0.0, | |
| "auto_map": { | |
| "AutoConfig": "configuration_vjepa21.VJEPA21Config", | |
| "AutoModel": "modeling_vjepa21.VJEPA21Model", | |
| "AutoModelForVideoClassification": "modeling_vjepa21.VJEPA21ForVideoClassification", | |
| "AutoVideoProcessor": "video_processing_vjepa21.VJEPA21VideoProcessor" | |
| }, | |
| "crop_size": 384, | |
| "drop_path_rate": 0.0, | |
| "dtype": "float32", | |
| "frames_per_clip": 64, | |
| "has_cls_first": false, | |
| "hidden_act": "gelu", | |
| "hidden_size": 768, | |
| "img_temporal_dim_size": 1, | |
| "in_chans": 3, | |
| "initializer_range": 0.02, | |
| "interpolate_rope": true, | |
| "layer_norm_eps": 1e-06, | |
| "mlp_ratio": 4.0, | |
| "modality_embedding": true, | |
| "model_type": "vjepa21", | |
| "n_output_distillation": 1, | |
| "n_registers": 0, | |
| "num_attention_heads": 12, | |
| "num_hidden_layers": 12, | |
| "num_pooler_heads": 16, | |
| "num_pooler_layers": 3, | |
| "patch_size": 16, | |
| "pred_hidden_size": 384, | |
| "pred_mlp_ratio": 4.0, | |
| "pred_num_attention_heads": 12, | |
| "pred_num_hidden_layers": 12, | |
| "pred_num_mask_tokens": 8, | |
| "pred_return_all_tokens": true, | |
| "pred_teacher_embed_dim": 1664, | |
| "pred_zero_init_mask_tokens": true, | |
| "qkv_bias": true, | |
| "transformers_version": "5.14.1", | |
| "tubelet_size": 2, | |
| "wide_silu": true | |
| } |