{ "architectures": [ "UnlimitedOCRForCausalLM" ], "attention_bias": false, "attention_dropout": 0.0, "auto_map": { "AutoConfig": "modeling_unlimitedocr.UnlimitedOCRConfig", "AutoModel": "modeling_unlimitedocr.UnlimitedOCRForCausalLM" }, "aux_loss_alpha": 0.001, "bos_token_id": 0, "candidate_resolutions": [ [ 1024, 1024 ] ], "dtype": "bfloat16", "eos_token_id": 1, "ep_size": 1, "first_k_dense_replace": 1, "global_view_pos": "head", "hidden_act": "silu", "hidden_size": 1280, "initializer_range": 0.02, "intermediate_size": 6848, "kv_lora_rank": null, "language_config": { "architectures": [ "DeepseekOCRForCausalLM" ], "auto_map": { "AutoConfig": "configuration_deepseekv2.DeepseekV2Config", "AutoModel": "modeling_deepseek.DeepseekV2Model", "AutoModelForCausalLM": "modeling_deepseek.DeepseekV2ForCausalLM" }, "bos_token_id": 0, "eos_token_id": 1, "first_k_dense_replace": 1, "hidden_size": 1280, "intermediate_size": 6848, "kv_lora_rank": null, "lm_head": true, "max_position_embeddings": 32768, "moe_intermediate_size": 896, "n_group": 1, "n_routed_experts": 64, "n_shared_experts": 2, "num_attention_heads": 10, "num_experts_per_tok": 6, "num_hidden_layers": 12, "num_key_value_heads": 10, "q_lora_rank": null, "qk_nope_head_dim": 0, "qk_rope_head_dim": 0, "rm_head": false, "sliding_window_size": 128, "topk_group": 1, "topk_method": "greedy", "torch_dtype": "bfloat16", "use_mla": false, "v_head_dim": 128, "vocab_size": 129280 }, "lm_head": true, "max_position_embeddings": 32768, "model_type": "unlimited-ocr", "moe_intermediate_size": 896, "moe_layer_freq": 1, "n_group": 1, "n_routed_experts": 64, "n_shared_experts": 2, "norm_topk_prob": false, "num_attention_heads": 10, "num_experts_per_tok": 6, "num_hidden_layers": 12, "num_key_value_heads": 10, "pretraining_tp": 1, "projector_config": { "input_dim": 2048, "model_type": "mlp_projector", "n_embed": 1280, "projector_type": "linear" }, "q_lora_rank": null, "qk_nope_head_dim": 0, "qk_rope_head_dim": 0, "quantization_config": { "config_groups": { "group_0": { "format": "pack-quantized", "input_activations": null, "output_activations": null, "targets": [ "Linear" ], "weights": { "actorder": null, "block_structure": null, "dynamic": false, "group_size": 128, "num_bits": 4, "observer": "memoryless_minmax", "observer_kwargs": {}, "scale_dtype": null, "strategy": "group", "symmetric": true, "type": "int", "zp_dtype": null } } }, "format": "pack-quantized", "global_compression_ratio": null, "ignore": [ "", "lm_head", "model.layers.0.mlp.down_proj", "model.layers.0.self_attn.k_proj", "model.layers.0.self_attn.o_proj", "model.layers.0.self_attn.q_proj", "model.layers.0.self_attn.v_proj", "model.layers.1.mlp.shared_experts.down_proj", "model.layers.1.mlp.shared_experts.gate_proj", "model.layers.1.mlp.shared_experts.up_proj", "model.layers.1.self_attn.k_proj", "model.layers.1.self_attn.o_proj", "model.layers.1.self_attn.q_proj", "model.layers.1.self_attn.v_proj", "model.layers.10.mlp.shared_experts.down_proj", "model.layers.10.mlp.shared_experts.gate_proj", "model.layers.10.mlp.shared_experts.up_proj", "model.layers.10.self_attn.k_proj", "model.layers.10.self_attn.o_proj", "model.layers.10.self_attn.q_proj", "model.layers.10.self_attn.v_proj", "model.layers.11.mlp.shared_experts.down_proj", "model.layers.11.mlp.shared_experts.gate_proj", "model.layers.11.mlp.shared_experts.up_proj", "model.layers.11.self_attn.k_proj", "model.layers.11.self_attn.o_proj", "model.layers.11.self_attn.q_proj", "model.layers.11.self_attn.v_proj", "model.layers.2.mlp.shared_experts.down_proj", "model.layers.2.mlp.shared_experts.gate_proj", "model.layers.2.mlp.shared_experts.up_proj", "model.layers.2.self_attn.k_proj", "model.layers.2.self_attn.o_proj", "model.layers.2.self_attn.q_proj", "model.layers.2.self_attn.v_proj", "model.layers.3.mlp.shared_experts.down_proj", "model.layers.3.mlp.shared_experts.gate_proj", "model.layers.3.mlp.shared_experts.up_proj", "model.layers.3.self_attn.k_proj", "model.layers.3.self_attn.o_proj", "model.layers.3.self_attn.q_proj", "model.layers.3.self_attn.v_proj", "model.layers.4.mlp.shared_experts.down_proj", "model.layers.4.mlp.shared_experts.gate_proj", "model.layers.4.mlp.shared_experts.up_proj", "model.layers.4.self_attn.k_proj", "model.layers.4.self_attn.o_proj", "model.layers.4.self_attn.q_proj", "model.layers.4.self_attn.v_proj", "model.layers.5.mlp.shared_experts.down_proj", "model.layers.5.mlp.shared_experts.gate_proj", "model.layers.5.mlp.shared_experts.up_proj", "model.layers.5.self_attn.k_proj", "model.layers.5.self_attn.o_proj", "model.layers.5.self_attn.q_proj", "model.layers.5.self_attn.v_proj", "model.layers.6.mlp.shared_experts.down_proj", "model.layers.6.mlp.shared_experts.gate_proj", "model.layers.6.mlp.shared_experts.up_proj", "model.layers.6.self_attn.k_proj", "model.layers.6.self_attn.o_proj", "model.layers.6.self_attn.q_proj", "model.layers.6.self_attn.v_proj", "model.layers.7.mlp.shared_experts.down_proj", "model.layers.7.mlp.shared_experts.gate_proj", "model.layers.7.mlp.shared_experts.up_proj", "model.layers.7.self_attn.k_proj", "model.layers.7.self_attn.o_proj", "model.layers.7.self_attn.q_proj", "model.layers.7.self_attn.v_proj", "model.layers.8.mlp.shared_experts.down_proj", "model.layers.8.mlp.shared_experts.gate_proj", "model.layers.8.mlp.shared_experts.up_proj", "model.layers.8.self_attn.k_proj", "model.layers.8.self_attn.o_proj", "model.layers.8.self_attn.q_proj", "model.layers.8.self_attn.v_proj", "model.layers.9.mlp.shared_experts.down_proj", "model.layers.9.mlp.shared_experts.gate_proj", "model.layers.9.mlp.shared_experts.up_proj", "model.layers.9.self_attn.k_proj", "model.layers.9.self_attn.o_proj", "model.layers.9.self_attn.q_proj", "model.layers.9.self_attn.v_proj", "model.projector.layers", "model.sam_model.blocks.0.attn.proj", "model.sam_model.blocks.0.attn.qkv", "model.sam_model.blocks.0.mlp.lin1", "model.sam_model.blocks.0.mlp.lin2", "model.sam_model.blocks.1.attn.proj", "model.sam_model.blocks.1.attn.qkv", "model.sam_model.blocks.1.mlp.lin1", "model.sam_model.blocks.1.mlp.lin2", "model.sam_model.blocks.10.attn.proj", "model.sam_model.blocks.10.attn.qkv", "model.sam_model.blocks.10.mlp.lin1", "model.sam_model.blocks.10.mlp.lin2", "model.sam_model.blocks.11.attn.proj", "model.sam_model.blocks.11.attn.qkv", "model.sam_model.blocks.11.mlp.lin1", "model.sam_model.blocks.11.mlp.lin2", "model.sam_model.blocks.2.attn.proj", "model.sam_model.blocks.2.attn.qkv", "model.sam_model.blocks.2.mlp.lin1", "model.sam_model.blocks.2.mlp.lin2", "model.sam_model.blocks.3.attn.proj", "model.sam_model.blocks.3.attn.qkv", "model.sam_model.blocks.3.mlp.lin1", "model.sam_model.blocks.3.mlp.lin2", "model.sam_model.blocks.4.attn.proj", "model.sam_model.blocks.4.attn.qkv", "model.sam_model.blocks.4.mlp.lin1", "model.sam_model.blocks.4.mlp.lin2", "model.sam_model.blocks.5.attn.proj", "model.sam_model.blocks.5.attn.qkv", "model.sam_model.blocks.5.mlp.lin1", "model.sam_model.blocks.5.mlp.lin2", "model.sam_model.blocks.6.attn.proj", "model.sam_model.blocks.6.attn.qkv", "model.sam_model.blocks.6.mlp.lin1", "model.sam_model.blocks.6.mlp.lin2", "model.sam_model.blocks.7.attn.proj", "model.sam_model.blocks.7.attn.qkv", "model.sam_model.blocks.7.mlp.lin1", "model.sam_model.blocks.7.mlp.lin2", "model.sam_model.blocks.8.attn.proj", "model.sam_model.blocks.8.attn.qkv", "model.sam_model.blocks.8.mlp.lin1", "model.sam_model.blocks.8.mlp.lin2", "model.sam_model.blocks.9.attn.proj", "model.sam_model.blocks.9.attn.qkv", "model.sam_model.blocks.9.mlp.lin1", "model.sam_model.blocks.9.mlp.lin2", "model.vision_model.encoder.layers.0.mlp.fc1", "model.vision_model.encoder.layers.0.mlp.fc2", "model.vision_model.encoder.layers.0.self_attn.out_proj", "model.vision_model.encoder.layers.0.self_attn.qkv_proj", "model.vision_model.encoder.layers.1.mlp.fc1", "model.vision_model.encoder.layers.1.mlp.fc2", "model.vision_model.encoder.layers.1.self_attn.out_proj", "model.vision_model.encoder.layers.1.self_attn.qkv_proj", "model.vision_model.encoder.layers.10.mlp.fc1", "model.vision_model.encoder.layers.10.mlp.fc2", "model.vision_model.encoder.layers.10.self_attn.out_proj", "model.vision_model.encoder.layers.10.self_attn.qkv_proj", "model.vision_model.encoder.layers.11.mlp.fc1", "model.vision_model.encoder.layers.11.mlp.fc2", "model.vision_model.encoder.layers.11.self_attn.out_proj", "model.vision_model.encoder.layers.11.self_attn.qkv_proj", "model.vision_model.encoder.layers.12.mlp.fc1", "model.vision_model.encoder.layers.12.mlp.fc2", "model.vision_model.encoder.layers.12.self_attn.out_proj", "model.vision_model.encoder.layers.12.self_attn.qkv_proj", "model.vision_model.encoder.layers.13.mlp.fc1", "model.vision_model.encoder.layers.13.mlp.fc2", "model.vision_model.encoder.layers.13.self_attn.out_proj", "model.vision_model.encoder.layers.13.self_attn.qkv_proj", "model.vision_model.encoder.layers.14.mlp.fc1", "model.vision_model.encoder.layers.14.mlp.fc2", "model.vision_model.encoder.layers.14.self_attn.out_proj", "model.vision_model.encoder.layers.14.self_attn.qkv_proj", "model.vision_model.encoder.layers.15.mlp.fc1", "model.vision_model.encoder.layers.15.mlp.fc2", "model.vision_model.encoder.layers.15.self_attn.out_proj", "model.vision_model.encoder.layers.15.self_attn.qkv_proj", "model.vision_model.encoder.layers.16.mlp.fc1", "model.vision_model.encoder.layers.16.mlp.fc2", "model.vision_model.encoder.layers.16.self_attn.out_proj", "model.vision_model.encoder.layers.16.self_attn.qkv_proj", "model.vision_model.encoder.layers.17.mlp.fc1", "model.vision_model.encoder.layers.17.mlp.fc2", "model.vision_model.encoder.layers.17.self_attn.out_proj", "model.vision_model.encoder.layers.17.self_attn.qkv_proj", "model.vision_model.encoder.layers.18.mlp.fc1", "model.vision_model.encoder.layers.18.mlp.fc2", "model.vision_model.encoder.layers.18.self_attn.out_proj", "model.vision_model.encoder.layers.18.self_attn.qkv_proj", "model.vision_model.encoder.layers.19.mlp.fc1", "model.vision_model.encoder.layers.19.mlp.fc2", "model.vision_model.encoder.layers.19.self_attn.out_proj", "model.vision_model.encoder.layers.19.self_attn.qkv_proj", "model.vision_model.encoder.layers.2.mlp.fc1", "model.vision_model.encoder.layers.2.mlp.fc2", "model.vision_model.encoder.layers.2.self_attn.out_proj", "model.vision_model.encoder.layers.2.self_attn.qkv_proj", "model.vision_model.encoder.layers.20.mlp.fc1", "model.vision_model.encoder.layers.20.mlp.fc2", "model.vision_model.encoder.layers.20.self_attn.out_proj", "model.vision_model.encoder.layers.20.self_attn.qkv_proj", "model.vision_model.encoder.layers.21.mlp.fc1", "model.vision_model.encoder.layers.21.mlp.fc2", "model.vision_model.encoder.layers.21.self_attn.out_proj", "model.vision_model.encoder.layers.21.self_attn.qkv_proj", "model.vision_model.encoder.layers.22.mlp.fc1", "model.vision_model.encoder.layers.22.mlp.fc2", "model.vision_model.encoder.layers.22.self_attn.out_proj", "model.vision_model.encoder.layers.22.self_attn.qkv_proj", "model.vision_model.encoder.layers.23.mlp.fc1", "model.vision_model.encoder.layers.23.mlp.fc2", "model.vision_model.encoder.layers.23.self_attn.out_proj", "model.vision_model.encoder.layers.23.self_attn.qkv_proj", "model.vision_model.encoder.layers.3.mlp.fc1", "model.vision_model.encoder.layers.3.mlp.fc2", "model.vision_model.encoder.layers.3.self_attn.out_proj", "model.vision_model.encoder.layers.3.self_attn.qkv_proj", "model.vision_model.encoder.layers.4.mlp.fc1", "model.vision_model.encoder.layers.4.mlp.fc2", "model.vision_model.encoder.layers.4.self_attn.out_proj", "model.vision_model.encoder.layers.4.self_attn.qkv_proj", "model.vision_model.encoder.layers.5.mlp.fc1", "model.vision_model.encoder.layers.5.mlp.fc2", "model.vision_model.encoder.layers.5.self_attn.out_proj", "model.vision_model.encoder.layers.5.self_attn.qkv_proj", "model.vision_model.encoder.layers.6.mlp.fc1", "model.vision_model.encoder.layers.6.mlp.fc2", "model.vision_model.encoder.layers.6.self_attn.out_proj", "model.vision_model.encoder.layers.6.self_attn.qkv_proj", "model.vision_model.encoder.layers.7.mlp.fc1", "model.vision_model.encoder.layers.7.mlp.fc2", "model.vision_model.encoder.layers.7.self_attn.out_proj", "model.vision_model.encoder.layers.7.self_attn.qkv_proj", "model.vision_model.encoder.layers.8.mlp.fc1", "model.vision_model.encoder.layers.8.mlp.fc2", "model.vision_model.encoder.layers.8.self_attn.out_proj", "model.vision_model.encoder.layers.8.self_attn.qkv_proj", "model.vision_model.encoder.layers.9.mlp.fc1", "model.vision_model.encoder.layers.9.mlp.fc2", "model.vision_model.encoder.layers.9.self_attn.out_proj", "model.vision_model.encoder.layers.9.self_attn.qkv_proj", "model.vision_model.transformer.layers.0.mlp.fc1", "model.vision_model.transformer.layers.0.mlp.fc2", "model.vision_model.transformer.layers.0.self_attn.out_proj", "model.vision_model.transformer.layers.0.self_attn.qkv_proj", "model.vision_model.transformer.layers.1.mlp.fc1", "model.vision_model.transformer.layers.1.mlp.fc2", "model.vision_model.transformer.layers.1.self_attn.out_proj", "model.vision_model.transformer.layers.1.self_attn.qkv_proj", "model.vision_model.transformer.layers.10.mlp.fc1", "model.vision_model.transformer.layers.10.mlp.fc2", "model.vision_model.transformer.layers.10.self_attn.out_proj", "model.vision_model.transformer.layers.10.self_attn.qkv_proj", "model.vision_model.transformer.layers.11.mlp.fc1", "model.vision_model.transformer.layers.11.mlp.fc2", "model.vision_model.transformer.layers.11.self_attn.out_proj", "model.vision_model.transformer.layers.11.self_attn.qkv_proj", "model.vision_model.transformer.layers.12.mlp.fc1", "model.vision_model.transformer.layers.12.mlp.fc2", "model.vision_model.transformer.layers.12.self_attn.out_proj", "model.vision_model.transformer.layers.12.self_attn.qkv_proj", "model.vision_model.transformer.layers.13.mlp.fc1", "model.vision_model.transformer.layers.13.mlp.fc2", "model.vision_model.transformer.layers.13.self_attn.out_proj", "model.vision_model.transformer.layers.13.self_attn.qkv_proj", "model.vision_model.transformer.layers.14.mlp.fc1", "model.vision_model.transformer.layers.14.mlp.fc2", "model.vision_model.transformer.layers.14.self_attn.out_proj", "model.vision_model.transformer.layers.14.self_attn.qkv_proj", "model.vision_model.transformer.layers.15.mlp.fc1", "model.vision_model.transformer.layers.15.mlp.fc2", "model.vision_model.transformer.layers.15.self_attn.out_proj", "model.vision_model.transformer.layers.15.self_attn.qkv_proj", "model.vision_model.transformer.layers.16.mlp.fc1", "model.vision_model.transformer.layers.16.mlp.fc2", "model.vision_model.transformer.layers.16.self_attn.out_proj", "model.vision_model.transformer.layers.16.self_attn.qkv_proj", "model.vision_model.transformer.layers.17.mlp.fc1", "model.vision_model.transformer.layers.17.mlp.fc2", "model.vision_model.transformer.layers.17.self_attn.out_proj", "model.vision_model.transformer.layers.17.self_attn.qkv_proj", "model.vision_model.transformer.layers.18.mlp.fc1", "model.vision_model.transformer.layers.18.mlp.fc2", "model.vision_model.transformer.layers.18.self_attn.out_proj", "model.vision_model.transformer.layers.18.self_attn.qkv_proj", "model.vision_model.transformer.layers.19.mlp.fc1", "model.vision_model.transformer.layers.19.mlp.fc2", "model.vision_model.transformer.layers.19.self_attn.out_proj", "model.vision_model.transformer.layers.19.self_attn.qkv_proj", "model.vision_model.transformer.layers.2.mlp.fc1", "model.vision_model.transformer.layers.2.mlp.fc2", "model.vision_model.transformer.layers.2.self_attn.out_proj", "model.vision_model.transformer.layers.2.self_attn.qkv_proj", "model.vision_model.transformer.layers.20.mlp.fc1", "model.vision_model.transformer.layers.20.mlp.fc2", "model.vision_model.transformer.layers.20.self_attn.out_proj", "model.vision_model.transformer.layers.20.self_attn.qkv_proj", "model.vision_model.transformer.layers.21.mlp.fc1", "model.vision_model.transformer.layers.21.mlp.fc2", "model.vision_model.transformer.layers.21.self_attn.out_proj", "model.vision_model.transformer.layers.21.self_attn.qkv_proj", "model.vision_model.transformer.layers.22.mlp.fc1", "model.vision_model.transformer.layers.22.mlp.fc2", "model.vision_model.transformer.layers.22.self_attn.out_proj", "model.vision_model.transformer.layers.22.self_attn.qkv_proj", "model.vision_model.transformer.layers.23.mlp.fc1", "model.vision_model.transformer.layers.23.mlp.fc2", "model.vision_model.transformer.layers.23.self_attn.out_proj", "model.vision_model.transformer.layers.23.self_attn.qkv_proj", "model.vision_model.transformer.layers.3.mlp.fc1", "model.vision_model.transformer.layers.3.mlp.fc2", "model.vision_model.transformer.layers.3.self_attn.out_proj", "model.vision_model.transformer.layers.3.self_attn.qkv_proj", "model.vision_model.transformer.layers.4.mlp.fc1", "model.vision_model.transformer.layers.4.mlp.fc2", "model.vision_model.transformer.layers.4.self_attn.out_proj", "model.vision_model.transformer.layers.4.self_attn.qkv_proj", "model.vision_model.transformer.layers.5.mlp.fc1", "model.vision_model.transformer.layers.5.mlp.fc2", "model.vision_model.transformer.layers.5.self_attn.out_proj", "model.vision_model.transformer.layers.5.self_attn.qkv_proj", "model.vision_model.transformer.layers.6.mlp.fc1", "model.vision_model.transformer.layers.6.mlp.fc2", "model.vision_model.transformer.layers.6.self_attn.out_proj", "model.vision_model.transformer.layers.6.self_attn.qkv_proj", "model.vision_model.transformer.layers.7.mlp.fc1", "model.vision_model.transformer.layers.7.mlp.fc2", "model.vision_model.transformer.layers.7.self_attn.out_proj", "model.vision_model.transformer.layers.7.self_attn.qkv_proj", "model.vision_model.transformer.layers.8.mlp.fc1", "model.vision_model.transformer.layers.8.mlp.fc2", "model.vision_model.transformer.layers.8.self_attn.out_proj", "model.vision_model.transformer.layers.8.self_attn.qkv_proj", "model.vision_model.transformer.layers.9.mlp.fc1", "model.vision_model.transformer.layers.9.mlp.fc2", "model.vision_model.transformer.layers.9.self_attn.out_proj", "model.vision_model.transformer.layers.9.self_attn.qkv_proj" ], "kv_cache_scheme": null, "quant_method": "compressed-tensors", "quantization_status": "compressed", "sparsity_config": {}, "transform_config": {}, "version": "0.14.0.1" }, "rm_head": false, "rms_norm_eps": 1e-06, "rope_scaling": null, "rope_theta": 10000.0, "routed_scaling_factor": 1.0, "scoring_func": "softmax", "seq_aux": true, "sliding_window": 128, "sliding_window_size": 128, "tie_word_embeddings": false, "tile_tag": "2D", "topk_group": 1, "topk_method": "greedy", "transformers_version": "4.57.1", "use_cache": true, "use_mla": false, "v_head_dim": 128, "vision_config": { "image_size": 1024, "mlp_ratio": 3.7362, "model_name": "deeplip_b_l", "model_type": "vision", "width": { "clip-l-14-224": { "heads": 16, "image_size": 224, "layers": 24, "patch_size": 14, "width": 1024 }, "sam_vit_b": { "downsample_channels": [ 512, 1024 ], "global_attn_indexes": [ 2, 5, 8, 11 ], "heads": 12, "layers": 12, "width": 768 } } }, "vocab_size": 129280 }