| { | |
| "model_type": "baguettotron_vlm", | |
| "vit_model_id": "OpenGVLab/InternViT-300M-448px-V2_5", | |
| "llm_model_id": "PleIAs/Baguettotron", | |
| "vit_hidden": 1024, | |
| "vit_tokens": 1024, | |
| "llm_hidden": 576, | |
| "num_visual_tokens": 256, | |
| "unshuffle_factor": 2, | |
| "image_token": "<image>", | |
| "chat_style": "base", | |
| "stage": 1, | |
| "torch_dtype": "bfloat16", | |
| "bos_token_id": 1, | |
| "eos_token_id": [ | |
| 2, | |
| 65492 | |
| ], | |
| "pad_token_id": 3, | |
| "tie_word_embeddings": false, | |
| "auto_map": { | |
| "AutoConfig": "configuration_baguettotron_vlm.BaguettotronVLMConfig", | |
| "AutoModelForImageTextToText": "modeling_baguettotron_vlm.BaguettotronVLMForConditionalGeneration", | |
| "AutoProcessor": "processing_baguettotron_vlm.BaguettotronVLMProcessor" | |
| } | |
| } |