ewin-reg commited on
Commit
f004bb0
·
verified ·
1 Parent(s): e1cc78b

fix: set vision_config.image_size=384 and interpolate_pos_encoding=True

Browse files
Files changed (1) hide show
  1. modeling_minicpm5_v.py +4 -3
modeling_minicpm5_v.py CHANGED
@@ -82,7 +82,7 @@ class MiniCPM5VConfig(PretrainedConfig):
82
  if vision_config is None:
83
  vision_config = {
84
  "hidden_size": 1152,
85
- "image_size": 448,
86
  "intermediate_size": 4304,
87
  "num_attention_heads": 16,
88
  "num_hidden_layers": 27,
@@ -189,13 +189,14 @@ class MiniCPM5VForConditionalGeneration(MiniCPM5VPreTrainedModel):
189
  self.llm.set_output_embeddings(new_embeddings)
190
 
191
  def encode_vision(self, pixel_values: torch.Tensor) -> torch.Tensor:
192
- vision_outputs = self.vpm(pixel_values=pixel_values)
193
  hidden_states = vision_outputs.last_hidden_state
194
- img_size = self.config.vision_config.image_size
195
  patch_size = self.config.vision_config.patch_size
196
  grid_dim = img_size // patch_size
197
  return self.resampler(hidden_states, grid_h=grid_dim, grid_w=grid_dim)
198
 
 
199
  def forward(
200
  self,
201
  input_ids: Optional[torch.LongTensor] = None,
 
82
  if vision_config is None:
83
  vision_config = {
84
  "hidden_size": 1152,
85
+ "image_size": 384,
86
  "intermediate_size": 4304,
87
  "num_attention_heads": 16,
88
  "num_hidden_layers": 27,
 
189
  self.llm.set_output_embeddings(new_embeddings)
190
 
191
  def encode_vision(self, pixel_values: torch.Tensor) -> torch.Tensor:
192
+ vision_outputs = self.vpm(pixel_values=pixel_values, interpolate_pos_encoding=True)
193
  hidden_states = vision_outputs.last_hidden_state
194
+ img_size = pixel_values.shape[-1]
195
  patch_size = self.config.vision_config.patch_size
196
  grid_dim = img_size // patch_size
197
  return self.resampler(hidden_states, grid_h=grid_dim, grid_w=grid_dim)
198
 
199
+
200
  def forward(
201
  self,
202
  input_ids: Optional[torch.LongTensor] = None,