vision_tower.patch_embed.proj.input_quantizer TensorQuantizer(disabled) vision_tower.patch_embed.proj.output_quantizer TensorQuantizer(disabled) vision_tower.patch_embed.proj.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.0.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.1.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.2.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.3.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.4.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.5.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.6.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.7.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.8.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.9.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.10.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.11.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.12.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.13.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.14.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.15.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.16.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.17.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.18.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.19.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.20.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.21.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.22.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.23.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.24.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.25.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.norm0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.norm0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.norm1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.norm1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc0.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc0.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc0.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc1.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc1.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.mlp.fc1.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wqkv.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wqkv.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wqkv.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wo.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wo.output_quantizer TensorQuantizer(disabled) vision_tower.encoder.blocks.26.wo.weight_quantizer TensorQuantizer(disabled) vision_tower.encoder.final_layernorm.input_quantizer TensorQuantizer(disabled) vision_tower.encoder.final_layernorm.output_quantizer TensorQuantizer(disabled) mm_projector.pre_norm.input_quantizer TensorQuantizer(disabled) mm_projector.pre_norm.output_quantizer TensorQuantizer(disabled) mm_projector.proj.0.input_quantizer TensorQuantizer(disabled) mm_projector.proj.0.output_quantizer TensorQuantizer(disabled) mm_projector.proj.0.weight_quantizer TensorQuantizer(disabled) mm_projector.proj.2.input_quantizer TensorQuantizer(disabled) mm_projector.proj.2.output_quantizer TensorQuantizer(disabled) mm_projector.proj.2.weight_quantizer TensorQuantizer(disabled) language_model.model.embed_tokens.weight_quantizer TensorQuantizer(disabled) language_model.model.embed_tokens.input_quantizer HardDisabledTensorQuantizer(disabled) language_model.model.embed_tokens.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.0.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.0.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.0.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.0.mlp.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.1.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.1.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.1.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.70e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.79e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.03e-02 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.64e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.95e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.1.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.1.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.2.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.2.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.2.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.60e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.47e+00 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.81e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.65e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.2.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.2.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.3.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.3.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.3.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.22e+00 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.92e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.87e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.74e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.31e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.3.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.3.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.4.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.4.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.4.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.62e+01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.95e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.23e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.4.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.4.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.5.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.5.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.5.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.59e+00 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.23e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.67e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.5.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.5.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.6.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.6.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.6.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e+02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.6.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.6.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.7.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.7.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.7.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.81e+02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.84e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.7.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.7.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.8.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.8.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.8.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.77e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.84e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.75e+01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.94e-02 calibrator=MaxCalibrator quant) language_model.model.layers.8.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.8.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.9.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.9.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.9.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.57e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.35e+01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.89e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.61e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.9.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.9.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.10.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.10.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.10.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.60e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.97e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.15e+01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.03e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.10.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.10.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.11.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.11.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.11.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.99e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.56e+00 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.89e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.11.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.11.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.12.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.12.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.12.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.76e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.83e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.96e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.53e+00 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.12.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.12.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.13.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.13.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.13.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.45e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.57e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=6.72e+00 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.03e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.13.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.13.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.14.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.14.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.14.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.44e+00 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.03e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.69e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.14.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.14.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.15.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.15.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.15.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.63e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.64e+02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.84e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.15.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.15.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.16.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.16.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.16.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.65e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.41e+00 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.94e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.94e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.16.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.16.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.17.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.17.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.17.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.61e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.56e+00 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.97e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.17.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.17.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.18.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.18.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.18.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.12e+02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.40e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.18.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.18.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.19.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.19.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.19.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e+00 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.93e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e+00 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.84e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.19.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.19.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.20.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.20.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.20.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e+00 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.94e+00 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.98e-02 calibrator=MaxCalibrator quant) language_model.model.layers.20.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.20.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.21.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.21.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.21.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e+00 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.67e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e+01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.67e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.89e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.94e-02 calibrator=MaxCalibrator quant) language_model.model.layers.21.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.21.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.22.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.22.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.22.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e+00 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.83e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.94e+00 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.54e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.22.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.22.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.23.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.23.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.23.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e+00 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.69e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.34e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.12e+00 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.23.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.23.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.24.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.24.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.24.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e+00 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.71e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.31e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.61e+01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.24.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.24.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.25.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.25.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.25.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e+00 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.23e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e+01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.69e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.25.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.25.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.26.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.26.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.26.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e+00 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.70e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e+01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.90e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.26.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.26.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.27.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.27.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.27.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e+00 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.82e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.97e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e+01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.27.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.27.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.28.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.28.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.28.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.49e+00 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.99e+01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.28.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.28.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.29.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.29.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.29.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.59e+00 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.71e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.31e+01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.77e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.53e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.45e-01 calibrator=MaxCalibrator quant) language_model.model.layers.29.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.29.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.30.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.30.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.30.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e+00 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.71e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.92e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.02e+01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.30.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.30.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.31.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.31.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.31.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.69e+00 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.64e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.80e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.65e+01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.31.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.31.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.32.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.32.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.32.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.77e+00 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.01e+01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.60e-01 calibrator=MaxCalibrator quant) language_model.model.layers.32.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.32.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.33.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.33.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.33.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e+00 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.62e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.70e+01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.84e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.33.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.33.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.34.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.34.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.34.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e+00 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.80e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.55e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.10e+01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.98e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.34.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.34.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.35.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.35.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.35.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.84e+00 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.53e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.22e+01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.95e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.35.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.35.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.36.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.36.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.36.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e+00 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.13e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.82e+01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.89e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.36.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.36.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.37.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.37.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.37.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.99e+00 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.25e+01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.03e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.18e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.08e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.37.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.37.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.38.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.38.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.38.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.03e+00 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.55e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.74e+01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.84e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.38.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.38.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.39.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.39.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.39.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.00e+00 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.63e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.15e+01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.39.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.39.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.40.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.40.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.40.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.20e+00 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.38e+01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.40.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.40.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.41.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.41.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.41.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.28e+00 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.78e+01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.41.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.41.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.42.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.42.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.42.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.25e+00 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.31e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.91e+01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.87e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.85e-01 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.42.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.42.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.43.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.43.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.43.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.42e+00 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.60e+01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.85e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.54e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.43.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.43.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.44.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.44.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.44.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.44e+00 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.81e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.89e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.40e+01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.76e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.44.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.44.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.45.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.45.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.45.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.44e+00 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.93e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.60e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.15e+01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.63e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.33e-02 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.40e-01 calibrator=MaxCalibrator quant) language_model.model.layers.45.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.45.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.46.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.46.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.46.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.50e+00 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.34e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.89e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e+02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.39e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.23e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.57e-02 calibrator=MaxCalibrator quant) language_model.model.layers.46.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.46.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.47.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.47.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.47.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.48e+00 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e+02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.81e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.49e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.72e-02 calibrator=MaxCalibrator quant) language_model.model.layers.47.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.47.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.48.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.48.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.48.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.56e+00 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.80e+01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.84e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.47e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.64e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.48.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.48.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.49.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.49.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.49.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.70e+00 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.86e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.54e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.71e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.31e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.30e+01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.91e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.57e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.52e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.55e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.88e-01 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.77e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.49.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.49.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.50.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.50.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.50.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.88e+00 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.58e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.38e-02 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.89e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e+02 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.68e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.62e-02 calibrator=MaxCalibrator quant) language_model.model.layers.50.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.50.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.51.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.51.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.51.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.91e+00 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.96e-02 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.15e+01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.72e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.64e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.42e-02 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.35e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.99e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.69e-01 calibrator=MaxCalibrator quant) language_model.model.layers.51.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.51.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.52.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.52.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.52.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.05e+00 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.95e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.92e+01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.87e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.98e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.86e-02 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.49e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.52.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.52.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.53.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.53.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.53.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.12e+00 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.76e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.98e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.03e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.67e-02 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.83e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.87e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.10e+01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.36e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.31e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.28e-02 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.95e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.61e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.53.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.53.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.54.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.54.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.54.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.59e+00 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.55e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.85e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.32e+02 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.90e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.42e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.12e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.54e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.79e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.54.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.54.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.55.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.55.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.55.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.67e+00 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=9.95e+01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.23e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.78e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.06e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.45e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.55.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.55.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.56.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.56.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.56.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.92e+00 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.70e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.27e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e+02 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.76e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.20e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.79e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.98e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.56.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.56.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.57.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.57.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.57.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.00e+00 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.63e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.22e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.08e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.75e+01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.62e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.07e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.26e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.37e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.45e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.57.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.57.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.58.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.58.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.58.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.53e+00 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.83e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.19e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.11e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.93e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.82e+02 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.98e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.05e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.32e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.21e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.25e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.02e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.66e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.73e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.18e-01 calibrator=MaxCalibrator quant) language_model.model.layers.58.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.58.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.59.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.59.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.59.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.64e+00 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.54e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.56e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.13e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.14e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.30e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.84e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.52e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.89e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.97e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.41e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.15e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.52e+04 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.01e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.17e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.33e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.98e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.46e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.43e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.75e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.04e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.10e-01 calibrator=MaxCalibrator quant) language_model.model.layers.59.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.59.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_a_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_a_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_a_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_a_proj_with_mqa.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_a_proj_with_mqa.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_a_proj_with_mqa.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_b_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_b_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.kv_b_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.q_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.60.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.60.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) language_model.model.layers.60.self_attn.p_bmm_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.03e+00 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.92e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.38e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.80e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.99e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.28e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.70e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.50e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.48e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.63e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.gate_up_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.62e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.60e+04 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.0 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.1 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.29e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.2 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.47e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.3 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.09e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.4 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=2.16e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.5 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.24e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.6 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=7.23e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.7 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=3.93e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.8 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.51e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.9 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=1.44e+00 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.10 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.90e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.experts.down_proj_weight_quantizers.11 TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.00e-01 calibrator=MaxCalibrator quant) language_model.model.layers.60.mlp.shared_experts.gate_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.gate_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.gate_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.up_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.up_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.up_proj.weight_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.down_proj.input_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.down_proj.output_quantizer TensorQuantizer(disabled) language_model.model.layers.60.mlp.shared_experts.down_proj.weight_quantizer TensorQuantizer(disabled) language_model.lm_head.input_quantizer TensorQuantizer(disabled) language_model.lm_head.output_quantizer TensorQuantizer(disabled) language_model.lm_head.weight_quantizer TensorQuantizer(disabled) 3719 TensorQuantizers found in model