ggml_cuda_init: found 2 CUDA devices (Total VRAM: 32538 MiB): Device 0: Tesla P100-PCIE-16GB, compute capability 6.0, VMM: yes, VRAM: 16269 MiB Device 1: Tesla P100-PCIE-16GB, compute capability 6.0, VMM: yes, VRAM: 16269 MiB load_backend: loaded CUDA backend from /mnt/nvme1/llm/llama-eaddario-cuda-real/libggml-cuda.so load_backend: loaded RPC backend from /mnt/nvme1/llm/llama-eaddario-cuda-real/libggml-rpc.so load_backend: loaded CPU backend from /mnt/nvme1/llm/llama-eaddario-cuda-real/libggml-cpu-haswell.so common_init_result: fitting params to device memory, for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on llama_params_fit_impl: projected memory use with initial parameters [MiB]: llama_params_fit_impl: - CUDA0 (Tesla P100-PCIE-16GB): 16269 total, 26601 used, -10623 free vs. target of 2048 llama_params_fit_impl: - CUDA1 (Tesla P100-PCIE-16GB): 16269 total, 25153 used, -9172 free vs. target of 2048 llama_params_fit_impl: projected to use 51754 MiB of device memory vs. 31958 MiB of free device memory llama_params_fit_impl: cannot meet free memory targets on all devices, need to use 23892 MiB less in total llama_params_fit_impl: context size set by user to 2048 -> no change llama_params_fit_impl: with only dense weights in device memory there is a total surplus of 21384 MiB llama_params_fit_impl: filling dense-only layers back-to-front: llama_params_fit_impl: - CUDA1 (Tesla P100-PCIE-16GB): 41 layers, 6637 MiB used, 9343 MiB free llama_params_fit_impl: - CUDA0 (Tesla P100-PCIE-16GB): 0 layers, 1041 MiB used, 14935 MiB free llama_params_fit_impl: converting dense-only layers to full layers and filling them front-to-back with overflow to next device/system memory: llama_params_fit_impl: - CUDA0 (Tesla P100-PCIE-16GB): 10 layers ( 1 overflowing), 13431 MiB used, 2545 MiB free llama_params_fit_impl: - CUDA1 (Tesla P100-PCIE-16GB): 31 layers (24 overflowing), 13776 MiB used, 2204 MiB free llama_params_fit: successfully fit params to free device memory llama_params_fit: fitting params to free memory took 6.30 seconds llama_model_load_from_file_impl: using device CUDA0 (Tesla P100-PCIE-16GB) (0000:01:00.0) - 16011 MiB free llama_model_load_from_file_impl: using device CUDA1 (Tesla P100-PCIE-16GB) (0000:04:00.0) - 16011 MiB free llama_model_loader: loaded meta data with 52 key-value pairs and 733 tensors from /mnt/ssd1/models/tvall43/Qwen3.6-35B-A3B-heretic/750-v1/Qwen3.6-35B-A3B-heretic-BPW12.00.gguf (version GGUF V3 (latest)) llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output. llama_model_loader: - kv 0: general.architecture str = qwen35moe llama_model_loader: - kv 1: general.type str = model llama_model_loader: - kv 2: general.sampling.top_k i32 = 20 llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000 llama_model_loader: - kv 4: general.sampling.temp f32 = 1.000000 llama_model_loader: - kv 5: general.name str = Qwen3.6 35B A3B Heretic llama_model_loader: - kv 6: general.finetune str = heretic llama_model_loader: - kv 7: general.basename str = Qwen3.6 llama_model_loader: - kv 8: general.size_label str = 35B-A3B llama_model_loader: - kv 9: general.license str = apache-2.0 llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.6-3... llama_model_loader: - kv 11: general.base_model.count u32 = 1 llama_model_loader: - kv 12: general.base_model.0.name str = Qwen3.6 35B A3B llama_model_loader: - kv 13: general.base_model.0.organization str = Qwen llama_model_loader: - kv 14: general.base_model.0.repo_url str = https://huggingface.co/Qwen/Qwen3.6-3... llama_model_loader: - kv 15: general.tags arr[str,7] = ["qwen3_5_moe", "qwen", "heretic", "u... llama_model_loader: - kv 16: qwen35moe.block_count u32 = 40 llama_model_loader: - kv 17: qwen35moe.context_length u32 = 262144 llama_model_loader: - kv 18: qwen35moe.embedding_length u32 = 2048 llama_model_loader: - kv 19: qwen35moe.attention.head_count u32 = 16 llama_model_loader: - kv 20: qwen35moe.attention.head_count_kv u32 = 2 llama_model_loader: - kv 21: qwen35moe.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0] llama_model_loader: - kv 22: qwen35moe.rope.freq_base f32 = 10000000.000000 llama_model_loader: - kv 23: qwen35moe.attention.layer_norm_rms_epsilon f32 = 0.000001 llama_model_loader: - kv 24: qwen35moe.expert_count u32 = 256 llama_model_loader: - kv 25: qwen35moe.expert_used_count u32 = 8 llama_model_loader: - kv 26: qwen35moe.attention.key_length u32 = 256 llama_model_loader: - kv 27: qwen35moe.attention.value_length u32 = 256 llama_model_loader: - kv 28: qwen35moe.expert_feed_forward_length u32 = 512 llama_model_loader: - kv 29: qwen35moe.expert_shared_feed_forward_length u32 = 512 llama_model_loader: - kv 30: qwen35moe.ssm.conv_kernel u32 = 4 llama_model_loader: - kv 31: qwen35moe.ssm.state_size u32 = 128 llama_model_loader: - kv 32: qwen35moe.ssm.group_count u32 = 16 llama_model_loader: - kv 33: qwen35moe.ssm.time_step_rank u32 = 32 llama_model_loader: - kv 34: qwen35moe.ssm.inner_size u32 = 4096 llama_model_loader: - kv 35: qwen35moe.full_attention_interval u32 = 4 llama_model_loader: - kv 36: qwen35moe.rope.dimension_count u32 = 64 llama_model_loader: - kv 37: tokenizer.ggml.model str = gpt2 llama_model_loader: - kv 38: tokenizer.ggml.pre str = qwen35 llama_model_loader: - kv 39: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ... llama_model_loader: - kv 40: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ... llama_model_loader: - kv 41: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",... llama_model_loader: - kv 42: tokenizer.ggml.eos_token_id u32 = 248046 llama_model_loader: - kv 43: tokenizer.ggml.padding_token_id u32 = 248055 llama_model_loader: - kv 44: tokenizer.ggml.bos_token_id u32 = 248044 llama_model_loader: - kv 45: tokenizer.chat_template str = {%- set image_count = namespace(value... llama_model_loader: - kv 46: general.quantization_version u32 = 2 llama_model_loader: - kv 47: general.file_type u32 = 1 llama_model_loader: - kv 48: quantize.imatrix.file str = /mnt/ssd1/models/tvall43/Qwen3.6-35B-... llama_model_loader: - kv 49: quantize.imatrix.dataset str = /home/duka/llm/models/tvall43/Qwen3.6... llama_model_loader: - kv 50: quantize.imatrix.entries_count u32 = 510 llama_model_loader: - kv 51: quantize.imatrix.chunks_count u32 = 197 llama_model_loader: - type f32: 301 tensors llama_model_loader: - type f16: 271 tensors llama_model_loader: - type q8_0: 161 tensors print_info: file format = GGUF V3 (latest) print_info: file type = F16 print_info: file size = 48.42 GiB (12.00 BPW) load: 0 unused tokens load: printing all EOG tokens: load: - 248044 ('<|endoftext|>') load: - 248046 ('<|im_end|>') load: - 248063 ('<|fim_pad|>') load: - 248064 ('<|repo_name|>') load: - 248065 ('<|file_sep|>') load: special tokens cache size = 33 load: token to piece cache size = 1.7581 MB print_info: arch = qwen35moe print_info: vocab_only = 0 print_info: no_alloc = 0 print_info: n_ctx_train = 262144 print_info: n_embd = 2048 print_info: n_embd_inp = 2048 print_info: n_layer = 40 print_info: n_head = 16 print_info: n_head_kv = 2 print_info: n_rot = 64 print_info: n_swa = 0 print_info: is_swa_any = 0 print_info: n_embd_head_k = 256 print_info: n_embd_head_v = 256 print_info: n_gqa = 8 print_info: n_embd_k_gqa = 512 print_info: n_embd_v_gqa = 512 print_info: f_norm_eps = 0.0e+00 print_info: f_norm_rms_eps = 1.0e-06 print_info: f_clamp_kqv = 0.0e+00 print_info: f_max_alibi_bias = 0.0e+00 print_info: f_logit_scale = 0.0e+00 print_info: f_attn_scale = 0.0e+00 print_info: n_ff = 0 print_info: n_expert = 256 print_info: n_expert_used = 8 print_info: n_expert_groups = 0 print_info: n_group_used = 0 print_info: causal attn = 1 print_info: pooling type = -1 print_info: rope type = 40 print_info: rope scaling = linear print_info: freq_base_train = 10000000.0 print_info: freq_scale_train = 1 print_info: n_ctx_orig_yarn = 262144 print_info: rope_yarn_log_mul = 0.0000 print_info: rope_finetuned = unknown print_info: mrope sections = [11, 11, 10, 0] print_info: ssm_d_conv = 4 print_info: ssm_d_inner = 4096 print_info: ssm_d_state = 128 print_info: ssm_dt_rank = 32 print_info: ssm_n_group = 16 print_info: ssm_dt_b_c_rms = 0 print_info: model type = 35B.A3B print_info: model params = 34.66 B print_info: general.name = Qwen3.6 35B A3B Heretic print_info: vocab type = BPE print_info: n_vocab = 248320 print_info: n_merges = 247587 print_info: BOS token = 248044 '<|endoftext|>' print_info: EOS token = 248046 '<|im_end|>' print_info: EOT token = 248046 '<|im_end|>' print_info: PAD token = 248055 '<|vision_pad|>' print_info: LF token = 198 'Ċ' print_info: FIM PRE token = 248060 '<|fim_prefix|>' print_info: FIM SUF token = 248062 '<|fim_suffix|>' print_info: FIM MID token = 248061 '<|fim_middle|>' print_info: FIM PAD token = 248063 '<|fim_pad|>' print_info: FIM REP token = 248064 '<|repo_name|>' print_info: FIM SEP token = 248065 '<|file_sep|>' print_info: EOG token = 248044 '<|endoftext|>' print_info: EOG token = 248046 '<|im_end|>' print_info: EOG token = 248063 '<|fim_pad|>' print_info: EOG token = 248064 '<|repo_name|>' print_info: EOG token = 248065 '<|file_sep|>' print_info: max token length = 256 load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = true) load_tensors: offloading output layer to GPU load_tensors: offloading 39 repeating layers to GPU load_tensors: offloaded 41/41 layers to GPU load_tensors: CUDA0 model buffer size = 12356.98 MiB load_tensors: CUDA1 model buffer size = 11694.09 MiB load_tensors: CUDA_Host model buffer size = 25531.32 MiB .................................................................................................. common_init_result: added <|endoftext|> logit bias = -inf common_init_result: added <|im_end|> logit bias = -inf common_init_result: added <|fim_pad|> logit bias = -inf common_init_result: added <|repo_name|> logit bias = -inf common_init_result: added <|file_sep|> logit bias = -inf llama_context: constructing llama_context llama_context: n_seq_max = 1 llama_context: n_ctx = 2048 llama_context: n_ctx_seq = 2048 llama_context: n_batch = 2048 llama_context: n_ubatch = 2048 llama_context: causal_attn = 1 llama_context: flash_attn = enabled llama_context: kv_unified = false llama_context: freq_base = 10000000.0 llama_context: freq_scale = 1 llama_context: n_ctx_seq (2048) < n_ctx_train (262144) -- the full capacity of the model will not be utilized llama_context: CUDA_Host output buffer size = 0.95 MiB llama_kv_cache: CUDA0 KV buffer size = 16.00 MiB llama_kv_cache: CUDA1 KV buffer size = 64.00 MiB llama_kv_cache: size = 80.00 MiB ( 2048 cells, 10 layers, 1/1 seqs), K (f32): 40.00 MiB, V (f32): 40.00 MiB llama_kv_cache: attn_rot_k = 0, n_embd_head_k_all = 256 llama_kv_cache: attn_rot_v = 0, n_embd_head_k_all = 256 llama_memory_recurrent: CUDA0 RS buffer size = 16.75 MiB llama_memory_recurrent: CUDA1 RS buffer size = 46.06 MiB llama_memory_recurrent: size = 62.81 MiB ( 1 cells, 40 layers, 1 seqs), R (f32): 2.81 MiB, S (f32): 60.00 MiB sched_reserve: reserving ... sched_reserve: resolving fused Gated Delta Net support: sched_reserve: fused Gated Delta Net (autoregressive) enabled sched_reserve: fused Gated Delta Net (chunked) enabled sched_reserve: CUDA0 compute buffer size = 834.00 MiB sched_reserve: CUDA1 compute buffer size = 1972.00 MiB sched_reserve: CUDA_Host compute buffer size = 48.08 MiB sched_reserve: graph nodes = 3749 sched_reserve: graph splits = 104 (with bs=2048), 53 (with bs=1) sched_reserve: reserve took 46.35 ms, sched copies = 1 common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable) system_info: n_threads = 16 (n_threads_batch = 16) / 16 | CUDA : ARCHS = 600,610 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | FA_ALL_QUANTS = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 | kl_divergence: computing over 197 chunks, n_ctx=2048, batch_size=2048, n_seq=1 kl_divergence: 8.13 seconds per pass - ETA 26.67 minutes chunk PPL ln(PPL(Q)/PPL(base)) KL Divergence Δp RMS Same top p 1 7.8417 ± 0.6341 0.00349 ± 0.00350 0.00547 ± 0.00038 2.146 ± 0.114 % 96.090 ± 0.606 % 2 6.4094 ± 0.3498 0.00252 ± 0.00253 0.00536 ± 0.00026 2.379 ± 0.129 % 96.579 ± 0.402 % 3 7.5367 ± 0.3575 0.00505 ± 0.00231 0.00665 ± 0.00035 2.640 ± 0.185 % 96.253 ± 0.343 % 4 8.1255 ± 0.3442 0.00517 ± 0.00213 0.00796 ± 0.00089 2.698 ± 0.166 % 96.065 ± 0.304 % 5 7.9453 ± 0.2978 0.00476 ± 0.00185 0.00760 ± 0.00071 2.654 ± 0.138 % 95.836 ± 0.279 % 6 7.4523 ± 0.2517 0.00324 ± 0.00163 0.00702 ± 0.00060 2.558 ± 0.120 % 96.106 ± 0.247 % 7 6.6388 ± 0.2018 0.00261 ± 0.00165 0.00889 ± 0.00088 2.865 ± 0.232 % 95.559 ± 0.243 % 8 5.7901 ± 0.1581 0.00148 ± 0.00150 0.00839 ± 0.00077 2.804 ± 0.209 % 94.807 ± 0.245 % 9 6.0510 ± 0.1575 0.00231 ± 0.00139 0.00802 ± 0.00069 2.730 ± 0.191 % 94.993 ± 0.227 % 10 6.3171 ± 0.1584 0.00263 ± 0.00131 0.00784 ± 0.00062 2.681 ± 0.175 % 95.122 ± 0.213 % 11 6.7947 ± 0.1660 0.00242 ± 0.00126 0.00770 ± 0.00056 2.651 ± 0.162 % 95.201 ± 0.201 % 12 6.9841 ± 0.1642 0.00288 ± 0.00119 0.00750 ± 0.00052 2.606 ± 0.151 % 95.243 ± 0.192 % 13 6.9329 ± 0.1565 0.00291 ± 0.00113 0.00726 ± 0.00048 2.576 ± 0.141 % 95.376 ± 0.182 % 14 7.1083 ± 0.1562 0.00213 ± 0.00114 0.00804 ± 0.00086 2.742 ± 0.182 % 95.357 ± 0.176 % 15 7.0692 ± 0.1502 0.00225 ± 0.00109 0.00810 ± 0.00081 2.761 ± 0.170 % 95.380 ± 0.169 % 16 7.0890 ± 0.1456 0.00240 ± 0.00105 0.00791 ± 0.00076 2.724 ± 0.162 % 95.461 ± 0.163 % 17 7.2271 ± 0.1451 0.00212 ± 0.00101 0.00787 ± 0.00072 2.695 ± 0.154 % 95.469 ± 0.158 % 18 7.0255 ± 0.1361 0.00237 ± 0.00097 0.00773 ± 0.00068 2.686 ± 0.147 % 95.552 ± 0.152 % 19 6.9914 ± 0.1320 0.00237 ± 0.00093 0.00756 ± 0.00064 2.650 ± 0.141 % 95.663 ± 0.146 % 20 7.0282 ± 0.1294 0.00258 ± 0.00091 0.00752 ± 0.00061 2.644 ± 0.135 % 95.674 ± 0.142 % 21 7.2364 ± 0.1311 0.00301 ± 0.00090 0.00752 ± 0.00059 2.665 ± 0.131 % 95.671 ± 0.139 % 22 7.2533 ± 0.1284 0.00291 ± 0.00087 0.00739 ± 0.00056 2.640 ± 0.126 % 95.694 ± 0.135 % 23 7.1061 ± 0.1228 0.00240 ± 0.00085 0.00754 ± 0.00059 2.669 ± 0.127 % 95.741 ± 0.132 % 24 7.1738 ± 0.1215 0.00274 ± 0.00083 0.00742 ± 0.00056 2.648 ± 0.123 % 95.748 ± 0.129 % 25 7.2675 ± 0.1208 0.00261 ± 0.00081 0.00736 ± 0.00054 2.628 ± 0.119 % 95.761 ± 0.126 % 26 7.2228 ± 0.1173 0.00254 ± 0.00079 0.00731 ± 0.00052 2.628 ± 0.115 % 95.774 ± 0.123 % 27 7.2151 ± 0.1148 0.00249 ± 0.00077 0.00725 ± 0.00050 2.613 ± 0.111 % 95.779 ± 0.121 % 28 7.2136 ± 0.1126 0.00262 ± 0.00076 0.00718 ± 0.00048 2.602 ± 0.108 % 95.783 ± 0.119 % 29 7.2372 ± 0.1110 0.00257 ± 0.00074 0.00723 ± 0.00047 2.603 ± 0.105 % 95.773 ± 0.117 % 30 7.1736 ± 0.1081 0.00262 ± 0.00073 0.00721 ± 0.00046 2.594 ± 0.102 % 95.780 ± 0.115 % 31 7.2632 ± 0.1079 0.00263 ± 0.00072 0.00719 ± 0.00044 2.601 ± 0.100 % 95.803 ± 0.113 % 32 7.2223 ± 0.1055 0.00313 ± 0.00071 0.00734 ± 0.00043 2.605 ± 0.097 % 95.778 ± 0.111 % 33 7.1566 ± 0.1028 0.00309 ± 0.00070 0.00735 ± 0.00043 2.603 ± 0.095 % 95.817 ± 0.109 % 34 7.2411 ± 0.1026 0.00319 ± 0.00069 0.00730 ± 0.00042 2.589 ± 0.093 % 95.811 ± 0.107 % 35 7.0880 ± 0.0986 0.00306 ± 0.00068 0.00730 ± 0.00041 2.605 ± 0.091 % 95.808 ± 0.106 % 36 7.0327 ± 0.0962 0.00305 ± 0.00067 0.00727 ± 0.00039 2.608 ± 0.088 % 95.821 ± 0.104 % 37 7.0992 ± 0.0960 0.00296 ± 0.00066 0.00724 ± 0.00038 2.599 ± 0.086 % 95.831 ± 0.103 % 38 7.0953 ± 0.0948 0.00296 ± 0.00065 0.00718 ± 0.00037 2.590 ± 0.084 % 95.838 ± 0.101 % 39 7.1473 ± 0.0943 0.00311 ± 0.00065 0.00736 ± 0.00043 2.574 ± 0.083 % 95.859 ± 0.100 % 40 7.1748 ± 0.0936 0.00319 ± 0.00064 0.00733 ± 0.00042 2.568 ± 0.081 % 95.863 ± 0.098 % 41 6.9836 ± 0.0896 0.00305 ± 0.00063 0.00726 ± 0.00041 2.567 ± 0.079 % 95.875 ± 0.097 % 42 7.0312 ± 0.0891 0.00306 ± 0.00062 0.00723 ± 0.00040 2.558 ± 0.078 % 95.878 ± 0.096 % 43 7.0315 ± 0.0882 0.00357 ± 0.00065 0.00753 ± 0.00043 2.627 ± 0.084 % 95.897 ± 0.095 % 44 6.9925 ± 0.0865 0.00349 ± 0.00064 0.00745 ± 0.00042 2.614 ± 0.082 % 95.912 ± 0.093 % 45 7.0480 ± 0.0863 0.00352 ± 0.00063 0.00740 ± 0.00041 2.600 ± 0.081 % 95.925 ± 0.092 % 46 7.0567 ± 0.0855 0.00349 ± 0.00062 0.00734 ± 0.00040 2.588 ± 0.079 % 95.922 ± 0.091 % 47 6.9997 ± 0.0844 0.00402 ± 0.00090 0.01026 ± 0.00076 2.976 ± 0.115 % 95.874 ± 0.091 % 48 7.0653 ± 0.0845 0.00423 ± 0.00089 0.01021 ± 0.00075 2.960 ± 0.114 % 95.868 ± 0.090 % 49 6.9366 ± 0.0819 0.00425 ± 0.00088 0.01044 ± 0.00073 3.045 ± 0.110 % 95.855 ± 0.089 % 50 6.9499 ± 0.0811 0.00441 ± 0.00087 0.01038 ± 0.00072 3.038 ± 0.108 % 95.848 ± 0.088 % 51 6.9116 ± 0.0798 0.00482 ± 0.00088 0.01065 ± 0.00073 3.072 ± 0.106 % 95.856 ± 0.087 % 52 6.8954 ± 0.0788 0.00487 ± 0.00087 0.01054 ± 0.00072 3.061 ± 0.105 % 95.878 ± 0.086 % 53 6.9359 ± 0.0785 0.00469 ± 0.00086 0.01069 ± 0.00074 3.079 ± 0.105 % 95.869 ± 0.085 % 54 6.9118 ± 0.0774 0.00461 ± 0.00085 0.01061 ± 0.00072 3.073 ± 0.104 % 95.869 ± 0.085 % 55 6.9468 ± 0.0772 0.00450 ± 0.00083 0.01051 ± 0.00071 3.057 ± 0.102 % 95.857 ± 0.084 % 56 6.9637 ± 0.0768 0.00453 ± 0.00082 0.01043 ± 0.00070 3.044 ± 0.101 % 95.861 ± 0.083 % 57 6.9758 ± 0.0763 0.00479 ± 0.00081 0.01039 ± 0.00068 3.043 ± 0.100 % 95.867 ± 0.082 % 58 7.0183 ± 0.0761 0.00469 ± 0.00080 0.01032 ± 0.00067 3.028 ± 0.098 % 95.857 ± 0.082 % 59 7.0542 ± 0.0759 0.00472 ± 0.00079 0.01027 ± 0.00066 3.022 ± 0.097 % 95.828 ± 0.081 % 60 7.0993 ± 0.0760 0.00470 ± 0.00078 0.01022 ± 0.00065 3.017 ± 0.095 % 95.815 ± 0.081 % 61 7.0726 ± 0.0750 0.00465 ± 0.00077 0.01014 ± 0.00064 3.008 ± 0.094 % 95.818 ± 0.080 % 62 7.0538 ± 0.0742 0.00446 ± 0.00077 0.01042 ± 0.00066 3.026 ± 0.093 % 95.817 ± 0.079 % 63 7.1154 ± 0.0744 0.00452 ± 0.00076 0.01034 ± 0.00065 3.013 ± 0.092 % 95.815 ± 0.079 % 64 7.1057 ± 0.0737 0.00452 ± 0.00075 0.01034 ± 0.00064 3.033 ± 0.093 % 95.801 ± 0.078 % 65 7.1436 ± 0.0736 0.00445 ± 0.00074 0.01032 ± 0.00063 3.039 ± 0.092 % 95.797 ± 0.078 % 66 7.1135 ± 0.0726 0.00443 ± 0.00073 0.01024 ± 0.00063 3.030 ± 0.091 % 95.814 ± 0.077 % 67 7.0670 ± 0.0715 0.00455 ± 0.00074 0.01036 ± 0.00062 3.057 ± 0.092 % 95.811 ± 0.077 % 68 7.1095 ± 0.0715 0.00474 ± 0.00074 0.01034 ± 0.00061 3.055 ± 0.090 % 95.808 ± 0.076 % 69 7.0876 ± 0.0707 0.00468 ± 0.00073 0.01027 ± 0.00060 3.045 ± 0.089 % 95.807 ± 0.075 % 70 6.9867 ± 0.0691 0.00471 ± 0.00072 0.01018 ± 0.00060 3.029 ± 0.089 % 95.836 ± 0.075 % 71 6.9832 ± 0.0685 0.00475 ± 0.00071 0.01011 ± 0.00059 3.018 ± 0.088 % 95.855 ± 0.074 % 72 7.0147 ± 0.0684 0.00470 ± 0.00070 0.01004 ± 0.00058 3.007 ± 0.087 % 95.863 ± 0.073 % 73 7.0490 ± 0.0683 0.00469 ± 0.00069 0.00999 ± 0.00057 2.996 ± 0.086 % 95.876 ± 0.073 % 74 7.0716 ± 0.0681 0.00470 ± 0.00069 0.00992 ± 0.00056 2.987 ± 0.085 % 95.883 ± 0.072 % 75 7.0212 ± 0.0670 0.00470 ± 0.00068 0.00985 ± 0.00056 2.979 ± 0.084 % 95.900 ± 0.072 % 76 7.0284 ± 0.0666 0.00468 ± 0.00067 0.00980 ± 0.00055 2.972 ± 0.083 % 95.901 ± 0.071 % 77 7.0110 ± 0.0660 0.00470 ± 0.00066 0.00974 ± 0.00054 2.967 ± 0.082 % 95.892 ± 0.071 % 78 7.0427 ± 0.0659 0.00469 ± 0.00066 0.00969 ± 0.00054 2.958 ± 0.082 % 95.886 ± 0.070 % 79 7.0745 ± 0.0658 0.00473 ± 0.00065 0.00963 ± 0.00053 2.949 ± 0.081 % 95.893 ± 0.070 % 80 7.0860 ± 0.0656 0.00469 ± 0.00064 0.00959 ± 0.00052 2.945 ± 0.080 % 95.894 ± 0.069 % 81 7.1187 ± 0.0656 0.00464 ± 0.00064 0.00955 ± 0.00052 2.936 ± 0.079 % 95.888 ± 0.069 % 82 7.1217 ± 0.0652 0.00461 ± 0.00063 0.00948 ± 0.00051 2.926 ± 0.079 % 95.894 ± 0.069 % 83 7.0694 ± 0.0643 0.00465 ± 0.00063 0.00962 ± 0.00051 2.972 ± 0.081 % 95.904 ± 0.068 % 84 7.1082 ± 0.0643 0.00458 ± 0.00063 0.00961 ± 0.00050 2.969 ± 0.080 % 95.887 ± 0.068 % 85 7.1203 ± 0.0641 0.00452 ± 0.00062 0.00958 ± 0.00050 2.960 ± 0.079 % 95.889 ± 0.067 % 86 7.1543 ± 0.0640 0.00445 ± 0.00062 0.00953 ± 0.00049 2.952 ± 0.078 % 95.880 ± 0.067 % 87 7.1636 ± 0.0638 0.00436 ± 0.00061 0.00949 ± 0.00049 2.945 ± 0.078 % 95.873 ± 0.067 % 88 7.1847 ± 0.0637 0.00441 ± 0.00061 0.00950 ± 0.00048 2.943 ± 0.077 % 95.868 ± 0.066 % 89 7.1871 ± 0.0633 0.00429 ± 0.00061 0.00975 ± 0.00054 2.957 ± 0.078 % 95.874 ± 0.066 % 90 7.1953 ± 0.0630 0.00429 ± 0.00061 0.00971 ± 0.00054 2.949 ± 0.077 % 95.881 ± 0.065 % 91 7.1799 ± 0.0625 0.00423 ± 0.00060 0.00965 ± 0.00053 2.941 ± 0.077 % 95.892 ± 0.065 % 92 7.1969 ± 0.0624 0.00420 ± 0.00060 0.00962 ± 0.00052 2.937 ± 0.076 % 95.898 ± 0.065 % 93 7.1781 ± 0.0618 0.00419 ± 0.00059 0.00958 ± 0.00052 2.934 ± 0.075 % 95.909 ± 0.064 % 94 7.2137 ± 0.0619 0.00420 ± 0.00059 0.00955 ± 0.00051 2.927 ± 0.075 % 95.900 ± 0.064 % 95 7.2285 ± 0.0617 0.00411 ± 0.00058 0.00952 ± 0.00051 2.923 ± 0.074 % 95.898 ± 0.064 % 96 7.2405 ± 0.0615 0.00415 ± 0.00058 0.00956 ± 0.00050 2.933 ± 0.074 % 95.903 ± 0.063 % 97 7.2557 ± 0.0614 0.00376 ± 0.00058 0.00965 ± 0.00050 2.952 ± 0.074 % 95.910 ± 0.063 % 98 7.2851 ± 0.0614 0.00380 ± 0.00057 0.00961 ± 0.00050 2.944 ± 0.073 % 95.908 ± 0.063 % 99 7.3194 ± 0.0614 0.00382 ± 0.00057 0.00958 ± 0.00049 2.936 ± 0.073 % 95.896 ± 0.062 % 100 7.3054 ± 0.0610 0.00392 ± 0.00057 0.00959 ± 0.00049 2.949 ± 0.073 % 95.899 ± 0.062 % 101 7.3213 ± 0.0608 0.00388 ± 0.00056 0.00956 ± 0.00049 2.943 ± 0.072 % 95.892 ± 0.062 % 102 7.3281 ± 0.0606 0.00399 ± 0.00056 0.00954 ± 0.00048 2.941 ± 0.072 % 95.899 ± 0.061 % 103 7.3034 ± 0.0600 0.00385 ± 0.00056 0.00950 ± 0.00048 2.935 ± 0.071 % 95.903 ± 0.061 % 104 7.2781 ± 0.0595 0.00394 ± 0.00055 0.00948 ± 0.00047 2.933 ± 0.071 % 95.902 ± 0.061 % 105 7.2620 ± 0.0591 0.00393 ± 0.00055 0.00946 ± 0.00047 2.931 ± 0.070 % 95.897 ± 0.061 % 106 7.2331 ± 0.0585 0.00392 ± 0.00054 0.00942 ± 0.00046 2.925 ± 0.070 % 95.900 ± 0.060 % 107 7.2102 ± 0.0580 0.00398 ± 0.00054 0.00945 ± 0.00046 2.937 ± 0.069 % 95.904 ± 0.060 % 108 7.1824 ± 0.0574 0.00402 ± 0.00054 0.00945 ± 0.00046 2.933 ± 0.069 % 95.898 ± 0.060 % 109 7.1949 ± 0.0572 0.00405 ± 0.00054 0.00942 ± 0.00046 2.929 ± 0.068 % 95.892 ± 0.059 % 110 7.1356 ± 0.0564 0.00404 ± 0.00053 0.00938 ± 0.00045 2.933 ± 0.068 % 95.910 ± 0.059 % 111 7.1367 ± 0.0562 0.00408 ± 0.00053 0.00935 ± 0.00045 2.931 ± 0.068 % 95.917 ± 0.059 % 112 7.1795 ± 0.0563 0.00413 ± 0.00053 0.00932 ± 0.00044 2.924 ± 0.067 % 95.909 ± 0.059 % 113 7.1594 ± 0.0559 0.00409 ± 0.00052 0.00931 ± 0.00044 2.927 ± 0.067 % 95.912 ± 0.058 % 114 7.1868 ± 0.0559 0.00408 ± 0.00052 0.00928 ± 0.00044 2.922 ± 0.066 % 95.909 ± 0.058 % 115 7.1959 ± 0.0557 0.00402 ± 0.00052 0.00925 ± 0.00043 2.916 ± 0.066 % 95.902 ± 0.058 % 116 7.2010 ± 0.0555 0.00404 ± 0.00051 0.00922 ± 0.00043 2.913 ± 0.066 % 95.900 ± 0.058 % 117 7.2226 ± 0.0555 0.00401 ± 0.00051 0.00921 ± 0.00043 2.911 ± 0.065 % 95.897 ± 0.057 % 118 7.2285 ± 0.0553 0.00399 ± 0.00051 0.00918 ± 0.00042 2.906 ± 0.065 % 95.894 ± 0.057 % 119 7.2486 ± 0.0552 0.00395 ± 0.00050 0.00915 ± 0.00042 2.899 ± 0.064 % 95.892 ± 0.057 % 120 7.2526 ± 0.0550 0.00395 ± 0.00050 0.00911 ± 0.00042 2.893 ± 0.064 % 95.899 ± 0.057 % 121 7.2706 ± 0.0550 0.00390 ± 0.00050 0.00909 ± 0.00041 2.888 ± 0.063 % 95.899 ± 0.056 % 122 7.2484 ± 0.0546 0.00390 ± 0.00049 0.00906 ± 0.00041 2.884 ± 0.063 % 95.904 ± 0.056 % 123 7.2360 ± 0.0542 0.00390 ± 0.00049 0.00905 ± 0.00041 2.888 ± 0.063 % 95.907 ± 0.056 % 124 7.2317 ± 0.0539 0.00393 ± 0.00049 0.00906 ± 0.00040 2.891 ± 0.062 % 95.891 ± 0.056 % 125 7.1579 ± 0.0531 0.00393 ± 0.00049 0.00921 ± 0.00040 2.939 ± 0.063 % 95.900 ± 0.055 % 126 7.1978 ± 0.0532 0.00391 ± 0.00049 0.00921 ± 0.00040 2.950 ± 0.063 % 95.898 ± 0.055 % 127 7.2085 ± 0.0531 0.00392 ± 0.00049 0.00919 ± 0.00039 2.945 ± 0.063 % 95.898 ± 0.055 % 128 7.2415 ± 0.0532 0.00394 ± 0.00049 0.00916 ± 0.00039 2.941 ± 0.062 % 95.893 ± 0.055 % 129 7.2164 ± 0.0528 0.00398 ± 0.00048 0.00915 ± 0.00039 2.942 ± 0.062 % 95.902 ± 0.055 % 130 7.2365 ± 0.0528 0.00399 ± 0.00048 0.00913 ± 0.00039 2.941 ± 0.062 % 95.894 ± 0.054 % 131 7.2582 ± 0.0527 0.00395 ± 0.00048 0.00916 ± 0.00039 2.946 ± 0.062 % 95.896 ± 0.054 % 132 7.2608 ± 0.0525 0.00392 ± 0.00048 0.00918 ± 0.00038 2.952 ± 0.062 % 95.883 ± 0.054 % 133 7.2570 ± 0.0523 0.00389 ± 0.00047 0.00916 ± 0.00038 2.948 ± 0.061 % 95.878 ± 0.054 % 134 7.2621 ± 0.0521 0.00388 ± 0.00047 0.00914 ± 0.00038 2.943 ± 0.061 % 95.878 ± 0.054 % 135 7.2580 ± 0.0519 0.00393 ± 0.00047 0.00911 ± 0.00038 2.938 ± 0.061 % 95.877 ± 0.054 % 136 7.2766 ± 0.0518 0.00391 ± 0.00046 0.00908 ± 0.00037 2.934 ± 0.060 % 95.869 ± 0.053 % 137 7.2797 ± 0.0517 0.00385 ± 0.00046 0.00906 ± 0.00037 2.931 ± 0.060 % 95.863 ± 0.053 % 138 7.2808 ± 0.0515 0.00388 ± 0.00046 0.00905 ± 0.00037 2.931 ± 0.059 % 95.860 ± 0.053 % 139 7.2788 ± 0.0513 0.00390 ± 0.00046 0.00902 ± 0.00036 2.928 ± 0.059 % 95.868 ± 0.053 % 140 7.2751 ± 0.0510 0.00386 ± 0.00046 0.00902 ± 0.00036 2.933 ± 0.059 % 95.872 ± 0.053 % 141 7.2876 ± 0.0510 0.00390 ± 0.00045 0.00899 ± 0.00036 2.928 ± 0.059 % 95.863 ± 0.052 % 142 7.3124 ± 0.0510 0.00388 ± 0.00045 0.00897 ± 0.00036 2.923 ± 0.058 % 95.863 ± 0.052 % 143 7.2672 ± 0.0505 0.00388 ± 0.00045 0.00893 ± 0.00035 2.917 ± 0.058 % 95.876 ± 0.052 % 144 7.2761 ± 0.0503 0.00391 ± 0.00045 0.00890 ± 0.00035 2.911 ± 0.058 % 95.877 ± 0.052 % 145 7.2803 ± 0.0502 0.00391 ± 0.00044 0.00889 ± 0.00035 2.909 ± 0.057 % 95.867 ± 0.052 % 146 7.2911 ± 0.0501 0.00394 ± 0.00044 0.00888 ± 0.00035 2.912 ± 0.058 % 95.860 ± 0.052 % 147 7.2954 ± 0.0500 0.00394 ± 0.00044 0.00886 ± 0.00035 2.908 ± 0.057 % 95.861 ± 0.051 % 148 7.3087 ± 0.0499 0.00395 ± 0.00044 0.00885 ± 0.00034 2.903 ± 0.057 % 95.856 ± 0.051 % 149 7.3135 ± 0.0498 0.00391 ± 0.00044 0.00883 ± 0.00034 2.900 ± 0.057 % 95.862 ± 0.051 % 150 7.2902 ± 0.0494 0.00410 ± 0.00044 0.00905 ± 0.00035 2.968 ± 0.059 % 95.864 ± 0.051 % 151 7.2887 ± 0.0492 0.00411 ± 0.00044 0.00902 ± 0.00034 2.963 ± 0.059 % 95.869 ± 0.051 % 152 7.2862 ± 0.0490 0.00412 ± 0.00043 0.00901 ± 0.00034 2.963 ± 0.058 % 95.869 ± 0.050 % 153 7.2870 ± 0.0489 0.00413 ± 0.00043 0.00900 ± 0.00034 2.964 ± 0.058 % 95.870 ± 0.050 % 154 7.2966 ± 0.0487 0.00414 ± 0.00043 0.00898 ± 0.00034 2.959 ± 0.058 % 95.866 ± 0.050 % 155 7.3176 ± 0.0487 0.00413 ± 0.00043 0.00896 ± 0.00034 2.954 ± 0.058 % 95.862 ± 0.050 % 156 7.3118 ± 0.0485 0.00410 ± 0.00043 0.00900 ± 0.00034 2.956 ± 0.057 % 95.853 ± 0.050 % 157 7.3073 ± 0.0483 0.00406 ± 0.00042 0.00899 ± 0.00034 2.953 ± 0.057 % 95.851 ± 0.050 % 158 7.3155 ± 0.0482 0.00404 ± 0.00042 0.00896 ± 0.00034 2.947 ± 0.057 % 95.851 ± 0.050 % 159 7.3247 ± 0.0481 0.00408 ± 0.00042 0.00894 ± 0.00033 2.944 ± 0.057 % 95.844 ± 0.049 % 160 7.3592 ± 0.0483 0.00408 ± 0.00042 0.00893 ± 0.00033 2.941 ± 0.056 % 95.838 ± 0.049 % 161 7.3757 ± 0.0482 0.00407 ± 0.00042 0.00890 ± 0.00033 2.936 ± 0.056 % 95.843 ± 0.049 % 162 7.3687 ± 0.0480 0.00408 ± 0.00041 0.00888 ± 0.00033 2.932 ± 0.056 % 95.846 ± 0.049 % 163 7.3626 ± 0.0478 0.00404 ± 0.00041 0.00888 ± 0.00033 2.940 ± 0.056 % 95.848 ± 0.049 % 164 7.2830 ± 0.0471 0.00402 ± 0.00041 0.00883 ± 0.00032 2.933 ± 0.056 % 95.865 ± 0.049 % 165 7.2998 ± 0.0471 0.00401 ± 0.00041 0.00882 ± 0.00032 2.930 ± 0.056 % 95.862 ± 0.048 % 166 7.3088 ± 0.0470 0.00403 ± 0.00041 0.00890 ± 0.00032 2.944 ± 0.056 % 95.858 ± 0.048 % 167 7.3256 ± 0.0470 0.00387 ± 0.00041 0.00893 ± 0.00032 2.949 ± 0.056 % 95.848 ± 0.048 % 168 7.3349 ± 0.0469 0.00381 ± 0.00041 0.00899 ± 0.00033 2.954 ± 0.057 % 95.843 ± 0.048 % 169 7.3364 ± 0.0468 0.00381 ± 0.00041 0.00897 ± 0.00033 2.951 ± 0.057 % 95.848 ± 0.048 % 170 7.3265 ± 0.0466 0.00366 ± 0.00041 0.00899 ± 0.00033 2.956 ± 0.056 % 95.847 ± 0.048 % 171 7.3120 ± 0.0463 0.00366 ± 0.00041 0.00898 ± 0.00033 2.957 ± 0.056 % 95.849 ± 0.048 % 172 7.3380 ± 0.0464 0.00366 ± 0.00041 0.00897 ± 0.00033 2.954 ± 0.056 % 95.844 ± 0.048 % 173 7.3506 ± 0.0464 0.00382 ± 0.00042 0.00939 ± 0.00034 3.022 ± 0.057 % 95.834 ± 0.047 % 174 7.3418 ± 0.0462 0.00380 ± 0.00042 0.00936 ± 0.00034 3.017 ± 0.057 % 95.829 ± 0.047 % 175 7.3568 ± 0.0461 0.00380 ± 0.00042 0.00935 ± 0.00034 3.013 ± 0.057 % 95.822 ± 0.047 % 176 7.3809 ± 0.0462 0.00381 ± 0.00042 0.00932 ± 0.00034 3.008 ± 0.057 % 95.816 ± 0.047 % 177 7.3772 ± 0.0460 0.00383 ± 0.00041 0.00931 ± 0.00033 3.009 ± 0.056 % 95.812 ± 0.047 % 178 7.3846 ± 0.0459 0.00379 ± 0.00041 0.00929 ± 0.00033 3.004 ± 0.056 % 95.808 ± 0.047 % 179 7.3194 ± 0.0453 0.00381 ± 0.00041 0.00926 ± 0.00033 2.999 ± 0.056 % 95.814 ± 0.047 % 180 7.3225 ± 0.0452 0.00382 ± 0.00041 0.00923 ± 0.00033 2.995 ± 0.056 % 95.815 ± 0.047 % 181 7.2985 ± 0.0449 0.00378 ± 0.00041 0.00921 ± 0.00033 2.994 ± 0.056 % 95.822 ± 0.047 % 182 7.3052 ± 0.0448 0.00379 ± 0.00041 0.00921 ± 0.00032 2.996 ± 0.056 % 95.820 ± 0.046 % 183 7.3050 ± 0.0447 0.00372 ± 0.00041 0.00929 ± 0.00033 3.002 ± 0.056 % 95.824 ± 0.046 % 184 7.2947 ± 0.0445 0.00375 ± 0.00040 0.00929 ± 0.00033 2.999 ± 0.055 % 95.826 ± 0.046 % 185 7.2974 ± 0.0444 0.00377 ± 0.00040 0.00928 ± 0.00033 2.996 ± 0.055 % 95.825 ± 0.046 % 186 7.3126 ± 0.0444 0.00372 ± 0.00040 0.00926 ± 0.00033 2.992 ± 0.055 % 95.828 ± 0.046 % 187 7.3036 ± 0.0442 0.00370 ± 0.00040 0.00928 ± 0.00032 2.999 ± 0.055 % 95.821 ± 0.046 % 188 7.3108 ± 0.0441 0.00369 ± 0.00040 0.00927 ± 0.00032 2.997 ± 0.055 % 95.818 ± 0.046 % 189 7.3258 ± 0.0441 0.00367 ± 0.00040 0.00926 ± 0.00032 2.994 ± 0.054 % 95.810 ± 0.046 % 190 7.3243 ± 0.0440 0.00365 ± 0.00039 0.00923 ± 0.00032 2.990 ± 0.054 % 95.814 ± 0.045 % 191 7.3432 ± 0.0440 0.00364 ± 0.00039 0.00921 ± 0.00032 2.986 ± 0.054 % 95.815 ± 0.045 % 192 7.3521 ± 0.0439 0.00363 ± 0.00039 0.00920 ± 0.00032 2.983 ± 0.054 % 95.816 ± 0.045 % 193 7.3344 ± 0.0437 0.00367 ± 0.00039 0.00921 ± 0.00032 2.989 ± 0.054 % 95.813 ± 0.045 % 194 7.3172 ± 0.0435 0.00372 ± 0.00039 0.00923 ± 0.00031 2.999 ± 0.054 % 95.814 ± 0.045 % 195 7.3360 ± 0.0435 0.00375 ± 0.00039 0.00922 ± 0.00031 2.995 ± 0.054 % 95.812 ± 0.045 % 196 7.3499 ± 0.0435 0.00375 ± 0.00039 0.00920 ± 0.00031 2.991 ± 0.054 % 95.812 ± 0.045 % 197 7.3809 ± 0.0436 0.00377 ± 0.00038 0.00918 ± 0.00031 2.986 ± 0.054 % 95.809 ± 0.045 % ====== Perplexity statistics ====== Mean PPL(Q) : 7.380869 ± 0.043587 Mean PPL(base) : 7.353122 ± 0.043360 Cor(ln(PPL(Q)), ln(PPL(base))): 99.79% Mean ln(PPL(Q)/PPL(base)) : 0.003766 ± 0.000385 Mean PPL(Q)/PPL(base) : 1.003774 ± 0.000386 Mean PPL(Q)-PPL(base) : 0.027747 ± 0.002842 ====== KL divergence statistics ====== Mean KLD: 0.009182 ± 0.000310 Maximum KLD: 23.352367 99.9% KLD: 0.643423 99.0% KLD: 0.057889 95.0% KLD: 0.019196 90.0% KLD: 0.012560 Median KLD: 0.003198 10.0% KLD: 0.000124 5.0% KLD: 0.000042 1.0% KLD: 0.000005 0.1% KLD: -0.000001 Minimum KLD: -0.000241 ====== Token probability statistics ====== Mean Δp: -0.051 ± 0.007 % Maximum Δp: 99.830% 99.9% Δp: 18.497% 99.0% Δp: 7.026% 95.0% Δp: 3.349% 90.0% Δp: 1.918% 75.0% Δp: 0.346% Median Δp: -0.001% 25.0% Δp: -0.444% 10.0% Δp: -2.087% 5.0% Δp: -3.550% 1.0% Δp: -7.285% 0.1% Δp: -19.715% Minimum Δp: -99.557% RMS Δp : 2.986 ± 0.054 % Same top p: 95.809 ± 0.045 % llama_perf_context_print: load time = 139854.36 ms llama_perf_context_print: prompt eval time = 1368556.93 ms / 403456 tokens ( 3.39 ms per token, 294.80 tokens per second) llama_perf_context_print: eval time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second) llama_perf_context_print: total time = 1405889.34 ms / 403457 tokens llama_perf_context_print: graphs reused = 196 llama_memory_breakdown_print: | memory breakdown [MiB] | total free self model context compute unaccounted | llama_memory_breakdown_print: | - CUDA0 (P100-PCIE-16GB) | 16269 = 2549 + (13223 = 12356 + 32 + 833) + 496 | llama_memory_breakdown_print: | - CUDA1 (P100-PCIE-16GB) | 16269 = 1677 + (13776 = 11694 + 110 + 1972) + 815 | llama_memory_breakdown_print: | - Host | 25579 = 25531 + 0 + 48 |