0.00.146.315 I log_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.146.318 I device_info:
0.00.232.216 I - CUDA0 : NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition (97244 MiB, 96677 MiB free)
0.00.232.226 I - CPU : AMD Ryzen Threadripper 9960X 24-Cores (257066 MiB, 257066 MiB free)
0.00.232.317 I system_info: n_threads = 24 (n_threads_batch = 24) / 48 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.00.232.396 I srv init: using 47 threads for HTTP server
0.00.232.602 I srv start: binding port with default address family
0.00.233.764 I srv llama_server: loading model
0.00.233.819 I srv load_model: loading model '/home/ripper/ornith-35b-lab/artifacts/quant/ornith-1.0-35b-IQ4_XS.gguf'
0.00.551.858 I srv load_model: [spec] estimated memory usage of draft model is 4143.45 MiB
0.00.551.892 I common_init_result: fitting params to device memory ...
0.00.551.893 I common_init_result: (for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on)
0.02.598.867 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.02.616.643 I common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable)
0.02.651.920 I srv load_model: loading draft model '/home/ripper/ornith-35b-lab/artifacts/mtp/ornith-1.0-35b-mtp-chaincorr-h2r10prefix500-h1r2-h3r8fw-lr5e6-Q6_K.gguf'
0.03.007.012 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.03.018.391 W llama_context: n_ctx_seq (8192) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
0.03.029.957 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables prompt cache; per-head MTP state is not prompt-cache serializable yet
0.03.029.961 W srv operator(): LLAMA_MTP_PER_HEAD_CONTEXT disables context checkpoints; per-head MTP state is not checkpoint-serializable yet
0.03.029.961 I srv operator(): [spec] created 2 MTP draft contexts, one per active head
0.03.029.975 I srv load_model: initializing slots, n_slots = 16
0.03.041.146 I common_context_can_seq_rm: the context supports bounded partial sequence removal
0.03.049.543 I common_speculative_impl_draft_mtp: adding speculative implementation 'draft-mtp'
0.03.049.547 I common_speculative_impl_draft_mtp: - n_max=2, n_min=0, p_min=0.00, n_embd=2048, backend_sampling=1
0.03.049.548 I common_speculative_impl_draft_mtp: - gpu_layers=99, cache_k=f16, cache_v=f16, ctx_tgt=yes, ctx_dft=yes, devices=[default]
0.03.049.676 I common_speculative_impl_draft_mtp: - draft sampler top_k=1 top_p=1.000 temp=1.000
0.03.049.703 I common_speculative_impl_draft_mtp: - fast backend MTP sampling enabled
0.03.049.709 I common_speculative_impl_draft_mtp: - per-head MTP contexts enabled (2 active heads)
0.03.049.715 I common_speculative_impl_draft_mtp: - backend draft sampler top_k=1 top_p=1.000 temp=1.000 contexts=2
0.03.070.992 I srv load_model: speculative decoding context initialized
0.03.070.996 I slot load_model: id 0 | task -1 | new slot, n_ctx = 8192
0.03.071.006 I slot load_model: id 1 | task -1 | new slot, n_ctx = 8192
0.03.071.006 I slot load_model: id 2 | task -1 | new slot, n_ctx = 8192
0.03.071.007 I slot load_model: id 3 | task -1 | new slot, n_ctx = 8192
0.03.071.007 I slot load_model: id 4 | task -1 | new slot, n_ctx = 8192
0.03.071.008 I slot load_model: id 5 | task -1 | new slot, n_ctx = 8192
0.03.071.008 I slot load_model: id 6 | task -1 | new slot, n_ctx = 8192
0.03.071.008 I slot load_model: id 7 | task -1 | new slot, n_ctx = 8192
0.03.071.008 I slot load_model: id 8 | task -1 | new slot, n_ctx = 8192
0.03.071.009 I slot load_model: id 9 | task -1 | new slot, n_ctx = 8192
0.03.071.009 I slot load_model: id 10 | task -1 | new slot, n_ctx = 8192
0.03.071.009 I slot load_model: id 11 | task -1 | new slot, n_ctx = 8192
0.03.071.009 I slot load_model: id 12 | task -1 | new slot, n_ctx = 8192
0.03.071.010 I slot load_model: id 13 | task -1 | new slot, n_ctx = 8192
0.03.071.011 I slot load_model: id 14 | task -1 | new slot, n_ctx = 8192
0.03.071.014 I slot load_model: id 15 | task -1 | new slot, n_ctx = 8192
0.03.071.060 I srv load_model: prompt cache is disabled - use `--cache-ram N` to enable it
0.03.071.062 I srv load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
0.03.071.062 I srv load_model: context checkpoints disabled
0.03.071.078 W srv init: --cache-idle-slots requires --cache-ram, disabling
0.03.079.756 I init: chat template, example_format: '<|im_start|>system
You are a helpful assistant<|im_end|>
<|im_start|>user
Hello<|im_end|>
<|im_start|>assistant
Hi there<|im_end|>
<|im_start|>user
How are you?<|im_end|>
<|im_start|>assistant
'
0.03.086.095 I srv init: init: chat template, thinking = 0
0.03.086.139 I srv llama_server: model loaded
0.03.086.143 I srv llama_server: server is listening on http://0.0.0.0:8022
0.03.086.150 I srv update_slots: all slots are idle
0.38.472.478 I srv operator(): Chat format: peg-native
0.38.472.485 I srv operator(): Chat format: peg-native
0.38.472.493 I srv operator(): Chat format: peg-native
0.38.472.496 I srv operator(): Chat format: peg-native
0.38.472.505 I srv operator(): Chat format: peg-native
0.38.472.509 I srv operator(): Chat format: peg-native
0.38.472.527 I srv operator(): Chat format: peg-native
0.38.472.625 I slot get_availabl: id 15 | task -1 | selected slot by LRU, t_last = -1
0.38.472.676 I slot launch_slot_: id 15 | task 3 | processing task, is_child = 0
0.38.472.678 I slot get_availabl: id 14 | task -1 | selected slot by LRU, t_last = -1
0.38.472.696 I slot launch_slot_: id 14 | task 5 | processing task, is_child = 0
0.38.472.698 I slot get_availabl: id 13 | task -1 | selected slot by LRU, t_last = -1
0.38.472.715 I slot launch_slot_: id 13 | task 2 | processing task, is_child = 0
0.38.472.717 I slot get_availabl: id 12 | task -1 | selected slot by LRU, t_last = -1
0.38.472.731 I slot launch_slot_: id 12 | task 0 | processing task, is_child = 0
0.38.472.733 I slot get_availabl: id 11 | task -1 | selected slot by LRU, t_last = -1
0.38.472.746 I slot launch_slot_: id 11 | task 4 | processing task, is_child = 0
0.38.472.748 I slot get_availabl: id 10 | task -1 | selected slot by LRU, t_last = -1
0.38.472.762 I slot launch_slot_: id 10 | task 1 | processing task, is_child = 0
0.38.472.764 I slot get_availabl: id 9 | task -1 | selected slot by LRU, t_last = -1
0.38.472.779 I slot launch_slot_: id 9 | task 6 | processing task, is_child = 0
0.38.472.821 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.472.894 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.472.934 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.472.937 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.472.952 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.472.980 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.473.380 I srv operator(): Chat format: peg-native
0.38.474.854 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.475.938 I srv operator(): Chat format: peg-native
0.38.476.503 I srv operator(): Chat format: peg-native
0.38.476.554 I srv operator(): Chat format: peg-native
0.38.477.545 I srv operator(): Chat format: peg-native
0.38.478.381 I srv operator(): Chat format: peg-native
0.38.478.406 I srv operator(): Chat format: peg-native
0.38.486.496 I srv operator(): Chat format: peg-native
0.38.486.815 I srv operator(): Chat format: peg-native
0.38.722.686 I slot get_availabl: id 8 | task -1 | selected slot by LRU, t_last = -1
0.38.722.748 I slot launch_slot_: id 8 | task 8 | processing task, is_child = 0
0.38.722.751 I slot get_availabl: id 7 | task -1 | selected slot by LRU, t_last = -1
0.38.722.766 I slot launch_slot_: id 7 | task 9 | processing task, is_child = 0
0.38.722.768 I slot get_availabl: id 6 | task -1 | selected slot by LRU, t_last = -1
0.38.722.783 I slot launch_slot_: id 6 | task 10 | processing task, is_child = 0
0.38.722.785 I slot get_availabl: id 5 | task -1 | selected slot by LRU, t_last = -1
0.38.722.798 I slot launch_slot_: id 5 | task 11 | processing task, is_child = 0
0.38.722.800 I slot get_availabl: id 4 | task -1 | selected slot by LRU, t_last = -1
0.38.722.815 I slot launch_slot_: id 4 | task 12 | processing task, is_child = 0
0.38.722.817 I slot get_availabl: id 3 | task -1 | selected slot by LRU, t_last = -1
0.38.722.834 I slot launch_slot_: id 3 | task 13 | processing task, is_child = 0
0.38.722.836 I slot get_availabl: id 2 | task -1 | selected slot by LRU, t_last = -1
0.38.722.849 I slot launch_slot_: id 2 | task 14 | processing task, is_child = 0
0.38.722.852 I slot get_availabl: id 1 | task -1 | selected slot by LRU, t_last = -1
0.38.722.864 I slot launch_slot_: id 1 | task 15 | processing task, is_child = 0
0.38.722.866 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = -1
0.38.722.879 I slot launch_slot_: id 0 | task 16 | processing task, is_child = 0
0.38.731.849 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.876 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.884 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.914 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.928 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.975 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.992 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.731.998 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.38.732.020 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.175.365 I slot print_timing: id 9 | task 6 | n_decoded = 102, tg = 22.89 t/s, tg_3s = 22.89 t/s
0.43.176.306 I slot print_timing: id 11 | task 4 | n_decoded = 102, tg = 22.89 t/s, tg_3s = 22.89 t/s
0.43.177.525 I slot print_timing: id 14 | task 5 | n_decoded = 102, tg = 22.89 t/s, tg_3s = 22.89 t/s
0.43.293.823 I slot print_timing: id 0 | task 16 | n_decoded = 102, tg = 23.63 t/s, tg_3s = 23.63 t/s
0.43.294.992 I slot print_timing: id 2 | task 14 | n_decoded = 102, tg = 23.63 t/s, tg_3s = 23.63 t/s
0.43.296.756 I slot print_timing: id 6 | task 10 | n_decoded = 102, tg = 23.64 t/s, tg_3s = 23.64 t/s
0.43.669.771 I slot print_timing: id 9 | task 6 | prompt eval time = 245.67 ms / 25 tokens ( 9.83 ms per token, 101.76 tokens per second)
0.43.669.773 I slot print_timing: id 9 | task 6 | eval time = 4951.27 ms / 114 tokens ( 43.43 ms per token, 23.02 tokens per second)
0.43.669.774 I slot print_timing: id 9 | task 6 | total time = 5196.94 ms / 139 tokens
0.43.669.779 I slot print_timing: id 9 | task 6 | graphs reused = 1
0.43.669.782 I slot print_timing: id 9 | task 6 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.669.801 I statistics draft-mtp: #calls(b,g,a) = 16 39 609, #gen drafts = 615, #acc drafts = 468, #gen tokens = 1230, #acc tokens = 889, #mean acc len = 2.46, #acc rate/pos = (0.768, 0.691), dur(b,g,a) = 0.011, 119.757, 0.688 ms
0.43.669.841 I slot release: id 9 | task 6 | stop processing: n_tokens = 138, truncated = 0
0.43.671.047 I slot print_timing: id 11 | task 4 | prompt eval time = 247.12 ms / 25 tokens ( 9.88 ms per token, 101.17 tokens per second)
0.43.671.049 I slot print_timing: id 11 | task 4 | eval time = 4951.02 ms / 114 tokens ( 43.43 ms per token, 23.03 tokens per second)
0.43.671.049 I slot print_timing: id 11 | task 4 | total time = 5198.14 ms / 139 tokens
0.43.671.050 I slot print_timing: id 11 | task 4 | graphs reused = 1
0.43.671.052 I slot print_timing: id 11 | task 4 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.671.058 I statistics draft-mtp: #calls(b,g,a) = 16 39 611, #gen drafts = 615, #acc drafts = 470, #gen tokens = 1230, #acc tokens = 893, #mean acc len = 2.46, #acc rate/pos = (0.769, 0.692), dur(b,g,a) = 0.011, 119.757, 0.690 ms
0.43.671.078 I slot release: id 11 | task 4 | stop processing: n_tokens = 138, truncated = 0
0.43.672.904 I slot print_timing: id 14 | task 5 | prompt eval time = 249.10 ms / 25 tokens ( 9.96 ms per token, 100.36 tokens per second)
0.43.672.905 I slot print_timing: id 14 | task 5 | eval time = 4950.83 ms / 114 tokens ( 43.43 ms per token, 23.03 tokens per second)
0.43.672.906 I slot print_timing: id 14 | task 5 | total time = 5199.92 ms / 139 tokens
0.43.672.906 I slot print_timing: id 14 | task 5 | graphs reused = 1
0.43.672.908 I slot print_timing: id 14 | task 5 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.672.916 I statistics draft-mtp: #calls(b,g,a) = 16 39 614, #gen drafts = 615, #acc drafts = 473, #gen tokens = 1230, #acc tokens = 899, #mean acc len = 2.46, #acc rate/pos = (0.770, 0.694), dur(b,g,a) = 0.011, 119.757, 0.693 ms
0.43.672.937 I slot release: id 14 | task 5 | stop processing: n_tokens = 138, truncated = 0
0.43.673.539 I slot print_timing: id 15 | task 3 | n_decoded = 101, tg = 20.40 t/s, tg_3s = 20.40 t/s
0.43.679.260 I srv operator(): Chat format: peg-native
0.43.679.506 I srv operator(): Chat format: peg-native
0.43.681.942 I srv operator(): Chat format: peg-native
0.43.773.277 I slot print_timing: id 0 | task 16 | prompt eval time = 245.81 ms / 25 tokens ( 9.83 ms per token, 101.70 tokens per second)
0.43.773.280 I slot print_timing: id 0 | task 16 | eval time = 4795.61 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.43.773.281 I slot print_timing: id 0 | task 16 | total time = 5041.42 ms / 139 tokens
0.43.773.282 I slot print_timing: id 0 | task 16 | graphs reused = 1
0.43.773.284 I slot print_timing: id 0 | task 16 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.773.297 I statistics draft-mtp: #calls(b,g,a) = 16 40 616, #gen drafts = 628, #acc drafts = 475, #gen tokens = 1256, #acc tokens = 903, #mean acc len = 2.47, #acc rate/pos = (0.771, 0.695), dur(b,g,a) = 0.011, 125.780, 0.696 ms
0.43.773.322 I slot release: id 0 | task 16 | stop processing: n_tokens = 138, truncated = 0
0.43.773.934 I slot print_timing: id 1 | task 15 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.43.774.542 I slot print_timing: id 2 | task 14 | prompt eval time = 247.12 ms / 25 tokens ( 9.88 ms per token, 101.17 tokens per second)
0.43.774.543 I slot print_timing: id 2 | task 14 | eval time = 4795.50 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.43.774.544 I slot print_timing: id 2 | task 14 | total time = 5042.62 ms / 139 tokens
0.43.774.544 I slot print_timing: id 2 | task 14 | graphs reused = 1
0.43.774.546 I slot print_timing: id 2 | task 14 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.774.551 I statistics draft-mtp: #calls(b,g,a) = 16 40 618, #gen drafts = 628, #acc drafts = 477, #gen tokens = 1256, #acc tokens = 907, #mean acc len = 2.47, #acc rate/pos = (0.772, 0.696), dur(b,g,a) = 0.011, 125.780, 0.698 ms
0.43.774.569 I slot release: id 2 | task 14 | stop processing: n_tokens = 138, truncated = 0
0.43.776.338 I slot print_timing: id 5 | task 11 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.43.776.928 I slot print_timing: id 6 | task 10 | prompt eval time = 249.53 ms / 25 tokens ( 9.98 ms per token, 100.19 tokens per second)
0.43.776.930 I slot print_timing: id 6 | task 10 | eval time = 4795.42 ms / 114 tokens ( 42.07 ms per token, 23.77 tokens per second)
0.43.776.931 I slot print_timing: id 6 | task 10 | total time = 5044.95 ms / 139 tokens
0.43.776.931 I slot print_timing: id 6 | task 10 | graphs reused = 1
0.43.776.933 I slot print_timing: id 6 | task 10 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.43.776.939 I statistics draft-mtp: #calls(b,g,a) = 16 40 622, #gen drafts = 628, #acc drafts = 481, #gen tokens = 1256, #acc tokens = 915, #mean acc len = 2.47, #acc rate/pos = (0.773, 0.698), dur(b,g,a) = 0.011, 125.780, 0.703 ms
0.43.776.957 I slot release: id 6 | task 10 | stop processing: n_tokens = 138, truncated = 0
0.43.777.563 I slot print_timing: id 7 | task 9 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.43.778.174 I slot print_timing: id 8 | task 8 | n_decoded = 101, tg = 21.06 t/s, tg_3s = 21.06 t/s
0.43.779.614 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.43.779.679 I slot launch_slot_: id 0 | task 57 | processing task, is_child = 0
0.43.779.681 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.43.779.699 I slot launch_slot_: id 2 | task 58 | processing task, is_child = 0
0.43.779.702 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.43.779.717 I slot launch_slot_: id 6 | task 59 | processing task, is_child = 0
0.43.783.054 I srv operator(): Chat format: peg-native
0.43.783.411 I srv operator(): Chat format: peg-native
0.43.785.066 I srv operator(): Chat format: peg-native
0.43.786.414 W slot operator(): id 0 | task 57 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.786.455 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.786.476 W slot operator(): id 2 | task 58 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.786.503 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.786.534 W slot operator(): id 6 | task 59 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.786.559 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.926.798 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.022
0.43.926.871 I slot launch_slot_: id 9 | task 61 | processing task, is_child = 0
0.43.926.873 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.43.926.890 I slot launch_slot_: id 11 | task 62 | processing task, is_child = 0
0.43.926.893 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.43.926.909 I slot launch_slot_: id 14 | task 63 | processing task, is_child = 0
0.43.932.250 W slot operator(): id 9 | task 61 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.932.278 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.932.306 W slot operator(): id 11 | task 62 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.932.341 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.43.932.357 W slot operator(): id 14 | task 63 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.43.932.384 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.44.827.478 I slot print_timing: id 15 | task 3 | prompt eval time = 249.70 ms / 28 tokens ( 8.92 ms per token, 112.14 tokens per second)
0.44.827.481 I slot print_timing: id 15 | task 3 | eval time = 6104.76 ms / 125 tokens ( 48.84 ms per token, 20.48 tokens per second)
0.44.827.482 I slot print_timing: id 15 | task 3 | total time = 6354.46 ms / 153 tokens
0.44.827.483 I slot print_timing: id 15 | task 3 | graphs reused = 1
0.44.827.486 I slot print_timing: id 15 | task 3 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.44.827.499 I statistics draft-mtp: #calls(b,g,a) = 22 48 747, #gen drafts = 747, #acc drafts = 562, #gen tokens = 1494, #acc tokens = 1068, #mean acc len = 2.43, #acc rate/pos = (0.752, 0.677), dur(b,g,a) = 0.014, 155.324, 0.854 ms
0.44.827.527 I slot release: id 15 | task 3 | stop processing: n_tokens = 152, truncated = 0
0.44.836.107 I srv operator(): Chat format: peg-native
0.44.937.338 I slot print_timing: id 1 | task 15 | prompt eval time = 246.41 ms / 28 tokens ( 8.80 ms per token, 113.63 tokens per second)
0.44.937.343 I slot print_timing: id 1 | task 15 | eval time = 5959.06 ms / 125 tokens ( 47.67 ms per token, 20.98 tokens per second)
0.44.937.344 I slot print_timing: id 1 | task 15 | total time = 6205.46 ms / 153 tokens
0.44.937.345 I slot print_timing: id 1 | task 15 | graphs reused = 1
0.44.937.348 I slot print_timing: id 1 | task 15 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.44.937.359 I statistics draft-mtp: #calls(b,g,a) = 22 49 749, #gen drafts = 762, #acc drafts = 563, #gen tokens = 1524, #acc tokens = 1070, #mean acc len = 2.43, #acc rate/pos = (0.752, 0.677), dur(b,g,a) = 0.014, 159.825, 0.857 ms
0.44.937.383 I slot release: id 1 | task 15 | stop processing: n_tokens = 152, truncated = 0
0.44.939.176 I slot print_timing: id 5 | task 11 | prompt eval time = 248.97 ms / 28 tokens ( 8.89 ms per token, 112.46 tokens per second)
0.44.939.178 I slot print_timing: id 5 | task 11 | eval time = 5958.24 ms / 125 tokens ( 47.67 ms per token, 20.98 tokens per second)
0.44.939.179 I slot print_timing: id 5 | task 11 | total time = 6207.21 ms / 153 tokens
0.44.939.179 I slot print_timing: id 5 | task 11 | graphs reused = 1
0.44.939.181 I slot print_timing: id 5 | task 11 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.44.939.187 I statistics draft-mtp: #calls(b,g,a) = 22 49 753, #gen drafts = 762, #acc drafts = 565, #gen tokens = 1524, #acc tokens = 1074, #mean acc len = 2.43, #acc rate/pos = (0.750, 0.676), dur(b,g,a) = 0.014, 159.825, 0.861 ms
0.44.939.205 I slot release: id 5 | task 11 | stop processing: n_tokens = 152, truncated = 0
0.44.940.412 I slot print_timing: id 7 | task 9 | prompt eval time = 250.11 ms / 28 tokens ( 8.93 ms per token, 111.95 tokens per second)
0.44.940.416 I slot print_timing: id 7 | task 9 | eval time = 5958.31 ms / 125 tokens ( 47.67 ms per token, 20.98 tokens per second)
0.44.940.417 I slot print_timing: id 7 | task 9 | total time = 6208.42 ms / 153 tokens
0.44.940.417 I slot print_timing: id 7 | task 9 | graphs reused = 1
0.44.940.419 I slot print_timing: id 7 | task 9 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.44.940.425 I statistics draft-mtp: #calls(b,g,a) = 22 49 755, #gen drafts = 762, #acc drafts = 567, #gen tokens = 1524, #acc tokens = 1078, #mean acc len = 2.43, #acc rate/pos = (0.751, 0.677), dur(b,g,a) = 0.014, 159.825, 0.863 ms
0.44.940.442 I slot release: id 7 | task 9 | stop processing: n_tokens = 152, truncated = 0
0.44.941.049 I slot print_timing: id 8 | task 8 | prompt eval time = 250.81 ms / 28 tokens ( 8.96 ms per token, 111.64 tokens per second)
0.44.941.052 I slot print_timing: id 8 | task 8 | eval time = 5958.22 ms / 125 tokens ( 47.67 ms per token, 20.98 tokens per second)
0.44.941.053 I slot print_timing: id 8 | task 8 | total time = 6209.03 ms / 153 tokens
0.44.941.053 I slot print_timing: id 8 | task 8 | graphs reused = 1
0.44.941.055 I slot print_timing: id 8 | task 8 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.44.941.059 I statistics draft-mtp: #calls(b,g,a) = 22 49 756, #gen drafts = 762, #acc drafts = 568, #gen tokens = 1524, #acc tokens = 1080, #mean acc len = 2.43, #acc rate/pos = (0.751, 0.677), dur(b,g,a) = 0.014, 159.825, 0.864 ms
0.44.941.074 I slot release: id 8 | task 8 | stop processing: n_tokens = 152, truncated = 0
0.44.943.744 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.44.943.813 I slot launch_slot_: id 1 | task 72 | processing task, is_child = 0
0.44.946.297 I srv operator(): Chat format: peg-native
0.44.947.321 I srv operator(): Chat format: peg-native
0.44.948.644 I srv operator(): Chat format: peg-native
0.44.949.386 W slot operator(): id 1 | task 72 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.44.949.409 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.44.950.092 I srv operator(): Chat format: peg-native
0.45.053.888 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.45.053.957 I slot launch_slot_: id 5 | task 74 | processing task, is_child = 0
0.45.053.960 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.020
0.45.053.980 I slot launch_slot_: id 7 | task 75 | processing task, is_child = 0
0.45.053.982 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.45.053.999 I slot launch_slot_: id 8 | task 76 | processing task, is_child = 0
0.45.054.001 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.45.054.017 I slot launch_slot_: id 15 | task 77 | processing task, is_child = 0
0.45.061.723 W slot operator(): id 5 | task 74 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.061.755 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.061.789 W slot operator(): id 7 | task 75 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.061.811 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.061.853 W slot operator(): id 8 | task 76 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.061.884 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.061.907 W slot operator(): id 15 | task 77 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.45.061.935 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.45.601.818 I slot print_timing: id 10 | task 1 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
0.45.603.057 I slot print_timing: id 12 | task 0 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
0.45.603.673 I slot print_timing: id 13 | task 2 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
0.45.720.740 I slot print_timing: id 3 | task 13 | n_decoded = 100, tg = 14.83 t/s, tg_3s = 14.83 t/s
0.45.721.348 I slot print_timing: id 4 | task 12 | n_decoded = 100, tg = 14.83 t/s, tg_3s = 14.83 t/s
0.47.539.764 I slot print_timing: id 10 | task 1 | prompt eval time = 246.42 ms / 29 tokens ( 8.50 ms per token, 117.69 tokens per second)
0.47.539.773 I slot print_timing: id 10 | task 1 | eval time = 8820.46 ms / 128 tokens ( 68.91 ms per token, 14.51 tokens per second)
0.47.539.773 I slot print_timing: id 10 | task 1 | total time = 9066.88 ms / 157 tokens
0.47.539.774 I slot print_timing: id 10 | task 1 | graphs reused = 1
0.47.539.778 I slot print_timing: id 10 | task 1 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.47.539.793 I statistics draft-mtp: #calls(b,g,a) = 27 70 1073, #gen drafts = 1086, #acc drafts = 779, #gen tokens = 2167, #acc tokens = 1467, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.641), dur(b,g,a) = 0.018, 231.753, 1.248 ms
0.47.539.829 I slot release: id 10 | task 1 | stop processing: n_tokens = 156, truncated = 0
0.47.540.035 I slot print_timing: id 12 | task 0 | prompt eval time = 247.78 ms / 29 tokens ( 8.54 ms per token, 117.04 tokens per second)
0.47.540.039 I slot print_timing: id 12 | task 0 | eval time = 8819.34 ms / 128 tokens ( 68.90 ms per token, 14.51 tokens per second)
0.47.540.039 I slot print_timing: id 12 | task 0 | total time = 9067.12 ms / 157 tokens
0.47.540.040 I slot print_timing: id 12 | task 0 | graphs reused = 1
0.47.540.041 I slot print_timing: id 12 | task 0 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.47.540.044 I statistics draft-mtp: #calls(b,g,a) = 27 70 1073, #gen drafts = 1086, #acc drafts = 779, #gen tokens = 2167, #acc tokens = 1467, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.641), dur(b,g,a) = 0.018, 231.753, 1.248 ms
0.47.540.065 I slot release: id 12 | task 0 | stop processing: n_tokens = 156, truncated = 0
0.47.540.274 I slot print_timing: id 13 | task 2 | prompt eval time = 248.48 ms / 29 tokens ( 8.57 ms per token, 116.71 tokens per second)
0.47.540.278 I slot print_timing: id 13 | task 2 | eval time = 8818.85 ms / 128 tokens ( 68.90 ms per token, 14.51 tokens per second)
0.47.540.278 I slot print_timing: id 13 | task 2 | total time = 9067.33 ms / 157 tokens
0.47.540.278 I slot print_timing: id 13 | task 2 | graphs reused = 1
0.47.540.279 I slot print_timing: id 13 | task 2 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.47.540.280 I statistics draft-mtp: #calls(b,g,a) = 27 70 1073, #gen drafts = 1086, #acc drafts = 779, #gen tokens = 2167, #acc tokens = 1467, #mean acc len = 2.37, #acc rate/pos = (0.726, 0.641), dur(b,g,a) = 0.018, 231.753, 1.248 ms
0.47.540.297 I slot release: id 13 | task 2 | stop processing: n_tokens = 156, truncated = 0
0.47.550.599 I srv operator(): Chat format: peg-native
0.47.550.606 I srv operator(): Chat format: peg-native
0.47.550.767 I srv operator(): Chat format: peg-native
0.47.640.022 I slot print_timing: id 3 | task 13 | prompt eval time = 247.69 ms / 29 tokens ( 8.54 ms per token, 117.08 tokens per second)
0.47.640.030 I slot print_timing: id 3 | task 13 | eval time = 8660.41 ms / 128 tokens ( 67.66 ms per token, 14.78 tokens per second)
0.47.640.031 I slot print_timing: id 3 | task 13 | total time = 8908.10 ms / 157 tokens
0.47.640.031 I slot print_timing: id 3 | task 13 | graphs reused = 1
0.47.640.034 I slot print_timing: id 3 | task 13 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.47.640.046 I statistics draft-mtp: #calls(b,g,a) = 27 71 1086, #gen drafts = 1097, #acc drafts = 787, #gen tokens = 2189, #acc tokens = 1481, #mean acc len = 2.36, #acc rate/pos = (0.725, 0.639), dur(b,g,a) = 0.018, 237.309, 1.267 ms
0.47.640.074 I slot release: id 3 | task 13 | stop processing: n_tokens = 156, truncated = 0
0.47.640.290 I slot print_timing: id 4 | task 12 | prompt eval time = 248.26 ms / 29 tokens ( 8.56 ms per token, 116.81 tokens per second)
0.47.640.292 I slot print_timing: id 4 | task 12 | eval time = 8660.10 ms / 128 tokens ( 67.66 ms per token, 14.78 tokens per second)
0.47.640.293 I slot print_timing: id 4 | task 12 | total time = 8908.36 ms / 157 tokens
0.47.640.293 I slot print_timing: id 4 | task 12 | graphs reused = 1
0.47.640.295 I slot print_timing: id 4 | task 12 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.464, 0.362)
0.47.640.298 I statistics draft-mtp: #calls(b,g,a) = 27 71 1086, #gen drafts = 1097, #acc drafts = 787, #gen tokens = 2189, #acc tokens = 1481, #mean acc len = 2.36, #acc rate/pos = (0.725, 0.639), dur(b,g,a) = 0.018, 237.309, 1.267 ms
0.47.640.316 I slot release: id 4 | task 12 | stop processing: n_tokens = 156, truncated = 0
0.47.646.418 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.47.646.487 I slot launch_slot_: id 3 | task 100 | processing task, is_child = 0
0.47.646.490 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.47.646.507 I slot launch_slot_: id 4 | task 99 | processing task, is_child = 0
0.47.646.509 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.47.646.524 I slot launch_slot_: id 10 | task 101 | processing task, is_child = 0
0.47.650.187 I srv operator(): Chat format: peg-native
0.47.650.242 I srv operator(): Chat format: peg-native
0.47.652.106 W slot operator(): id 3 | task 100 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.652.136 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.652.179 W slot operator(): id 4 | task 99 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.652.216 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.652.244 W slot operator(): id 10 | task 101 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.652.265 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.798.158 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.47.798.225 I slot launch_slot_: id 12 | task 103 | processing task, is_child = 0
0.47.798.228 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.47.798.246 I slot launch_slot_: id 13 | task 104 | processing task, is_child = 0
0.47.802.183 W slot operator(): id 12 | task 103 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.802.221 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.47.802.238 W slot operator(): id 13 | task 104 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.47.802.262 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.48.311.780 I slot print_timing: id 6 | task 59 | n_decoded = 102, tg = 23.24 t/s, tg_3s = 23.24 t/s
0.48.438.355 I slot print_timing: id 14 | task 63 | n_decoded = 102, tg = 23.43 t/s, tg_3s = 23.43 t/s
0.48.801.311 I slot print_timing: id 2 | task 58 | n_decoded = 101, tg = 20.70 t/s, tg_3s = 20.70 t/s
0.48.803.131 I slot print_timing: id 6 | task 59 | prompt eval time = 135.85 ms / 25 tokens ( 5.43 ms per token, 184.02 tokens per second)
0.48.803.134 I slot print_timing: id 6 | task 59 | eval time = 4880.69 ms / 114 tokens ( 42.81 ms per token, 23.36 tokens per second)
0.48.803.134 I slot print_timing: id 6 | task 59 | total time = 5016.54 ms / 139 tokens
0.48.803.135 I slot print_timing: id 6 | task 59 | graphs reused = 1
0.48.803.138 I slot print_timing: id 6 | task 59 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.48.803.150 I statistics draft-mtp: #calls(b,g,a) = 32 80 1225, #gen drafts = 1234, #acc drafts = 890, #gen tokens = 2463, #acc tokens = 1680, #mean acc len = 2.37, #acc rate/pos = (0.727, 0.645), dur(b,g,a) = 0.020, 267.957, 1.456 ms
0.48.803.177 I slot release: id 6 | task 59 | stop processing: n_tokens = 138, truncated = 0
0.48.812.042 I srv operator(): Chat format: peg-native
0.48.923.928 I slot print_timing: id 11 | task 62 | n_decoded = 101, tg = 20.87 t/s, tg_3s = 20.87 t/s
0.48.925.446 I slot print_timing: id 14 | task 63 | prompt eval time = 152.65 ms / 25 tokens ( 6.11 ms per token, 163.77 tokens per second)
0.48.925.448 I slot print_timing: id 14 | task 63 | eval time = 4840.40 ms / 114 tokens ( 42.46 ms per token, 23.55 tokens per second)
0.48.925.449 I slot print_timing: id 14 | task 63 | total time = 4993.05 ms / 139 tokens
0.48.925.450 I slot print_timing: id 14 | task 63 | graphs reused = 1
0.48.925.453 I slot print_timing: id 14 | task 63 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.48.925.465 I statistics draft-mtp: #calls(b,g,a) = 32 81 1248, #gen drafts = 1249, #acc drafts = 907, #gen tokens = 2493, #acc tokens = 1713, #mean acc len = 2.37, #acc rate/pos = (0.727, 0.646), dur(b,g,a) = 0.020, 272.511, 1.487 ms
0.48.925.489 I slot release: id 14 | task 63 | stop processing: n_tokens = 138, truncated = 0
0.48.926.136 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.48.926.202 I slot launch_slot_: id 6 | task 114 | processing task, is_child = 0
0.48.932.280 W slot operator(): id 6 | task 114 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.48.932.313 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.48.934.587 I srv operator(): Chat format: peg-native
0.49.058.546 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.49.058.613 I slot launch_slot_: id 14 | task 116 | processing task, is_child = 0
0.49.062.636 W slot operator(): id 14 | task 116 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.49.062.678 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.49.558.797 I slot print_timing: id 7 | task 75 | n_decoded = 102, tg = 23.56 t/s, tg_3s = 23.56 t/s
0.49.924.024 I slot print_timing: id 2 | task 58 | prompt eval time = 135.08 ms / 28 tokens ( 4.82 ms per token, 207.29 tokens per second)
0.49.924.027 I slot print_timing: id 2 | task 58 | eval time = 6002.41 ms / 125 tokens ( 48.02 ms per token, 20.82 tokens per second)
0.49.924.027 I slot print_timing: id 2 | task 58 | total time = 6137.49 ms / 153 tokens
0.49.924.028 I slot print_timing: id 2 | task 58 | graphs reused = 1
0.49.924.031 I slot print_timing: id 2 | task 58 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.49.924.044 I statistics draft-mtp: #calls(b,g,a) = 34 89 1361, #gen drafts = 1374, #acc drafts = 986, #gen tokens = 2743, #acc tokens = 1864, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.645), dur(b,g,a) = 0.022, 300.852, 1.622 ms
0.49.924.066 I slot release: id 2 | task 58 | stop processing: n_tokens = 152, truncated = 0
0.49.932.979 I srv operator(): Chat format: peg-native
0.50.044.399 I slot print_timing: id 5 | task 74 | n_decoded = 101, tg = 20.97 t/s, tg_3s = 20.97 t/s
0.50.045.601 I slot print_timing: id 7 | task 75 | prompt eval time = 166.79 ms / 25 tokens ( 6.67 ms per token, 149.89 tokens per second)
0.50.045.603 I slot print_timing: id 7 | task 75 | eval time = 4816.98 ms / 114 tokens ( 42.25 ms per token, 23.67 tokens per second)
0.50.045.603 I slot print_timing: id 7 | task 75 | total time = 4983.77 ms / 139 tokens
0.50.045.604 I slot print_timing: id 7 | task 75 | graphs reused = 1
0.50.045.607 I slot print_timing: id 7 | task 75 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.50.045.620 I statistics draft-mtp: #calls(b,g,a) = 34 90 1381, #gen drafts = 1389, #acc drafts = 1000, #gen tokens = 2773, #acc tokens = 1892, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.646), dur(b,g,a) = 0.022, 306.211, 1.646 ms
0.50.045.654 I slot release: id 7 | task 75 | stop processing: n_tokens = 138, truncated = 0
0.50.047.800 I slot print_timing: id 11 | task 62 | prompt eval time = 152.44 ms / 28 tokens ( 5.44 ms per token, 183.67 tokens per second)
0.50.047.802 I slot print_timing: id 11 | task 62 | eval time = 5963.01 ms / 125 tokens ( 47.70 ms per token, 20.96 tokens per second)
0.50.047.803 I slot print_timing: id 11 | task 62 | total time = 6115.45 ms / 153 tokens
0.50.047.803 I slot print_timing: id 11 | task 62 | graphs reused = 1
0.50.047.805 I slot print_timing: id 11 | task 62 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.50.047.811 I statistics draft-mtp: #calls(b,g,a) = 34 90 1385, #gen drafts = 1389, #acc drafts = 1003, #gen tokens = 2773, #acc tokens = 1898, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.646), dur(b,g,a) = 0.022, 306.211, 1.650 ms
0.50.047.837 I slot release: id 11 | task 62 | stop processing: n_tokens = 152, truncated = 0
0.50.050.043 I slot print_timing: id 15 | task 77 | n_decoded = 101, tg = 20.95 t/s, tg_3s = 20.95 t/s
0.50.050.052 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.50.050.130 I slot launch_slot_: id 2 | task 125 | processing task, is_child = 0
0.50.054.041 I srv operator(): Chat format: peg-native
0.50.056.388 W slot operator(): id 2 | task 125 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.50.056.417 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.057.213 I srv operator(): Chat format: peg-native
0.50.176.749 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.50.176.835 I slot launch_slot_: id 11 | task 127 | processing task, is_child = 0
0.50.176.840 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.50.176.862 I slot launch_slot_: id 7 | task 128 | processing task, is_child = 0
0.50.182.585 W slot operator(): id 7 | task 128 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.50.182.606 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.182.647 W slot operator(): id 11 | task 127 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.50.182.686 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.50.565.849 I slot print_timing: id 0 | task 57 | n_decoded = 100, tg = 15.05 t/s, tg_3s = 15.05 t/s
0.50.692.662 I slot print_timing: id 9 | task 61 | n_decoded = 100, tg = 15.13 t/s, tg_3s = 15.13 t/s
0.51.181.446 I slot print_timing: id 5 | task 74 | prompt eval time = 166.03 ms / 28 tokens ( 5.93 ms per token, 168.65 tokens per second)
0.51.181.449 I slot print_timing: id 5 | task 74 | eval time = 5953.65 ms / 125 tokens ( 47.63 ms per token, 21.00 tokens per second)
0.51.181.450 I slot print_timing: id 5 | task 74 | total time = 6119.67 ms / 153 tokens
0.51.181.450 I slot print_timing: id 5 | task 74 | graphs reused = 1
0.51.181.453 I slot print_timing: id 5 | task 74 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.51.181.465 I statistics draft-mtp: #calls(b,g,a) = 37 99 1518, #gen drafts = 1528, #acc drafts = 1099, #gen tokens = 3051, #acc tokens = 2076, #mean acc len = 2.37, #acc rate/pos = (0.724, 0.644), dur(b,g,a) = 0.024, 339.468, 1.823 ms
0.51.181.489 I slot release: id 5 | task 74 | stop processing: n_tokens = 152, truncated = 0
0.51.186.324 I slot print_timing: id 15 | task 77 | prompt eval time = 167.94 ms / 28 tokens ( 6.00 ms per token, 166.73 tokens per second)
0.51.186.327 I slot print_timing: id 15 | task 77 | eval time = 5956.45 ms / 125 tokens ( 47.65 ms per token, 20.99 tokens per second)
0.51.186.328 I slot print_timing: id 15 | task 77 | total time = 6124.38 ms / 153 tokens
0.51.186.329 I slot print_timing: id 15 | task 77 | graphs reused = 1
0.51.186.331 I slot print_timing: id 15 | task 77 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.51.186.339 I statistics draft-mtp: #calls(b,g,a) = 37 99 1528, #gen drafts = 1528, #acc drafts = 1105, #gen tokens = 3051, #acc tokens = 2088, #mean acc len = 2.37, #acc rate/pos = (0.723, 0.643), dur(b,g,a) = 0.024, 339.468, 1.835 ms
0.51.186.362 I slot release: id 15 | task 77 | stop processing: n_tokens = 152, truncated = 0
0.51.190.198 I srv operator(): Chat format: peg-native
0.51.194.371 I srv operator(): Chat format: peg-native
0.51.295.667 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.51.295.735 I slot launch_slot_: id 5 | task 138 | processing task, is_child = 0
0.51.295.739 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.51.295.756 I slot launch_slot_: id 15 | task 139 | processing task, is_child = 0
0.51.300.503 W slot operator(): id 5 | task 138 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.300.521 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.300.564 W slot operator(): id 15 | task 139 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.51.300.587 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.51.685.080 I slot print_timing: id 1 | task 72 | n_decoded = 100, tg = 15.07 t/s, tg_3s = 15.07 t/s
0.51.811.128 I slot print_timing: id 8 | task 76 | n_decoded = 100, tg = 15.19 t/s, tg_3s = 15.19 t/s
0.52.175.292 I slot print_timing: id 4 | task 99 | n_decoded = 102, tg = 23.26 t/s, tg_3s = 23.26 t/s
0.52.302.900 I slot print_timing: id 13 | task 104 | n_decoded = 102, tg = 23.38 t/s, tg_3s = 23.38 t/s
0.52.663.954 I slot print_timing: id 0 | task 57 | prompt eval time = 134.30 ms / 29 tokens ( 4.63 ms per token, 215.93 tokens per second)
0.52.663.958 I slot print_timing: id 0 | task 57 | eval time = 8743.20 ms / 128 tokens ( 68.31 ms per token, 14.64 tokens per second)
0.52.663.959 I slot print_timing: id 0 | task 57 | total time = 8877.51 ms / 157 tokens
0.52.663.960 I slot print_timing: id 0 | task 57 | graphs reused = 1
0.52.663.964 I slot print_timing: id 0 | task 57 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.52.663.979 I statistics draft-mtp: #calls(b,g,a) = 39 111 1700, #gen drafts = 1715, #acc drafts = 1218, #gen tokens = 3423, #acc tokens = 2302, #mean acc len = 2.35, #acc rate/pos = (0.716, 0.638), dur(b,g,a) = 0.025, 378.863, 2.036 ms
0.52.664.007 I slot release: id 0 | task 57 | stop processing: n_tokens = 156, truncated = 0
0.52.666.405 I slot print_timing: id 4 | task 99 | prompt eval time = 138.79 ms / 25 tokens ( 5.55 ms per token, 180.13 tokens per second)
0.52.666.408 I slot print_timing: id 4 | task 99 | eval time = 4875.41 ms / 114 tokens ( 42.77 ms per token, 23.38 tokens per second)
0.52.666.408 I slot print_timing: id 4 | task 99 | total time = 5014.20 ms / 139 tokens
0.52.666.409 I slot print_timing: id 4 | task 99 | graphs reused = 1
0.52.666.412 I slot print_timing: id 4 | task 99 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.52.666.417 I statistics draft-mtp: #calls(b,g,a) = 39 111 1704, #gen drafts = 1715, #acc drafts = 1222, #gen tokens = 3423, #acc tokens = 2309, #mean acc len = 2.36, #acc rate/pos = (0.717, 0.638), dur(b,g,a) = 0.025, 378.863, 2.041 ms
0.52.666.436 I slot release: id 4 | task 99 | stop processing: n_tokens = 138, truncated = 0
0.52.669.313 I slot print_timing: id 10 | task 101 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.70 t/s
0.52.673.062 I srv operator(): Chat format: peg-native
0.52.674.712 I srv operator(): Chat format: peg-native
0.52.777.726 I slot print_timing: id 9 | task 61 | prompt eval time = 152.23 ms / 29 tokens ( 5.25 ms per token, 190.50 tokens per second)
0.52.777.730 I slot print_timing: id 9 | task 61 | eval time = 8693.21 ms / 128 tokens ( 67.92 ms per token, 14.72 tokens per second)
0.52.777.731 I slot print_timing: id 9 | task 61 | total time = 8845.44 ms / 157 tokens
0.52.777.732 I slot print_timing: id 9 | task 61 | graphs reused = 1
0.52.777.736 I slot print_timing: id 9 | task 61 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.52.777.754 I statistics draft-mtp: #calls(b,g,a) = 39 112 1715, #gen drafts = 1728, #acc drafts = 1229, #gen tokens = 3449, #acc tokens = 2323, #mean acc len = 2.35, #acc rate/pos = (0.717, 0.638), dur(b,g,a) = 0.025, 384.363, 2.053 ms
0.52.777.779 I slot release: id 9 | task 61 | stop processing: n_tokens = 156, truncated = 0
0.52.784.564 I slot print_timing: id 13 | task 104 | prompt eval time = 138.81 ms / 25 tokens ( 5.55 ms per token, 180.10 tokens per second)
0.52.784.567 I slot print_timing: id 13 | task 104 | eval time = 4843.49 ms / 114 tokens ( 42.49 ms per token, 23.54 tokens per second)
0.52.784.567 I slot print_timing: id 13 | task 104 | total time = 4982.30 ms / 139 tokens
0.52.784.568 I slot print_timing: id 13 | task 104 | graphs reused = 1
0.52.784.571 I slot print_timing: id 13 | task 104 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.52.784.579 I statistics draft-mtp: #calls(b,g,a) = 39 112 1726, #gen drafts = 1728, #acc drafts = 1240, #gen tokens = 3449, #acc tokens = 2344, #mean acc len = 2.36, #acc rate/pos = (0.718, 0.640), dur(b,g,a) = 0.025, 384.363, 2.068 ms
0.52.784.600 I slot release: id 13 | task 104 | stop processing: n_tokens = 138, truncated = 0
0.52.785.686 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.52.785.752 I slot launch_slot_: id 4 | task 152 | processing task, is_child = 0
0.52.785.755 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.52.785.773 I slot launch_slot_: id 0 | task 153 | processing task, is_child = 0
0.52.787.125 I srv operator(): Chat format: peg-native
0.52.791.692 W slot operator(): id 0 | task 153 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.791.728 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.791.761 W slot operator(): id 4 | task 152 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.791.778 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.793.408 I srv operator(): Chat format: peg-native
0.52.924.567 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.52.924.648 I slot launch_slot_: id 9 | task 155 | processing task, is_child = 0
0.52.924.652 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.52.924.672 I slot launch_slot_: id 13 | task 156 | processing task, is_child = 0
0.52.929.652 W slot operator(): id 9 | task 155 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.929.686 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.52.929.725 W slot operator(): id 13 | task 156 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.52.929.761 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.562.752 I slot print_timing: id 14 | task 116 | n_decoded = 102, tg = 23.32 t/s, tg_3s = 23.31 t/s
0.53.799.721 I slot print_timing: id 1 | task 72 | prompt eval time = 98.79 ms / 29 tokens ( 3.41 ms per token, 293.56 tokens per second)
0.53.799.725 I slot print_timing: id 1 | task 72 | eval time = 8751.52 ms / 128 tokens ( 68.37 ms per token, 14.63 tokens per second)
0.53.799.725 I slot print_timing: id 1 | task 72 | total time = 8850.31 ms / 157 tokens
0.53.799.726 I slot print_timing: id 1 | task 72 | graphs reused = 1
0.53.799.729 I slot print_timing: id 1 | task 72 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.53.799.742 I statistics draft-mtp: #calls(b,g,a) = 43 120 1834, #gen drafts = 1849, #acc drafts = 1310, #gen tokens = 3689, #acc tokens = 2477, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.636), dur(b,g,a) = 0.027, 414.250, 2.208 ms
0.53.799.768 I slot release: id 1 | task 72 | stop processing: n_tokens = 156, truncated = 0
0.53.805.080 I slot print_timing: id 10 | task 101 | prompt eval time = 138.99 ms / 28 tokens ( 4.96 ms per token, 201.45 tokens per second)
0.53.805.083 I slot print_timing: id 10 | task 101 | eval time = 6013.80 ms / 125 tokens ( 48.11 ms per token, 20.79 tokens per second)
0.53.805.083 I slot print_timing: id 10 | task 101 | total time = 6152.79 ms / 153 tokens
0.53.805.084 I slot print_timing: id 10 | task 101 | graphs reused = 1
0.53.805.086 I slot print_timing: id 10 | task 101 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.53.805.094 I statistics draft-mtp: #calls(b,g,a) = 43 120 1844, #gen drafts = 1849, #acc drafts = 1317, #gen tokens = 3689, #acc tokens = 2491, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.637), dur(b,g,a) = 0.027, 414.250, 2.221 ms
0.53.805.113 I slot release: id 10 | task 101 | stop processing: n_tokens = 152, truncated = 0
0.53.809.267 I srv operator(): Chat format: peg-native
0.53.813.781 I srv operator(): Chat format: peg-native
0.53.911.811 I slot print_timing: id 8 | task 76 | prompt eval time = 167.37 ms / 29 tokens ( 5.77 ms per token, 173.27 tokens per second)
0.53.911.814 I slot print_timing: id 8 | task 76 | eval time = 8682.55 ms / 128 tokens ( 67.83 ms per token, 14.74 tokens per second)
0.53.911.815 I slot print_timing: id 8 | task 76 | total time = 8849.92 ms / 157 tokens
0.53.911.816 I slot print_timing: id 8 | task 76 | graphs reused = 1
0.53.911.819 I slot print_timing: id 8 | task 76 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.53.911.838 I statistics draft-mtp: #calls(b,g,a) = 43 121 1849, #gen drafts = 1862, #acc drafts = 1321, #gen tokens = 3715, #acc tokens = 2499, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.637), dur(b,g,a) = 0.027, 420.410, 2.226 ms
0.53.911.864 I slot release: id 8 | task 76 | stop processing: n_tokens = 156, truncated = 0
0.53.914.888 I slot print_timing: id 6 | task 114 | n_decoded = 101, tg = 20.77 t/s, tg_3s = 20.77 t/s
0.53.918.633 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.53.918.699 I slot launch_slot_: id 1 | task 165 | processing task, is_child = 0
0.53.918.702 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.53.918.720 I slot launch_slot_: id 10 | task 166 | processing task, is_child = 0
0.53.921.106 I srv operator(): Chat format: peg-native
0.53.924.887 W slot operator(): id 1 | task 165 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.53.924.910 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.53.924.958 W slot operator(): id 10 | task 166 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.53.924.983 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.064.506 I slot print_timing: id 14 | task 116 | prompt eval time = 125.23 ms / 25 tokens ( 5.01 ms per token, 199.63 tokens per second)
0.54.064.509 I slot print_timing: id 14 | task 116 | eval time = 4876.61 ms / 114 tokens ( 42.78 ms per token, 23.38 tokens per second)
0.54.064.510 I slot print_timing: id 14 | task 116 | total time = 5001.84 ms / 139 tokens
0.54.064.512 I slot print_timing: id 14 | task 116 | graphs reused = 1
0.54.064.514 I slot print_timing: id 14 | task 116 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.54.064.525 I statistics draft-mtp: #calls(b,g,a) = 45 122 1874, #gen drafts = 1875, #acc drafts = 1339, #gen tokens = 3741, #acc tokens = 2534, #mean acc len = 2.35, #acc rate/pos = (0.715, 0.638), dur(b,g,a) = 0.029, 426.495, 2.260 ms
0.54.064.549 I slot release: id 14 | task 116 | stop processing: n_tokens = 138, truncated = 0
0.54.065.207 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.54.065.273 I slot launch_slot_: id 14 | task 168 | processing task, is_child = 0
0.54.070.968 W slot operator(): id 14 | task 168 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.071.001 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.072.895 I srv operator(): Chat format: peg-native
0.54.196.972 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.54.197.039 I slot launch_slot_: id 8 | task 170 | processing task, is_child = 0
0.54.202.212 W slot operator(): id 8 | task 170 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.54.202.229 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.54.697.979 I slot print_timing: id 3 | task 100 | n_decoded = 100, tg = 14.48 t/s, tg_3s = 14.48 t/s
0.54.700.087 I slot print_timing: id 7 | task 128 | n_decoded = 102, tg = 23.29 t/s, tg_3s = 23.29 t/s
0.54.824.664 I slot print_timing: id 12 | task 103 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
0.55.067.320 I slot print_timing: id 6 | task 114 | prompt eval time = 119.09 ms / 28 tokens ( 4.25 ms per token, 235.11 tokens per second)
0.55.067.323 I slot print_timing: id 6 | task 114 | eval time = 6015.91 ms / 125 tokens ( 48.13 ms per token, 20.78 tokens per second)
0.55.067.323 I slot print_timing: id 6 | task 114 | total time = 6135.00 ms / 153 tokens
0.55.067.324 I slot print_timing: id 6 | task 114 | graphs reused = 1
0.55.067.327 I slot print_timing: id 6 | task 114 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.55.067.338 I statistics draft-mtp: #calls(b,g,a) = 47 130 1991, #gen drafts = 2000, #acc drafts = 1425, #gen tokens = 3991, #acc tokens = 2695, #mean acc len = 2.35, #acc rate/pos = (0.716, 0.638), dur(b,g,a) = 0.031, 455.413, 2.407 ms
0.55.067.364 I slot release: id 6 | task 114 | stop processing: n_tokens = 152, truncated = 0
0.55.076.193 I srv operator(): Chat format: peg-native
0.55.184.948 I slot print_timing: id 7 | task 128 | prompt eval time = 138.83 ms / 25 tokens ( 5.55 ms per token, 180.08 tokens per second)
0.55.184.952 I slot print_timing: id 7 | task 128 | eval time = 4863.48 ms / 114 tokens ( 42.66 ms per token, 23.44 tokens per second)
0.55.184.952 I slot print_timing: id 7 | task 128 | total time = 5002.31 ms / 139 tokens
0.55.184.953 I slot print_timing: id 7 | task 128 | graphs reused = 1
0.55.184.956 I slot print_timing: id 7 | task 128 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.55.184.966 I statistics draft-mtp: #calls(b,g,a) = 47 131 2007, #gen drafts = 2015, #acc drafts = 1434, #gen tokens = 4021, #acc tokens = 2713, #mean acc len = 2.35, #acc rate/pos = (0.714, 0.637), dur(b,g,a) = 0.031, 459.910, 2.425 ms
0.55.184.991 I slot release: id 7 | task 128 | stop processing: n_tokens = 138, truncated = 0
0.55.186.990 I slot print_timing: id 11 | task 127 | n_decoded = 101, tg = 20.76 t/s, tg_3s = 20.76 t/s
0.55.189.408 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.55.189.478 I slot launch_slot_: id 6 | task 179 | processing task, is_child = 0
0.55.193.733 I srv operator(): Chat format: peg-native
0.55.194.863 W slot operator(): id 6 | task 179 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.194.898 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.55.320.995 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.55.321.064 I slot launch_slot_: id 7 | task 181 | processing task, is_child = 0
0.55.326.250 W slot operator(): id 7 | task 181 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.55.326.275 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.312.625 I slot print_timing: id 11 | task 127 | prompt eval time = 139.05 ms / 28 tokens ( 4.97 ms per token, 201.37 tokens per second)
0.56.312.628 I slot print_timing: id 11 | task 127 | eval time = 5990.89 ms / 125 tokens ( 47.93 ms per token, 20.87 tokens per second)
0.56.312.628 I slot print_timing: id 11 | task 127 | total time = 6129.94 ms / 153 tokens
0.56.312.629 I slot print_timing: id 11 | task 127 | graphs reused = 1
0.56.312.632 I slot print_timing: id 11 | task 127 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.56.312.643 I statistics draft-mtp: #calls(b,g,a) = 49 140 2152, #gen drafts = 2156, #acc drafts = 1533, #gen tokens = 4303, #acc tokens = 2901, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.636), dur(b,g,a) = 0.033, 491.832, 2.597 ms
0.56.312.667 I slot release: id 11 | task 127 | stop processing: n_tokens = 152, truncated = 0
0.56.314.814 I slot print_timing: id 15 | task 139 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
0.56.321.162 I srv operator(): Chat format: peg-native
0.56.432.250 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.56.432.320 I slot launch_slot_: id 11 | task 191 | processing task, is_child = 0
0.56.437.334 W slot operator(): id 11 | task 191 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.437.369 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.56.807.598 I slot print_timing: id 3 | task 100 | prompt eval time = 138.57 ms / 29 tokens ( 4.78 ms per token, 209.28 tokens per second)
0.56.807.602 I slot print_timing: id 3 | task 100 | eval time = 9016.89 ms / 128 tokens ( 70.44 ms per token, 14.20 tokens per second)
0.56.807.603 I slot print_timing: id 3 | task 100 | total time = 9155.46 ms / 157 tokens
0.56.807.604 I slot print_timing: id 3 | task 100 | graphs reused = 1
0.56.807.607 I slot print_timing: id 3 | task 100 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.56.807.620 I statistics draft-mtp: #calls(b,g,a) = 50 144 2202, #gen drafts = 2217, #acc drafts = 1566, #gen tokens = 4423, #acc tokens = 2963, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.634), dur(b,g,a) = 0.034, 508.386, 2.658 ms
0.56.807.645 I slot release: id 3 | task 100 | stop processing: n_tokens = 156, truncated = 0
0.56.809.428 I slot print_timing: id 2 | task 125 | n_decoded = 100, tg = 15.06 t/s, tg_3s = 15.06 t/s
0.56.816.943 I srv operator(): Chat format: peg-native
0.56.925.572 I slot print_timing: id 12 | task 103 | prompt eval time = 138.59 ms / 29 tokens ( 4.78 ms per token, 209.25 tokens per second)
0.56.925.576 I slot print_timing: id 12 | task 103 | eval time = 8984.77 ms / 128 tokens ( 70.19 ms per token, 14.25 tokens per second)
0.56.925.577 I slot print_timing: id 12 | task 103 | total time = 9123.36 ms / 157 tokens
0.56.925.578 I slot print_timing: id 12 | task 103 | graphs reused = 1
0.56.925.581 I slot print_timing: id 12 | task 103 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
0.56.925.595 I statistics draft-mtp: #calls(b,g,a) = 50 145 2217, #gen drafts = 2231, #acc drafts = 1578, #gen tokens = 4451, #acc tokens = 2986, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.635), dur(b,g,a) = 0.034, 513.860, 2.677 ms
0.56.925.619 I slot release: id 12 | task 103 | stop processing: n_tokens = 156, truncated = 0
0.56.933.113 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
0.56.933.179 I slot launch_slot_: id 3 | task 196 | processing task, is_child = 0
0.56.935.184 I srv operator(): Chat format: peg-native
0.56.938.729 W slot operator(): id 3 | task 196 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.56.938.760 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.065.083 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 0.120 (> 0.100 thold), f_keep = 0.019
0.57.065.151 I slot launch_slot_: id 12 | task 198 | processing task, is_child = 0
0.57.069.837 W slot operator(): id 12 | task 198 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.069.881 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.320.328 I slot print_timing: id 4 | task 152 | n_decoded = 102, tg = 23.17 t/s, tg_3s = 23.17 t/s
0.57.446.870 I slot print_timing: id 13 | task 156 | n_decoded = 102, tg = 23.30 t/s, tg_3s = 23.30 t/s
0.57.448.097 I slot print_timing: id 15 | task 139 | prompt eval time = 139.29 ms / 28 tokens ( 4.97 ms per token, 201.01 tokens per second)
0.57.448.099 I slot print_timing: id 15 | task 139 | eval time = 6008.21 ms / 125 tokens ( 48.07 ms per token, 20.80 tokens per second)
0.57.448.100 I slot print_timing: id 15 | task 139 | total time = 6147.50 ms / 153 tokens
0.57.448.102 I slot print_timing: id 15 | task 139 | graphs reused = 1
0.57.448.106 I slot print_timing: id 15 | task 139 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.57.448.117 I statistics draft-mtp: #calls(b,g,a) = 52 149 2292, #gen drafts = 2292, #acc drafts = 1630, #gen tokens = 4573, #acc tokens = 3086, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.036, 530.002, 2.775 ms
0.57.448.144 I slot release: id 15 | task 139 | stop processing: n_tokens = 152, truncated = 0
0.57.456.544 I srv operator(): Chat format: peg-native
0.57.562.733 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
0.57.562.801 I slot launch_slot_: id 15 | task 203 | processing task, is_child = 0
0.57.565.860 W slot operator(): id 15 | task 203 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.565.889 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.815.848 I slot print_timing: id 4 | task 152 | prompt eval time = 125.89 ms / 25 tokens ( 5.04 ms per token, 198.59 tokens per second)
0.57.815.851 I slot print_timing: id 4 | task 152 | eval time = 4898.15 ms / 114 tokens ( 42.97 ms per token, 23.27 tokens per second)
0.57.815.851 I slot print_timing: id 4 | task 152 | total time = 5024.04 ms / 139 tokens
0.57.815.852 I slot print_timing: id 4 | task 152 | graphs reused = 1
0.57.815.855 I slot print_timing: id 4 | task 152 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.57.815.865 I statistics draft-mtp: #calls(b,g,a) = 53 152 2327, #gen drafts = 2338, #acc drafts = 1655, #gen tokens = 4665, #acc tokens = 3132, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.037, 539.035, 2.816 ms
0.57.815.889 I slot release: id 4 | task 152 | stop processing: n_tokens = 138, truncated = 0
0.57.824.766 I srv operator(): Chat format: peg-native
0.57.935.688 I slot print_timing: id 9 | task 155 | n_decoded = 101, tg = 20.75 t/s, tg_3s = 20.75 t/s
0.57.938.076 I slot print_timing: id 13 | task 156 | prompt eval time = 139.09 ms / 25 tokens ( 5.56 ms per token, 179.74 tokens per second)
0.57.938.081 I slot print_timing: id 13 | task 156 | eval time = 4869.22 ms / 114 tokens ( 42.71 ms per token, 23.41 tokens per second)
0.57.938.082 I slot print_timing: id 13 | task 156 | total time = 5008.30 ms / 139 tokens
0.57.938.083 I slot print_timing: id 13 | task 156 | graphs reused = 1
0.57.938.086 I slot print_timing: id 13 | task 156 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.57.938.096 I statistics draft-mtp: #calls(b,g,a) = 53 153 2351, #gen drafts = 2353, #acc drafts = 1674, #gen tokens = 4695, #acc tokens = 3169, #mean acc len = 2.35, #acc rate/pos = (0.712, 0.636), dur(b,g,a) = 0.037, 543.406, 2.847 ms
0.57.938.125 I slot release: id 13 | task 156 | stop processing: n_tokens = 138, truncated = 0
0.57.939.371 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.022
0.57.939.443 I slot launch_slot_: id 4 | task 207 | processing task, is_child = 0
0.57.945.817 W slot operator(): id 4 | task 207 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.57.945.851 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.57.946.415 I srv operator(): Chat format: peg-native
0.58.067.870 I slot print_timing: id 5 | task 138 | n_decoded = 100, tg = 15.09 t/s, tg_3s = 15.09 t/s
0.58.072.655 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.58.072.725 I slot launch_slot_: id 13 | task 209 | processing task, is_child = 0
0.58.076.745 W slot operator(): id 13 | task 209 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.58.076.778 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.58.576.410 I slot print_timing: id 14 | task 168 | n_decoded = 102, tg = 23.25 t/s, tg_3s = 23.25 t/s
0.58.935.289 I slot print_timing: id 2 | task 125 | prompt eval time = 113.45 ms / 29 tokens ( 3.91 ms per token, 255.61 tokens per second)
0.58.935.297 I slot print_timing: id 2 | task 125 | eval time = 8765.42 ms / 128 tokens ( 68.48 ms per token, 14.60 tokens per second)
0.58.935.297 I slot print_timing: id 2 | task 125 | total time = 8878.87 ms / 157 tokens
0.58.935.298 I slot print_timing: id 2 | task 125 | graphs reused = 1
0.58.935.302 I slot print_timing: id 2 | task 125 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
0.58.935.316 I statistics draft-mtp: #calls(b,g,a) = 55 161 2462, #gen drafts = 2477, #acc drafts = 1747, #gen tokens = 4942, #acc tokens = 3307, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.039, 572.993, 2.979 ms
0.58.935.336 I slot release: id 2 | task 125 | stop processing: n_tokens = 156, truncated = 0
0.58.940.257 I slot print_timing: id 10 | task 166 | n_decoded = 101, tg = 20.69 t/s, tg_3s = 20.69 t/s
0.58.944.386 I srv operator(): Chat format: peg-native
0.59.057.807 I slot print_timing: id 9 | task 155 | prompt eval time = 138.88 ms / 28 tokens ( 4.96 ms per token, 201.62 tokens per second)
0.59.057.810 I slot print_timing: id 9 | task 155 | eval time = 5989.24 ms / 125 tokens ( 47.91 ms per token, 20.87 tokens per second)
0.59.057.810 I slot print_timing: id 9 | task 155 | total time = 6128.12 ms / 153 tokens
0.59.057.811 I slot print_timing: id 9 | task 155 | graphs reused = 1
0.59.057.814 I slot print_timing: id 9 | task 155 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
0.59.057.829 I statistics draft-mtp: #calls(b,g,a) = 55 162 2486, #gen drafts = 2492, #acc drafts = 1766, #gen tokens = 4972, #acc tokens = 3345, #mean acc len = 2.35, #acc rate/pos = (0.710, 0.635), dur(b,g,a) = 0.039, 576.961, 3.013 ms
0.59.057.852 I slot release: id 9 | task 155 | stop processing: n_tokens = 152, truncated = 0
0.59.060.792 I slot print_timing: id 14 | task 168 | prompt eval time = 119.00 ms / 25 tokens ( 4.76 ms per token, 210.09 tokens per second)
0.59.060.794 I slot print_timing: id 14 | task 168 | eval time = 4870.79 ms / 114 tokens ( 42.73 ms per token, 23.40 tokens per second)
0.59.060.795 I slot print_timing: id 14 | task 168 | total time = 4989.79 ms / 139 tokens
0.59.060.795 I slot print_timing: id 14 | task 168 | graphs reused = 1
0.59.060.797 I slot print_timing: id 14 | task 168 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
0.59.060.803 I statistics draft-mtp: #calls(b,g,a) = 55 162 2491, #gen drafts = 2492, #acc drafts = 1771, #gen tokens = 4972, #acc tokens = 3354, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.039, 576.961, 3.018 ms
0.59.060.821 I slot release: id 14 | task 168 | stop processing: n_tokens = 138, truncated = 0
0.59.061.309 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
0.59.061.370 I slot launch_slot_: id 2 | task 218 | processing task, is_child = 0
0.59.067.238 I srv operator(): Chat format: peg-native
0.59.067.656 W slot operator(): id 2 | task 218 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.067.684 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.069.377 I srv operator(): Chat format: peg-native
0.59.188.285 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
0.59.188.353 I slot launch_slot_: id 9 | task 220 | processing task, is_child = 0
0.59.188.356 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
0.59.188.376 I slot launch_slot_: id 14 | task 221 | processing task, is_child = 0
0.59.193.649 W slot operator(): id 9 | task 220 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.193.678 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.193.716 W slot operator(): id 14 | task 221 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
0.59.193.738 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
0.59.578.651 I slot print_timing: id 0 | task 153 | n_decoded = 100, tg = 15.01 t/s, tg_3s = 15.01 t/s
0.59.826.241 I slot print_timing: id 7 | task 181 | n_decoded = 102, tg = 23.31 t/s, tg_3s = 23.31 t/s
1.00.072.500 I slot print_timing: id 10 | task 166 | prompt eval time = 132.85 ms / 28 tokens ( 4.74 ms per token, 210.76 tokens per second)
1.00.072.505 I slot print_timing: id 10 | task 166 | eval time = 6014.65 ms / 125 tokens ( 48.12 ms per token, 20.78 tokens per second)
1.00.072.506 I slot print_timing: id 10 | task 166 | total time = 6147.50 ms / 153 tokens
1.00.072.507 I slot print_timing: id 10 | task 166 | graphs reused = 1
1.00.072.510 I slot print_timing: id 10 | task 166 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.00.072.521 I statistics draft-mtp: #calls(b,g,a) = 58 170 2610, #gen drafts = 2615, #acc drafts = 1852, #gen tokens = 5217, #acc tokens = 3508, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.042, 606.822, 3.172 ms
1.00.072.550 I slot release: id 10 | task 166 | stop processing: n_tokens = 152, truncated = 0
1.00.081.391 I srv operator(): Chat format: peg-native
1.00.185.030 I slot print_timing: id 5 | task 138 | prompt eval time = 139.07 ms / 29 tokens ( 4.80 ms per token, 208.53 tokens per second)
1.00.185.035 I slot print_timing: id 5 | task 138 | eval time = 8745.43 ms / 128 tokens ( 68.32 ms per token, 14.64 tokens per second)
1.00.185.036 I slot print_timing: id 5 | task 138 | total time = 8884.50 ms / 157 tokens
1.00.185.036 I slot print_timing: id 5 | task 138 | graphs reused = 1
1.00.185.039 I slot print_timing: id 5 | task 138 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.00.185.049 I statistics draft-mtp: #calls(b,g,a) = 58 171 2615, #gen drafts = 2629, #acc drafts = 1857, #gen tokens = 5245, #acc tokens = 3517, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.635), dur(b,g,a) = 0.042, 612.428, 3.178 ms
1.00.185.074 I slot release: id 5 | task 138 | stop processing: n_tokens = 156, truncated = 0
1.00.187.539 I slot print_timing: id 6 | task 179 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.00.191.881 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.00.191.951 I slot launch_slot_: id 5 | task 230 | processing task, is_child = 0
1.00.194.385 I srv operator(): Chat format: peg-native
1.00.197.649 W slot operator(): id 5 | task 230 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.197.673 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.320.763 I slot print_timing: id 7 | task 181 | prompt eval time = 124.91 ms / 25 tokens ( 5.00 ms per token, 200.15 tokens per second)
1.00.320.766 I slot print_timing: id 7 | task 181 | eval time = 4869.56 ms / 114 tokens ( 42.72 ms per token, 23.41 tokens per second)
1.00.320.767 I slot print_timing: id 7 | task 181 | total time = 4994.47 ms / 139 tokens
1.00.320.767 I slot print_timing: id 7 | task 181 | graphs reused = 1
1.00.320.770 I slot print_timing: id 7 | task 181 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.00.320.781 I statistics draft-mtp: #calls(b,g,a) = 59 172 2636, #gen drafts = 2643, #acc drafts = 1870, #gen tokens = 5273, #acc tokens = 3542, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.634), dur(b,g,a) = 0.043, 618.049, 3.203 ms
1.00.320.806 I slot release: id 7 | task 181 | stop processing: n_tokens = 138, truncated = 0
1.00.324.619 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.00.324.688 I slot launch_slot_: id 10 | task 232 | processing task, is_child = 0
1.00.329.500 I srv operator(): Chat format: peg-native
1.00.330.273 W slot operator(): id 10 | task 232 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.330.310 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.456.505 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.00.456.572 I slot launch_slot_: id 7 | task 234 | processing task, is_child = 0
1.00.461.699 W slot operator(): id 7 | task 234 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.00.461.732 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.00.954.115 I slot print_timing: id 1 | task 165 | n_decoded = 100, tg = 14.50 t/s, tg_3s = 14.50 t/s
1.01.201.842 I slot print_timing: id 8 | task 170 | n_decoded = 100, tg = 14.55 t/s, tg_3s = 14.55 t/s
1.01.323.882 I slot print_timing: id 6 | task 179 | prompt eval time = 118.97 ms / 28 tokens ( 4.25 ms per token, 235.34 tokens per second)
1.01.323.885 I slot print_timing: id 6 | task 179 | eval time = 6010.01 ms / 125 tokens ( 48.08 ms per token, 20.80 tokens per second)
1.01.323.886 I slot print_timing: id 6 | task 179 | total time = 6128.98 ms / 153 tokens
1.01.323.887 I slot print_timing: id 6 | task 179 | graphs reused = 1
1.01.323.890 I slot print_timing: id 6 | task 179 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.01.323.901 I statistics draft-mtp: #calls(b,g,a) = 61 180 2759, #gen drafts = 2768, #acc drafts = 1961, #gen tokens = 5523, #acc tokens = 3712, #mean acc len = 2.35, #acc rate/pos = (0.711, 0.635), dur(b,g,a) = 0.045, 646.787, 3.353 ms
1.01.323.932 I slot release: id 6 | task 179 | stop processing: n_tokens = 152, truncated = 0
1.01.332.822 I srv operator(): Chat format: peg-native
1.01.444.405 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.01.444.474 I slot launch_slot_: id 6 | task 243 | processing task, is_child = 0
1.01.448.782 W slot operator(): id 6 | task 243 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.448.810 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.572.808 I slot print_timing: id 0 | task 153 | prompt eval time = 125.68 ms / 29 tokens ( 4.33 ms per token, 230.75 tokens per second)
1.01.572.812 I slot print_timing: id 0 | task 153 | eval time = 8655.41 ms / 128 tokens ( 67.62 ms per token, 14.79 tokens per second)
1.01.572.813 I slot print_timing: id 0 | task 153 | total time = 8781.08 ms / 157 tokens
1.01.572.814 I slot print_timing: id 0 | task 153 | graphs reused = 1
1.01.572.818 I slot print_timing: id 0 | task 153 | draft acceptance = 0.42963 ( 58 accepted / 135 generated), mean acceptance length = 1.85, acceptance rate per position = (0.471, 0.382)
1.01.572.837 I statistics draft-mtp: #calls(b,g,a) = 61 182 2783, #gen drafts = 2797, #acc drafts = 1976, #gen tokens = 5580, #acc tokens = 3740, #mean acc len = 2.34, #acc rate/pos = (0.710, 0.634), dur(b,g,a) = 0.045, 655.603, 3.383 ms
1.01.572.863 I slot release: id 0 | task 153 | stop processing: n_tokens = 156, truncated = 0
1.01.578.523 I slot print_timing: id 12 | task 198 | n_decoded = 102, tg = 23.27 t/s, tg_3s = 23.27 t/s
1.01.581.472 I srv operator(): Chat format: peg-native
1.01.695.237 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.01.695.304 I slot launch_slot_: id 0 | task 246 | processing task, is_child = 0
1.01.698.409 W slot operator(): id 0 | task 246 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.01.698.438 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.01.948.893 I slot print_timing: id 3 | task 196 | n_decoded = 101, tg = 20.65 t/s, tg_3s = 20.65 t/s
1.02.075.404 I slot print_timing: id 12 | task 198 | prompt eval time = 125.61 ms / 25 tokens ( 5.02 ms per token, 199.02 tokens per second)
1.02.075.407 I slot print_timing: id 12 | task 198 | eval time = 4879.90 ms / 114 tokens ( 42.81 ms per token, 23.36 tokens per second)
1.02.075.407 I slot print_timing: id 12 | task 198 | total time = 5005.52 ms / 139 tokens
1.02.075.409 I slot print_timing: id 12 | task 198 | graphs reused = 1
1.02.075.412 I slot print_timing: id 12 | task 198 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.02.075.424 I statistics draft-mtp: #calls(b,g,a) = 63 186 2856, #gen drafts = 2859, #acc drafts = 2026, #gen tokens = 5704, #acc tokens = 3836, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.634), dur(b,g,a) = 0.046, 667.737, 3.475 ms
1.02.075.454 I slot release: id 12 | task 198 | stop processing: n_tokens = 138, truncated = 0
1.02.083.726 I srv operator(): Chat format: peg-native
1.02.193.991 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.02.194.060 I slot launch_slot_: id 12 | task 251 | processing task, is_child = 0
1.02.198.793 W slot operator(): id 12 | task 251 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.02.198.853 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.02.575.426 I slot print_timing: id 13 | task 209 | n_decoded = 102, tg = 23.32 t/s, tg_3s = 23.32 t/s
1.02.938.425 I slot print_timing: id 4 | task 207 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.03.057.417 I slot print_timing: id 1 | task 165 | prompt eval time = 132.64 ms / 29 tokens ( 4.57 ms per token, 218.64 tokens per second)
1.03.057.424 I slot print_timing: id 1 | task 165 | eval time = 8999.86 ms / 128 tokens ( 70.31 ms per token, 14.22 tokens per second)
1.03.057.425 I slot print_timing: id 1 | task 165 | total time = 9132.50 ms / 157 tokens
1.03.057.426 I slot print_timing: id 1 | task 165 | graphs reused = 1
1.03.057.429 I slot print_timing: id 1 | task 165 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.03.057.444 I statistics draft-mtp: #calls(b,g,a) = 64 194 2969, #gen drafts = 2984, #acc drafts = 2102, #gen tokens = 5953, #acc tokens = 3980, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.633), dur(b,g,a) = 0.046, 695.753, 3.616 ms
1.03.057.467 I slot release: id 1 | task 165 | stop processing: n_tokens = 156, truncated = 0
1.03.059.417 I slot print_timing: id 3 | task 196 | prompt eval time = 119.68 ms / 28 tokens ( 4.27 ms per token, 233.96 tokens per second)
1.03.059.419 I slot print_timing: id 3 | task 196 | eval time = 6000.98 ms / 125 tokens ( 48.01 ms per token, 20.83 tokens per second)
1.03.059.419 I slot print_timing: id 3 | task 196 | total time = 6120.66 ms / 153 tokens
1.03.059.420 I slot print_timing: id 3 | task 196 | graphs reused = 1
1.03.059.422 I slot print_timing: id 3 | task 196 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.03.059.428 I statistics draft-mtp: #calls(b,g,a) = 64 194 2972, #gen drafts = 2984, #acc drafts = 2105, #gen tokens = 5953, #acc tokens = 3986, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.633), dur(b,g,a) = 0.046, 695.753, 3.620 ms
1.03.059.448 I slot release: id 3 | task 196 | stop processing: n_tokens = 152, truncated = 0
1.03.065.092 I slot print_timing: id 13 | task 209 | prompt eval time = 124.65 ms / 25 tokens ( 4.99 ms per token, 200.56 tokens per second)
1.03.065.095 I slot print_timing: id 13 | task 209 | eval time = 4863.67 ms / 114 tokens ( 42.66 ms per token, 23.44 tokens per second)
1.03.065.096 I slot print_timing: id 13 | task 209 | total time = 4988.32 ms / 139 tokens
1.03.065.096 I slot print_timing: id 13 | task 209 | graphs reused = 1
1.03.065.099 I slot print_timing: id 13 | task 209 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.03.065.105 I statistics draft-mtp: #calls(b,g,a) = 64 194 2982, #gen drafts = 2984, #acc drafts = 2114, #gen tokens = 5953, #acc tokens = 4003, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.633), dur(b,g,a) = 0.046, 695.753, 3.635 ms
1.03.065.129 I slot release: id 13 | task 209 | stop processing: n_tokens = 138, truncated = 0
1.03.066.495 I srv operator(): Chat format: peg-native
1.03.067.304 I srv operator(): Chat format: peg-native
1.03.073.574 I srv operator(): Chat format: peg-native
1.03.168.188 I slot print_timing: id 11 | task 191 | n_decoded = 100, tg = 15.14 t/s, tg_3s = 15.14 t/s
1.03.169.709 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.03.169.768 I slot launch_slot_: id 1 | task 260 | processing task, is_child = 0
1.03.169.771 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.03.169.787 I slot launch_slot_: id 3 | task 261 | processing task, is_child = 0
1.03.169.790 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.03.169.805 I slot launch_slot_: id 13 | task 262 | processing task, is_child = 0
1.03.176.510 W slot operator(): id 1 | task 260 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.176.547 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.176.586 W slot operator(): id 3 | task 261 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.176.612 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.176.652 W slot operator(): id 13 | task 262 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.176.680 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.328.247 I slot print_timing: id 8 | task 170 | prompt eval time = 126.09 ms / 29 tokens ( 4.35 ms per token, 229.99 tokens per second)
1.03.328.252 I slot print_timing: id 8 | task 170 | eval time = 8999.93 ms / 128 tokens ( 70.31 ms per token, 14.22 tokens per second)
1.03.328.253 I slot print_timing: id 8 | task 170 | total time = 9126.02 ms / 157 tokens
1.03.328.254 I slot print_timing: id 8 | task 170 | graphs reused = 1
1.03.328.257 I slot print_timing: id 8 | task 170 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.03.328.268 I statistics draft-mtp: #calls(b,g,a) = 66 196 2997, #gen drafts = 3009, #acc drafts = 2124, #gen tokens = 6002, #acc tokens = 4022, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.633), dur(b,g,a) = 0.047, 707.915, 3.650 ms
1.03.328.295 I slot release: id 8 | task 170 | stop processing: n_tokens = 156, truncated = 0
1.03.338.807 I srv operator(): Chat format: peg-native
1.03.452.193 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.03.452.263 I slot launch_slot_: id 8 | task 265 | processing task, is_child = 0
1.03.457.408 W slot operator(): id 8 | task 265 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.03.457.441 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.03.712.937 I slot print_timing: id 14 | task 221 | n_decoded = 102, tg = 23.29 t/s, tg_3s = 23.29 t/s
1.04.074.835 I slot print_timing: id 4 | task 207 | prompt eval time = 119.16 ms / 28 tokens ( 4.26 ms per token, 234.97 tokens per second)
1.04.074.838 I slot print_timing: id 4 | task 207 | eval time = 6009.81 ms / 125 tokens ( 48.08 ms per token, 20.80 tokens per second)
1.04.074.839 I slot print_timing: id 4 | task 207 | total time = 6128.97 ms / 153 tokens
1.04.074.840 I slot print_timing: id 4 | task 207 | graphs reused = 1
1.04.074.844 I slot print_timing: id 4 | task 207 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.04.074.855 I statistics draft-mtp: #calls(b,g,a) = 68 202 3092, #gen drafts = 3103, #acc drafts = 2189, #gen tokens = 6190, #acc tokens = 4146, #mean acc len = 2.34, #acc rate/pos = (0.708, 0.633), dur(b,g,a) = 0.049, 730.359, 3.774 ms
1.04.074.882 I slot release: id 4 | task 207 | stop processing: n_tokens = 152, truncated = 0
1.04.083.773 I srv operator(): Chat format: peg-native
1.04.194.585 I slot print_timing: id 9 | task 220 | n_decoded = 101, tg = 20.78 t/s, tg_3s = 20.78 t/s
1.04.197.668 I slot print_timing: id 14 | task 221 | prompt eval time = 139.91 ms / 25 tokens ( 5.60 ms per token, 178.69 tokens per second)
1.04.197.670 I slot print_timing: id 14 | task 221 | eval time = 4864.01 ms / 114 tokens ( 42.67 ms per token, 23.44 tokens per second)
1.04.197.671 I slot print_timing: id 14 | task 221 | total time = 5003.91 ms / 139 tokens
1.04.197.672 I slot print_timing: id 14 | task 221 | graphs reused = 1
1.04.197.675 I slot print_timing: id 14 | task 221 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.04.197.686 I statistics draft-mtp: #calls(b,g,a) = 68 203 3117, #gen drafts = 3118, #acc drafts = 2209, #gen tokens = 6220, #acc tokens = 4184, #mean acc len = 2.34, #acc rate/pos = (0.709, 0.634), dur(b,g,a) = 0.049, 734.710, 3.802 ms
1.04.197.715 I slot release: id 14 | task 221 | stop processing: n_tokens = 138, truncated = 0
1.04.198.033 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.04.198.101 I slot launch_slot_: id 4 | task 272 | processing task, is_child = 0
1.04.204.499 W slot operator(): id 4 | task 272 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.204.521 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.209.694 I srv operator(): Chat format: peg-native
1.04.333.284 I slot print_timing: id 15 | task 203 | n_decoded = 100, tg = 15.06 t/s, tg_3s = 15.06 t/s
1.04.333.296 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.04.333.364 I slot launch_slot_: id 14 | task 274 | processing task, is_child = 0
1.04.337.325 W slot operator(): id 14 | task 274 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.04.337.365 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.04.954.612 I slot print_timing: id 7 | task 234 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.35 t/s
1.05.318.337 I slot print_timing: id 11 | task 191 | prompt eval time = 126.17 ms / 29 tokens ( 4.35 ms per token, 229.84 tokens per second)
1.05.318.341 I slot print_timing: id 11 | task 191 | eval time = 8754.80 ms / 128 tokens ( 68.40 ms per token, 14.62 tokens per second)
1.05.318.342 I slot print_timing: id 11 | task 191 | total time = 8880.97 ms / 157 tokens
1.05.318.343 I slot print_timing: id 11 | task 191 | graphs reused = 1
1.05.318.345 I slot print_timing: id 11 | task 191 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.05.318.360 I statistics draft-mtp: #calls(b,g,a) = 70 212 3243, #gen drafts = 3258, #acc drafts = 2291, #gen tokens = 6499, #acc tokens = 4339, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.051, 767.646, 3.963 ms
1.05.318.382 I slot release: id 11 | task 191 | stop processing: n_tokens = 156, truncated = 0
1.05.323.960 I slot print_timing: id 9 | task 220 | prompt eval time = 139.70 ms / 28 tokens ( 4.99 ms per token, 200.44 tokens per second)
1.05.323.964 I slot print_timing: id 9 | task 220 | eval time = 5990.58 ms / 125 tokens ( 47.92 ms per token, 20.87 tokens per second)
1.05.323.965 I slot print_timing: id 9 | task 220 | total time = 6130.28 ms / 153 tokens
1.05.323.965 I slot print_timing: id 9 | task 220 | graphs reused = 1
1.05.323.967 I slot print_timing: id 9 | task 220 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.05.323.974 I statistics draft-mtp: #calls(b,g,a) = 70 212 3253, #gen drafts = 3258, #acc drafts = 2299, #gen tokens = 6499, #acc tokens = 4355, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.051, 767.646, 3.976 ms
1.05.323.995 I slot release: id 9 | task 220 | stop processing: n_tokens = 152, truncated = 0
1.05.324.645 I slot print_timing: id 10 | task 232 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.05.327.331 I srv operator(): Chat format: peg-native
1.05.332.238 I srv operator(): Chat format: peg-native
1.05.434.244 I slot print_timing: id 7 | task 234 | prompt eval time = 124.60 ms / 25 tokens ( 4.98 ms per token, 200.65 tokens per second)
1.05.434.247 I slot print_timing: id 7 | task 234 | eval time = 4847.92 ms / 114 tokens ( 42.53 ms per token, 23.52 tokens per second)
1.05.434.248 I slot print_timing: id 7 | task 234 | total time = 4972.52 ms / 139 tokens
1.05.434.249 I slot print_timing: id 7 | task 234 | graphs reused = 1
1.05.434.251 I slot print_timing: id 7 | task 234 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.05.434.261 I statistics draft-mtp: #calls(b,g,a) = 70 213 3266, #gen drafts = 3272, #acc drafts = 2308, #gen tokens = 6527, #acc tokens = 4371, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.051, 772.773, 3.992 ms
1.05.434.284 I slot release: id 7 | task 234 | stop processing: n_tokens = 138, truncated = 0
1.05.437.487 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.05.437.554 I slot launch_slot_: id 11 | task 284 | processing task, is_child = 0
1.05.437.557 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.05.437.574 I slot launch_slot_: id 9 | task 285 | processing task, is_child = 0
1.05.442.569 I srv operator(): Chat format: peg-native
1.05.443.806 W slot operator(): id 9 | task 285 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.443.838 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.443.877 W slot operator(): id 11 | task 284 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.443.912 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.584.746 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.05.584.815 I slot launch_slot_: id 7 | task 287 | processing task, is_child = 0
1.05.589.994 W slot operator(): id 7 | task 287 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.05.590.025 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.05.837.973 I slot print_timing: id 2 | task 218 | n_decoded = 100, tg = 15.02 t/s, tg_3s = 15.02 t/s
1.06.449.092 I slot print_timing: id 15 | task 203 | prompt eval time = 125.13 ms / 29 tokens ( 4.31 ms per token, 231.76 tokens per second)
1.06.449.096 I slot print_timing: id 15 | task 203 | eval time = 8758.07 ms / 128 tokens ( 68.42 ms per token, 14.62 tokens per second)
1.06.449.096 I slot print_timing: id 15 | task 203 | total time = 8883.20 ms / 157 tokens
1.06.449.098 I slot print_timing: id 15 | task 203 | graphs reused = 1
1.06.449.100 I slot print_timing: id 15 | task 203 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.06.449.114 I statistics draft-mtp: #calls(b,g,a) = 73 221 3380, #gen drafts = 3395, #acc drafts = 2389, #gen tokens = 6772, #acc tokens = 4525, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.053, 802.428, 4.132 ms
1.06.449.138 I slot release: id 15 | task 203 | stop processing: n_tokens = 156, truncated = 0
1.06.454.687 I slot print_timing: id 10 | task 232 | prompt eval time = 119.27 ms / 28 tokens ( 4.26 ms per token, 234.75 tokens per second)
1.06.454.691 I slot print_timing: id 10 | task 232 | eval time = 6005.10 ms / 125 tokens ( 48.04 ms per token, 20.82 tokens per second)
1.06.454.691 I slot print_timing: id 10 | task 232 | total time = 6124.37 ms / 153 tokens
1.06.454.692 I slot print_timing: id 10 | task 232 | graphs reused = 1
1.06.454.695 I slot print_timing: id 10 | task 232 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.06.454.702 I statistics draft-mtp: #calls(b,g,a) = 73 221 3391, #gen drafts = 3395, #acc drafts = 2396, #gen tokens = 6772, #acc tokens = 4539, #mean acc len = 2.34, #acc rate/pos = (0.707, 0.632), dur(b,g,a) = 0.053, 802.428, 4.147 ms
1.06.454.726 I slot release: id 10 | task 232 | stop processing: n_tokens = 152, truncated = 0
1.06.458.154 I srv operator(): Chat format: peg-native
1.06.463.264 I srv operator(): Chat format: peg-native
1.06.566.441 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.06.566.508 I slot launch_slot_: id 15 | task 296 | processing task, is_child = 0
1.06.566.511 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.06.566.530 I slot launch_slot_: id 10 | task 297 | processing task, is_child = 0
1.06.571.186 W slot operator(): id 10 | task 297 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.571.219 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.571.255 W slot operator(): id 15 | task 296 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.06.571.284 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.06.711.567 I slot print_timing: id 0 | task 246 | n_decoded = 101, tg = 20.67 t/s, tg_3s = 20.67 t/s
1.06.717.360 I slot print_timing: id 12 | task 251 | n_decoded = 102, tg = 23.22 t/s, tg_3s = 23.22 t/s
1.07.203.296 I slot print_timing: id 5 | task 230 | n_decoded = 100, tg = 14.52 t/s, tg_3s = 14.52 t/s
1.07.206.489 I slot print_timing: id 12 | task 251 | prompt eval time = 125.22 ms / 25 tokens ( 5.01 ms per token, 199.65 tokens per second)
1.07.206.493 I slot print_timing: id 12 | task 251 | eval time = 4882.43 ms / 114 tokens ( 42.83 ms per token, 23.35 tokens per second)
1.07.206.493 I slot print_timing: id 12 | task 251 | total time = 5007.65 ms / 139 tokens
1.07.206.494 I slot print_timing: id 12 | task 251 | graphs reused = 1
1.07.206.498 I slot print_timing: id 12 | task 251 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.07.206.510 I statistics draft-mtp: #calls(b,g,a) = 75 227 3484, #gen drafts = 3487, #acc drafts = 2460, #gen tokens = 6956, #acc tokens = 4660, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.054, 823.713, 4.271 ms
1.07.206.537 I slot release: id 12 | task 251 | stop processing: n_tokens = 138, truncated = 0
1.07.215.194 I srv operator(): Chat format: peg-native
1.07.325.271 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.07.325.340 I slot launch_slot_: id 12 | task 304 | processing task, is_child = 0
1.07.330.008 W slot operator(): id 12 | task 304 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.330.040 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.07.706.776 I slot print_timing: id 13 | task 262 | n_decoded = 102, tg = 23.30 t/s, tg_3s = 23.30 t/s
1.07.822.504 I slot print_timing: id 0 | task 246 | prompt eval time = 126.50 ms / 28 tokens ( 4.52 ms per token, 221.35 tokens per second)
1.07.822.510 I slot print_timing: id 0 | task 246 | eval time = 5997.56 ms / 125 tokens ( 47.98 ms per token, 20.84 tokens per second)
1.07.822.511 I slot print_timing: id 0 | task 246 | total time = 6124.06 ms / 153 tokens
1.07.822.513 I slot print_timing: id 0 | task 246 | graphs reused = 1
1.07.822.516 I slot print_timing: id 0 | task 246 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.07.822.531 I statistics draft-mtp: #calls(b,g,a) = 76 232 3550, #gen drafts = 3565, #acc drafts = 2506, #gen tokens = 7111, #acc tokens = 4748, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.632), dur(b,g,a) = 0.054, 841.528, 4.345 ms
1.07.822.555 I slot release: id 0 | task 246 | stop processing: n_tokens = 152, truncated = 0
1.07.831.605 I srv operator(): Chat format: peg-native
1.07.938.093 I slot print_timing: id 2 | task 218 | prompt eval time = 113.79 ms / 29 tokens ( 3.92 ms per token, 254.86 tokens per second)
1.07.938.097 I slot print_timing: id 2 | task 218 | eval time = 8756.61 ms / 128 tokens ( 68.41 ms per token, 14.62 tokens per second)
1.07.938.097 I slot print_timing: id 2 | task 218 | total time = 8870.40 ms / 157 tokens
1.07.938.099 I slot print_timing: id 2 | task 218 | graphs reused = 1
1.07.938.101 I slot print_timing: id 2 | task 218 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.07.938.114 I statistics draft-mtp: #calls(b,g,a) = 76 233 3565, #gen drafts = 3579, #acc drafts = 2516, #gen tokens = 7139, #acc tokens = 4765, #mean acc len = 2.34, #acc rate/pos = (0.706, 0.631), dur(b,g,a) = 0.054, 845.363, 4.363 ms
1.07.938.138 I slot release: id 2 | task 218 | stop processing: n_tokens = 156, truncated = 0
1.07.944.885 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.07.944.951 I slot launch_slot_: id 2 | task 310 | processing task, is_child = 0
1.07.947.231 I srv operator(): Chat format: peg-native
1.07.948.807 W slot operator(): id 2 | task 310 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.07.948.849 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.074.149 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.08.074.216 I slot launch_slot_: id 0 | task 312 | processing task, is_child = 0
1.08.077.272 W slot operator(): id 0 | task 312 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.077.309 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.204.470 I slot print_timing: id 3 | task 261 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.71 t/s
1.08.206.333 I slot print_timing: id 6 | task 243 | n_decoded = 100, tg = 15.08 t/s, tg_3s = 15.08 t/s
1.08.210.366 I slot print_timing: id 13 | task 262 | prompt eval time = 151.92 ms / 25 tokens ( 6.08 ms per token, 164.56 tokens per second)
1.08.210.368 I slot print_timing: id 13 | task 262 | eval time = 4881.76 ms / 114 tokens ( 42.82 ms per token, 23.35 tokens per second)
1.08.210.369 I slot print_timing: id 13 | task 262 | total time = 5033.67 ms / 139 tokens
1.08.210.370 I slot print_timing: id 13 | task 262 | graphs reused = 1
1.08.210.373 I slot print_timing: id 13 | task 262 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.08.210.384 I statistics draft-mtp: #calls(b,g,a) = 78 235 3606, #gen drafts = 3608, #acc drafts = 2543, #gen tokens = 7197, #acc tokens = 4818, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.055, 852.118, 4.411 ms
1.08.210.412 I slot release: id 13 | task 262 | stop processing: n_tokens = 138, truncated = 0
1.08.219.270 I srv operator(): Chat format: peg-native
1.08.328.394 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.08.328.464 I slot launch_slot_: id 13 | task 315 | processing task, is_child = 0
1.08.332.548 W slot operator(): id 13 | task 315 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.08.332.578 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.08.832.891 I slot print_timing: id 14 | task 274 | n_decoded = 102, tg = 23.34 t/s, tg_3s = 23.34 t/s
1.09.195.437 I slot print_timing: id 4 | task 272 | n_decoded = 101, tg = 20.74 t/s, tg_3s = 20.74 t/s
1.09.316.049 I slot print_timing: id 5 | task 230 | prompt eval time = 119.61 ms / 29 tokens ( 4.12 ms per token, 242.46 tokens per second)
1.09.316.055 I slot print_timing: id 5 | task 230 | eval time = 8998.76 ms / 128 tokens ( 70.30 ms per token, 14.22 tokens per second)
1.09.316.056 I slot print_timing: id 5 | task 230 | total time = 9118.37 ms / 157 tokens
1.09.316.057 I slot print_timing: id 5 | task 230 | graphs reused = 1
1.09.316.061 I slot print_timing: id 5 | task 230 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.09.316.075 I statistics draft-mtp: #calls(b,g,a) = 79 244 3734, #gen drafts = 3749, #acc drafts = 2628, #gen tokens = 7478, #acc tokens = 4981, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.056, 882.846, 4.572 ms
1.09.316.100 I slot release: id 5 | task 230 | stop processing: n_tokens = 156, truncated = 0
1.09.317.873 I slot print_timing: id 3 | task 261 | prompt eval time = 151.43 ms / 28 tokens ( 5.41 ms per token, 184.90 tokens per second)
1.09.317.876 I slot print_timing: id 3 | task 261 | eval time = 5989.82 ms / 125 tokens ( 47.92 ms per token, 20.87 tokens per second)
1.09.317.876 I slot print_timing: id 3 | task 261 | total time = 6141.25 ms / 153 tokens
1.09.317.877 I slot print_timing: id 3 | task 261 | graphs reused = 1
1.09.317.880 I slot print_timing: id 3 | task 261 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.09.317.887 I statistics draft-mtp: #calls(b,g,a) = 79 244 3738, #gen drafts = 3749, #acc drafts = 2630, #gen tokens = 7478, #acc tokens = 4984, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.056, 882.846, 4.579 ms
1.09.317.910 I slot release: id 3 | task 261 | stop processing: n_tokens = 152, truncated = 0
1.09.324.291 I slot print_timing: id 14 | task 274 | prompt eval time = 125.03 ms / 25 tokens ( 5.00 ms per token, 199.95 tokens per second)
1.09.324.293 I slot print_timing: id 14 | task 274 | eval time = 4861.90 ms / 114 tokens ( 42.65 ms per token, 23.45 tokens per second)
1.09.324.294 I slot print_timing: id 14 | task 274 | total time = 4986.93 ms / 139 tokens
1.09.324.294 I slot print_timing: id 14 | task 274 | graphs reused = 1
1.09.324.297 I slot print_timing: id 14 | task 274 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.09.324.305 I statistics draft-mtp: #calls(b,g,a) = 79 244 3748, #gen drafts = 3749, #acc drafts = 2639, #gen tokens = 7478, #acc tokens = 5001, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.056, 882.846, 4.589 ms
1.09.324.328 I slot release: id 14 | task 274 | stop processing: n_tokens = 138, truncated = 0
1.09.325.630 I srv operator(): Chat format: peg-native
1.09.326.079 I srv operator(): Chat format: peg-native
1.09.332.724 I srv operator(): Chat format: peg-native
1.09.431.201 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.09.431.274 I slot launch_slot_: id 5 | task 325 | processing task, is_child = 0
1.09.431.277 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.09.431.294 I slot launch_slot_: id 3 | task 326 | processing task, is_child = 0
1.09.431.296 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.09.431.311 I slot launch_slot_: id 14 | task 327 | processing task, is_child = 0
1.09.437.454 W slot operator(): id 3 | task 326 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.437.496 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.437.526 W slot operator(): id 5 | task 325 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.437.547 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.09.437.601 W slot operator(): id 14 | task 327 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.09.437.631 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.083.505 I slot print_timing: id 7 | task 287 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.35 t/s
1.10.203.692 I slot print_timing: id 1 | task 260 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.10.325.496 I slot print_timing: id 6 | task 243 | prompt eval time = 124.35 ms / 29 tokens ( 4.29 ms per token, 233.21 tokens per second)
1.10.325.500 I slot print_timing: id 6 | task 243 | eval time = 8752.33 ms / 128 tokens ( 68.38 ms per token, 14.62 tokens per second)
1.10.325.500 I slot print_timing: id 6 | task 243 | total time = 8876.68 ms / 157 tokens
1.10.325.501 I slot print_timing: id 6 | task 243 | graphs reused = 1
1.10.325.505 I slot print_timing: id 6 | task 243 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.10.325.520 I statistics draft-mtp: #calls(b,g,a) = 82 252 3855, #gen drafts = 3870, #acc drafts = 2714, #gen tokens = 7719, #acc tokens = 5143, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.057, 914.881, 4.725 ms
1.10.325.565 I slot release: id 6 | task 243 | stop processing: n_tokens = 156, truncated = 0
1.10.328.368 I slot print_timing: id 4 | task 272 | prompt eval time = 121.19 ms / 28 tokens ( 4.33 ms per token, 231.05 tokens per second)
1.10.328.371 I slot print_timing: id 4 | task 272 | eval time = 6002.65 ms / 125 tokens ( 48.02 ms per token, 20.82 tokens per second)
1.10.328.371 I slot print_timing: id 4 | task 272 | total time = 6123.84 ms / 153 tokens
1.10.328.372 I slot print_timing: id 4 | task 272 | graphs reused = 1
1.10.328.375 I slot print_timing: id 4 | task 272 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.10.328.386 I statistics draft-mtp: #calls(b,g,a) = 82 252 3860, #gen drafts = 3870, #acc drafts = 2718, #gen tokens = 7719, #acc tokens = 5150, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.057, 914.881, 4.734 ms
1.10.328.413 I slot release: id 4 | task 272 | stop processing: n_tokens = 152, truncated = 0
1.10.334.634 I srv operator(): Chat format: peg-native
1.10.337.377 I srv operator(): Chat format: peg-native
1.10.442.143 I slot print_timing: id 8 | task 265 | n_decoded = 100, tg = 14.58 t/s, tg_3s = 14.58 t/s
1.10.442.864 I slot print_timing: id 9 | task 285 | n_decoded = 101, tg = 20.76 t/s, tg_3s = 20.76 t/s
1.10.447.807 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.10.447.879 I slot launch_slot_: id 6 | task 336 | processing task, is_child = 0
1.10.447.881 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.10.447.899 I slot launch_slot_: id 4 | task 337 | processing task, is_child = 0
1.10.453.022 W slot operator(): id 4 | task 337 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.453.054 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.453.084 W slot operator(): id 6 | task 336 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.453.116 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.10.595.939 I slot print_timing: id 7 | task 287 | prompt eval time = 125.15 ms / 25 tokens ( 5.01 ms per token, 199.75 tokens per second)
1.10.595.942 I slot print_timing: id 7 | task 287 | eval time = 4880.76 ms / 114 tokens ( 42.81 ms per token, 23.36 tokens per second)
1.10.595.942 I slot print_timing: id 7 | task 287 | total time = 5005.92 ms / 139 tokens
1.10.595.943 I slot print_timing: id 7 | task 287 | graphs reused = 1
1.10.595.946 I slot print_timing: id 7 | task 287 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.10.595.958 I statistics draft-mtp: #calls(b,g,a) = 84 254 3890, #gen drafts = 3898, #acc drafts = 2739, #gen tokens = 7775, #acc tokens = 5191, #mean acc len = 2.33, #acc rate/pos = (0.704, 0.630), dur(b,g,a) = 0.057, 925.266, 4.767 ms
1.10.595.982 I slot release: id 7 | task 287 | stop processing: n_tokens = 138, truncated = 0
1.10.604.531 I srv operator(): Chat format: peg-native
1.10.717.400 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.10.717.475 I slot launch_slot_: id 7 | task 340 | processing task, is_child = 0
1.10.722.589 W slot operator(): id 7 | task 340 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.10.722.623 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.587.884 I slot print_timing: id 9 | task 285 | prompt eval time = 133.36 ms / 28 tokens ( 4.76 ms per token, 209.95 tokens per second)
1.11.587.887 I slot print_timing: id 9 | task 285 | eval time = 6010.68 ms / 125 tokens ( 48.09 ms per token, 20.80 tokens per second)
1.11.587.888 I slot print_timing: id 9 | task 285 | total time = 6144.04 ms / 153 tokens
1.11.587.889 I slot print_timing: id 9 | task 285 | graphs reused = 1
1.11.587.892 I slot print_timing: id 9 | task 285 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.11.587.902 I statistics draft-mtp: #calls(b,g,a) = 85 262 4018, #gen drafts = 4024, #acc drafts = 2831, #gen tokens = 8027, #acc tokens = 5366, #mean acc len = 2.34, #acc rate/pos = (0.705, 0.631), dur(b,g,a) = 0.058, 953.621, 4.920 ms
1.11.587.927 I slot release: id 9 | task 285 | stop processing: n_tokens = 152, truncated = 0
1.11.588.557 I slot print_timing: id 10 | task 297 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.70 t/s
1.11.596.675 I srv operator(): Chat format: peg-native
1.11.707.464 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.11.707.535 I slot launch_slot_: id 9 | task 349 | processing task, is_child = 0
1.11.712.556 W slot operator(): id 9 | task 349 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.11.712.587 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.11.843.566 I slot print_timing: id 12 | task 304 | n_decoded = 102, tg = 23.24 t/s, tg_3s = 23.24 t/s
1.12.326.218 I slot print_timing: id 1 | task 260 | prompt eval time = 151.23 ms / 29 tokens ( 5.21 ms per token, 191.76 tokens per second)
1.12.326.222 I slot print_timing: id 1 | task 260 | eval time = 8998.45 ms / 128 tokens ( 70.30 ms per token, 14.22 tokens per second)
1.12.326.223 I slot print_timing: id 1 | task 260 | total time = 9149.68 ms / 157 tokens
1.12.326.223 I slot print_timing: id 1 | task 260 | graphs reused = 1
1.12.326.226 I slot print_timing: id 1 | task 260 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.12.326.241 I statistics draft-mtp: #calls(b,g,a) = 86 268 4102, #gen drafts = 4117, #acc drafts = 2885, #gen tokens = 8212, #acc tokens = 5466, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.059, 976.294, 5.028 ms
1.12.326.268 I slot release: id 1 | task 260 | stop processing: n_tokens = 156, truncated = 0
1.12.331.963 I slot print_timing: id 12 | task 304 | prompt eval time = 125.14 ms / 25 tokens ( 5.01 ms per token, 199.77 tokens per second)
1.12.331.965 I slot print_timing: id 12 | task 304 | eval time = 4876.78 ms / 114 tokens ( 42.78 ms per token, 23.38 tokens per second)
1.12.331.966 I slot print_timing: id 12 | task 304 | total time = 5001.93 ms / 139 tokens
1.12.331.966 I slot print_timing: id 12 | task 304 | graphs reused = 1
1.12.331.969 I slot print_timing: id 12 | task 304 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.12.331.976 I statistics draft-mtp: #calls(b,g,a) = 86 268 4114, #gen drafts = 4117, #acc drafts = 2892, #gen tokens = 8212, #acc tokens = 5480, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.059, 976.294, 5.046 ms
1.12.331.997 I slot release: id 12 | task 304 | stop processing: n_tokens = 138, truncated = 0
1.12.335.030 I srv operator(): Chat format: peg-native
1.12.340.711 I srv operator(): Chat format: peg-native
1.12.442.464 I slot print_timing: id 11 | task 284 | n_decoded = 100, tg = 14.57 t/s, tg_3s = 14.57 t/s
1.12.444.002 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.12.444.069 I slot launch_slot_: id 1 | task 356 | processing task, is_child = 0
1.12.444.071 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.12.444.088 I slot launch_slot_: id 12 | task 357 | processing task, is_child = 0
1.12.450.110 W slot operator(): id 1 | task 356 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.450.142 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.450.175 W slot operator(): id 12 | task 357 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.450.206 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.588.317 I slot print_timing: id 8 | task 265 | prompt eval time = 126.00 ms / 29 tokens ( 4.34 ms per token, 230.16 tokens per second)
1.12.588.320 I slot print_timing: id 8 | task 265 | eval time = 9004.89 ms / 128 tokens ( 70.35 ms per token, 14.21 tokens per second)
1.12.588.321 I slot print_timing: id 8 | task 265 | total time = 9130.89 ms / 157 tokens
1.12.588.321 I slot print_timing: id 8 | task 265 | graphs reused = 1
1.12.588.324 I slot print_timing: id 8 | task 265 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.12.588.338 I statistics draft-mtp: #calls(b,g,a) = 87 270 4131, #gen drafts = 4144, #acc drafts = 2905, #gen tokens = 8265, #acc tokens = 5506, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.630), dur(b,g,a) = 0.060, 987.102, 5.068 ms
1.12.588.365 I slot release: id 8 | task 265 | stop processing: n_tokens = 156, truncated = 0
1.12.596.712 I srv operator(): Chat format: peg-native
1.12.710.469 I slot print_timing: id 10 | task 297 | prompt eval time = 139.32 ms / 28 tokens ( 4.98 ms per token, 200.98 tokens per second)
1.12.710.472 I slot print_timing: id 10 | task 297 | eval time = 5999.91 ms / 125 tokens ( 48.00 ms per token, 20.83 tokens per second)
1.12.710.473 I slot print_timing: id 10 | task 297 | total time = 6139.23 ms / 153 tokens
1.12.710.474 I slot print_timing: id 10 | task 297 | graphs reused = 1
1.12.710.477 I slot print_timing: id 10 | task 297 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.12.710.489 I statistics draft-mtp: #calls(b,g,a) = 88 271 4154, #gen drafts = 4159, #acc drafts = 2920, #gen tokens = 8295, #acc tokens = 5535, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.630), dur(b,g,a) = 0.061, 992.207, 5.101 ms
1.12.710.518 I slot release: id 10 | task 297 | stop processing: n_tokens = 152, truncated = 0
1.12.712.462 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.12.712.531 I slot launch_slot_: id 8 | task 360 | processing task, is_child = 0
1.12.718.294 W slot operator(): id 8 | task 360 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.718.327 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.12.718.975 I srv operator(): Chat format: peg-native
1.12.844.475 I slot print_timing: id 13 | task 315 | n_decoded = 102, tg = 23.26 t/s, tg_3s = 23.26 t/s
1.12.845.404 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.12.845.472 I slot launch_slot_: id 10 | task 362 | processing task, is_child = 0
1.12.850.010 W slot operator(): id 10 | task 362 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.12.850.035 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.098.355 I slot print_timing: id 0 | task 312 | n_decoded = 101, tg = 20.63 t/s, tg_3s = 20.63 t/s
1.13.350.127 I slot print_timing: id 13 | task 315 | prompt eval time = 125.83 ms / 25 tokens ( 5.03 ms per token, 198.67 tokens per second)
1.13.350.130 I slot print_timing: id 13 | task 315 | eval time = 4891.70 ms / 114 tokens ( 42.91 ms per token, 23.30 tokens per second)
1.13.350.130 I slot print_timing: id 13 | task 315 | total time = 5017.53 ms / 139 tokens
1.13.350.131 I slot print_timing: id 13 | task 315 | graphs reused = 1
1.13.350.136 I slot print_timing: id 13 | task 315 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.13.350.147 I statistics draft-mtp: #calls(b,g,a) = 90 276 4234, #gen drafts = 4236, #acc drafts = 2975, #gen tokens = 8449, #acc tokens = 5638, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.062, 1011.607, 5.208 ms
1.13.350.171 I slot release: id 13 | task 315 | stop processing: n_tokens = 138, truncated = 0
1.13.358.633 I srv operator(): Chat format: peg-native
1.13.470.439 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.13.470.508 I slot launch_slot_: id 13 | task 368 | processing task, is_child = 0
1.13.474.509 W slot operator(): id 13 | task 368 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.13.474.539 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.13.607.311 I slot print_timing: id 15 | task 296 | n_decoded = 100, tg = 14.50 t/s, tg_3s = 14.50 t/s
1.13.974.783 I slot print_timing: id 14 | task 327 | n_decoded = 102, tg = 23.27 t/s, tg_3s = 23.27 t/s
1.14.212.874 I slot print_timing: id 0 | task 312 | prompt eval time = 125.52 ms / 28 tokens ( 4.48 ms per token, 223.08 tokens per second)
1.14.212.881 I slot print_timing: id 0 | task 312 | eval time = 6010.04 ms / 125 tokens ( 48.08 ms per token, 20.80 tokens per second)
1.14.212.881 I slot print_timing: id 0 | task 312 | total time = 6135.55 ms / 153 tokens
1.14.212.882 I slot print_timing: id 0 | task 312 | graphs reused = 1
1.14.212.886 I slot print_timing: id 0 | task 312 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.14.212.905 I statistics draft-mtp: #calls(b,g,a) = 91 283 4331, #gen drafts = 4346, #acc drafts = 3043, #gen tokens = 8669, #acc tokens = 5766, #mean acc len = 2.33, #acc rate/pos = (0.703, 0.629), dur(b,g,a) = 0.063, 1034.802, 5.320 ms
1.14.212.938 I slot release: id 0 | task 312 | stop processing: n_tokens = 152, truncated = 0
1.14.222.134 I srv operator(): Chat format: peg-native
1.14.335.000 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.14.335.076 I slot launch_slot_: id 0 | task 376 | processing task, is_child = 0
1.14.338.139 W slot operator(): id 0 | task 376 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.338.166 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.466.056 I slot print_timing: id 3 | task 326 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.14.471.484 I slot print_timing: id 14 | task 327 | prompt eval time = 154.43 ms / 25 tokens ( 6.18 ms per token, 161.88 tokens per second)
1.14.471.487 I slot print_timing: id 14 | task 327 | eval time = 4879.41 ms / 114 tokens ( 42.80 ms per token, 23.36 tokens per second)
1.14.471.487 I slot print_timing: id 14 | task 327 | total time = 5033.84 ms / 139 tokens
1.14.471.488 I slot print_timing: id 14 | task 327 | graphs reused = 1
1.14.471.491 I slot print_timing: id 14 | task 327 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.14.471.503 I statistics draft-mtp: #calls(b,g,a) = 92 285 4375, #gen drafts = 4376, #acc drafts = 3073, #gen tokens = 8728, #acc tokens = 5822, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.064, 1040.808, 5.375 ms
1.14.471.535 I slot release: id 14 | task 327 | stop processing: n_tokens = 138, truncated = 0
1.14.480.360 I srv operator(): Chat format: peg-native
1.14.581.478 I slot print_timing: id 11 | task 284 | prompt eval time = 133.57 ms / 29 tokens ( 4.61 ms per token, 217.11 tokens per second)
1.14.581.484 I slot print_timing: id 11 | task 284 | eval time = 9003.99 ms / 128 tokens ( 70.34 ms per token, 14.22 tokens per second)
1.14.581.484 I slot print_timing: id 11 | task 284 | total time = 9137.57 ms / 157 tokens
1.14.581.485 I slot print_timing: id 11 | task 284 | graphs reused = 1
1.14.581.488 I slot print_timing: id 11 | task 284 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.14.581.505 I statistics draft-mtp: #calls(b,g,a) = 92 286 4376, #gen drafts = 4390, #acc drafts = 3073, #gen tokens = 8756, #acc tokens = 5822, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.064, 1045.614, 5.376 ms
1.14.581.532 I slot release: id 11 | task 284 | stop processing: n_tokens = 156, truncated = 0
1.14.588.969 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.14.589.049 I slot launch_slot_: id 11 | task 379 | processing task, is_child = 0
1.14.590.487 I srv operator(): Chat format: peg-native
1.14.593.881 W slot operator(): id 11 | task 379 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.593.922 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.720.302 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.14.720.378 I slot launch_slot_: id 14 | task 381 | processing task, is_child = 0
1.14.724.389 W slot operator(): id 14 | task 381 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.14.724.422 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.14.973.503 I slot print_timing: id 2 | task 310 | n_decoded = 100, tg = 14.48 t/s, tg_3s = 14.48 t/s
1.15.220.806 I slot print_timing: id 7 | task 340 | n_decoded = 102, tg = 23.32 t/s, tg_3s = 23.32 t/s
1.15.463.866 I slot print_timing: id 4 | task 337 | n_decoded = 101, tg = 20.73 t/s, tg_3s = 20.73 t/s
1.15.585.693 I slot print_timing: id 3 | task 326 | prompt eval time = 153.95 ms / 28 tokens ( 5.50 ms per token, 181.88 tokens per second)
1.15.585.696 I slot print_timing: id 3 | task 326 | eval time = 5994.24 ms / 125 tokens ( 47.95 ms per token, 20.85 tokens per second)
1.15.585.696 I slot print_timing: id 3 | task 326 | total time = 6148.20 ms / 153 tokens
1.15.585.698 I slot print_timing: id 3 | task 326 | graphs reused = 1
1.15.585.701 I slot print_timing: id 3 | task 326 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.15.585.713 I statistics draft-mtp: #calls(b,g,a) = 94 294 4503, #gen drafts = 4515, #acc drafts = 3159, #gen tokens = 9005, #acc tokens = 5988, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.066, 1072.639, 5.530 ms
1.15.585.741 I slot release: id 3 | task 326 | stop processing: n_tokens = 152, truncated = 0
1.15.594.686 I srv operator(): Chat format: peg-native
1.15.699.724 I slot print_timing: id 15 | task 296 | prompt eval time = 139.53 ms / 29 tokens ( 4.81 ms per token, 207.83 tokens per second)
1.15.699.729 I slot print_timing: id 15 | task 296 | eval time = 8988.90 ms / 128 tokens ( 70.23 ms per token, 14.24 tokens per second)
1.15.699.730 I slot print_timing: id 15 | task 296 | total time = 9128.43 ms / 157 tokens
1.15.699.730 I slot print_timing: id 15 | task 296 | graphs reused = 1
1.15.699.733 I slot print_timing: id 15 | task 296 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.15.699.746 I statistics draft-mtp: #calls(b,g,a) = 94 295 4515, #gen drafts = 4529, #acc drafts = 3169, #gen tokens = 9033, #acc tokens = 6007, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.629), dur(b,g,a) = 0.066, 1076.661, 5.546 ms
1.15.699.768 I slot release: id 15 | task 296 | stop processing: n_tokens = 156, truncated = 0
1.15.704.254 I slot print_timing: id 7 | task 340 | prompt eval time = 124.73 ms / 25 tokens ( 4.99 ms per token, 200.43 tokens per second)
1.15.704.258 I slot print_timing: id 7 | task 340 | eval time = 4856.91 ms / 114 tokens ( 42.60 ms per token, 23.47 tokens per second)
1.15.704.258 I slot print_timing: id 7 | task 340 | total time = 4981.64 ms / 139 tokens
1.15.704.260 I slot print_timing: id 7 | task 340 | graphs reused = 1
1.15.704.263 I slot print_timing: id 7 | task 340 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.15.704.273 I statistics draft-mtp: #calls(b,g,a) = 94 295 4522, #gen drafts = 4529, #acc drafts = 3173, #gen tokens = 9033, #acc tokens = 6015, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.066, 1076.661, 5.558 ms
1.15.704.299 I slot release: id 7 | task 340 | stop processing: n_tokens = 138, truncated = 0
1.15.708.915 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.15.708.981 I slot launch_slot_: id 15 | task 390 | processing task, is_child = 0
1.15.709.884 I srv operator(): Chat format: peg-native
1.15.712.607 I srv operator(): Chat format: peg-native
1.15.714.722 W slot operator(): id 15 | task 390 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.714.755 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.836.349 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.15.836.416 I slot launch_slot_: id 3 | task 392 | processing task, is_child = 0
1.15.836.419 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.15.836.438 I slot launch_slot_: id 7 | task 393 | processing task, is_child = 0
1.15.841.966 W slot operator(): id 3 | task 392 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.842.004 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.15.842.053 W slot operator(): id 7 | task 393 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.15.842.073 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.227.660 I slot print_timing: id 5 | task 325 | n_decoded = 100, tg = 15.07 t/s, tg_3s = 15.07 t/s
1.16.596.978 I slot print_timing: id 4 | task 337 | prompt eval time = 139.55 ms / 28 tokens ( 4.98 ms per token, 200.65 tokens per second)
1.16.596.981 I slot print_timing: id 4 | task 337 | eval time = 6004.38 ms / 125 tokens ( 48.03 ms per token, 20.82 tokens per second)
1.16.596.982 I slot print_timing: id 4 | task 337 | total time = 6143.92 ms / 153 tokens
1.16.596.983 I slot print_timing: id 4 | task 337 | graphs reused = 1
1.16.596.985 I slot print_timing: id 4 | task 337 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.16.596.996 I statistics draft-mtp: #calls(b,g,a) = 97 302 4625, #gen drafts = 4636, #acc drafts = 3245, #gen tokens = 9247, #acc tokens = 6150, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.628), dur(b,g,a) = 0.067, 1103.260, 5.686 ms
1.16.597.025 I slot release: id 4 | task 337 | stop processing: n_tokens = 152, truncated = 0
1.16.606.176 I srv operator(): Chat format: peg-native
1.16.720.871 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.16.720.938 I slot launch_slot_: id 4 | task 401 | processing task, is_child = 0
1.16.725.957 W slot operator(): id 4 | task 401 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.16.725.979 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.16.979.717 I slot print_timing: id 12 | task 357 | n_decoded = 102, tg = 23.23 t/s, tg_3s = 23.23 t/s
1.17.094.885 I slot print_timing: id 2 | task 310 | prompt eval time = 118.76 ms / 29 tokens ( 4.10 ms per token, 244.19 tokens per second)
1.17.094.888 I slot print_timing: id 2 | task 310 | eval time = 9027.29 ms / 128 tokens ( 70.53 ms per token, 14.18 tokens per second)
1.17.094.889 I slot print_timing: id 2 | task 310 | total time = 9146.05 ms / 157 tokens
1.17.094.890 I slot print_timing: id 2 | task 310 | graphs reused = 1
1.17.094.893 I slot print_timing: id 2 | task 310 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.17.094.909 I statistics draft-mtp: #calls(b,g,a) = 98 306 4682, #gen drafts = 4697, #acc drafts = 3283, #gen tokens = 9368, #acc tokens = 6223, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.068, 1119.412, 5.750 ms
1.17.094.931 I slot release: id 2 | task 310 | stop processing: n_tokens = 156, truncated = 0
1.17.103.983 I srv operator(): Chat format: peg-native
1.17.219.786 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.17.219.864 I slot launch_slot_: id 2 | task 406 | processing task, is_child = 0
1.17.223.886 W slot operator(): id 2 | task 406 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.223.911 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.472.285 I slot print_timing: id 1 | task 356 | n_decoded = 101, tg = 20.68 t/s, tg_3s = 20.68 t/s
1.17.475.260 I slot print_timing: id 6 | task 336 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
1.17.478.195 I slot print_timing: id 12 | task 357 | prompt eval time = 138.46 ms / 25 tokens ( 5.54 ms per token, 180.56 tokens per second)
1.17.478.197 I slot print_timing: id 12 | task 357 | eval time = 4889.53 ms / 114 tokens ( 42.89 ms per token, 23.32 tokens per second)
1.17.478.197 I slot print_timing: id 12 | task 357 | total time = 5027.99 ms / 139 tokens
1.17.478.198 I slot print_timing: id 12 | task 357 | graphs reused = 1
1.17.478.201 I slot print_timing: id 12 | task 357 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.17.478.214 I statistics draft-mtp: #calls(b,g,a) = 99 309 4740, #gen drafts = 4743, #acc drafts = 3327, #gen tokens = 9460, #acc tokens = 6307, #mean acc len = 2.33, #acc rate/pos = (0.702, 0.629), dur(b,g,a) = 0.068, 1130.312, 5.819 ms
1.17.478.238 I slot release: id 12 | task 357 | stop processing: n_tokens = 138, truncated = 0
1.17.489.508 I srv operator(): Chat format: peg-native
1.17.597.374 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.17.597.444 I slot launch_slot_: id 12 | task 410 | processing task, is_child = 0
1.17.602.230 W slot operator(): id 12 | task 410 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.17.602.264 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.17.852.739 I slot print_timing: id 10 | task 362 | n_decoded = 101, tg = 20.71 t/s, tg_3s = 20.71 t/s
1.17.976.473 I slot print_timing: id 13 | task 368 | n_decoded = 102, tg = 23.31 t/s, tg_3s = 23.31 t/s
1.18.336.812 I slot print_timing: id 5 | task 325 | prompt eval time = 154.21 ms / 29 tokens ( 5.32 ms per token, 188.06 tokens per second)
1.18.336.816 I slot print_timing: id 5 | task 325 | eval time = 8745.04 ms / 128 tokens ( 68.32 ms per token, 14.64 tokens per second)
1.18.336.816 I slot print_timing: id 5 | task 325 | total time = 8899.25 ms / 157 tokens
1.18.336.818 I slot print_timing: id 5 | task 325 | graphs reused = 1
1.18.336.821 I slot print_timing: id 5 | task 325 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.18.336.845 I statistics draft-mtp: #calls(b,g,a) = 100 316 4837, #gen drafts = 4852, #acc drafts = 3389, #gen tokens = 9677, #acc tokens = 6423, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.627), dur(b,g,a) = 0.069, 1155.723, 5.943 ms
1.18.336.869 I slot release: id 5 | task 325 | stop processing: n_tokens = 156, truncated = 0
1.18.345.725 I srv operator(): Chat format: peg-native
1.18.459.346 I slot print_timing: id 9 | task 349 | n_decoded = 100, tg = 15.10 t/s, tg_3s = 15.10 t/s
1.18.461.593 I slot print_timing: id 13 | task 368 | prompt eval time = 125.31 ms / 25 tokens ( 5.01 ms per token, 199.51 tokens per second)
1.18.461.596 I slot print_timing: id 13 | task 368 | eval time = 4861.74 ms / 114 tokens ( 42.65 ms per token, 23.45 tokens per second)
1.18.461.597 I slot print_timing: id 13 | task 368 | total time = 4987.04 ms / 139 tokens
1.18.461.598 I slot print_timing: id 13 | task 368 | graphs reused = 1
1.18.461.601 I slot print_timing: id 13 | task 368 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.18.461.613 I statistics draft-mtp: #calls(b,g,a) = 100 317 4865, #gen drafts = 4867, #acc drafts = 3411, #gen tokens = 9707, #acc tokens = 6465, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.069, 1160.494, 5.979 ms
1.18.461.639 I slot release: id 13 | task 368 | stop processing: n_tokens = 138, truncated = 0
1.18.462.919 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.18.462.986 I slot launch_slot_: id 5 | task 418 | processing task, is_child = 0
1.18.468.529 W slot operator(): id 5 | task 418 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.468.563 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.470.315 I srv operator(): Chat format: peg-native
1.18.588.846 I slot print_timing: id 1 | task 356 | prompt eval time = 137.97 ms / 28 tokens ( 4.93 ms per token, 202.94 tokens per second)
1.18.588.851 I slot print_timing: id 1 | task 356 | eval time = 6000.71 ms / 125 tokens ( 48.01 ms per token, 20.83 tokens per second)
1.18.588.851 I slot print_timing: id 1 | task 356 | total time = 6138.68 ms / 153 tokens
1.18.588.852 I slot print_timing: id 1 | task 356 | graphs reused = 1
1.18.588.855 I slot print_timing: id 1 | task 356 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.18.588.865 I statistics draft-mtp: #calls(b,g,a) = 101 318 4869, #gen drafts = 4881, #acc drafts = 3414, #gen tokens = 9735, #acc tokens = 6471, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.070, 1165.960, 5.985 ms
1.18.588.890 I slot release: id 1 | task 356 | stop processing: n_tokens = 152, truncated = 0
1.18.595.167 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.18.595.233 I slot launch_slot_: id 1 | task 420 | processing task, is_child = 0
1.18.597.436 I srv operator(): Chat format: peg-native
1.18.600.063 W slot operator(): id 1 | task 420 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.600.090 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.726.201 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.18.726.276 I slot launch_slot_: id 13 | task 422 | processing task, is_child = 0
1.18.730.343 W slot operator(): id 13 | task 422 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.18.730.367 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.18.981.476 I slot print_timing: id 10 | task 362 | prompt eval time = 126.04 ms / 28 tokens ( 4.50 ms per token, 222.16 tokens per second)
1.18.981.480 I slot print_timing: id 10 | task 362 | eval time = 6005.39 ms / 125 tokens ( 48.04 ms per token, 20.81 tokens per second)
1.18.981.480 I slot print_timing: id 10 | task 362 | total time = 6131.43 ms / 153 tokens
1.18.981.481 I slot print_timing: id 10 | task 362 | graphs reused = 1
1.18.981.484 I slot print_timing: id 10 | task 362 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.18.981.495 I statistics draft-mtp: #calls(b,g,a) = 103 321 4921, #gen drafts = 4926, #acc drafts = 3448, #gen tokens = 9825, #acc tokens = 6536, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.072, 1177.792, 6.047 ms
1.18.981.522 I slot release: id 10 | task 362 | stop processing: n_tokens = 152, truncated = 0
1.18.990.699 I srv operator(): Chat format: peg-native
1.19.100.556 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.19.100.630 I slot launch_slot_: id 10 | task 426 | processing task, is_child = 0
1.19.105.269 W slot operator(): id 10 | task 426 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.105.299 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.238.621 I slot print_timing: id 14 | task 381 | n_decoded = 102, tg = 23.24 t/s, tg_3s = 23.24 t/s
1.19.599.234 I slot print_timing: id 6 | task 336 | prompt eval time = 139.77 ms / 29 tokens ( 4.82 ms per token, 207.49 tokens per second)
1.19.599.241 I slot print_timing: id 6 | task 336 | eval time = 9006.34 ms / 128 tokens ( 70.36 ms per token, 14.21 tokens per second)
1.19.599.242 I slot print_timing: id 6 | task 336 | total time = 9146.11 ms / 157 tokens
1.19.599.243 I slot print_timing: id 6 | task 336 | graphs reused = 1
1.19.599.246 I slot print_timing: id 6 | task 336 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.19.599.261 I statistics draft-mtp: #calls(b,g,a) = 104 326 4988, #gen drafts = 5003, #acc drafts = 3496, #gen tokens = 9978, #acc tokens = 6627, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.073, 1197.437, 6.126 ms
1.19.599.290 I slot release: id 6 | task 336 | stop processing: n_tokens = 156, truncated = 0
1.19.604.192 I slot print_timing: id 11 | task 379 | n_decoded = 101, tg = 20.65 t/s, tg_3s = 20.65 t/s
1.19.608.581 I srv operator(): Chat format: peg-native
1.19.720.595 I slot print_timing: id 8 | task 360 | n_decoded = 100, tg = 14.53 t/s, tg_3s = 14.53 t/s
1.19.723.903 I slot print_timing: id 14 | task 381 | prompt eval time = 125.29 ms / 25 tokens ( 5.01 ms per token, 199.54 tokens per second)
1.19.723.906 I slot print_timing: id 14 | task 381 | eval time = 4874.18 ms / 114 tokens ( 42.76 ms per token, 23.39 tokens per second)
1.19.723.906 I slot print_timing: id 14 | task 381 | total time = 4999.47 ms / 139 tokens
1.19.723.908 I slot print_timing: id 14 | task 381 | graphs reused = 1
1.19.723.911 I slot print_timing: id 14 | task 381 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.19.723.922 I statistics draft-mtp: #calls(b,g,a) = 104 327 5017, #gen drafts = 5018, #acc drafts = 3516, #gen tokens = 10008, #acc tokens = 6666, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.073, 1202.328, 6.160 ms
1.19.723.949 I slot release: id 14 | task 381 | stop processing: n_tokens = 138, truncated = 0
1.19.724.261 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.19.724.326 I slot launch_slot_: id 6 | task 432 | processing task, is_child = 0
1.19.729.912 W slot operator(): id 6 | task 432 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.729.933 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.19.731.991 I srv operator(): Chat format: peg-native
1.19.856.869 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.19.856.946 I slot launch_slot_: id 14 | task 434 | processing task, is_child = 0
1.19.860.928 W slot operator(): id 14 | task 434 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.19.860.963 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.355.918 I slot print_timing: id 7 | task 393 | n_decoded = 102, tg = 23.32 t/s, tg_3s = 23.32 t/s
1.20.597.072 I slot print_timing: id 9 | task 349 | prompt eval time = 125.93 ms / 29 tokens ( 4.34 ms per token, 230.28 tokens per second)
1.20.597.076 I slot print_timing: id 9 | task 349 | eval time = 8758.55 ms / 128 tokens ( 68.43 ms per token, 14.61 tokens per second)
1.20.597.077 I slot print_timing: id 9 | task 349 | total time = 8884.48 ms / 157 tokens
1.20.597.078 I slot print_timing: id 9 | task 349 | graphs reused = 1
1.20.597.081 I slot print_timing: id 9 | task 349 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.20.597.100 I statistics draft-mtp: #calls(b,g,a) = 106 334 5111, #gen drafts = 5126, #acc drafts = 3577, #gen tokens = 10223, #acc tokens = 6780, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.074, 1228.393, 6.277 ms
1.20.597.134 I slot release: id 9 | task 349 | stop processing: n_tokens = 156, truncated = 0
1.20.605.465 I srv operator(): Chat format: peg-native
1.20.723.254 I slot print_timing: id 11 | task 379 | prompt eval time = 119.25 ms / 28 tokens ( 4.26 ms per token, 234.80 tokens per second)
1.20.723.258 I slot print_timing: id 11 | task 379 | eval time = 6010.06 ms / 125 tokens ( 48.08 ms per token, 20.80 tokens per second)
1.20.723.259 I slot print_timing: id 11 | task 379 | total time = 6129.31 ms / 153 tokens
1.20.723.260 I slot print_timing: id 11 | task 379 | graphs reused = 1
1.20.723.263 I slot print_timing: id 11 | task 379 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.20.723.276 I statistics draft-mtp: #calls(b,g,a) = 106 335 5137, #gen drafts = 5141, #acc drafts = 3600, #gen tokens = 10253, #acc tokens = 6824, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.074, 1233.114, 6.314 ms
1.20.723.309 I slot release: id 11 | task 379 | stop processing: n_tokens = 152, truncated = 0
1.20.725.759 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.20.725.829 I slot launch_slot_: id 9 | task 441 | processing task, is_child = 0
1.20.731.084 W slot operator(): id 9 | task 441 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.731.117 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.732.233 I srv operator(): Chat format: peg-native
1.20.852.129 I slot print_timing: id 3 | task 392 | n_decoded = 101, tg = 20.74 t/s, tg_3s = 20.73 t/s
1.20.854.197 I slot print_timing: id 7 | task 393 | prompt eval time = 139.36 ms / 25 tokens ( 5.57 ms per token, 179.39 tokens per second)
1.20.854.199 I slot print_timing: id 7 | task 393 | eval time = 4872.76 ms / 114 tokens ( 42.74 ms per token, 23.40 tokens per second)
1.20.854.199 I slot print_timing: id 7 | task 393 | total time = 5012.12 ms / 139 tokens
1.20.854.200 I slot print_timing: id 7 | task 393 | graphs reused = 1
1.20.854.203 I slot print_timing: id 7 | task 393 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.20.854.216 I statistics draft-mtp: #calls(b,g,a) = 107 336 5149, #gen drafts = 5155, #acc drafts = 3609, #gen tokens = 10281, #acc tokens = 6842, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.075, 1238.276, 6.330 ms
1.20.854.245 I slot release: id 7 | task 393 | stop processing: n_tokens = 138, truncated = 0
1.20.857.423 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.20.857.494 I slot launch_slot_: id 11 | task 444 | processing task, is_child = 0
1.20.862.529 I srv operator(): Chat format: peg-native
1.20.863.261 W slot operator(): id 11 | task 444 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.863.295 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.20.989.013 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.20.989.083 I slot launch_slot_: id 7 | task 446 | processing task, is_child = 0
1.20.994.255 W slot operator(): id 7 | task 446 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.20.994.277 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.21.120.155 I slot print_timing: id 0 | task 376 | n_decoded = 100, tg = 15.02 t/s, tg_3s = 15.02 t/s
1.21.853.722 I slot print_timing: id 8 | task 360 | prompt eval time = 119.62 ms / 29 tokens ( 4.12 ms per token, 242.43 tokens per second)
1.21.853.729 I slot print_timing: id 8 | task 360 | eval time = 9015.78 ms / 128 tokens ( 70.44 ms per token, 14.20 tokens per second)
1.21.853.729 I slot print_timing: id 8 | task 360 | total time = 9135.40 ms / 157 tokens
1.21.853.730 I slot print_timing: id 8 | task 360 | graphs reused = 1
1.21.853.733 I slot print_timing: id 8 | task 360 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.21.853.745 I statistics draft-mtp: #calls(b,g,a) = 109 344 5264, #gen drafts = 5279, #acc drafts = 3689, #gen tokens = 10528, #acc tokens = 6993, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.077, 1269.372, 6.472 ms
1.21.853.770 I slot release: id 8 | task 360 | stop processing: n_tokens = 156, truncated = 0
1.21.862.765 I srv operator(): Chat format: peg-native
1.21.973.425 I slot print_timing: id 3 | task 392 | prompt eval time = 139.14 ms / 28 tokens ( 4.97 ms per token, 201.23 tokens per second)
1.21.973.427 I slot print_timing: id 3 | task 392 | eval time = 5992.27 ms / 125 tokens ( 47.94 ms per token, 20.86 tokens per second)
1.21.973.427 I slot print_timing: id 3 | task 392 | total time = 6131.42 ms / 153 tokens
1.21.973.428 I slot print_timing: id 3 | task 392 | graphs reused = 1
1.21.973.431 I slot print_timing: id 3 | task 392 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.21.973.442 I statistics draft-mtp: #calls(b,g,a) = 109 345 5283, #gen drafts = 5294, #acc drafts = 3702, #gen tokens = 10558, #acc tokens = 7019, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.077, 1274.434, 6.497 ms
1.21.973.466 I slot release: id 3 | task 392 | stop processing: n_tokens = 152, truncated = 0
1.21.977.757 I slot get_availabl: id 8 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.21.977.822 I slot launch_slot_: id 8 | task 455 | processing task, is_child = 0
1.21.982.915 I srv operator(): Chat format: peg-native
1.21.983.551 W slot operator(): id 8 | task 455 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.21.983.588 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.109.612 I slot print_timing: id 12 | task 410 | n_decoded = 102, tg = 23.27 t/s, tg_3s = 23.27 t/s
1.22.111.126 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.22.111.196 I slot launch_slot_: id 3 | task 457 | processing task, is_child = 0
1.22.115.397 W slot operator(): id 3 | task 457 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.115.417 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.22.242.542 I slot print_timing: id 2 | task 406 | n_decoded = 101, tg = 20.64 t/s, tg_3s = 20.64 t/s
1.22.614.303 I slot print_timing: id 12 | task 410 | prompt eval time = 124.90 ms / 25 tokens ( 5.00 ms per token, 200.15 tokens per second)
1.22.614.306 I slot print_timing: id 12 | task 410 | eval time = 4887.13 ms / 114 tokens ( 42.87 ms per token, 23.33 tokens per second)
1.22.614.306 I slot print_timing: id 12 | task 410 | total time = 5012.03 ms / 139 tokens
1.22.614.307 I slot print_timing: id 12 | task 410 | graphs reused = 1
1.22.614.310 I slot print_timing: id 12 | task 410 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.22.614.321 I statistics draft-mtp: #calls(b,g,a) = 111 350 5368, #gen drafts = 5371, #acc drafts = 3761, #gen tokens = 10712, #acc tokens = 7131, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.079, 1293.497, 6.613 ms
1.22.614.347 I slot release: id 12 | task 410 | stop processing: n_tokens = 138, truncated = 0
1.22.623.376 I srv operator(): Chat format: peg-native
1.22.732.883 I slot print_timing: id 15 | task 390 | n_decoded = 100, tg = 14.48 t/s, tg_3s = 14.48 t/s
1.22.732.897 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.22.732.965 I slot launch_slot_: id 12 | task 463 | processing task, is_child = 0
1.22.737.615 W slot operator(): id 12 | task 463 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.22.737.638 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.226.984 I slot print_timing: id 0 | task 376 | prompt eval time = 125.88 ms / 29 tokens ( 4.34 ms per token, 230.37 tokens per second)
1.23.226.987 I slot print_timing: id 0 | task 376 | eval time = 8762.93 ms / 128 tokens ( 68.46 ms per token, 14.61 tokens per second)
1.23.226.988 I slot print_timing: id 0 | task 376 | total time = 8888.82 ms / 157 tokens
1.23.226.989 I slot print_timing: id 0 | task 376 | graphs reused = 1
1.23.226.991 I slot print_timing: id 0 | task 376 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.23.227.006 I statistics draft-mtp: #calls(b,g,a) = 112 355 5433, #gen drafts = 5448, #acc drafts = 3805, #gen tokens = 10865, #acc tokens = 7213, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.079, 1311.297, 6.696 ms
1.23.227.032 I slot release: id 0 | task 376 | stop processing: n_tokens = 156, truncated = 0
1.23.234.454 I slot print_timing: id 13 | task 422 | n_decoded = 102, tg = 23.29 t/s, tg_3s = 23.29 t/s
1.23.235.862 I srv operator(): Chat format: peg-native
1.23.344.112 I slot print_timing: id 2 | task 406 | prompt eval time = 125.77 ms / 28 tokens ( 4.49 ms per token, 222.63 tokens per second)
1.23.344.119 I slot print_timing: id 2 | task 406 | eval time = 5994.42 ms / 125 tokens ( 47.96 ms per token, 20.85 tokens per second)
1.23.344.119 I slot print_timing: id 2 | task 406 | total time = 6120.19 ms / 153 tokens
1.23.344.120 I slot print_timing: id 2 | task 406 | graphs reused = 1
1.23.344.123 I slot print_timing: id 2 | task 406 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.23.344.136 I statistics draft-mtp: #calls(b,g,a) = 112 356 5450, #gen drafts = 5463, #acc drafts = 3820, #gen tokens = 10895, #acc tokens = 7242, #mean acc len = 2.33, #acc rate/pos = (0.701, 0.628), dur(b,g,a) = 0.079, 1314.289, 6.718 ms
1.23.344.160 I slot release: id 2 | task 406 | stop processing: n_tokens = 152, truncated = 0
1.23.350.085 I slot get_availabl: id 0 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.23.350.152 I slot launch_slot_: id 0 | task 469 | processing task, is_child = 0
1.23.353.120 I srv operator(): Chat format: peg-native
1.23.354.042 W slot operator(): id 0 | task 469 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.354.062 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.474.623 I slot print_timing: id 4 | task 401 | n_decoded = 100, tg = 15.10 t/s, tg_3s = 15.10 t/s
1.23.479.736 I slot get_availabl: id 2 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.23.479.802 I slot launch_slot_: id 2 | task 471 | processing task, is_child = 0
1.23.483.913 W slot operator(): id 2 | task 471 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.483.937 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.23.610.476 I slot print_timing: id 1 | task 420 | n_decoded = 101, tg = 20.65 t/s, tg_3s = 20.65 t/s
1.23.737.698 I slot print_timing: id 13 | task 422 | prompt eval time = 124.93 ms / 25 tokens ( 5.00 ms per token, 200.12 tokens per second)
1.23.737.701 I slot print_timing: id 13 | task 422 | eval time = 4882.37 ms / 114 tokens ( 42.83 ms per token, 23.35 tokens per second)
1.23.737.702 I slot print_timing: id 13 | task 422 | total time = 5007.30 ms / 139 tokens
1.23.737.702 I slot print_timing: id 13 | task 422 | graphs reused = 1
1.23.737.705 I slot print_timing: id 13 | task 422 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.23.737.717 I statistics draft-mtp: #calls(b,g,a) = 114 359 5506, #gen drafts = 5508, #acc drafts = 3856, #gen tokens = 10985, #acc tokens = 7309, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.081, 1325.196, 6.791 ms
1.23.737.748 I slot release: id 13 | task 422 | stop processing: n_tokens = 138, truncated = 0
1.23.746.082 I srv operator(): Chat format: peg-native
1.23.856.468 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.23.856.540 I slot launch_slot_: id 13 | task 475 | processing task, is_child = 0
1.23.860.673 W slot operator(): id 13 | task 475 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.23.860.704 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.358.740 I slot print_timing: id 14 | task 434 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.24.718.226 I slot print_timing: id 1 | task 420 | prompt eval time = 119.30 ms / 28 tokens ( 4.26 ms per token, 234.69 tokens per second)
1.24.718.229 I slot print_timing: id 1 | task 420 | eval time = 5998.82 ms / 125 tokens ( 47.99 ms per token, 20.84 tokens per second)
1.24.718.229 I slot print_timing: id 1 | task 420 | total time = 6118.12 ms / 153 tokens
1.24.718.230 I slot print_timing: id 1 | task 420 | graphs reused = 1
1.24.718.233 I slot print_timing: id 1 | task 420 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.24.718.245 I statistics draft-mtp: #calls(b,g,a) = 115 367 5620, #gen drafts = 5634, #acc drafts = 3931, #gen tokens = 11236, #acc tokens = 7454, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.082, 1351.867, 6.932 ms
1.24.718.268 I slot release: id 1 | task 420 | stop processing: n_tokens = 152, truncated = 0
1.24.721.124 I slot print_timing: id 6 | task 432 | n_decoded = 101, tg = 20.73 t/s, tg_3s = 20.73 t/s
1.24.727.400 I srv operator(): Chat format: peg-native
1.24.833.246 I slot print_timing: id 15 | task 390 | prompt eval time = 112.92 ms / 29 tokens ( 3.89 ms per token, 256.83 tokens per second)
1.24.833.250 I slot print_timing: id 15 | task 390 | eval time = 9005.58 ms / 128 tokens ( 70.36 ms per token, 14.21 tokens per second)
1.24.833.251 I slot print_timing: id 15 | task 390 | total time = 9118.49 ms / 157 tokens
1.24.833.251 I slot print_timing: id 15 | task 390 | graphs reused = 1
1.24.833.254 I slot print_timing: id 15 | task 390 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.24.833.268 I statistics draft-mtp: #calls(b,g,a) = 115 368 5634, #gen drafts = 5648, #acc drafts = 3943, #gen tokens = 11264, #acc tokens = 7477, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.082, 1355.698, 6.949 ms
1.24.833.297 I slot release: id 15 | task 390 | stop processing: n_tokens = 156, truncated = 0
1.24.840.895 I slot print_timing: id 14 | task 434 | prompt eval time = 125.40 ms / 25 tokens ( 5.02 ms per token, 199.37 tokens per second)
1.24.840.897 I slot print_timing: id 14 | task 434 | eval time = 4854.53 ms / 114 tokens ( 42.58 ms per token, 23.48 tokens per second)
1.24.840.898 I slot print_timing: id 14 | task 434 | total time = 4979.93 ms / 139 tokens
1.24.840.899 I slot print_timing: id 14 | task 434 | graphs reused = 1
1.24.840.901 I slot print_timing: id 14 | task 434 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.24.840.907 I statistics draft-mtp: #calls(b,g,a) = 115 368 5648, #gen drafts = 5648, #acc drafts = 3955, #gen tokens = 11264, #acc tokens = 7499, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.082, 1355.698, 6.965 ms
1.24.840.934 I slot release: id 14 | task 434 | stop processing: n_tokens = 138, truncated = 0
1.24.840.952 I slot get_availabl: id 15 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.24.841.018 I slot launch_slot_: id 15 | task 484 | processing task, is_child = 0
1.24.841.574 I srv operator(): Chat format: peg-native
1.24.844.818 W slot operator(): id 15 | task 484 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.844.838 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.848.752 I srv operator(): Chat format: peg-native
1.24.962.718 I slot get_availabl: id 1 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.24.962.788 I slot launch_slot_: id 1 | task 486 | processing task, is_child = 0
1.24.962.790 I slot get_availabl: id 14 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.24.962.809 I slot launch_slot_: id 14 | task 487 | processing task, is_child = 0
1.24.967.583 W slot operator(): id 1 | task 486 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.967.612 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.24.967.653 W slot operator(): id 14 | task 487 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.24.967.675 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.230.822 I slot print_timing: id 5 | task 418 | n_decoded = 100, tg = 15.05 t/s, tg_3s = 15.05 t/s
1.25.476.478 I slot print_timing: id 7 | task 446 | n_decoded = 102, tg = 23.41 t/s, tg_3s = 23.41 t/s
1.25.595.253 I slot print_timing: id 4 | task 401 | prompt eval time = 125.79 ms / 29 tokens ( 4.34 ms per token, 230.54 tokens per second)
1.25.595.257 I slot print_timing: id 4 | task 401 | eval time = 8743.48 ms / 128 tokens ( 68.31 ms per token, 14.64 tokens per second)
1.25.595.257 I slot print_timing: id 4 | task 401 | total time = 8869.27 ms / 157 tokens
1.25.595.258 I slot print_timing: id 4 | task 401 | graphs reused = 1
1.25.595.262 I slot print_timing: id 4 | task 401 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.25.595.277 I statistics draft-mtp: #calls(b,g,a) = 118 374 5723, #gen drafts = 5738, #acc drafts = 4004, #gen tokens = 11443, #acc tokens = 7591, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.084, 1377.700, 7.055 ms
1.25.595.305 I slot release: id 4 | task 401 | stop processing: n_tokens = 156, truncated = 0
1.25.604.349 I srv operator(): Chat format: peg-native
1.25.719.971 I slot get_availabl: id 4 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.25.720.037 I slot launch_slot_: id 4 | task 494 | processing task, is_child = 0
1.25.725.205 W slot operator(): id 4 | task 494 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.725.242 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.25.853.871 I slot print_timing: id 6 | task 432 | prompt eval time = 119.58 ms / 28 tokens ( 4.27 ms per token, 234.15 tokens per second)
1.25.853.875 I slot print_timing: id 6 | task 432 | eval time = 6004.32 ms / 125 tokens ( 48.03 ms per token, 20.82 tokens per second)
1.25.853.876 I slot print_timing: id 6 | task 432 | total time = 6123.90 ms / 153 tokens
1.25.853.877 I slot print_timing: id 6 | task 432 | graphs reused = 1
1.25.853.880 I slot print_timing: id 6 | task 432 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.25.853.891 I statistics draft-mtp: #calls(b,g,a) = 119 376 5759, #gen drafts = 5768, #acc drafts = 4028, #gen tokens = 11503, #acc tokens = 7638, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.085, 1387.210, 7.102 ms
1.25.853.916 I slot release: id 6 | task 432 | stop processing: n_tokens = 152, truncated = 0
1.25.855.864 I slot print_timing: id 10 | task 426 | n_decoded = 100, tg = 15.09 t/s, tg_3s = 15.09 t/s
1.25.856.483 I slot print_timing: id 11 | task 444 | n_decoded = 101, tg = 20.72 t/s, tg_3s = 20.72 t/s
1.25.863.060 I srv operator(): Chat format: peg-native
1.25.971.965 I slot print_timing: id 7 | task 446 | prompt eval time = 125.20 ms / 25 tokens ( 5.01 ms per token, 199.68 tokens per second)
1.25.971.969 I slot print_timing: id 7 | task 446 | eval time = 4852.48 ms / 114 tokens ( 42.57 ms per token, 23.49 tokens per second)
1.25.971.969 I slot print_timing: id 7 | task 446 | total time = 4977.68 ms / 139 tokens
1.25.971.971 I slot print_timing: id 7 | task 446 | graphs reused = 1
1.25.971.974 I slot print_timing: id 7 | task 446 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.25.971.985 I statistics draft-mtp: #calls(b,g,a) = 119 377 5775, #gen drafts = 5783, #acc drafts = 4040, #gen tokens = 11533, #acc tokens = 7661, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.085, 1391.762, 7.120 ms
1.25.972.013 I slot release: id 7 | task 446 | stop processing: n_tokens = 138, truncated = 0
1.25.975.679 I slot get_availabl: id 6 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.25.975.747 I slot launch_slot_: id 6 | task 497 | processing task, is_child = 0
1.25.980.736 I srv operator(): Chat format: peg-native
1.25.981.225 W slot operator(): id 6 | task 497 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.25.981.246 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.106.950 I slot get_availabl: id 7 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.26.107.016 I slot launch_slot_: id 7 | task 499 | processing task, is_child = 0
1.26.112.183 W slot operator(): id 7 | task 499 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.26.112.214 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.26.976.975 I slot print_timing: id 11 | task 444 | prompt eval time = 119.21 ms / 28 tokens ( 4.26 ms per token, 234.89 tokens per second)
1.26.976.978 I slot print_timing: id 11 | task 444 | eval time = 5994.48 ms / 125 tokens ( 47.96 ms per token, 20.85 tokens per second)
1.26.976.979 I slot print_timing: id 11 | task 444 | total time = 6113.69 ms / 153 tokens
1.26.976.980 I slot print_timing: id 11 | task 444 | graphs reused = 1
1.26.976.982 I slot print_timing: id 11 | task 444 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.26.976.995 I statistics draft-mtp: #calls(b,g,a) = 121 385 5904, #gen drafts = 5908, #acc drafts = 4130, #gen tokens = 11783, #acc tokens = 7832, #mean acc len = 2.33, #acc rate/pos = (0.700, 0.627), dur(b,g,a) = 0.085, 1420.653, 7.279 ms
1.26.977.022 I slot release: id 11 | task 444 | stop processing: n_tokens = 152, truncated = 0
1.26.985.784 I srv operator(): Chat format: peg-native
1.27.090.584 I slot print_timing: id 3 | task 457 | n_decoded = 101, tg = 20.83 t/s, tg_3s = 20.83 t/s
1.27.095.985 I slot get_availabl: id 11 | task -1 | selected slot by LCP similarity, sim_best = 0.103 (> 0.100 thold), f_keep = 0.020
1.27.096.052 I slot launch_slot_: id 11 | task 508 | processing task, is_child = 0
1.27.101.012 W slot operator(): id 11 | task 508 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.101.049 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.232.084 I slot print_timing: id 12 | task 463 | n_decoded = 102, tg = 23.35 t/s, tg_3s = 23.34 t/s
1.27.348.457 I slot print_timing: id 5 | task 418 | prompt eval time = 119.28 ms / 29 tokens ( 4.11 ms per token, 243.12 tokens per second)
1.27.348.461 I slot print_timing: id 5 | task 418 | eval time = 8760.62 ms / 128 tokens ( 68.44 ms per token, 14.61 tokens per second)
1.27.348.462 I slot print_timing: id 5 | task 418 | total time = 8879.90 ms / 157 tokens
1.27.348.463 I slot print_timing: id 5 | task 418 | graphs reused = 1
1.27.348.466 I slot print_timing: id 5 | task 418 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.27.348.480 I statistics draft-mtp: #calls(b,g,a) = 122 388 5938, #gen drafts = 5953, #acc drafts = 4152, #gen tokens = 11872, #acc tokens = 7872, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.086, 1434.310, 7.325 ms
1.27.348.504 I slot release: id 5 | task 418 | stop processing: n_tokens = 156, truncated = 0
1.27.357.452 I srv operator(): Chat format: peg-native
1.27.470.562 I slot print_timing: id 9 | task 441 | n_decoded = 100, tg = 15.10 t/s, tg_3s = 15.10 t/s
1.27.473.544 I slot get_availabl: id 5 | task -1 | selected slot by LCP similarity, sim_best = 0.107 (> 0.100 thold), f_keep = 0.019
1.27.473.613 I slot launch_slot_: id 5 | task 512 | processing task, is_child = 0
1.27.478.058 W slot operator(): id 5 | task 512 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.478.091 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.733.071 I slot print_timing: id 12 | task 463 | prompt eval time = 125.22 ms / 25 tokens ( 5.01 ms per token, 199.65 tokens per second)
1.27.733.074 I slot print_timing: id 12 | task 463 | eval time = 4870.19 ms / 114 tokens ( 42.72 ms per token, 23.41 tokens per second)
1.27.733.075 I slot print_timing: id 12 | task 463 | total time = 4995.41 ms / 139 tokens
1.27.733.076 I slot print_timing: id 12 | task 463 | graphs reused = 1
1.27.733.079 I slot print_timing: id 12 | task 463 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.27.733.090 I statistics draft-mtp: #calls(b,g,a) = 123 391 5996, #gen drafts = 5999, #acc drafts = 4193, #gen tokens = 11964, #acc tokens = 7950, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.086, 1446.598, 7.406 ms
1.27.733.115 I slot release: id 12 | task 463 | stop processing: n_tokens = 138, truncated = 0
1.27.741.247 I srv operator(): Chat format: peg-native
1.27.851.018 I slot get_availabl: id 12 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.27.851.089 I slot launch_slot_: id 12 | task 516 | processing task, is_child = 0
1.27.856.052 W slot operator(): id 12 | task 516 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.27.856.089 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.27.979.724 I slot print_timing: id 10 | task 426 | prompt eval time = 125.69 ms / 29 tokens ( 4.33 ms per token, 230.72 tokens per second)
1.27.979.728 I slot print_timing: id 10 | task 426 | eval time = 8748.73 ms / 128 tokens ( 68.35 ms per token, 14.63 tokens per second)
1.27.979.728 I slot print_timing: id 10 | task 426 | total time = 8874.42 ms / 157 tokens
1.27.979.729 I slot print_timing: id 10 | task 426 | graphs reused = 1
1.27.979.732 I slot print_timing: id 10 | task 426 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.27.979.746 I statistics draft-mtp: #calls(b,g,a) = 123 393 6014, #gen drafts = 6028, #acc drafts = 4205, #gen tokens = 12021, #acc tokens = 7973, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.086, 1455.577, 7.428 ms
1.27.979.775 I slot release: id 10 | task 426 | stop processing: n_tokens = 156, truncated = 0
1.27.989.339 I srv operator(): Chat format: peg-native
1.28.104.466 I slot get_availabl: id 10 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.28.104.533 I slot launch_slot_: id 10 | task 519 | processing task, is_child = 0
1.28.109.261 W slot operator(): id 10 | task 519 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.109.289 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.237.774 I slot print_timing: id 3 | task 457 | prompt eval time = 125.48 ms / 28 tokens ( 4.48 ms per token, 223.14 tokens per second)
1.28.237.778 I slot print_timing: id 3 | task 457 | eval time = 5996.86 ms / 125 tokens ( 47.97 ms per token, 20.84 tokens per second)
1.28.237.779 I slot print_timing: id 3 | task 457 | total time = 6122.34 ms / 153 tokens
1.28.237.779 I slot print_timing: id 3 | task 457 | graphs reused = 1
1.28.237.782 I slot print_timing: id 3 | task 457 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.28.237.792 I statistics draft-mtp: #calls(b,g,a) = 125 395 6047, #gen drafts = 6058, #acc drafts = 4228, #gen tokens = 12081, #acc tokens = 8018, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.087, 1464.614, 7.470 ms
1.28.237.814 I slot release: id 3 | task 457 | stop processing: n_tokens = 152, truncated = 0
1.28.245.799 I srv operator(): Chat format: peg-native
1.28.358.213 I slot print_timing: id 13 | task 475 | n_decoded = 102, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.28.359.428 I slot get_availabl: id 3 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.184
1.28.359.494 I slot launch_slot_: id 3 | task 522 | processing task, is_child = 0
1.28.364.399 W slot operator(): id 3 | task 522 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.364.424 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.28.492.128 I slot print_timing: id 2 | task 471 | n_decoded = 101, tg = 20.69 t/s, tg_3s = 20.69 t/s
1.28.865.098 I slot print_timing: id 13 | task 475 | prompt eval time = 125.10 ms / 25 tokens ( 5.00 ms per token, 199.84 tokens per second)
1.28.865.101 I slot print_timing: id 13 | task 475 | eval time = 4879.28 ms / 114 tokens ( 42.80 ms per token, 23.36 tokens per second)
1.28.865.102 I slot print_timing: id 13 | task 475 | total time = 5004.38 ms / 139 tokens
1.28.865.103 I slot print_timing: id 13 | task 475 | graphs reused = 1
1.28.865.105 I slot print_timing: id 13 | task 475 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.28.865.117 I statistics draft-mtp: #calls(b,g,a) = 126 400 6134, #gen drafts = 6136, #acc drafts = 4289, #gen tokens = 12237, #acc tokens = 8133, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.627), dur(b,g,a) = 0.088, 1482.820, 7.582 ms
1.28.865.147 I slot release: id 13 | task 475 | stop processing: n_tokens = 138, truncated = 0
1.28.873.365 I srv operator(): Chat format: peg-native
1.28.980.239 I slot print_timing: id 8 | task 455 | n_decoded = 100, tg = 14.54 t/s, tg_3s = 14.54 t/s
1.28.982.957 I slot get_availabl: id 13 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.181
1.28.983.025 I slot launch_slot_: id 13 | task 528 | processing task, is_child = 0
1.28.987.073 W slot operator(): id 13 | task 528 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.28.987.102 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.486.780 I slot print_timing: id 14 | task 487 | n_decoded = 102, tg = 23.29 t/s, tg_3s = 23.29 t/s
1.29.602.546 I slot print_timing: id 9 | task 441 | prompt eval time = 119.06 ms / 29 tokens ( 4.11 ms per token, 243.56 tokens per second)
1.29.602.553 I slot print_timing: id 9 | task 441 | eval time = 8752.36 ms / 128 tokens ( 68.38 ms per token, 14.62 tokens per second)
1.29.602.554 I slot print_timing: id 9 | task 441 | total time = 8871.43 ms / 157 tokens
1.29.602.555 I slot print_timing: id 9 | task 441 | graphs reused = 1
1.29.602.559 I slot print_timing: id 9 | task 441 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.29.602.575 I statistics draft-mtp: #calls(b,g,a) = 127 406 6214, #gen drafts = 6229, #acc drafts = 4342, #gen tokens = 12422, #acc tokens = 8233, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.089, 1504.458, 7.679 ms
1.29.602.600 I slot release: id 9 | task 441 | stop processing: n_tokens = 156, truncated = 0
1.29.604.215 I slot print_timing: id 2 | task 471 | prompt eval time = 125.54 ms / 28 tokens ( 4.48 ms per token, 223.04 tokens per second)
1.29.604.217 I slot print_timing: id 2 | task 471 | eval time = 5994.74 ms / 125 tokens ( 47.96 ms per token, 20.85 tokens per second)
1.29.604.217 I slot print_timing: id 2 | task 471 | total time = 6120.28 ms / 153 tokens
1.29.604.218 I slot print_timing: id 2 | task 471 | graphs reused = 1
1.29.604.220 I slot print_timing: id 2 | task 471 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.29.604.227 I statistics draft-mtp: #calls(b,g,a) = 127 406 6217, #gen drafts = 6229, #acc drafts = 4344, #gen tokens = 12422, #acc tokens = 8237, #mean acc len = 2.32, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.089, 1504.458, 7.683 ms
1.29.604.245 I slot release: id 2 | task 471 | stop processing: n_tokens = 152, truncated = 0
1.29.612.512 I srv operator(): Chat format: peg-native
1.29.720.213 I slot get_availabl: id 9 | task -1 | selected slot by LCP similarity, sim_best = 1.000 (> 0.100 thold), f_keep = 0.186
1.29.720.280 I slot launch_slot_: id 9 | task 535 | processing task, is_child = 0
1.29.725.883 W slot operator(): id 9 | task 535 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
1.29.725.908 I srv stream_sessi: stream_session_attach_pipe: conv_id= (empty=1)
1.29.963.775 I slot print_timing: id 1 | task 486 | n_decoded = 101, tg = 20.80 t/s, tg_3s = 20.80 t/s
1.29.970.353 I slot print_timing: id 14 | task 487 | prompt eval time = 140.01 ms / 25 tokens ( 5.60 ms per token, 178.56 tokens per second)
1.29.970.355 I slot print_timing: id 14 | task 487 | eval time = 4862.66 ms / 114 tokens ( 42.65 ms per token, 23.44 tokens per second)
1.29.970.356 I slot print_timing: id 14 | task 487 | total time = 5002.67 ms / 139 tokens
1.29.970.357 I slot print_timing: id 14 | task 487 | graphs reused = 1
1.29.970.360 I slot print_timing: id 14 | task 487 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.29.970.371 I statistics draft-mtp: #calls(b,g,a) = 128 409 6271, #gen drafts = 6272, #acc drafts = 4384, #gen tokens = 12508, #acc tokens = 8311, #mean acc len = 2.33, #acc rate/pos = (0.699, 0.626), dur(b,g,a) = 0.089, 1519.470, 7.751 ms
1.29.970.401 I slot release: id 14 | task 487 | stop processing: n_tokens = 138, truncated = 0
1.30.297.736 I slot print_timing: id 0 | task 469 | n_decoded = 100, tg = 14.65 t/s, tg_3s = 14.65 t/s
1.30.522.106 I slot print_timing: id 7 | task 499 | n_decoded = 102, tg = 23.80 t/s, tg_3s = 23.80 t/s
1.30.856.151 I slot print_timing: id 6 | task 497 | n_decoded = 101, tg = 21.24 t/s, tg_3s = 21.24 t/s
1.30.963.942 I slot print_timing: id 8 | task 455 | prompt eval time = 119.88 ms / 29 tokens ( 4.13 ms per token, 241.91 tokens per second)
1.30.963.946 I slot print_timing: id 8 | task 455 | eval time = 8860.48 ms / 128 tokens ( 69.22 ms per token, 14.45 tokens per second)
1.30.963.947 I slot print_timing: id 8 | task 455 | total time = 8980.36 ms / 157 tokens
1.30.963.947 I slot print_timing: id 8 | task 455 | graphs reused = 1
1.30.963.951 I slot print_timing: id 8 | task 455 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.30.963.964 I statistics draft-mtp: #calls(b,g,a) = 128 418 6384, #gen drafts = 6397, #acc drafts = 4457, #gen tokens = 12757, #acc tokens = 8453, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.089, 1563.512, 7.902 ms
1.30.963.985 I slot release: id 8 | task 455 | stop processing: n_tokens = 156, truncated = 0
1.30.965.003 I slot print_timing: id 1 | task 486 | prompt eval time = 139.79 ms / 28 tokens ( 4.99 ms per token, 200.30 tokens per second)
1.30.965.006 I slot print_timing: id 1 | task 486 | eval time = 5857.60 ms / 125 tokens ( 46.86 ms per token, 21.34 tokens per second)
1.30.965.006 I slot print_timing: id 1 | task 486 | total time = 5997.39 ms / 153 tokens
1.30.965.007 I slot print_timing: id 1 | task 486 | graphs reused = 1
1.30.965.010 I slot print_timing: id 1 | task 486 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.30.965.016 I statistics draft-mtp: #calls(b,g,a) = 128 418 6386, #gen drafts = 6397, #acc drafts = 4458, #gen tokens = 12757, #acc tokens = 8455, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.089, 1563.512, 7.906 ms
1.30.965.035 I slot release: id 1 | task 486 | stop processing: n_tokens = 152, truncated = 0
1.30.967.450 I slot print_timing: id 7 | task 499 | prompt eval time = 124.86 ms / 25 tokens ( 4.99 ms per token, 200.22 tokens per second)
1.30.967.452 I slot print_timing: id 7 | task 499 | eval time = 4730.37 ms / 114 tokens ( 41.49 ms per token, 24.10 tokens per second)
1.30.967.453 I slot print_timing: id 7 | task 499 | total time = 4855.23 ms / 139 tokens
1.30.967.453 I slot print_timing: id 7 | task 499 | graphs reused = 1
1.30.967.455 I slot print_timing: id 7 | task 499 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.30.967.461 I statistics draft-mtp: #calls(b,g,a) = 128 418 6391, #gen drafts = 6397, #acc drafts = 4461, #gen tokens = 12757, #acc tokens = 8461, #mean acc len = 2.32, #acc rate/pos = (0.698, 0.626), dur(b,g,a) = 0.089, 1563.512, 7.912 ms
1.30.967.479 I slot release: id 7 | task 499 | stop processing: n_tokens = 138, truncated = 0
1.31.512.577 I slot print_timing: id 15 | task 484 | n_decoded = 100, tg = 15.25 t/s, tg_3s = 15.25 t/s
1.31.690.609 I slot print_timing: id 6 | task 497 | prompt eval time = 118.70 ms / 28 tokens ( 4.24 ms per token, 235.90 tokens per second)
1.31.690.612 I slot print_timing: id 6 | task 497 | eval time = 5590.63 ms / 125 tokens ( 44.73 ms per token, 22.36 tokens per second)
1.31.690.612 I slot print_timing: id 6 | task 497 | total time = 5709.33 ms / 153 tokens
1.31.690.614 I slot print_timing: id 6 | task 497 | graphs reused = 1
1.31.690.617 I slot print_timing: id 6 | task 497 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.31.690.628 I statistics draft-mtp: #calls(b,g,a) = 128 426 6479, #gen drafts = 6485, #acc drafts = 4515, #gen tokens = 12933, #acc tokens = 8563, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.625), dur(b,g,a) = 0.089, 1609.980, 8.019 ms
1.31.690.651 I slot release: id 6 | task 497 | stop processing: n_tokens = 152, truncated = 0
1.31.856.445 I slot print_timing: id 12 | task 516 | n_decoded = 102, tg = 26.31 t/s, tg_3s = 26.31 t/s
1.31.931.658 I slot print_timing: id 0 | task 469 | prompt eval time = 118.62 ms / 29 tokens ( 4.09 ms per token, 244.48 tokens per second)
1.31.931.665 I slot print_timing: id 0 | task 469 | eval time = 8458.97 ms / 128 tokens ( 66.09 ms per token, 15.13 tokens per second)
1.31.931.666 I slot print_timing: id 0 | task 469 | total time = 8577.59 ms / 157 tokens
1.31.931.667 I slot print_timing: id 0 | task 469 | graphs reused = 1
1.31.931.671 I slot print_timing: id 0 | task 469 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.31.931.684 I statistics draft-mtp: #calls(b,g,a) = 128 429 6505, #gen drafts = 6514, #acc drafts = 4531, #gen tokens = 12990, #acc tokens = 8593, #mean acc len = 2.32, #acc rate/pos = (0.697, 0.624), dur(b,g,a) = 0.089, 1625.305, 8.050 ms
1.31.931.711 I slot release: id 0 | task 469 | stop processing: n_tokens = 156, truncated = 0
1.31.933.629 I slot print_timing: id 5 | task 512 | n_decoded = 101, tg = 23.33 t/s, tg_3s = 23.33 t/s
1.32.081.593 I slot print_timing: id 4 | task 494 | n_decoded = 100, tg = 16.05 t/s, tg_3s = 16.05 t/s
1.32.157.881 I slot print_timing: id 12 | task 516 | prompt eval time = 123.99 ms / 25 tokens ( 4.96 ms per token, 201.63 tokens per second)
1.32.157.884 I slot print_timing: id 12 | task 516 | eval time = 4177.81 ms / 114 tokens ( 36.65 ms per token, 27.29 tokens per second)
1.32.157.884 I slot print_timing: id 12 | task 516 | total time = 4301.80 ms / 139 tokens
1.32.157.885 I slot print_timing: id 12 | task 516 | graphs reused = 1
1.32.157.888 I slot print_timing: id 12 | task 516 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.32.157.899 I statistics draft-mtp: #calls(b,g,a) = 128 432 6539, #gen drafts = 6541, #acc drafts = 4554, #gen tokens = 13044, #acc tokens = 8637, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.089, 1638.707, 8.091 ms
1.32.157.919 I slot release: id 12 | task 516 | stop processing: n_tokens = 138, truncated = 0
1.32.424.855 I slot print_timing: id 3 | task 522 | n_decoded = 101, tg = 25.67 t/s, tg_3s = 25.67 t/s
1.32.493.671 I slot print_timing: id 13 | task 528 | n_decoded = 102, tg = 30.17 t/s, tg_3s = 30.17 t/s
1.32.558.129 I slot print_timing: id 5 | task 512 | prompt eval time = 126.30 ms / 28 tokens ( 4.51 ms per token, 221.70 tokens per second)
1.32.558.133 I slot print_timing: id 5 | task 512 | eval time = 4953.74 ms / 125 tokens ( 39.63 ms per token, 25.23 tokens per second)
1.32.558.133 I slot print_timing: id 5 | task 512 | total time = 5080.04 ms / 153 tokens
1.32.558.134 I slot print_timing: id 5 | task 512 | graphs reused = 1
1.32.558.137 I slot print_timing: id 5 | task 512 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.32.558.150 I statistics draft-mtp: #calls(b,g,a) = 128 438 6584, #gen drafts = 6589, #acc drafts = 4580, #gen tokens = 13140, #acc tokens = 8687, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.089, 1667.736, 8.147 ms
1.32.558.168 I slot release: id 5 | task 512 | stop processing: n_tokens = 152, truncated = 0
1.32.677.675 I slot print_timing: id 11 | task 508 | n_decoded = 100, tg = 18.35 t/s, tg_3s = 18.35 t/s
1.32.731.155 I slot print_timing: id 15 | task 484 | prompt eval time = 111.81 ms / 29 tokens ( 3.86 ms per token, 259.37 tokens per second)
1.32.731.158 I slot print_timing: id 15 | task 484 | eval time = 7774.51 ms / 128 tokens ( 60.74 ms per token, 16.46 tokens per second)
1.32.731.159 I slot print_timing: id 15 | task 484 | total time = 7886.32 ms / 157 tokens
1.32.731.160 I slot print_timing: id 15 | task 484 | graphs reused = 1
1.32.731.163 I slot print_timing: id 15 | task 484 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.32.731.176 I statistics draft-mtp: #calls(b,g,a) = 128 441 6603, #gen drafts = 6609, #acc drafts = 4593, #gen tokens = 13179, #acc tokens = 8712, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.089, 1680.822, 8.172 ms
1.32.731.202 I slot release: id 15 | task 484 | stop processing: n_tokens = 156, truncated = 0
1.32.734.251 I slot print_timing: id 13 | task 528 | prompt eval time = 125.24 ms / 25 tokens ( 5.01 ms per token, 199.62 tokens per second)
1.32.734.254 I slot print_timing: id 13 | task 528 | eval time = 3621.92 ms / 114 tokens ( 31.77 ms per token, 31.48 tokens per second)
1.32.734.254 I slot print_timing: id 13 | task 528 | total time = 3747.16 ms / 139 tokens
1.32.734.255 I slot print_timing: id 13 | task 528 | graphs reused = 1
1.32.734.257 I slot print_timing: id 13 | task 528 | draft acceptance = 0.94872 ( 74 accepted / 78 generated), mean acceptance length = 2.90, acceptance rate per position = (0.974, 0.923)
1.32.734.267 I statistics draft-mtp: #calls(b,g,a) = 128 441 6609, #gen drafts = 6609, #acc drafts = 4598, #gen tokens = 13179, #acc tokens = 8720, #mean acc len = 2.32, #acc rate/pos = (0.696, 0.624), dur(b,g,a) = 0.089, 1680.822, 8.180 ms
1.32.734.282 I slot release: id 13 | task 528 | stop processing: n_tokens = 138, truncated = 0
1.32.897.767 I slot print_timing: id 3 | task 522 | prompt eval time = 125.77 ms / 28 tokens ( 4.49 ms per token, 222.63 tokens per second)
1.32.897.770 I slot print_timing: id 3 | task 522 | eval time = 4407.57 ms / 125 tokens ( 35.26 ms per token, 28.36 tokens per second)
1.32.897.771 I slot print_timing: id 3 | task 522 | total time = 4533.34 ms / 153 tokens
1.32.897.771 I slot print_timing: id 3 | task 522 | graphs reused = 1
1.32.897.774 I slot print_timing: id 3 | task 522 | draft acceptance = 0.79167 ( 76 accepted / 96 generated), mean acceptance length = 2.58, acceptance rate per position = (0.833, 0.750)
1.32.897.791 I statistics draft-mtp: #calls(b,g,a) = 128 445 6625, #gen drafts = 6629, #acc drafts = 4605, #gen tokens = 13219, #acc tokens = 8734, #mean acc len = 2.32, #acc rate/pos = (0.695, 0.623), dur(b,g,a) = 0.089, 1691.556, 8.195 ms
1.32.897.813 I slot release: id 3 | task 522 | stop processing: n_tokens = 152, truncated = 0
1.32.994.153 I slot print_timing: id 4 | task 494 | prompt eval time = 125.86 ms / 29 tokens ( 4.34 ms per token, 230.41 tokens per second)
1.32.994.158 I slot print_timing: id 4 | task 494 | eval time = 7143.07 ms / 128 tokens ( 55.81 ms per token, 17.92 tokens per second)
1.32.994.158 I slot print_timing: id 4 | task 494 | total time = 7268.93 ms / 157 tokens
1.32.994.159 I slot print_timing: id 4 | task 494 | graphs reused = 1
1.32.994.162 I slot print_timing: id 4 | task 494 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.32.994.178 I statistics draft-mtp: #calls(b,g,a) = 128 448 6637, #gen drafts = 6640, #acc drafts = 4609, #gen tokens = 13240, #acc tokens = 8741, #mean acc len = 2.32, #acc rate/pos = (0.694, 0.623), dur(b,g,a) = 0.089, 1697.940, 8.209 ms
1.32.994.197 I slot release: id 4 | task 494 | stop processing: n_tokens = 156, truncated = 0
1.33.045.538 I slot print_timing: id 10 | task 519 | n_decoded = 100, tg = 20.79 t/s, tg_3s = 20.79 t/s
1.33.212.669 I slot print_timing: id 11 | task 508 | prompt eval time = 125.91 ms / 29 tokens ( 4.34 ms per token, 230.33 tokens per second)
1.33.212.672 I slot print_timing: id 11 | task 508 | eval time = 5985.74 ms / 128 tokens ( 46.76 ms per token, 21.38 tokens per second)
1.33.212.672 I slot print_timing: id 11 | task 508 | total time = 6111.64 ms / 157 tokens
1.33.212.673 I slot print_timing: id 11 | task 508 | graphs reused = 1
1.33.212.675 I slot print_timing: id 11 | task 508 | draft acceptance = 0.41606 ( 57 accepted / 137 generated), mean acceptance length = 1.83, acceptance rate per position = (0.449, 0.377)
1.33.212.689 I statistics draft-mtp: #calls(b,g,a) = 128 457 6664, #gen drafts = 6666, #acc drafts = 4620, #gen tokens = 13291, #acc tokens = 8762, #mean acc len = 2.31, #acc rate/pos = (0.693, 0.622), dur(b,g,a) = 0.089, 1710.660, 8.237 ms
1.33.212.707 I slot release: id 11 | task 508 | stop processing: n_tokens = 156, truncated = 0
1.33.315.313 I slot print_timing: id 9 | task 535 | n_decoded = 100, tg = 28.82 t/s, tg_3s = 28.82 t/s
1.33.379.350 I slot print_timing: id 10 | task 519 | prompt eval time = 126.31 ms / 29 tokens ( 4.36 ms per token, 229.59 tokens per second)
1.33.379.353 I slot print_timing: id 10 | task 519 | eval time = 5143.77 ms / 128 tokens ( 40.19 ms per token, 24.88 tokens per second)
1.33.379.353 I slot print_timing: id 10 | task 519 | total time = 5270.08 ms / 157 tokens
1.33.379.354 I slot print_timing: id 10 | task 519 | graphs reused = 1
1.33.379.356 I slot print_timing: id 10 | task 519 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.33.379.370 I statistics draft-mtp: #calls(b,g,a) = 128 467 6684, #gen drafts = 6685, #acc drafts = 4630, #gen tokens = 13328, #acc tokens = 8780, #mean acc len = 2.31, #acc rate/pos = (0.693, 0.621), dur(b,g,a) = 0.089, 1722.528, 8.255 ms
1.33.379.387 I slot release: id 10 | task 519 | stop processing: n_tokens = 156, truncated = 0
1.33.487.630 I slot print_timing: id 9 | task 535 | prompt eval time = 119.60 ms / 29 tokens ( 4.12 ms per token, 242.47 tokens per second)
1.33.487.633 I slot print_timing: id 9 | task 535 | eval time = 3642.14 ms / 128 tokens ( 28.45 ms per token, 35.14 tokens per second)
1.33.487.634 I slot print_timing: id 9 | task 535 | total time = 3761.74 ms / 157 tokens
1.33.487.634 I slot print_timing: id 9 | task 535 | graphs reused = 11
1.33.487.637 I slot print_timing: id 9 | task 535 | draft acceptance = 0.39007 ( 55 accepted / 141 generated), mean acceptance length = 1.77, acceptance rate per position = (0.423, 0.352)
1.33.487.650 I statistics draft-mtp: #calls(b,g,a) = 128 479 6697, #gen drafts = 6697, #acc drafts = 4634, #gen tokens = 13351, #acc tokens = 8788, #mean acc len = 2.31, #acc rate/pos = (0.692, 0.620), dur(b,g,a) = 0.089, 1734.566, 8.263 ms
1.33.487.664 I slot release: id 9 | task 535 | stop processing: n_tokens = 156, truncated = 0
1.33.487.674 I srv update_slots: all slots are idle