#!/usr/bin/env bash # Candidate-only next prefill lever; do not replace the promoted launcher # until cold 2K/4K/8K parity and memory gates pass. set -euo pipefail BIN_DIR=${BIN_DIR:-/opt/llama.cpp-kimi-k3-candidate/build-flashkda-iq1s-v1/bin} MODEL=${MODEL:-$PWD/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf} RPC_WORKERS=${RPC_WORKERS:-10.10.10.1:50053,10.10.10.2:50053,10.10.10.4:50053} PORT=${PORT:-8212} exec env GGML_RPC_SKIP_HASH=1 CUDA_SCALE_LAUNCH_QUEUES=4x \ LLAMA_MMAP_PREFETCH=0 LLAMA_PARALLEL_DEVICE_LOAD=1 \ "$BIN_DIR/llama-server" --model "$MODEL" \ --alias kimi-k3-ubatch2048-candidate --host 0.0.0.0 --port "$PORT" \ --ctx-size 600000 --ctx-checkpoints 0 --parallel 1 --n-gpu-layers 999 --rpc "$RPC_WORKERS" \ --split-mode layer --tensor-split 1,1,1,1 --flash-attn on --fit off \ --cache-type-k f16 --cache-type-v f16 --batch-size 4096 \ --ubatch-size 2048 --threads 16 --threads-batch 20 --cache-reuse 256 \ --reasoning auto --metrics