LordNeel commited on
Commit
1040b14
·
verified ·
1 Parent(s): fd5a034

Update MTP benchmark profile and serving card

Browse files
Files changed (1) hide show
  1. scripts/serve_llamacpp_gpu0.sh +5 -0
scripts/serve_llamacpp_gpu0.sh CHANGED
@@ -29,11 +29,16 @@ SPEC_DRAFT_N_MIN="${SPEC_DRAFT_N_MIN:-}"
29
  SPEC_DRAFT_P_MIN="${SPEC_DRAFT_P_MIN:-}"
30
  SPEC_DRAFT_DEVICE="${SPEC_DRAFT_DEVICE:-}"
31
  SPEC_DRAFT_BACKEND_SAMPLING="${SPEC_DRAFT_BACKEND_SAMPLING:-0}"
 
32
  ALIAS="${ALIAS:-Ornith-1.0-35B-GGUF-${QUANT}}"
33
  LLAMA_SERVER_BIN="${LLAMA_SERVER_BIN:-${REPO_ROOT}/vendor/llama.cpp/build-cuda/bin/llama-server}"
34
  LLAMACPP_CUDA_HOME="${LLAMACPP_CUDA_HOME:-${REPO_ROOT}/.venv-build/lib/python3.12/site-packages/nvidia/cu13}"
35
  MODEL_PATH="${MODEL_PATH:-}"
36
 
 
 
 
 
37
  if [[ -x "${LLAMA_SERVER_BIN}" ]]; then
38
  export LD_LIBRARY_PATH="${REPO_ROOT}/vendor/llama.cpp/build-cuda/bin:${LLAMACPP_CUDA_HOME}/lib64:${LLAMACPP_CUDA_HOME}/lib:${LD_LIBRARY_PATH:-}"
39
  else
 
29
  SPEC_DRAFT_P_MIN="${SPEC_DRAFT_P_MIN:-}"
30
  SPEC_DRAFT_DEVICE="${SPEC_DRAFT_DEVICE:-}"
31
  SPEC_DRAFT_BACKEND_SAMPLING="${SPEC_DRAFT_BACKEND_SAMPLING:-0}"
32
+ MTP_PER_HEAD_CONTEXT="${MTP_PER_HEAD_CONTEXT:-0}"
33
  ALIAS="${ALIAS:-Ornith-1.0-35B-GGUF-${QUANT}}"
34
  LLAMA_SERVER_BIN="${LLAMA_SERVER_BIN:-${REPO_ROOT}/vendor/llama.cpp/build-cuda/bin/llama-server}"
35
  LLAMACPP_CUDA_HOME="${LLAMACPP_CUDA_HOME:-${REPO_ROOT}/.venv-build/lib/python3.12/site-packages/nvidia/cu13}"
36
  MODEL_PATH="${MODEL_PATH:-}"
37
 
38
+ if [[ "${MTP_PER_HEAD_CONTEXT}" == "1" ]]; then
39
+ export LLAMA_MTP_PER_HEAD_CONTEXT=1
40
+ fi
41
+
42
  if [[ -x "${LLAMA_SERVER_BIN}" ]]; then
43
  export LD_LIBRARY_PATH="${REPO_ROOT}/vendor/llama.cpp/build-cuda/bin:${LLAMACPP_CUDA_HOME}/lib64:${LLAMACPP_CUDA_HOME}/lib:${LD_LIBRARY_PATH:-}"
44
  else