FROM ghcr.io/ggml-org/llama.cpp:server-cuda ENV MODEL_REPO=mradermacher/NVIDIA-Nemotron-3-Nano-4B-BF16-GGUF ENV MODEL_FILE=NVIDIA-Nemotron-3-Nano-4B-BF16.Q4_K_M.gguf ENV PORT=7860 ENV CTX_SIZE=2048 ENV N_GPU_LAYERS=99 ENV NO_WARMUP=1 ENV HF_XET_HIGH_PERFORMANCE=1 USER root RUN apt-get update \ && apt-get install -y --no-install-recommends python3 python3-pip ca-certificates \ && rm -rf /var/lib/apt/lists/* \ && python3 -m pip install --break-system-packages --no-cache-dir "huggingface_hub" COPY start_server.py /app/start_server.py EXPOSE 7860 ENTRYPOINT [] CMD ["python3", "/app/start_server.py"]