{ "artifact": "opencoti-llamafile-0.10.3-c4-x86_64.llamafile", "sha256": "2f2606573e31b0e02606b546845294add47f68a95be754246b3a58e36e380645", "sizeBytes": 4812558983, "builtAt": "2026-07-16T17:51:48.870Z", "llamafileVersion": "0.10.3", "opencotiTag": "c4", "versionString": "opencoti-0.10.3-c4", "gitCommit": "7d296cd0b35a8631a6de901c6693f92aaceb1e98", "arch": "x86_64", "opencotiPatches": [ "0001-lazy-slot-context-defer.patch", "0002-lazy-slot-context-grow.patch", "0003-arg-assertion-bypass.patch", "0004-cuda-std-cpp17.patch", "0005-lazy-slot-context-shrink.patch", "0006-kv-reuse-prefix.patch", "0007-build-header-deps.patch", "0010-rest-kv-eviction.patch", "0020-headinfer-per-head.patch", "0030-neo-pipeline.patch", "0031-per-stream-split.patch", "0032-m2-state-io.patch", "0033-cpy-tie-blck-align.patch", "0034-m2-pinned-host.patch", "0035-concat-q-block-aware.patch", "0036-pcie-probe-consume.patch", "0040-iqk-flash-attn.patch", "0042-fused-moe.patch", "0070-rolling-kv.patch", "0071-state-io-cosmocc.patch", "0072-poly-kv-pool.patch", "0073-turboquant-kv.patch", "0075-d512-turbo-vec.patch", "0078-dca.patch", "0079-gemma-assistant-mtp.patch", "0080-mtp-d512-fa.patch", "0081-tcq-q6-asym-kv.patch", "0082-cuda-build-parallelism.patch", "0083-tcq-warp-encode.patch", "0084-cuda-graphs.patch", "0085-dca-quant-prefill-inlaunch.patch", "0086-f16-moe-mmf-prefill.patch", "0087-dca-yarn-factor.patch", "0088-sparsev-autopolicy.patch", "0089-sparse-attn-vslash-foundation.patch", "0090-rolling-kv-compute-reserve.patch", "0091-multi-session-graph-nodes.patch", "0092-cuda-build-ccache.patch", "0093-mtp-dualctx-fused-nextn.patch", "0094-tinyblas-small-gemm.patch", "0095-prefill-checkpoint-align.patch", "0096-remove-single-ctx-gemma-mtp.patch", "0097-native-elf-cmake.patch", "0098-rolling-kv-lse-decode.patch", "0099-dca-gemma4-wiring.patch", "0100-dca-single-chunk-defer.patch", "0101-kv-attn-rot-inherit.patch", "0102-fattn-bulk-h2d-scratch-ring.patch", "0103-kv-cpu-fa-probe-guard.patch", "0104-fattn-q6q4-vec-instance.patch", "0105-ws1-dca-per-tensor-defer.patch", "0106-ws1-scalar-k-turbo-v-boot-correctness.patch", "0107-ws1-turbo-mma-fused-decode.patch", "0108-ws2-dca-fused-turbo-v-inregister.patch", "0109-cuda-dso-2gb-fatbin-last.patch", "0110-ws2-asym-band-nan-guard.patch", "0111-dca-streaming-tail-bug2144.patch", "0112-rolling-kv-phasegate-prefill-bug2145.patch", "0113-rolling-kv-reserve-fixpoint-bug2146.patch", "0114-hybrid-rolling-kv-residency-bug2142.patch", "0115-rolling-kv-shift-guard-bug2148.patch", "0116-kv-auto-tier-hal582-p1.patch", "0117-rolling-kv-shift-rerope-639.patch", "0118-kv-auto-tier-tstar-spill.patch", "0119-p0-dcaon-scalar-inregister.patch", "0120-p2-mixed-kv.patch", "0121-p2-auto-tail.patch", "0122-rys-layer-duplication.patch", "0123-rys-probe.patch", "0124-rys-mtp-ctx-guard-bug2171.patch", "0125-hybrid-window-orderagnostic-bug2172.patch", "0126-p0-dcaoff-scalar-mma-decode.patch", "0127-p0-dcaoff-scalar-mma-decode-d256-d512.patch", "0128-mtp-spec-clone-cheap-mmvf-verify.patch", "0129-rys-probe-nested-args.patch", "0130-parallel2-fit-ckpt-fixes.patch", "0131-rys-probe-task-battery-v2.patch", "0132-runtime-introspection.patch", "0133-opencoti-version-string.patch", "0134-cuda-cross-sbsa.patch", "0135-poly-kv-pool-hybrid-guard.patch", "0136-polykv-control-plane-api.patch", "0137-spec-ctx-dft-null-check.patch" ], "backends": [ { "backend": "cuda", "dsoFilename": "ggml-cuda.so", "sha256": "5e0342ba9b2ded4847280067dfd6ebc4257e1b83a984881988c528c163b23e4a", "sizeBytes": 4756838104 } ] }