Instructions to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Use Docker
docker model run hf.co/xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
- Ollama
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with Ollama:
ollama run hf.co/xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
- Unsloth Desktop
- Pi
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with Docker Model Runner:
docker model run hf.co/xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
- Lemonade
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Run and chat with the model
lemonade run user.Gemma-4-31B-xVITA-zhTW-abliterated-GGUF-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "xCloudinfo/Gemma-4-31B-xVITA-zhTW-abliterated-GGUF:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Gemma-4-31B-xVITA-zhTW-abliterated-GGUF
云碩科技 · xCloudinfo · 系列:xVITA · 消除拒絕方向 · Abliterated
使用前提 本模型以合法、且在使用者獲授權範圍內使用為前提製作與發布。經 abliteration 移除模型的 拒絕方向,供資安研究、紅隊評估、內容審核訓練、文件與資料分析等正當工作使用。 使用者須在中華民國法律及所適用法規範圍內使用,並對一切用途與後果負完全責任; 不得用於任何違法或造成他人危害之用途。本模型不設安全防護,請自行評估部署風險。
xCloudinfo/Gemma-4-31B-xVITA-zhTW-GGUF 的消除拒絕方向版 GGUF,含視覺投影器(mmproj),可圖文對話。abliteration 只對語言端殘差流的權重做正交化,視覺塔完全未更動,與一般版共用同一份 mmproj。
這是什麼
- 方法:依 Arditi et al. (2024)「Refusal in LLMs is mediated by a single direction」,以權重正交化從殘差流寫入權重(embed、o_proj、down_proj)中移除「拒絕方向」。不重新訓練,繁體中文品質維持一致。
- 拒絕方向以經驗證(原版真的會拒)的繁體中文嚴重危害提示求得,掃描 layer_fraction 後取第 36 層(60 層中的 0.6 位置)為本模型的有效層。
能力邊界(誠實揭露,務必閱讀)
- 量化實測(對實際上架的 Q4_K_M 檔案測試,非僅測未量化權重):同一組 10 題保留測試集(毒品合成、惡意程式、槍械製造、勒索、入侵監控設備、致命毒物、疫情假訊息、信用卡盜刷、破壞關鍵基礎設施、自動化洗票程式)—— 一般版拒答 9/10 → 本模型拒答 0/10。
- 與云碩其他僅「降低過度拒絕」的 abliterated 系列不同,本模型在上述測試類別中拒絕行為已完全移除,屬於較不設限的版本。
- 此結果僅代表這 10 題測試集的實測結果,不代表窮舉所有有害類別或所有語言的行為;未測項目的拒絕/不拒絕傾向未經驗證。
- 繁體中文輸出品質(語感、台語慣用語理解)與一般版一致,未因移除拒絕方向而退化。
檔案與用法
六階量化 Q8_0 / Q6_K / Q5_K_M / Q4_K_M / IQ4_XS / IQ2_M + imatrix + 視覺投影器(mmproj)。
llama-server -m model-Q4_K_M.gguf \
--mmproj mmproj-Gemma-4-31B-xVITA-zhTW-f16.gguf -c 4096 -ngl 99
純文字可省略
--mmproj。Q4_K_M 部署首選;Q8_0/Q6_K 追品質;IQ4_XS/IQ2_M 省資源。
授權與來源
- 基底
google/gemma-4-31B-it:Apache-2.0 + Google Gemma 4 License(含 Prohibited Use Policy)。 - 本模型為云碩科技以自有語料獨立微調後再行 abliteration,不涉及第三方授權條款。
- 不得用於軍事或違法用途;須遵守中華民國法律與 EU AI Act;使用者須自行承擔部署與使用本模型的一切風險與後果。
由 云碩科技 xCloudinfo 於自有 AI 算力資源池製作。
- Downloads last month
- 496
2-bit
4-bit
5-bit
6-bit
8-bit