Instructions to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Use Docker
docker model run hf.co/kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
- Ollama
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with Ollama:
ollama run hf.co/kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
- Unsloth Desktop
- Pi
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with Docker Model Runner:
docker model run hf.co/kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
- Lemonade
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Run and chat with the model
lemonade run user.Apodex-1.1-mini-Finnish-Uncensored-GGUF-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- Apodex-1.1-mini-Finnish-Uncensored-GGUF (Native MTP Preserved)
Apodex-1.1-mini-Finnish-Uncensored-GGUF (Native MTP Preserved)
🌐 Quick Navigation / Valitse Kieli
🇫🇮 Suomenkielinen mallikortti & käyttöohje | 🇬🇧 English Documentation & Quickstart
Katagurun viralliset GGUF-monikvantisoinnit apodex/Apodex-1.1-mini -mallista. Mallille on suoritettu sensuroinnin poisto (SOMA/ARA -aktiviteettiortogonalisointi), suomen kielen ja episteemisen rehellisyyden ankkurointi sekä Kataguru Master Chat Template v1.0 -integraatio.
Kaikki malliversiot säilyttävät natiivin MTP/NextN-spekulaatiopään (kerros 40), mikä mahdollistaa jopa +30–50 % nopeamman tekstigeneroinnin ilman erillistä luonnosmallia.
Malli soveltuu suoraan ajettavaksi LM Studiossa, llama.cpp:ssä ja Ollamassa.
🌟 Erinomainen valinta vaikeisiin englanti–suomi -käännöstehtäviin (High-End English-to-Finnish Translation Engine):
Apodex-1.1-mini Finnish Uncensored on osoittautunut tuotantokäytössä poikkeuksellisen vahvaksi vaativan akateemisen, luonnontieteellisen, biolääketieteellisen ja teknisen tekstin kääntämisessä englannista luontevalle, täsmälliselle ja rikkaalle suomen kielelle.
- Terminologinen tarkkuus: Kääntää vaativat yhdyssanat ja tieteellisen sanaston suoraan oikeilla suomalaisilla vastineilla ilman kömpelöitä translitteraatioita tai käännöskoneanglisteja.
- Täysi sensuroimattomuus: Koska mallista on karsittu teennäiset kieltäytymisvektorit (SOMA/ARA), se ei katkea tai jumiudu myöskään haastavissa fysiologisissa, anatomisissa, lääketieteellisissä tai arkaluonteisissa yhteyksissä, vaan kääntää asiat tieteellisen rehellisesti ja täsmällisesti.
- Kevyt kuluttajaraudalle: Toimii sulavasti LM Studiossa, Ollamassa ja llama.cpp:ssä suoraan tavallisilla työasemilla.
1. Mitä Kataguru muutti? (Muutosyhteenveto)
| Kenttä | Kuvaus |
|---|---|
| Pohjamalli | apodex/Apodex-1.1-mini (Qwen3.5 MoE + Mamba/SSM) |
| Katagurun muutos | SOMA/ARA residuaaliortogonalisointi (kieltäytymisvektoreiden neutralointi), kevyt suomi- & episteeminen ankkuri-SFT, Kataguru Master Chat Template v1.0 |
| MTP-spekulaatio | Natiivi kerroksen 40 MTP/NextN-pää (20 lisätensoria) täysin säilytetty ja kvantisoitu |
| GGUF-versiot | Q4_K_M (IQ4_XS (Q5_K_M (Q6_K (Q3_K_M (~16 Gt), mmproj (861 Mt) |
| Visiotorni | mmproj-Apodex-1.1-mini-Finnish-Uncensored-BF16.gguf (multimodaalinen kuvatulkinta) |
| Mitä EI muutettu | Qwen3.5-MoE -arkkitehtuuri (256 asiantuntijaa, lineaarinen huomio), natiivi sanasto ja tokenisointi |
| Ensisijainen käyttö | Vaativat englanti–suomi -käännöstehtävät (akateeminen tiede, lääketiede, teknologia), paikallinen kuluttajarautapäättely (LM Studio, llama.cpp), esteetön suomenkielinen tekstintuotto ja kuvantulkinta |
2. Saatavilla Olevat Kvantisoinnit
| Tiedosto | Koko | Suositeltu laitteisto | Kuvaus |
|---|---|---|---|
Apodex-1.1-mini-Finnish-Uncensored-Q4_K_M.gguf |
~20 Gt | 24–32 Gt VRAM (tai 32+ Gt RAM + GPU) | Suositeltu yleisversio: optimaalinen laadun ja nopeuden suhde. |
Apodex-1.1-mini-Finnish-Uncensored-IQ4_XS.gguf |
~18 Gt | 20–24 Gt VRAM | Erittäin kompakti 4-bittinen i-matrix-kvantisointi. |
Apodex-1.1-mini-Finnish-Uncensored-Q5_K_M.gguf |
~24 Gt | 32 Gt VRAM / 64 Gt RAM | Korkeampi liukulukutarkkuus vaativiin päättelytehtäviin. |
Apodex-1.1-mini-Finnish-Uncensored-Q6_K.gguf |
~27 Gt | 32+ Gt VRAM | Lähes häviötön 6-bittinen laatu. |
Apodex-1.1-mini-Finnish-Uncensored-Q3_K_M.gguf |
~16 Gt | 16 Gt VRAM | Kevytversio rajallisen muistin järjestelmiin. |
mmproj-Apodex-1.1-mini-Finnish-Uncensored-BF16.gguf |
861 Mt | Kaikki laitteistot | Multimodaalinen visioprojektori (kuvien syöttöön). |
3. Sensuroinnin Poistomenetelmä: SOMA/ARA + Kevyt Ankkuri-SFT
Miksi perinteiset Hugging Face -menetelmät epäonnistuvat MoE-malleissa?
Hugging Facessa julkaistut "uncensored"-mallit jakautuvat perinteisesti kahteen karkeaan luokkaan:
- Raaka abliterointi (Naive Abliteration / Heretic-skriptit ilman optimointia):
- Suurin osa HF-yhteisön "abliterated"-malleista vähentää kieltäytymisvektorin sokkona kaikilta kerroksilta ilman hyperparametrien hienoviritystä.
- Seuraus ("lobotomia-efekti"): Mekanistinen tulkittavuus osoittaa, että raaka leikkaus vahingoittaa vierekkäisiä semanttisia representaatioita. Mallin matemaattinen ja koodauspäättely heikkenee, kielellinen koherenssi rakoilee ja vastaukset alkavat helposti kiertää kehää.
- MoE-katastrofi: Perinteiset skriptit leikkaavat myös reitittimiä (router gates), jolloin asiantuntijoiden erikoistuminen ja reitityksen entropia tuhoutuvat.
- Pelkkä synteettinen SFT (kuten perinteinen Dolphin-koulutus):
- Koulutetaan tuhansia myöntyväisiä keskusteluja ilman painotason geometrista leikkausta.
- Seuraus (jailbreak drift): Esikoulutetut kieltäytymisaktivaatiot säilyvät syvällä mallin pohjakerroksissa. Monimutkaisissa, monitulkintaisissa tai vieraankielisissä kehotteissa alkuperäinen turvasensuuri aktivoituu uudelleen.
Katagurun ratkaisu: Kaksivaiheinen Hybridiputki
Kataguru käyttää tiettävästi ainoana tuotantotason hybridiputkea, joka yhdistää matemaattisen suorakirurgian ja kielellisen toipumisen:
- SOMA (Sparse Orthogonal Modulation & Abliteration):
- Kieltäytymissuunta $v$ mitataan residuaalitilasta paritetuilla haitallinen/neutraali -kehotteilla.
- Optunan TPE-algoritmilla suoritetaan Bayesilainen haku, jolla löydetään täsmällinen kerrosikkuna ($0.25 L \le l \le 0.65 L$) ja skaalauskerroin $\alpha$, jolla kieltäytymisaste putoaa 0 %:iin samalla kun hämmennysluvun nousu rajataan tiukasti alle 1 %:iin ($\Delta \text{PPL} < 0.05$).
- MoE-suojattu ARA (Activation Residual Abliteration):
- Matemaattinen leikkaus kaavalla: $W' = W - \alpha \cdot v (v^T W)$.
- Kohdistetaan tarkasti vain huomiomatriiseihin ($W_o$) ja kaikkien 256 asiantuntijan alasprojektioihin ($W_{down}^{(i)}$).
- Reitittimen painoihin ei kosketa lainkaan, jolloin MoE-arkkitehtuurin asiantuntijajakauma säilyy 100 % ehjänä.
- Kevyt Ankkuri-SFT (150–250 askelta, 15 min):
- Leikkauksen jälkeen suoritetaan välitön kielellinen ankkurointi.
- Korjaa geometrisen leikkauksen aiheuttaman mikroskooppisen roson residuaaliavaruudessa.
- Poistaa moralisoivat esipuheet ("As an AI...", "On tärkeää huomata...") ja istuttaa Epistemic Honesty / Anti-Sycophancy -periaatteet (totuus mielistelyn edelle).
4. MTP-Spekulatiivinen Dekoodaus (Nopeutus)
Mallissa on sisäänrakennettu MTP (Multi-Token Prediction) -pää, jonka avulla llama.cpp tuottaa spekulatiivisesti useamman tokenin kerralla.
llama-cli:
./llama-cli \
-m Apodex-1.1-mini-Finnish-Uncensored-Q4_K_M.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
-p "Kysymys: Miksi taivas on sininen?\nVastaus:" \
-n 512
llama-server:
./llama-server \
-m Apodex-1.1-mini-Finnish-Uncensored-Q4_K_M.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--port 8080 -c 16384
5. Kuvien Syöttö (Multimodaalisuus)
./llama-mtmd-cli \
-m Apodex-1.1-mini-Finnish-Uncensored-Q4_K_M.gguf \
-mm mmproj-Apodex-1.1-mini-Finnish-Uncensored-BF16.gguf \
--image testikuva.jpg \
-p "Kuvaile mitä tässä kuvassa näkyy suomeksi."
6. Rajoitukset ja Rehellinen Arvio
- MoE-asiantuntijoiden offload: Parhaan suorituskyvyn saavuttamiseksi koko malli suositellaan ajettavaksi kokonaan VRAM:issa (tai vähintään GPU-kerroksilla, joissa huomiokerrokset ja aktiiviset asiantuntijat mahtuvat muistiin).
- Sensuroimattomuus: Malli tuottaa vastauksia ilman kieltäytymissääntöjä käyttäjän kehotteen mukaisesti.
🇬🇧 English & International Guide
Overview
This model is part of the Kataguru Finnish & Multilingual Open Source Fleet, engineered for high epistemic honesty, native morphosyntax, and uncensored reasoning.
Key Features
- Uncensored & Epistemically Honest: SOMA/ARA activation orthogonalization removes artificial corporate moralizing while preserving 100% of underlying factual, coding, and mathematical reasoning.
- First-Class Agglutinative & Finnish Support: Retains nuanced cases, compounding, and complex syntax without translation artifacts.
- Autonomous Reasoning Standard: Fully integrated with the Kataguru Master Chat Template v1.0, supporting autonomous thinking (
<think>...</think>).
Quickstart with vLLM / OpenAI API
# Example vLLM server launch:
vllm serve kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF --port 8000
Quickstart with Python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
response = client.chat.completions.create(
model="kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF",
messages=[
{"role": "user", "content": "Explain the core principle of metabolic health."}
],
temperature=0.6
)
print(response.choices[0].message.content)
- Downloads last month
- 343
3-bit
4-bit
5-bit
6-bit
Model tree for kataguru/Apodex-1.1-mini-Finnish-Uncensored-GGUF
Base model
Qwen/Qwen3.5-35B-A3B-Base