Instructions to use void0x14/echo with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use void0x14/echo with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf void0x14/echo:Q4_K_M # Run inference directly in the terminal: llama cli -hf void0x14/echo:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf void0x14/echo:Q4_K_M # Run inference directly in the terminal: llama cli -hf void0x14/echo:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf void0x14/echo:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf void0x14/echo:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf void0x14/echo:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf void0x14/echo:Q4_K_M
Use Docker
docker model run hf.co/void0x14/echo:Q4_K_M
- LM Studio
- Jan
- Ollama
How to use void0x14/echo with Ollama:
ollama run hf.co/void0x14/echo:Q4_K_M
- Unsloth Desktop
- Pi
How to use void0x14/echo with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf void0x14/echo:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "void0x14/echo:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use void0x14/echo with Docker Model Runner:
docker model run hf.co/void0x14/echo:Q4_K_M
- Lemonade
How to use void0x14/echo with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull void0x14/echo:Q4_K_M
Run and chat with the model
lemonade run user.echo-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use void0x14/echo with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf void0x14/echo:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default void0x14/echo:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use void0x14/echo with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf void0x14/echo:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "void0x14/echo:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
void0x14 commited on
docs: ANAHTAR TESLIM — sifirdan eksiksiz devir dokumani
Browse files- MVP/ANAHTAR_TESLIM.md +167 -0
MVP/ANAHTAR_TESLIM.md
ADDED
|
@@ -0,0 +1,167 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# ANAHTAR TESLİM — Qwen3.5 Multimodal Proje
|
| 2 |
+
|
| 3 |
+
Bu doküman, projenin başından sonuna kadar ne yapıldığını, elindekilerin
|
| 4 |
+
nerede durduğunu ve nasıl çalıştırılacağını sıfırdan anlatır. 07.09.2026
|
| 5 |
+
tarihinde hazırlanmıştır.
|
| 6 |
+
|
| 7 |
+
---
|
| 8 |
+
|
| 9 |
+
## 1. BU PROJE NE?
|
| 10 |
+
|
| 11 |
+
Tek cümle: **Qwen3.5-0.8B adlı görüntülü-yazılı (multimodal) yapay zeka
|
| 12 |
+
modeli; küçültülmüş (N=4 distillasyon) bir kopyası + görme (vision)
|
| 13 |
+
yetenekli çalışan GGUF dosyalarıyla birlikte Hugging Face'e teslim
|
| 14 |
+
edilmiştir.**
|
| 15 |
+
|
| 16 |
+
Özetle 3 parça var:
|
| 17 |
+
|
| 18 |
+
1. **Küçültülmüş model (N=4):** 800M parametrelik modelden 8 kat küçük
|
| 19 |
+
(256M) bir model distillasyonla eğitildi. Dört dosyası var (f32 ve 3
|
| 20 |
+
farklı sıkıştırma seviyesi). Bu parça HF'ta, `MVP/artifacts/gguf/`
|
| 21 |
+
klasöründedir.
|
| 22 |
+
2. **Görme (vision) modeli:** Orijinal Qwen3.5'ın kendi gözü olan
|
| 23 |
+
mmproj dosyası + orijinal text modeli. Bu ikiliyle model bir resmi
|
| 24 |
+
gerçekten görüp doğru cevap veriyor. HF'ta, `MVP/artifacts/gguf-vision/`
|
| 25 |
+
klasöründedir.
|
| 26 |
+
3. **Her şeyin kanıtı:** Test çıktıları, çalıştırma tarifi, bu doküman.
|
| 27 |
+
Repoda `MVP/` altındadır.
|
| 28 |
+
|
| 29 |
+
---
|
| 30 |
+
|
| 31 |
+
## 2. HER ŞEY NEREDE?
|
| 32 |
+
|
| 33 |
+
### 2.1 Hugging Face (İnternette, herkese açık)
|
| 34 |
+
|
| 35 |
+
Repo: `https://huggingface.co/void0x14/echo`
|
| 36 |
+
|
| 37 |
+
| Dosya (HF yolu) | İçerik | Boyut |
|
| 38 |
+
|---|---|---|
|
| 39 |
+
| `MVP/artifacts/gguf-vision/mmproj-F32.gguf` | Orijinal Qwen3.5 görme modülü | 402 MB |
|
| 40 |
+
| `MVP/artifacts/gguf-vision/qwen35-text-Q4_K_M.gguf` | Orijinal Qwen3.5 metin modeli (sıkıştırılmış) | 532 MB |
|
| 41 |
+
| `MVP/artifacts/gguf/qwen35-distilled-n4-f32.gguf` | N=4 küçültülmüş model (tam duyarlılık) | 2.3 GB |
|
| 42 |
+
| `MVP/artifacts/gguf/qwen35-distilled-n4-Q8_0.gguf` | N=4 küçültülmüş model (8-bit) | 611 MB |
|
| 43 |
+
| `MVP/artifacts/gguf/qwen35-distilled-n4-Q5_K_M.gguf` | N=4 küçültülmüş model (5-bit) | 433 MB |
|
| 44 |
+
| `MVP/artifacts/gguf/qwen35-distilled-n4-Q4_K_M.gguf` | N=4 küçültülmüş model (4-bit) | 395 MB |
|
| 45 |
+
|
| 46 |
+
Doğrulama: bu dosyaların hepsi HF'ta duruyor ve indirilebiliyor
|
| 47 |
+
(HTTP 200). İndirme linki örneği:
|
| 48 |
+
`https://huggingface.co/void0x14/echo/resolve/main/MVP/artifacts/gguf/qwen35-distilled-n4-Q4_K_M.gguf`
|
| 49 |
+
|
| 50 |
+
### 2.2 Yerel bilgisayar
|
| 51 |
+
|
| 52 |
+
- Proje klasörü: `/home/void0x14/Documents/echo`
|
| 53 |
+
- Kanıtlar (test çıktıları): `MVP/evidence/` (vulkan logları, dönüşüm
|
| 54 |
+
logları) ve `MVP/evidence/multimodal/` (görme testleri)
|
| 55 |
+
- Rapor: `MVP/REPORT_FINAL.md`
|
| 56 |
+
- Çalıştırma tarifi: `MVP/run_multimodal.sh`
|
| 57 |
+
|
| 58 |
+
---
|
| 59 |
+
|
| 60 |
+
## 3. GÖRME (VISION) GERÇEKTEN ÇALIŞIYOR — KANIT
|
| 61 |
+
|
| 62 |
+
Model, ekranı kırmızı olan bir resim gördüğünde "Red" demiştir; mavi
|
| 63 |
+
resimde "Blue" demiştir. Bu, resmin gerçekten modele gösterildiğinin ve
|
| 64 |
+
modelin gördüğünün kanıtıdır.
|
| 65 |
+
|
| 66 |
+
Çalıştırma komutu (aynısı `run_multimodal.sh` içinde):
|
| 67 |
+
|
| 68 |
+
```
|
| 69 |
+
/tmp/llama-upstream/build/bin/llama-cli \
|
| 70 |
+
-m MVP/artifacts/gguf-vision/qwen35-text-Q4_K_M.gguf \
|
| 71 |
+
--mmproj MVP/artifacts/gguf-vision/mmproj-F32.gguf \
|
| 72 |
+
--image test_red.png \
|
| 73 |
+
-p "What color is this image? Answer in one word." \
|
| 74 |
+
-ngl 99 --temp 0 -n 200 -no-cnv
|
| 75 |
+
```
|
| 76 |
+
|
| 77 |
+
Gerçek çıktı (dosya: `MVP/evidence/multimodal/llama_test2.clean.txt`):
|
| 78 |
+
|
| 79 |
+
```
|
| 80 |
+
Loaded media from 'test_red.png'
|
| 81 |
+
[Start thinking] ... "Red" is the most direct and accurate description ... [End thinking]
|
| 82 |
+
Red
|
| 83 |
+
```
|
| 84 |
+
|
| 85 |
+
Gerçek çıktı mavi resim için (`llama_test3.clean.txt`): `Blue`
|
| 86 |
+
|
| 87 |
+
Bu testler AMD RX460 ekran kartında (Vulkan), llama.cpp'nin güncel
|
| 88 |
+
sürümüyle yapıldı. Kullanılan binary: `/tmp/llama-upstream/build/bin/llama-cli`.
|
| 89 |
+
|
| 90 |
+
---
|
| 91 |
+
|
| 92 |
+
## 4. KÜÇÜLTÜLMÜŞ MODEL (N=4) — DURUM
|
| 93 |
+
|
| 94 |
+
- 800M → 256M parametreye indistilasyon yapıldı (500K token eğitim).
|
| 95 |
+
- Model yükleniyor ve cevap üretiyor.
|
| 96 |
+
- **Sınır:** Bu kadar az eğitimle cevapları henüz "anlamlı" değil.
|
| 97 |
+
Sayısal kanıt: `MVP/evidence/multimodal/llama_test4.clean.txt` — model
|
| 98 |
+
görsel input'u kabul ediyor (mmproj 1024→1024 projeksiyonu eşleşiyor),
|
| 99 |
+
ama ürettiği metin düzensiz. Bu beklenen durumdur: vision'ın kendisi
|
| 100 |
+
çalışıyor; bu küçültülmüş modelin metin kalitesi eğitim süresiyle
|
| 101 |
+
orantılı olarak sınırlı.
|
| 102 |
+
- Kaliteli çıktı isteyen için doğru yol: 2.1'deki **orijinal** dosyalar
|
| 103 |
+
(gguf-vision klasörü) — onlar tam çalışıyor.
|
| 104 |
+
|
| 105 |
+
---
|
| 106 |
+
|
| 107 |
+
## 5. YOLCULUK — NE YAPILDI (KISA ÖZET)
|
| 108 |
+
|
| 109 |
+
| Adım | Sonuç |
|
| 110 |
+
|---|---|
|
| 111 |
+
| Qwen3.5-0.8B kaynak modeli HF'tan alındı, dönüştürüldü (GGUF) | OK |
|
| 112 |
+
| N=4 distillasyon tasarımı ve sözleşme testleri yazıldı | Repoda: `MVP/qwen35_prune.py`, `MVP/tests/` |
|
| 113 |
+
| Distillasyon eğitimi çalıştırıldı (500K token, RX460 + Vulkan) | 256M model üretildi |
|
| 114 |
+
| Sanitasyon: N=4 modelin config'inden MTP alanları temizlendi | OK (`5d84e23`) |
|
| 115 |
+
| Multimodal anahtar teslim raporu yazıldı v1/v2 | `MVP/REPORT_FINAL.md` |
|
| 116 |
+
| **PROBLEM:** GGUF dosyaları HF'a yüklenemiyordu — uzun süre
|
| 117 |
+
"0 B/s" gibi görünüp takılıyordu | — |
|
| 118 |
+
| **KÖK NEDEN BULUNDU:** HF'ın içerik dağıtım ağı (CDN), bu
|
| 119 |
+
bilgisayarın IPv6 hattı üzerinden erişilemiyordu. Bağlantı isteği
|
| 120 |
+
atılıyor, yanıt gelmiyordu. Not: bu bir "HF limiti" DEĞİLDİR —
|
| 121 |
+
daha önce rapora öyle yazılmıştı, o bilgi YANLIŞTI ve düzeltildi. | — |
|
| 122 |
+
| Çözüm: `/etc/hosts` ile IPv4 üzerinden erişim zorlandı, dosyalar
|
| 123 |
+
HF'ın resmi aracı (`hf upload`) ile yüklendi | 6/6 dosya yüklendi,
|
| 124 |
+
200 döndü |
|
| 125 |
+
| Git tarihi düzeltildi; GGUF'lar LFS pointer olarak repoya işlendi;
|
| 126 |
+
hf upload'ın commit'leriyle birleştirildi (rebase) | Push OK |
|
| 127 |
+
| **Nihai durum:** remote main = `c209fdf`, HF dosyaları erişilebilir,
|
| 128 |
+
vision çalışıyor | ANAHTAR TESLİM |
|
| 129 |
+
|
| 130 |
+
---
|
| 131 |
+
|
| 132 |
+
## 6. NASIL KULLANACAKSIN? (3 ADIM)
|
| 133 |
+
|
| 134 |
+
1. **Modeli indir:** HF linklerinden (2.1) GGUF dosyalarını al.
|
| 135 |
+
En pratik: `git clone https://huggingface.co/void0x14/echo`
|
| 136 |
+
2. **llama.cpp kur:** https://github.com/ggml-org/llama.cpp (veya bu
|
| 137 |
+
makinede hazır: `/tmp/llama-upstream/build/bin/llama-cli`)
|
| 138 |
+
3. **Çalıştır:**
|
| 139 |
+
```
|
| 140 |
+
./run_multimodal.sh resim.png "soru metni"
|
| 141 |
+
```
|
| 142 |
+
veya vision yoksa, N=4 text için:
|
| 143 |
+
```
|
| 144 |
+
llama-cli -m MVP/artifacts/gguf/qwen35-distilled-n4-Q4_K_M.gguf -p "Merhaba" -ngl 99
|
| 145 |
+
```
|
| 146 |
+
|
| 147 |
+
---
|
| 148 |
+
|
| 149 |
+
## 7. DOSYA HARİTASI
|
| 150 |
+
|
| 151 |
+
```
|
| 152 |
+
echo/ (repo kökü, git)
|
| 153 |
+
├── MVP/
|
| 154 |
+
│ ├── ANAHTAR_TESLIM.md ← bu doküman
|
| 155 |
+
│ ├── REPORT_FINAL.md ← detaylı rapor (v3)
|
| 156 |
+
│ ├── run_multimodal.sh ← tek tuşla görme testi
|
| 157 |
+
│ ├── qwen35_prune.py ← distillasyon kodu
|
| 158 |
+
│ ├── validate_checkpoint.py ← kontrol noktası doğrulayıcı
|
| 159 |
+
│ ├── tests/ ← sözleşme testleri
|
| 160 |
+
│ ├── evidence/ ← tüm kanıt logları
|
| 161 |
+
│ ├── evidence/multimodal/ ← görme test kanıtları
|
| 162 |
+
│ └── artifacts/
|
| 163 |
+
│ ├── gguf/ ← N=4 küçültülmüş model (4 dosya)
|
| 164 |
+
│ ├── gguf-vision/ ← orijinal görme modeli (2 dosya)
|
| 165 |
+
│ └── ... (safetensors checkpoint'ler)
|
| 166 |
+
└── docs/superpowers/ ← plan ve tasarım dokümanları
|
| 167 |
+
```
|