--- license: apache-2.0 base_model: BSC-LT/salamandra-7b-instruct-2606 base_model_relation: quantized language: - es - ca - gl - eu - en pipeline_tag: text-generation tags: - gguf - llama.cpp - quantized - imatrix - spanish - salamandra - bsc library_name: gguf ---
``` ╔══════════════════════════════════════════════════════════════╗ ║ S A L A M A N D R A · 7 B · I N S T R U C T · 2 6 0 6 ║ ║ ─────────────────────────────────────────────────────── ║ ║ GGUF quant ladder · imatrix (calibrado en español) ║ ║ Q3 ▸ IQ4 ▸ Q4 ▸ Q5 ▸ Q6 ▸ Q8 · fidelidad medida (KLD) ║ ╚══════════════════════════════════════════════════════════════╝ ``` # Salamandra-7B-Instruct-2606 · GGUF **Cuantizaciones GGUF con imatrix del modelo soberano español/europeo de BSC-LT.** Escalera completa Q3→Q8 · matriz de importancia calibrada **en español** · fidelidad objetiva **medida contra el BF16** (KLD + PPL + Top-1).
> **Qué es esto**: [BSC-LT/salamandra-7b-instruct-2606](https://huggingface.co/BSC-LT/salamandra-7b-instruct-2606) — > el modelo multilingüe (ES · CA · GL · EU · EN…) del Barcelona Supercomputing Center— empaquetado en GGUF para > correr en local con `llama.cpp` / Ollama. **No es un modelo de código**: su valor es lingüístico y de soberanía, > así que aquí lo importante es que **la cuantización no rompa el modelo** — y eso se demuestra con la tabla de fidelidad de abajo, no con un benchmark de programación. ## ✅ Qué archivo elegir | Si quieres… | Usa | Por qué | |---|---|---| | **Lo mejor equilibrado** | **Q4_K_M** (4.5 GB) | el estándar seguro — cabe en 8 GB, buena fidelidad | | Máxima calidad práctica | **Q6_K** (6.0 GB) | KLD 0.004, casi indistinguible del original | | Fidelidad de archivo | **Q8_0** (7.7 GB) | prácticamente sin pérdida (Top-1 98.9%) | | Lo más pequeño usable | **Q3_K_M** (3.8 GB) | para RAM muy justa; algo de deriva | | Compacto con imatrix | **IQ4_XS** (4.2 GB) | más pequeño que Q4_K_M, fidelidad parecida | ## 📦 Archivos | Quant | Bits (aprox) | Tamaño | |---|---|---| | `salamandra-7b-Q3_K_M.gguf` | ~3.9 | 3.8 GB | | `salamandra-7b-IQ4_XS.gguf` | ~4.25 | 4.2 GB | | `salamandra-7b-Q4_K_M.gguf` | ~4.8 | 4.5 GB | | `salamandra-7b-Q5_K_M.gguf` | ~5.6 | 5.2 GB | | `salamandra-7b-Q6_K.gguf` | ~6.5 | 6.0 GB | | `salamandra-7b-Q8_0.gguf` | ~8.5 | 7.7 GB | ## 📊 Fidelidad medida (vs BF16 · corpus español) **KLD** (divergencia Kullback–Leibler) mide cuánto se aleja la distribución de salida de cada cuantización respecto al modelo original en BF16 — es el patrón oro de fidelidad de cuantización, más fino que la perplejidad sola. **Top-1** = con qué frecuencia el token más probable coincide con el del BF16. | Quant | Tamaño | PPL (es) | PPL Δ vs BF16 | **KLD media** | Top-1 vs BF16 | |---|---|---|---|---|---| | BF16 (ref) | 14.8 GB | 7.437 | — | 0 | 100% | | Q8_0 | 7.7 GB | 7.437 | **+0.0002** | **0.00043** | **98.9%** | | Q6_K | 6.0 GB | 7.460 | +0.023 | 0.00376 | 96.8% | | Q5_K_M | 5.2 GB | 7.485 | +0.048 | 0.00865 | 95.3% | | Q4_K_M | 4.5 GB | 7.611 | +0.174 | 0.02808 | 91.9% | | IQ4_XS | 4.2 GB | 7.705 | +0.268 | 0.03421 | 91.3% | | Q3_K_M | 3.8 GB | 8.117 | +0.680 | 0.08682 | 86.1% | ## 📈 Gráficas ![fidelidad vs tamaño](metrics/chart-quality-vs-size.png) ![PPL delta](metrics/chart-ppl-delta.png) ![Top-1 match](metrics/chart-top1-match.png) ## 🧮 ¿Me cabe? (RAM aproximada, contexto 8K) | Quant | RAM mínima | |---|---| | Q3_K_M / IQ4_XS | ~6 GB | | Q4_K_M / Q5_K_M | ~7–8 GB | | Q6_K / Q8_0 | ~8–10 GB | ## 🚀 Cómo ejecutarlo **Ollama** (usa la plantilla ChatML que ya trae el GGUF): ```bash ollama create salamandra7b -f Modelfile.8192 ollama run salamandra7b "Explica la fotosíntesis en una frase." ``` **llama.cpp**: ```bash llama-cli -m salamandra-7b-Q4_K_M.gguf -ngl 99 -c 8192 \ -p "<|im_start|>user\n¿Cuál es la capital de Galicia?<|im_end|>\n<|im_start|>assistant\n" ``` Muestreo recomendado: `temp 0.7 · top_p 0.95 · top_k 40`. Contexto nativo **8192**. ## ⚠️ Bueno saber - **Es un modelo lingüístico, no de código.** Brilla en español y lenguas cooficiales (catalán, gallego, euskera) y multilingüe; no esperes rendimiento de un modelo especializado en programación. - **Gate de calidad = fidelidad, no SWE.** Para una cuantización de un modelo así, lo que importa es que se parezca al original (KLD arriba), no un test de coding que sería ~0 por diseño del modelo base. - **imatrix en español**: la matriz de importancia se calibró con prosa española, no inglesa — evita la deriva que introduce calibrar en el idioma equivocado. ## 🔁 Procedencia y reproducibilidad - **Base**: `BSC-LT/salamandra-7b-instruct-2606` · arquitectura Llama · licencia Apache-2.0. - **imatrix**: corpus en español, `-c 512`, sobre el BF16. - **Ladder**: `llama-quantize --imatrix` para cada tier. Magic verificado en cada `.gguf`. - **Fidelidad**: `llama-perplexity --kl-divergence` contra base BF16 (`kld.dat`) + PPL en español. - Comandos exactos en `scripts/reproduce.sh`; métricas en `metrics/quant-summary-with-kld.{json,csv}`; checksums en `reports/artifact-sha256sums.txt`. ## Evaluation methodology - **Métrica**: KLD (mean/max) + Top-1 match + PPL, cada cuantización vs la referencia BF16, sobre un corpus **español**. Sin gate SWE — no aplica a un modelo lingüístico no-coder (sería 0 por diseño, no por la cuantización). - **Herramientas**: `llama.cpp` (`llama-imatrix`, `llama-quantize`, `llama-perplexity --kl-divergence`). - **Fecha**: 2026-07. Caveat: PPL/KLD sobre un corpus acotado; comparativa relativa entre tiers, no un ranking absoluto. ## 🗒️ Changelog - **2026-07** — release inicial: escalera Q3→Q8 + IQ4_XS, imatrix español, tabla KLD/PPL/Top-1 + gráficas. --- Cuantizado por **KikoCis**. Modelo base © Barcelona Supercomputing Center (BSC-LT), Apache-2.0. Todo el mérito del modelo es de BSC-LT; aquí solo se empaqueta y se mide la fidelidad de las cuantizaciones.