Instructions to use moritzmiller/sae-icm-final-checkpoint-gemma-2-2b-1e-05 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use moritzmiller/sae-icm-final-checkpoint-gemma-2-2b-1e-05 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-2-2b") model = PeftModel.from_pretrained(base_model, "moritzmiller/sae-icm-final-checkpoint-gemma-2-2b-1e-05") - Notebooks
- Google Colab
- Kaggle
metadata
license: gemma
base_model: google/gemma-2-2b
library_name: peft
sae-icm final checkpoint (gemma-2-2b, lambda = 1e-05)
Stage-2 artifacts for the paper Towards Isolated Interventions via Almost Orthogonal Features in Language Models (arXiv:2602.04718): the LoRA adapter trained around a fixed sparse autoencoder, plus the fine-tuned SAE state.
- base model:
google/gemma-2-2b - orthogonality penalty lambda:
1e-05 - SAE: TopK (K = 20), d_sae = 65536, spliced into the residual stream after block 12 (0-indexed)
- files:
adapter_model.safetensors,adapter_config.json,sae_state.safetensors(keysW_enc.weight,W_enc.bias,W_dec.weight,W_dec.bias)
Load with src/poet/load_hub.py from https://github.com/mrtzmllr/sae-icm.