Loading weights: 0%| | 0/1951 [00:00 forcing --uniform (plain CE weighting) [pd] data=experiments/v8_nla_local/data/stage3_balanced/av_sft_balanced.parquet rows=1356 uniform=True gamma=1.0 corpus_mean_weight=1.000 [pd] DOMAIN-AWARE negs: avg same-dom=16.0 diff-dom=16.0 per anchor (15 domains) [pd] contrastive ON: beta=1.0 K=2 temp=1.0 domain_aware=True token_dropout=0.0 (InfoNCE over hard-neg activations) [pd] INJECT at residual layer 23 (native scale); embed pass-through [pd] inject_layer=23 inject_mode=raw [pd] optimizer=adamw8bit lr=5e-05 wd=0.01 steps=1000 ga=1 trainable_params=12.08M `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`. C:\Users\caleb\deception-nanochat-sae-research\.venv-gemma4\Lib\site-packages\torch\_dynamo\eval_frame.py:1181: UserWarning: torch.utils.checkpoint: the use_reentrant parameter should be passed explicitly. Starting in PyTorch 2.9, calling checkpoint without use_reentrant will raise an exception. use_reentrant=False is recommended, but if you need to preserve the current default behavior, you can pass use_reentrant=True. Refer to docs for more details on the differences between the two variants. return fn(*args, **kwargs) C:\Users\caleb\deception-nanochat-sae-research\experiments\v8_nla_local\train_prior_deviation_av.py:325: UserWarning: Converting a tensor with requires_grad=True to a scalar may lead to unexpected behavior. Consider using tensor.detach() first. (Triggered internally at C:\actions-runner\_work\pytorch\pytorch\pytorch\torch\csrc\autograd\generated\python_variable_methods.cpp:837.) (loss / ga).backward(); tot += float(loss) / ga [pd] step 1/1000 wloss=5.580 skipped=0 [pd] step 10/1000 wloss=3.317 skipped=0 [pd] step 20/1000 wloss=5.289 skipped=0 [pd] step 30/1000 wloss=3.477 skipped=0 [pd] step 40/1000 wloss=4.236 skipped=0 [pd] step 50/1000 wloss=5.188 skipped=0 [pd] step 60/1000 wloss=3.750 skipped=0 [pd] step 70/1000 wloss=3.908 skipped=0 [pd] step 80/1000 wloss=4.209 skipped=0 [pd] step 90/1000 wloss=5.104 skipped=0 [pd] step 100/1000 wloss=4.671 skipped=0 C:\Users\caleb\deception-nanochat-sae-research\.venv-gemma4\Lib\site-packages\peft\utils\save_and_load.py:372: UserWarning: Could not find a config file in google/gemma-4-E2B - will assume that the vocabulary was not modified. warnings.warn( [pd] saved experiments/v8_nla_local/checkpoints/av_L23_clean\step_000100 [pd] step 110/1000 wloss=4.033 skipped=0 [pd] step 120/1000 wloss=4.942 skipped=0 [pd] step 130/1000 wloss=4.147 skipped=0 [pd] step 140/1000 wloss=3.960 skipped=0 [pd] step 150/1000 wloss=3.524 skipped=0 [pd] step 160/1000 wloss=3.136 skipped=0 [pd] step 170/1000 wloss=5.005 skipped=0 [pd] step 180/1000 wloss=3.400 skipped=0 [pd] step 190/1000 wloss=3.929 skipped=0 [pd] step 200/1000 wloss=4.085 skipped=0 [pd] saved experiments/v8_nla_local/checkpoints/av_L23_clean\step_000200 [pd] step 210/1000 wloss=4.888 skipped=0 [pd] step 220/1000 wloss=3.767 skipped=0 [pd] step 230/1000 wloss=3.771 skipped=0 [pd] step 240/1000 wloss=4.061 skipped=0 [pd] step 250/1000 wloss=3.724 skipped=0 [pd] step 260/1000 wloss=4.040 skipped=0 [pd] step 270/1000 wloss=5.344 skipped=0 [pd] step 280/1000 wloss=3.331 skipped=0 [pd] step 290/1000 wloss=4.078 skipped=0 [pd] step 300/1000 wloss=4.956 skipped=0 [pd] saved experiments/v8_nla_local/checkpoints/av_L23_clean\step_000300 [pd] step 310/1000 wloss=4.509 skipped=0 [pd] step 320/1000 wloss=4.247 skipped=0 [pd] step 330/1000 wloss=4.128 skipped=0 [pd] step 340/1000 wloss=4.066 skipped=0 [pd] step 350/1000 wloss=5.392 skipped=0 [pd] step 360/1000 wloss=3.563 skipped=0 [pd] step 370/1000 wloss=3.632 skipped=0 [pd] step 380/1000 wloss=3.913 skipped=0 [pd] step 390/1000 wloss=3.936 skipped=0 [pd] step 400/1000 wloss=3.896 skipped=0 [pd] saved experiments/v8_nla_local/checkpoints/av_L23_clean\step_000400 [pd] step 410/1000 wloss=3.727 skipped=0 [pd] step 420/1000 wloss=4.693 skipped=0 [pd] step 430/1000 wloss=4.753 skipped=0 [pd] step 440/1000 wloss=3.553 skipped=0 [pd] step 450/1000 wloss=3.824 skipped=0 [pd] step 460/1000 wloss=3.776 skipped=0 [pd] step 470/1000 wloss=3.735 skipped=0