Chanho-Lee's picture
Upload README.md with huggingface_hub
bee7d71 verified
|
Raw
History Blame Contribute Delete
1.21 kB
metadata
tags:
  - robotics
  - lerobot
  - reinforcement-learning

Reversed-curiosity RL assets for LGES case pick (icm_0708.pt / critic_0708.pt)

Companion checkpoints for RL fine-tuning of Chanho-Lee/smolvla_naive_0708 (reversed-curiosity / anti-exploration reward, AWR + BC). Code: smolvla_meanflow plugin.

file class contents
icm_0708.pt smolvla_meanflow.icm.ICM frozen forward models, streams ['proprio', 'vision'], per-stream calibrated eta {'proprio': 1.6751, 'vision': 0.3907}
critic_0708.pt smolvla_meanflow.critic.CriticEnsemble V(s) on the fixed reward mix {'proprio': 1.0, 'vision': 1.0} (input: concat features, 975-d)

Reward: r = sum_s w_s * exp(-eta_s * err_s) / sum_s w_s in (0, 1] per step. Trained on Chanho-Lee/lges_case_pick_0708 with the last episode of each pallet layer held out ([14, 29, 44, 59, 74]).

from huggingface_hub import hf_hub_download
from smolvla_meanflow.icm import ICM
from smolvla_meanflow.critic import CriticEnsemble

icm = ICM.load(hf_hub_download("Chanho-Lee/lges_case_pick_0708_rl", "icm_0708.pt"))
critic = CriticEnsemble.load(hf_hub_download("Chanho-Lee/lges_case_pick_0708_rl", "critic_0708.pt"))