Upload train_humanoid_gpu.py with huggingface_hub
Browse files- train_humanoid_gpu.py +13 -4
train_humanoid_gpu.py
CHANGED
|
@@ -24,6 +24,7 @@ import numpy as np
|
|
| 24 |
import gymnasium as gym
|
| 25 |
from stable_baselines3 import SAC
|
| 26 |
from stable_baselines3.common.callbacks import BaseCallback
|
|
|
|
| 27 |
|
| 28 |
# ββ Config βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
|
| 29 |
TIMESTEPS = 10_000_000
|
|
@@ -198,19 +199,27 @@ def main():
|
|
| 198 |
os.makedirs(SAVE_DIR, exist_ok=True)
|
| 199 |
os.makedirs(RESULTS_DIR, exist_ok=True)
|
| 200 |
|
| 201 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 202 |
|
| 203 |
model = SAC(
|
| 204 |
policy="MlpPolicy",
|
| 205 |
env=env,
|
| 206 |
learning_rate=3e-4,
|
| 207 |
buffer_size=1_000_000,
|
| 208 |
-
batch_size=
|
| 209 |
tau=0.005,
|
| 210 |
gamma=0.99,
|
| 211 |
learning_starts=25_000,
|
| 212 |
-
train_freq=
|
| 213 |
-
gradient_steps=
|
| 214 |
verbose=0,
|
| 215 |
device=DEVICE,
|
| 216 |
seed=42,
|
|
|
|
| 24 |
import gymnasium as gym
|
| 25 |
from stable_baselines3 import SAC
|
| 26 |
from stable_baselines3.common.callbacks import BaseCallback
|
| 27 |
+
from stable_baselines3.common.vec_env import SubprocVecEnv
|
| 28 |
|
| 29 |
# ββ Config βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
|
| 30 |
TIMESTEPS = 10_000_000
|
|
|
|
| 199 |
os.makedirs(SAVE_DIR, exist_ok=True)
|
| 200 |
os.makedirs(RESULTS_DIR, exist_ok=True)
|
| 201 |
|
| 202 |
+
N_ENVS = 16
|
| 203 |
+
|
| 204 |
+
def make_env(rank):
|
| 205 |
+
def _init():
|
| 206 |
+
env = UprightHumanoidWrapper(gym.make("Humanoid-v5"))
|
| 207 |
+
return env
|
| 208 |
+
return _init
|
| 209 |
+
|
| 210 |
+
env = SubprocVecEnv([make_env(i) for i in range(N_ENVS)])
|
| 211 |
|
| 212 |
model = SAC(
|
| 213 |
policy="MlpPolicy",
|
| 214 |
env=env,
|
| 215 |
learning_rate=3e-4,
|
| 216 |
buffer_size=1_000_000,
|
| 217 |
+
batch_size=512,
|
| 218 |
tau=0.005,
|
| 219 |
gamma=0.99,
|
| 220 |
learning_starts=25_000,
|
| 221 |
+
train_freq=1,
|
| 222 |
+
gradient_steps=2,
|
| 223 |
verbose=0,
|
| 224 |
device=DEVICE,
|
| 225 |
seed=42,
|