chane35's picture
PERMANENCE: reversibility-aware RL environment for training LLM agents
f6afd9e verified
Raw
History Blame
50.9 kB
{
"episodes": [
{
"episode": 1,
"loss": "0.1168",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.487",
"completion_length": "121.2",
"clipped_ratio": "0",
"learning_rate": "0",
"grad_norm": "1.441",
"epoch": "0.002"
},
{
"episode": 2,
"loss": "0.03414",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.728",
"completion_length": "82",
"clipped_ratio": "0",
"learning_rate": "1e-06",
"grad_norm": "0.06773",
"epoch": "0.004"
},
{
"episode": 3,
"loss": "0.03677",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.472",
"completion_length": "110.5",
"clipped_ratio": "0",
"learning_rate": "2e-06",
"grad_norm": "1.649",
"epoch": "0.006"
},
{
"episode": 4,
"loss": "0.1546",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.565",
"completion_length": "97.25",
"clipped_ratio": "0",
"learning_rate": "3e-06",
"grad_norm": "1.336",
"epoch": "0.008"
},
{
"episode": 5,
"loss": "0.0292",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.48",
"completion_length": "105.8",
"clipped_ratio": "0",
"learning_rate": "4e-06",
"grad_norm": "0.05263",
"epoch": "0.01"
},
{
"episode": 6,
"loss": "-0.05279",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.577",
"completion_length": "113",
"clipped_ratio": "0",
"learning_rate": "5e-06",
"grad_norm": "1.791",
"epoch": "0.012"
},
{
"episode": 7,
"loss": "0.1339",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.539",
"completion_length": "126.2",
"clipped_ratio": "0",
"learning_rate": "6e-06",
"grad_norm": "1.452",
"epoch": "0.014"
},
{
"episode": 8,
"loss": "0.03526",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.845",
"completion_length": "89",
"clipped_ratio": "0",
"learning_rate": "7e-06",
"grad_norm": "0.1091",
"epoch": "0.016"
},
{
"episode": 9,
"loss": "-0.03297",
"reward": "-0.03875",
"reward_std": "0.05375",
"kl": "1.484",
"completion_length": "114.5",
"clipped_ratio": "0",
"learning_rate": "8e-06",
"grad_norm": "1.834",
"epoch": "0.018"
},
{
"episode": 10,
"loss": "0.02409",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.3",
"completion_length": "158",
"clipped_ratio": "0",
"learning_rate": "9e-06",
"grad_norm": "0.08162",
"epoch": "0.02"
},
{
"episode": 11,
"loss": "-0.07952",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.526",
"completion_length": "114.5",
"clipped_ratio": "0",
"learning_rate": "1e-05",
"grad_norm": "1.697",
"epoch": "0.022"
},
{
"episode": 12,
"loss": "0.04861",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.59",
"completion_length": "99",
"clipped_ratio": "0",
"learning_rate": "1.1e-05",
"grad_norm": "1.777",
"epoch": "0.024"
},
{
"episode": 13,
"loss": "0.09983",
"reward": "-0.03875",
"reward_std": "0.06237",
"kl": "1.888",
"completion_length": "93.75",
"clipped_ratio": "0",
"learning_rate": "1.2e-05",
"grad_norm": "2.288",
"epoch": "0.026"
},
{
"episode": 14,
"loss": "0.1242",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.648",
"completion_length": "112.8",
"clipped_ratio": "0",
"learning_rate": "1.3e-05",
"grad_norm": "1.58",
"epoch": "0.028"
},
{
"episode": 15,
"loss": "0.04319",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.545",
"completion_length": "100.5",
"clipped_ratio": "0",
"learning_rate": "1.4e-05",
"grad_norm": "1.571",
"epoch": "0.03"
},
{
"episode": 16,
"loss": "0.03368",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.721",
"completion_length": "82",
"clipped_ratio": "0",
"learning_rate": "1.5e-05",
"grad_norm": "0.1079",
"epoch": "0.032"
},
{
"episode": 17,
"loss": "0.03411",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.737",
"completion_length": "96",
"clipped_ratio": "0",
"learning_rate": "1.6e-05",
"grad_norm": "0.05412",
"epoch": "0.034"
},
{
"episode": 18,
"loss": "0.02681",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.425",
"completion_length": "116.2",
"clipped_ratio": "0",
"learning_rate": "1.7e-05",
"grad_norm": "0.09016",
"epoch": "0.036"
},
{
"episode": 19,
"loss": "-0.1867",
"reward": "0.1367",
"reward_std": "0.4434",
"kl": "1.459",
"completion_length": "138.5",
"clipped_ratio": "0",
"learning_rate": "1.8e-05",
"grad_norm": "1.965",
"epoch": "0.038"
},
{
"episode": 20,
"loss": "0.02446",
"reward": "-0.03875",
"reward_std": "0.06237",
"kl": "1.662",
"completion_length": "97.75",
"clipped_ratio": "0",
"learning_rate": "1.9e-05",
"grad_norm": "1.648",
"epoch": "0.04"
},
{
"episode": 21,
"loss": "0.02844",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.462",
"completion_length": "103.5",
"clipped_ratio": "0",
"learning_rate": "2e-05",
"grad_norm": "0.05372",
"epoch": "0.042"
},
{
"episode": 22,
"loss": "0.1425",
"reward": "-0.06375",
"reward_std": "0.05297",
"kl": "1.547",
"completion_length": "140",
"clipped_ratio": "0",
"learning_rate": "2.1e-05",
"grad_norm": "1.714",
"epoch": "0.044"
},
{
"episode": 23,
"loss": "0.06482",
"reward": "0.1825",
"reward_std": "0.4707",
"kl": "1.429",
"completion_length": "101.2",
"clipped_ratio": "0",
"learning_rate": "2.2e-05",
"grad_norm": "1.443",
"epoch": "0.046"
},
{
"episode": 24,
"loss": "0.03516",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.529",
"completion_length": "93.5",
"clipped_ratio": "0",
"learning_rate": "2.3e-05",
"grad_norm": "1.834",
"epoch": "0.048"
},
{
"episode": 25,
"loss": "0.2135",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.349",
"completion_length": "140.5",
"clipped_ratio": "0",
"learning_rate": "2.4e-05",
"grad_norm": "1.748",
"epoch": "0.05"
},
{
"episode": 26,
"loss": "-0.0988",
"reward": "-0.03875",
"reward_std": "0.05375",
"kl": "1.452",
"completion_length": "110.8",
"clipped_ratio": "0",
"learning_rate": "2.5e-05",
"grad_norm": "1.824",
"epoch": "0.052"
},
{
"episode": 27,
"loss": "0.08622",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.599",
"completion_length": "92",
"clipped_ratio": "0",
"learning_rate": "2.6e-05",
"grad_norm": "1.645",
"epoch": "0.054"
},
{
"episode": 28,
"loss": "0.2779",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.387",
"completion_length": "158",
"clipped_ratio": "0",
"learning_rate": "2.7e-05",
"grad_norm": "1.36",
"epoch": "0.056"
},
{
"episode": 29,
"loss": "0.03327",
"reward": "-0.085",
"reward_std": "0",
"kl": "1.678",
"completion_length": "83",
"clipped_ratio": "0",
"learning_rate": "2.8e-05",
"grad_norm": "0.0967",
"epoch": "0.058"
},
{
"episode": 30,
"loss": "0.02572",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.724",
"completion_length": "89.5",
"clipped_ratio": "0",
"learning_rate": "2.9e-05",
"grad_norm": "1.624",
"epoch": "0.06"
},
{
"episode": 31,
"loss": "0.02943",
"reward": "0.015",
"reward_std": "0",
"kl": "1.541",
"completion_length": "103.5",
"clipped_ratio": "0",
"learning_rate": "3e-05",
"grad_norm": "0.04806",
"epoch": "0.062"
},
{
"episode": 32,
"loss": "0.01911",
"reward": "-0.03875",
"reward_std": "0.06237",
"kl": "1.364",
"completion_length": "98",
"clipped_ratio": "0",
"learning_rate": "3.1e-05",
"grad_norm": "1.499",
"epoch": "0.064"
},
{
"episode": 33,
"loss": "-0.3277",
"reward": "-0.06375",
"reward_std": "0.05297",
"kl": "1.405",
"completion_length": "77.75",
"clipped_ratio": "0",
"learning_rate": "3.2e-05",
"grad_norm": "1.937",
"epoch": "0.066"
},
{
"episode": 34,
"loss": "-0.1782",
"reward": "-0.08875",
"reward_std": "0.0075",
"kl": "1.544",
"completion_length": "88.25",
"clipped_ratio": "0",
"learning_rate": "3.3e-05",
"grad_norm": "1.418",
"epoch": "0.068"
},
{
"episode": 35,
"loss": "0.08649",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.487",
"completion_length": "106",
"clipped_ratio": "0",
"learning_rate": "3.4e-05",
"grad_norm": "1.569",
"epoch": "0.07"
},
{
"episode": 36,
"loss": "-0.0006697",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.382",
"completion_length": "99.75",
"clipped_ratio": "0",
"learning_rate": "3.5e-05",
"grad_norm": "1.449",
"epoch": "0.072"
},
{
"episode": 37,
"loss": "-0.02239",
"reward": "0.01125",
"reward_std": "0.0075",
"kl": "1.371",
"completion_length": "114.5",
"clipped_ratio": "0",
"learning_rate": "3.6e-05",
"grad_norm": "1.406",
"epoch": "0.074"
},
{
"episode": 38,
"loss": "0.03101",
"reward": "0.015",
"reward_std": "0",
"kl": "1.58",
"completion_length": "95.75",
"clipped_ratio": "0",
"learning_rate": "3.7e-05",
"grad_norm": "0.06464",
"epoch": "0.076"
},
{
"episode": 39,
"loss": "0.05389",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.723",
"completion_length": "89.5",
"clipped_ratio": "0",
"learning_rate": "3.8e-05",
"grad_norm": "1.589",
"epoch": "0.078"
},
{
"episode": 40,
"loss": "0.01259",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.451",
"completion_length": "107.5",
"clipped_ratio": "0",
"learning_rate": "3.9e-05",
"grad_norm": "1.351",
"epoch": "0.08"
},
{
"episode": 41,
"loss": "0.07202",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.776",
"completion_length": "92.25",
"clipped_ratio": "0",
"learning_rate": "4e-05",
"grad_norm": "1.879",
"epoch": "0.082"
},
{
"episode": 42,
"loss": "0.04993",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.674",
"completion_length": "82.25",
"clipped_ratio": "0",
"learning_rate": "4.1e-05",
"grad_norm": "1.664",
"epoch": "0.084"
},
{
"episode": 43,
"loss": "-0.009573",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.592",
"completion_length": "88.25",
"clipped_ratio": "0",
"learning_rate": "4.2e-05",
"grad_norm": "1.511",
"epoch": "0.086"
},
{
"episode": 44,
"loss": "-0.1045",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.62",
"completion_length": "96.25",
"clipped_ratio": "0",
"learning_rate": "4.3e-05",
"grad_norm": "1.58",
"epoch": "0.088"
},
{
"episode": 45,
"loss": "0.09343",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.692",
"completion_length": "87.5",
"clipped_ratio": "0",
"learning_rate": "4.4e-05",
"grad_norm": "1.955",
"epoch": "0.09"
},
{
"episode": 46,
"loss": "0.03445",
"reward": "0.015",
"reward_std": "0",
"kl": "1.762",
"completion_length": "87.75",
"clipped_ratio": "0",
"learning_rate": "4.5e-05",
"grad_norm": "0.1226",
"epoch": "0.092"
},
{
"episode": 47,
"loss": "-0.09708",
"reward": "-0.06",
"reward_std": "0.05",
"kl": "1.557",
"completion_length": "90.75",
"clipped_ratio": "0",
"learning_rate": "4.6e-05",
"grad_norm": "1.661",
"epoch": "0.094"
},
{
"episode": 48,
"loss": "0.03128",
"reward": "0.015",
"reward_std": "0",
"kl": "1.661",
"completion_length": "90",
"clipped_ratio": "0",
"learning_rate": "4.7e-05",
"grad_norm": "0.07655",
"epoch": "0.096"
},
{
"episode": 49,
"loss": "0.03093",
"reward": "0.015",
"reward_std": "0",
"kl": "1.609",
"completion_length": "102.5",
"clipped_ratio": "0",
"learning_rate": "4.8e-05",
"grad_norm": "0.06835",
"epoch": "0.098"
},
{
"episode": 50,
"loss": "0.0294",
"reward": "0.015",
"reward_std": "0",
"kl": "1.499",
"completion_length": "100.2",
"clipped_ratio": "0",
"learning_rate": "4.9e-05",
"grad_norm": "0.04857",
"epoch": "0.1"
},
{
"episode": 51,
"loss": "-0.08929",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.549",
"completion_length": "104",
"clipped_ratio": "0",
"learning_rate": "5e-05",
"grad_norm": "1.356",
"epoch": "0.102"
},
{
"episode": 52,
"loss": "0.2245",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.576",
"completion_length": "137.8",
"clipped_ratio": "0",
"learning_rate": "4.989e-05",
"grad_norm": "1.731",
"epoch": "0.104"
},
{
"episode": 53,
"loss": "0.2212",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.381",
"completion_length": "118",
"clipped_ratio": "0",
"learning_rate": "4.978e-05",
"grad_norm": "1.558",
"epoch": "0.106"
},
{
"episode": 54,
"loss": "0.03415",
"reward": "0.015",
"reward_std": "0",
"kl": "1.736",
"completion_length": "89.25",
"clipped_ratio": "0",
"learning_rate": "4.967e-05",
"grad_norm": "0.07583",
"epoch": "0.108"
},
{
"episode": 55,
"loss": "0.03483",
"reward": "0.015",
"reward_std": "0",
"kl": "1.754",
"completion_length": "97",
"clipped_ratio": "0",
"learning_rate": "4.956e-05",
"grad_norm": "0.09679",
"epoch": "0.11"
},
{
"episode": 56,
"loss": "0.05668",
"reward": "-0.01375",
"reward_std": "0.04802",
"kl": "1.489",
"completion_length": "107.2",
"clipped_ratio": "0",
"learning_rate": "4.944e-05",
"grad_norm": "1.737",
"epoch": "0.112"
},
{
"episode": 57,
"loss": "0.03395",
"reward": "0.015",
"reward_std": "0",
"kl": "1.723",
"completion_length": "88.5",
"clipped_ratio": "0",
"learning_rate": "4.933e-05",
"grad_norm": "0.07683",
"epoch": "0.114"
},
{
"episode": 58,
"loss": "0.03335",
"reward": "0.015",
"reward_std": "0",
"kl": "1.681",
"completion_length": "83",
"clipped_ratio": "0",
"learning_rate": "4.922e-05",
"grad_norm": "0.0568",
"epoch": "0.116"
},
{
"episode": 59,
"loss": "0.03198",
"reward": "0.015",
"reward_std": "0",
"kl": "1.614",
"completion_length": "100",
"clipped_ratio": "0",
"learning_rate": "4.911e-05",
"grad_norm": "0.06101",
"epoch": "0.118"
},
{
"episode": 60,
"loss": "0.03004",
"reward": "0.015",
"reward_std": "0",
"kl": "1.525",
"completion_length": "90.75",
"clipped_ratio": "0",
"learning_rate": "4.9e-05",
"grad_norm": "0.06637",
"epoch": "0.12"
},
{
"episode": 61,
"loss": "0.1298",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.597",
"completion_length": "103.8",
"clipped_ratio": "0",
"learning_rate": "4.889e-05",
"grad_norm": "1.57",
"epoch": "0.122"
},
{
"episode": 62,
"loss": "0.03358",
"reward": "0.015",
"reward_std": "0",
"kl": "1.721",
"completion_length": "87",
"clipped_ratio": "0",
"learning_rate": "4.878e-05",
"grad_norm": "0.05775",
"epoch": "0.124"
},
{
"episode": 63,
"loss": "0.05816",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.336",
"completion_length": "120.2",
"clipped_ratio": "0",
"learning_rate": "4.867e-05",
"grad_norm": "1.434",
"epoch": "0.126"
},
{
"episode": 64,
"loss": "-0.1117",
"reward": "-0.0175",
"reward_std": "0.05545",
"kl": "1.377",
"completion_length": "109",
"clipped_ratio": "0",
"learning_rate": "4.856e-05",
"grad_norm": "1.512",
"epoch": "0.128"
},
{
"episode": 65,
"loss": "0.0283",
"reward": "0.015",
"reward_std": "0",
"kl": "1.431",
"completion_length": "112.5",
"clipped_ratio": "0",
"learning_rate": "4.844e-05",
"grad_norm": "0.05251",
"epoch": "0.13"
},
{
"episode": 66,
"loss": "0.02255",
"reward": "-0.03875",
"reward_std": "0.06237",
"kl": "1.395",
"completion_length": "103.2",
"clipped_ratio": "0",
"learning_rate": "4.833e-05",
"grad_norm": "1.503",
"epoch": "0.132"
},
{
"episode": 67,
"loss": "0.0259",
"reward": "0.015",
"reward_std": "0",
"kl": "1.301",
"completion_length": "111.5",
"clipped_ratio": "0",
"learning_rate": "4.822e-05",
"grad_norm": "0.05156",
"epoch": "0.134"
},
{
"episode": 68,
"loss": "0.02639",
"reward": "0.015",
"reward_std": "0",
"kl": "1.364",
"completion_length": "118.2",
"clipped_ratio": "0",
"learning_rate": "4.811e-05",
"grad_norm": "0.03931",
"epoch": "0.136"
},
{
"episode": 69,
"loss": "0.02672",
"reward": "0.015",
"reward_std": "0",
"kl": "1.366",
"completion_length": "103",
"clipped_ratio": "0",
"learning_rate": "4.8e-05",
"grad_norm": "0.04079",
"epoch": "0.138"
},
{
"episode": 70,
"loss": "0.05654",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.344",
"completion_length": "108.5",
"clipped_ratio": "0",
"learning_rate": "4.789e-05",
"grad_norm": "1.761",
"epoch": "0.14"
},
{
"episode": 71,
"loss": "0.03006",
"reward": "0.015",
"reward_std": "0",
"kl": "1.524",
"completion_length": "106.8",
"clipped_ratio": "0",
"learning_rate": "4.778e-05",
"grad_norm": "0.1124",
"epoch": "0.142"
},
{
"episode": 72,
"loss": "0.02528",
"reward": "0.015",
"reward_std": "0",
"kl": "1.279",
"completion_length": "125.2",
"clipped_ratio": "0",
"learning_rate": "4.767e-05",
"grad_norm": "0.05816",
"epoch": "0.144"
},
{
"episode": 73,
"loss": "0.208",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.469",
"completion_length": "131",
"clipped_ratio": "0",
"learning_rate": "4.756e-05",
"grad_norm": "1.413",
"epoch": "0.146"
},
{
"episode": 74,
"loss": "0.06406",
"reward": "-0.035",
"reward_std": "0.05774",
"kl": "1.347",
"completion_length": "121.2",
"clipped_ratio": "0",
"learning_rate": "4.744e-05",
"grad_norm": "1.338",
"epoch": "0.148"
},
{
"episode": 75,
"loss": "0.02868",
"reward": "0.015",
"reward_std": "0",
"kl": "1.465",
"completion_length": "92.25",
"clipped_ratio": "0",
"learning_rate": "4.733e-05",
"grad_norm": "0.05968",
"epoch": "0.15"
},
{
"episode": 76,
"loss": "0.03725",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.292",
"completion_length": "119.2",
"clipped_ratio": "0",
"learning_rate": "4.722e-05",
"grad_norm": "2.02",
"epoch": "0.152"
},
{
"episode": 77,
"loss": "0.02851",
"reward": "0.015",
"reward_std": "0",
"kl": "1.446",
"completion_length": "118",
"clipped_ratio": "0",
"learning_rate": "4.711e-05",
"grad_norm": "0.15",
"epoch": "0.154"
},
{
"episode": 78,
"loss": "0.07068",
"reward": "0.015",
"reward_std": "0",
"kl": "3.348",
"completion_length": "104",
"clipped_ratio": "0",
"learning_rate": "4.7e-05",
"grad_norm": "4.452",
"epoch": "0.156"
},
{
"episode": 79,
"loss": "0.02455",
"reward": "0.015",
"reward_std": "0",
"kl": "1.25",
"completion_length": "132.2",
"clipped_ratio": "0",
"learning_rate": "4.689e-05",
"grad_norm": "0.03926",
"epoch": "0.158"
},
{
"episode": 80,
"loss": "0.02639",
"reward": "0.015",
"reward_std": "0",
"kl": "1.361",
"completion_length": "116.8",
"clipped_ratio": "0",
"learning_rate": "4.678e-05",
"grad_norm": "0.1211",
"epoch": "0.16"
},
{
"episode": 81,
"loss": "0.02788",
"reward": "0.015",
"reward_std": "0",
"kl": "1.419",
"completion_length": "100.5",
"clipped_ratio": "0",
"learning_rate": "4.667e-05",
"grad_norm": "0.03858",
"epoch": "0.162"
},
{
"episode": 82,
"loss": "0.03285",
"reward": "0.015",
"reward_std": "0",
"kl": "1.66",
"completion_length": "89.75",
"clipped_ratio": "0",
"learning_rate": "4.656e-05",
"grad_norm": "0.3443",
"epoch": "0.164"
},
{
"episode": 83,
"loss": "0.02415",
"reward": "0.015",
"reward_std": "0",
"kl": "1.255",
"completion_length": "125.2",
"clipped_ratio": "0",
"learning_rate": "4.644e-05",
"grad_norm": "0.04701",
"epoch": "0.166"
},
{
"episode": 84,
"loss": "0.1476",
"reward": "-0.06375",
"reward_std": "0.05297",
"kl": "1.054",
"completion_length": "144.2",
"clipped_ratio": "0.25",
"learning_rate": "4.633e-05",
"grad_norm": "1.043",
"epoch": "0.168"
},
{
"episode": 85,
"loss": "0.02414",
"reward": "0.015",
"reward_std": "0",
"kl": "1.324",
"completion_length": "133",
"clipped_ratio": "0",
"learning_rate": "4.622e-05",
"grad_norm": "0.1377",
"epoch": "0.17"
},
{
"episode": 86,
"loss": "0.4588",
"reward": "-0.0175",
"reward_std": "0.05545",
"kl": "1.243",
"completion_length": "134.2",
"clipped_ratio": "0.25",
"learning_rate": "4.611e-05",
"grad_norm": "1.549",
"epoch": "0.172"
},
{
"episode": 87,
"loss": "0.05721",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.323",
"completion_length": "116.8",
"clipped_ratio": "0",
"learning_rate": "4.6e-05",
"grad_norm": "1.334",
"epoch": "0.174"
},
{
"episode": 88,
"loss": "0.0259",
"reward": "0.015",
"reward_std": "0",
"kl": "1.336",
"completion_length": "105.8",
"clipped_ratio": "0",
"learning_rate": "4.589e-05",
"grad_norm": "0.04917",
"epoch": "0.176"
},
{
"episode": 89,
"loss": "0.03014",
"reward": "0.015",
"reward_std": "0",
"kl": "1.515",
"completion_length": "104.5",
"clipped_ratio": "0",
"learning_rate": "4.578e-05",
"grad_norm": "0.1387",
"epoch": "0.178"
},
{
"episode": 90,
"loss": "0.02943",
"reward": "0.015",
"reward_std": "0",
"kl": "1.476",
"completion_length": "117.5",
"clipped_ratio": "0",
"learning_rate": "4.567e-05",
"grad_norm": "0.2111",
"epoch": "0.18"
},
{
"episode": 91,
"loss": "0.1492",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.187",
"completion_length": "135.8",
"clipped_ratio": "0",
"learning_rate": "4.556e-05",
"grad_norm": "1.204",
"epoch": "0.182"
},
{
"episode": 92,
"loss": "0.00894",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.269",
"completion_length": "115.8",
"clipped_ratio": "0",
"learning_rate": "4.544e-05",
"grad_norm": "1.163",
"epoch": "0.184"
},
{
"episode": 93,
"loss": "0.02674",
"reward": "0.015",
"reward_std": "0",
"kl": "1.44",
"completion_length": "102.5",
"clipped_ratio": "0",
"learning_rate": "4.533e-05",
"grad_norm": "0.1047",
"epoch": "0.186"
},
{
"episode": 94,
"loss": "0.02273",
"reward": "0.015",
"reward_std": "0",
"kl": "1.198",
"completion_length": "133.2",
"clipped_ratio": "0",
"learning_rate": "4.522e-05",
"grad_norm": "0.05807",
"epoch": "0.188"
},
{
"episode": 95,
"loss": "0.02433",
"reward": "0.015",
"reward_std": "0",
"kl": "1.232",
"completion_length": "124",
"clipped_ratio": "0",
"learning_rate": "4.511e-05",
"grad_norm": "0.04012",
"epoch": "0.19"
},
{
"episode": 96,
"loss": "0.02564",
"reward": "0.015",
"reward_std": "0",
"kl": "1.31",
"completion_length": "111.5",
"clipped_ratio": "0",
"learning_rate": "4.5e-05",
"grad_norm": "0.06366",
"epoch": "0.192"
},
{
"episode": 97,
"loss": "0.02609",
"reward": "0.015",
"reward_std": "0",
"kl": "1.337",
"completion_length": "112.2",
"clipped_ratio": "0",
"learning_rate": "4.489e-05",
"grad_norm": "0.05895",
"epoch": "0.194"
},
{
"episode": 98,
"loss": "0.02595",
"reward": "0.015",
"reward_std": "0",
"kl": "1.339",
"completion_length": "102.8",
"clipped_ratio": "0",
"learning_rate": "4.478e-05",
"grad_norm": "0.07423",
"epoch": "0.196"
},
{
"episode": 99,
"loss": "-0.2551",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.134",
"completion_length": "131.2",
"clipped_ratio": "0",
"learning_rate": "4.467e-05",
"grad_norm": "1.3",
"epoch": "0.198"
},
{
"episode": 100,
"loss": "0.0307",
"reward": "0.015",
"reward_std": "0",
"kl": "1.706",
"completion_length": "85.5",
"clipped_ratio": "0",
"learning_rate": "4.456e-05",
"grad_norm": "0.113",
"epoch": "0.2"
},
{
"episode": 101,
"loss": "0.02324",
"reward": "0.015",
"reward_std": "0",
"kl": "1.188",
"completion_length": "121.8",
"clipped_ratio": "0",
"learning_rate": "4.444e-05",
"grad_norm": "0.04005",
"epoch": "0.202"
},
{
"episode": 102,
"loss": "0.02365",
"reward": "0.015",
"reward_std": "0",
"kl": "1.209",
"completion_length": "119.2",
"clipped_ratio": "0",
"learning_rate": "4.433e-05",
"grad_norm": "0.03859",
"epoch": "0.204"
},
{
"episode": 103,
"loss": "-0.1069",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.013",
"completion_length": "123.5",
"clipped_ratio": "0",
"learning_rate": "4.422e-05",
"grad_norm": "1.101",
"epoch": "0.206"
},
{
"episode": 104,
"loss": "-0.06919",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.118",
"completion_length": "129.8",
"clipped_ratio": "0",
"learning_rate": "4.411e-05",
"grad_norm": "1.286",
"epoch": "0.208"
},
{
"episode": 105,
"loss": "0.02123",
"reward": "0.015",
"reward_std": "0",
"kl": "1.138",
"completion_length": "142",
"clipped_ratio": "0",
"learning_rate": "4.4e-05",
"grad_norm": "0.04361",
"epoch": "0.21"
},
{
"episode": 106,
"loss": "0.02399",
"reward": "0.015",
"reward_std": "0",
"kl": "1.212",
"completion_length": "128",
"clipped_ratio": "0",
"learning_rate": "4.389e-05",
"grad_norm": "0.04805",
"epoch": "0.212"
},
{
"episode": 107,
"loss": "0.3564",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.031",
"completion_length": "152.8",
"clipped_ratio": "0.25",
"learning_rate": "4.378e-05",
"grad_norm": "1.439",
"epoch": "0.214"
},
{
"episode": 108,
"loss": "0.02283",
"reward": "0.015",
"reward_std": "0",
"kl": "1.166",
"completion_length": "129.2",
"clipped_ratio": "0",
"learning_rate": "4.367e-05",
"grad_norm": "0.05553",
"epoch": "0.216"
},
{
"episode": 109,
"loss": "-0.04348",
"reward": "-0.0675",
"reward_std": "0.05545",
"kl": "0.5512",
"completion_length": "202.8",
"clipped_ratio": "0",
"learning_rate": "4.356e-05",
"grad_norm": "1.05",
"epoch": "0.218"
},
{
"episode": 110,
"loss": "0.02031",
"reward": "0.015",
"reward_std": "0",
"kl": "1.051",
"completion_length": "137.5",
"clipped_ratio": "0",
"learning_rate": "4.344e-05",
"grad_norm": "0.04941",
"epoch": "0.22"
},
{
"episode": 111,
"loss": "0.1065",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.289",
"completion_length": "118.5",
"clipped_ratio": "0",
"learning_rate": "4.333e-05",
"grad_norm": "1.255",
"epoch": "0.222"
},
{
"episode": 112,
"loss": "0.02114",
"reward": "0.015",
"reward_std": "0",
"kl": "1.096",
"completion_length": "133.5",
"clipped_ratio": "0",
"learning_rate": "4.322e-05",
"grad_norm": "0.06218",
"epoch": "0.224"
},
{
"episode": 113,
"loss": "0.02359",
"reward": "0.015",
"reward_std": "0",
"kl": "1.246",
"completion_length": "112",
"clipped_ratio": "0",
"learning_rate": "4.311e-05",
"grad_norm": "0.03646",
"epoch": "0.226"
},
{
"episode": 114,
"loss": "-0.02765",
"reward": "-0.0175",
"reward_std": "0.05545",
"kl": "1.039",
"completion_length": "101",
"clipped_ratio": "0",
"learning_rate": "4.3e-05",
"grad_norm": "1.376",
"epoch": "0.228"
},
{
"episode": 115,
"loss": "0.0184",
"reward": "0.015",
"reward_std": "0",
"kl": "0.9662",
"completion_length": "165.5",
"clipped_ratio": "0.25",
"learning_rate": "4.289e-05",
"grad_norm": "0.04314",
"epoch": "0.23"
},
{
"episode": 116,
"loss": "0.1954",
"reward": "-0.03875",
"reward_std": "0.06237",
"kl": "1.071",
"completion_length": "158",
"clipped_ratio": "0.25",
"learning_rate": "4.278e-05",
"grad_norm": "1.173",
"epoch": "0.232"
},
{
"episode": 117,
"loss": "0.02071",
"reward": "0.015",
"reward_std": "0",
"kl": "1.051",
"completion_length": "130",
"clipped_ratio": "0",
"learning_rate": "4.267e-05",
"grad_norm": "0.02952",
"epoch": "0.234"
},
{
"episode": 118,
"loss": "0.1281",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "1.111",
"completion_length": "128.5",
"clipped_ratio": "0",
"learning_rate": "4.256e-05",
"grad_norm": "1.226",
"epoch": "0.236"
},
{
"episode": 119,
"loss": "0.1146",
"reward": "-0.01",
"reward_std": "0.05",
"kl": "0.9954",
"completion_length": "124.2",
"clipped_ratio": "0",
"learning_rate": "4.244e-05",
"grad_norm": "1.035",
"epoch": "0.238"
},
{
"episode": 120,
"loss": "0.09495",
"reward": "-0.0425",
"reward_std": "0.0664",
"kl": "0.6759",
"completion_length": "192.2",
"clipped_ratio": "0.25",
"learning_rate": "4.233e-05",
"grad_norm": "0.9413",
"epoch": "0.24"
},
{
"episode": 121,
"loss": "0.01714",
"reward": "0.015",
"reward_std": "0",
"kl": "0.894",
"completion_length": "164.8",
"clipped_ratio": "0",
"learning_rate": "4.222e-05",
"grad_norm": "0.04506",
"epoch": "0.242"
},
{
"episode": 122,
"loss": "-0.1289",
"reward": "-0.01375",
"reward_std": "0.0575",
"kl": "1.226",
"completion_length": "102.2",
"clipped_ratio": "0",
"learning_rate": "4.211e-05",
"grad_norm": "1.349",
"epoch": "0.244"
},
{
"episode": 123,
"loss": "0.02344",
"reward": "0.015",
"reward_std": "0",
"kl": "1.195",
"completion_length": "115.2",
"clipped_ratio": "0",
"learning_rate": "4.2e-05",
"grad_norm": "0.0458",
"epoch": "0.246"
},
{
"episode": 124,
"loss": "0.02134",
"reward": "0.015",
"reward_std": "0",
"kl": "1.169",
"completion_length": "125.2",
"clipped_ratio": "0",
"learning_rate": "4.189e-05",
"grad_norm": "0.06143",
"epoch": "0.248"
},
{
"episode": 125,
"loss": "-0.1984",
"reward": "0.01125",
"reward_std": "0.0075",
"kl": "1.124",
"completion_length": "116.8",
"clipped_ratio": "0",
"learning_rate": "4.178e-05",
"grad_norm": "1.044",
"epoch": "0.25"
},
{
"episode": 126,
"loss": "0.0192",
"reward": "0",
"reward_std": "0",
"kl": "0.9959",
"completion_length": "133.5",
"clipped_ratio": "0",
"learning_rate": "4.167e-05",
"grad_norm": "0.04122",
"epoch": "0.252"
},
{
"episode": 127,
"loss": "0.01727",
"reward": "0",
"reward_std": "0",
"kl": "0.977",
"completion_length": "147.5",
"clipped_ratio": "0.25",
"learning_rate": "4.156e-05",
"grad_norm": "0.02834",
"epoch": "0.254"
},
{
"episode": 128,
"loss": "0.009876",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.032",
"completion_length": "156.8",
"clipped_ratio": "0",
"learning_rate": "4.144e-05",
"grad_norm": "0.9371",
"epoch": "0.256"
},
{
"episode": 129,
"loss": "-0.09492",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.074",
"completion_length": "148.5",
"clipped_ratio": "0.25",
"learning_rate": "4.133e-05",
"grad_norm": "0.845",
"epoch": "0.258"
},
{
"episode": 130,
"loss": "0.02401",
"reward": "0",
"reward_std": "0",
"kl": "1.203",
"completion_length": "104.5",
"clipped_ratio": "0",
"learning_rate": "4.122e-05",
"grad_norm": "0.05182",
"epoch": "0.26"
},
{
"episode": 131,
"loss": "-0.2198",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.9641",
"completion_length": "162",
"clipped_ratio": "0.25",
"learning_rate": "4.111e-05",
"grad_norm": "0.8911",
"epoch": "0.262"
},
{
"episode": 132,
"loss": "0.08979",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.071",
"completion_length": "107.2",
"clipped_ratio": "0",
"learning_rate": "4.1e-05",
"grad_norm": "1.38",
"epoch": "0.264"
},
{
"episode": 133,
"loss": "0.0148",
"reward": "0",
"reward_std": "0",
"kl": "0.8439",
"completion_length": "204",
"clipped_ratio": "0.5",
"learning_rate": "4.089e-05",
"grad_norm": "0.03386",
"epoch": "0.266"
},
{
"episode": 134,
"loss": "0.0148",
"reward": "0",
"reward_std": "0",
"kl": "0.8089",
"completion_length": "192",
"clipped_ratio": "0.5",
"learning_rate": "4.078e-05",
"grad_norm": "0.0373",
"epoch": "0.268"
},
{
"episode": 135,
"loss": "0.2167",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.8866",
"completion_length": "182.2",
"clipped_ratio": "0.5",
"learning_rate": "4.067e-05",
"grad_norm": "0.9069",
"epoch": "0.27"
},
{
"episode": 136,
"loss": "0.02339",
"reward": "0",
"reward_std": "0",
"kl": "1.197",
"completion_length": "107.5",
"clipped_ratio": "0",
"learning_rate": "4.056e-05",
"grad_norm": "0.06824",
"epoch": "0.272"
},
{
"episode": 137,
"loss": "-0.1594",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.195",
"completion_length": "150.2",
"clipped_ratio": "0.25",
"learning_rate": "4.044e-05",
"grad_norm": "0.8749",
"epoch": "0.274"
},
{
"episode": 138,
"loss": "0.021",
"reward": "0",
"reward_std": "0",
"kl": "1.15",
"completion_length": "121.8",
"clipped_ratio": "0",
"learning_rate": "4.033e-05",
"grad_norm": "0.0369",
"epoch": "0.276"
},
{
"episode": 139,
"loss": "0.0129",
"reward": "0",
"reward_std": "0",
"kl": "0.7527",
"completion_length": "185",
"clipped_ratio": "0.5",
"learning_rate": "4.022e-05",
"grad_norm": "0.02335",
"epoch": "0.278"
},
{
"episode": 140,
"loss": "0.0135",
"reward": "0",
"reward_std": "0",
"kl": "0.7518",
"completion_length": "191.5",
"clipped_ratio": "0.5",
"learning_rate": "4.011e-05",
"grad_norm": "0.03046",
"epoch": "0.28"
},
{
"episode": 141,
"loss": "0.01559",
"reward": "0",
"reward_std": "0",
"kl": "0.8364",
"completion_length": "197",
"clipped_ratio": "0.25",
"learning_rate": "4e-05",
"grad_norm": "0.1297",
"epoch": "0.282"
},
{
"episode": 142,
"loss": "0.02244",
"reward": "0",
"reward_std": "0",
"kl": "1.18",
"completion_length": "119.5",
"clipped_ratio": "0",
"learning_rate": "3.989e-05",
"grad_norm": "0.04509",
"epoch": "0.284"
},
{
"episode": 143,
"loss": "-0.06772",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.04",
"completion_length": "113",
"clipped_ratio": "0",
"learning_rate": "3.978e-05",
"grad_norm": "1.059",
"epoch": "0.286"
},
{
"episode": 144,
"loss": "-0.1361",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.8591",
"completion_length": "164",
"clipped_ratio": "0",
"learning_rate": "3.967e-05",
"grad_norm": "0.7481",
"epoch": "0.288"
},
{
"episode": 145,
"loss": "0.009652",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.7233",
"completion_length": "170.8",
"clipped_ratio": "0",
"learning_rate": "3.956e-05",
"grad_norm": "0.8965",
"epoch": "0.29"
},
{
"episode": 146,
"loss": "0.01383",
"reward": "0",
"reward_std": "0",
"kl": "0.8261",
"completion_length": "172",
"clipped_ratio": "0.25",
"learning_rate": "3.944e-05",
"grad_norm": "0.01843",
"epoch": "0.292"
},
{
"episode": 147,
"loss": "0.1679",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.7532",
"completion_length": "195.5",
"clipped_ratio": "0.5",
"learning_rate": "3.933e-05",
"grad_norm": "0.8574",
"epoch": "0.294"
},
{
"episode": 148,
"loss": "0.01479",
"reward": "0",
"reward_std": "0",
"kl": "0.8126",
"completion_length": "161.5",
"clipped_ratio": "0.25",
"learning_rate": "3.922e-05",
"grad_norm": "0.04673",
"epoch": "0.296"
},
{
"episode": 149,
"loss": "0.09016",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6905",
"completion_length": "222",
"clipped_ratio": "0.25",
"learning_rate": "3.911e-05",
"grad_norm": "0.9023",
"epoch": "0.298"
},
{
"episode": 150,
"loss": "0.01703",
"reward": "0",
"reward_std": "0",
"kl": "0.9712",
"completion_length": "154.8",
"clipped_ratio": "0.25",
"learning_rate": "3.9e-05",
"grad_norm": "0.04395",
"epoch": "0.3"
},
{
"episode": 151,
"loss": "0.01369",
"reward": "0",
"reward_std": "0",
"kl": "0.8077",
"completion_length": "179.5",
"clipped_ratio": "0.5",
"learning_rate": "3.889e-05",
"grad_norm": "0.02968",
"epoch": "0.302"
},
{
"episode": 152,
"loss": "0.01495",
"reward": "0",
"reward_std": "0",
"kl": "0.7448",
"completion_length": "236.2",
"clipped_ratio": "0.5",
"learning_rate": "3.878e-05",
"grad_norm": "0.2067",
"epoch": "0.304"
},
{
"episode": 153,
"loss": "0.01446",
"reward": "0",
"reward_std": "0",
"kl": "0.8869",
"completion_length": "174.5",
"clipped_ratio": "0.5",
"learning_rate": "3.867e-05",
"grad_norm": "0.02209",
"epoch": "0.306"
},
{
"episode": 154,
"loss": "0.01308",
"reward": "0",
"reward_std": "0",
"kl": "0.7685",
"completion_length": "191",
"clipped_ratio": "0.25",
"learning_rate": "3.856e-05",
"grad_norm": "0.02081",
"epoch": "0.308"
},
{
"episode": 155,
"loss": "0.09928",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.7042",
"completion_length": "218.2",
"clipped_ratio": "0.75",
"learning_rate": "3.844e-05",
"grad_norm": "0.8511",
"epoch": "0.31"
},
{
"episode": 156,
"loss": "0.1472",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.8815",
"completion_length": "202",
"clipped_ratio": "0.5",
"learning_rate": "3.833e-05",
"grad_norm": "1.008",
"epoch": "0.312"
},
{
"episode": 157,
"loss": "0.01473",
"reward": "0",
"reward_std": "0",
"kl": "0.7722",
"completion_length": "184.5",
"clipped_ratio": "0.25",
"learning_rate": "3.822e-05",
"grad_norm": "0.1047",
"epoch": "0.314"
},
{
"episode": 158,
"loss": "0.01633",
"reward": "0",
"reward_std": "0",
"kl": "0.8847",
"completion_length": "166.5",
"clipped_ratio": "0.25",
"learning_rate": "3.811e-05",
"grad_norm": "0.06288",
"epoch": "0.316"
},
{
"episode": 159,
"loss": "0.01355",
"reward": "0",
"reward_std": "0",
"kl": "0.7771",
"completion_length": "177.2",
"clipped_ratio": "0.25",
"learning_rate": "3.8e-05",
"grad_norm": "0.05157",
"epoch": "0.318"
},
{
"episode": 160,
"loss": "0.06912",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.592",
"completion_length": "229.5",
"clipped_ratio": "0.5",
"learning_rate": "3.789e-05",
"grad_norm": "0.7783",
"epoch": "0.32"
},
{
"episode": 161,
"loss": "0.01657",
"reward": "0",
"reward_std": "0",
"kl": "1.046",
"completion_length": "135.5",
"clipped_ratio": "0.25",
"learning_rate": "3.778e-05",
"grad_norm": "0.02938",
"epoch": "0.322"
},
{
"episode": 162,
"loss": "0.01172",
"reward": "0",
"reward_std": "0",
"kl": "0.6083",
"completion_length": "232.5",
"clipped_ratio": "0.75",
"learning_rate": "3.767e-05",
"grad_norm": "0.02841",
"epoch": "0.324"
},
{
"episode": 163,
"loss": "0.1041",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.9652",
"completion_length": "218.5",
"clipped_ratio": "0.75",
"learning_rate": "3.756e-05",
"grad_norm": "0.9357",
"epoch": "0.326"
},
{
"episode": 164,
"loss": "0.02038",
"reward": "0",
"reward_std": "0",
"kl": "1.034",
"completion_length": "114.8",
"clipped_ratio": "0",
"learning_rate": "3.744e-05",
"grad_norm": "0.03502",
"epoch": "0.328"
},
{
"episode": 165,
"loss": "-0.2373",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6106",
"completion_length": "219.5",
"clipped_ratio": "0.75",
"learning_rate": "3.733e-05",
"grad_norm": "0.6781",
"epoch": "0.33"
},
{
"episode": 166,
"loss": "-0.1384",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "1.235",
"completion_length": "123.5",
"clipped_ratio": "0",
"learning_rate": "3.722e-05",
"grad_norm": "0.8199",
"epoch": "0.332"
},
{
"episode": 167,
"loss": "0.1289",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6907",
"completion_length": "207.8",
"clipped_ratio": "0.5",
"learning_rate": "3.711e-05",
"grad_norm": "0.8933",
"epoch": "0.334"
},
{
"episode": 168,
"loss": "0.05713",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.5286",
"completion_length": "234",
"clipped_ratio": "0.75",
"learning_rate": "3.7e-05",
"grad_norm": "0.6729",
"epoch": "0.336"
},
{
"episode": 169,
"loss": "0.01499",
"reward": "0",
"reward_std": "0",
"kl": "0.8495",
"completion_length": "174.2",
"clipped_ratio": "0.25",
"learning_rate": "3.689e-05",
"grad_norm": "0.1389",
"epoch": "0.338"
},
{
"episode": 170,
"loss": "0.01559",
"reward": "0",
"reward_std": "0",
"kl": "0.8565",
"completion_length": "168.5",
"clipped_ratio": "0.25",
"learning_rate": "3.678e-05",
"grad_norm": "0.04733",
"epoch": "0.34"
},
{
"episode": 171,
"loss": "-0.09501",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.8351",
"completion_length": "168",
"clipped_ratio": "0.25",
"learning_rate": "3.667e-05",
"grad_norm": "0.84",
"epoch": "0.342"
},
{
"episode": 172,
"loss": "-0.2282",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.862",
"completion_length": "177",
"clipped_ratio": "0.5",
"learning_rate": "3.656e-05",
"grad_norm": "0.6844",
"epoch": "0.344"
},
{
"episode": 173,
"loss": "0.01553",
"reward": "0",
"reward_std": "0",
"kl": "0.8731",
"completion_length": "185.5",
"clipped_ratio": "0.25",
"learning_rate": "3.644e-05",
"grad_norm": "0.2459",
"epoch": "0.346"
},
{
"episode": 174,
"loss": "0.0121",
"reward": "0",
"reward_std": "0",
"kl": "0.68",
"completion_length": "206.8",
"clipped_ratio": "0.5",
"learning_rate": "3.633e-05",
"grad_norm": "0.02169",
"epoch": "0.348"
},
{
"episode": 175,
"loss": "0.01206",
"reward": "0",
"reward_std": "0",
"kl": "0.6513",
"completion_length": "199",
"clipped_ratio": "0.5",
"learning_rate": "3.622e-05",
"grad_norm": "0.04694",
"epoch": "0.35"
},
{
"episode": 176,
"loss": "0.2827",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.7719",
"completion_length": "170.5",
"clipped_ratio": "0.25",
"learning_rate": "3.611e-05",
"grad_norm": "0.7261",
"epoch": "0.352"
},
{
"episode": 177,
"loss": "0.1534",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.7106",
"completion_length": "200",
"clipped_ratio": "0.25",
"learning_rate": "3.6e-05",
"grad_norm": "0.8582",
"epoch": "0.354"
},
{
"episode": 178,
"loss": "0.01187",
"reward": "0",
"reward_std": "0",
"kl": "0.5987",
"completion_length": "222.5",
"clipped_ratio": "0.25",
"learning_rate": "3.589e-05",
"grad_norm": "0.02377",
"epoch": "0.356"
},
{
"episode": 179,
"loss": "0.01027",
"reward": "0",
"reward_std": "0",
"kl": "0.5137",
"completion_length": "256",
"clipped_ratio": "1",
"learning_rate": "3.578e-05",
"grad_norm": "0.03761",
"epoch": "0.358"
},
{
"episode": 180,
"loss": "0.009968",
"reward": "0",
"reward_std": "0",
"kl": "0.5013",
"completion_length": "246",
"clipped_ratio": "0.5",
"learning_rate": "3.567e-05",
"grad_norm": "0.03003",
"epoch": "0.36"
},
{
"episode": 181,
"loss": "0.0136",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6799",
"completion_length": "256",
"clipped_ratio": "1",
"learning_rate": "3.556e-05",
"grad_norm": "0.6516",
"epoch": "0.362"
},
{
"episode": 182,
"loss": "0.0167",
"reward": "0",
"reward_std": "0",
"kl": "0.8716",
"completion_length": "147",
"clipped_ratio": "0",
"learning_rate": "3.544e-05",
"grad_norm": "0.07296",
"epoch": "0.364"
},
{
"episode": 183,
"loss": "0.0114",
"reward": "0",
"reward_std": "0",
"kl": "0.6002",
"completion_length": "206",
"clipped_ratio": "0.25",
"learning_rate": "3.533e-05",
"grad_norm": "0.03717",
"epoch": "0.366"
},
{
"episode": 184,
"loss": "0.07569",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.4309",
"completion_length": "237.5",
"clipped_ratio": "0.75",
"learning_rate": "3.522e-05",
"grad_norm": "0.6907",
"epoch": "0.368"
},
{
"episode": 185,
"loss": "0.01558",
"reward": "0",
"reward_std": "0",
"kl": "0.8331",
"completion_length": "182.2",
"clipped_ratio": "0.25",
"learning_rate": "3.511e-05",
"grad_norm": "0.1109",
"epoch": "0.37"
},
{
"episode": 186,
"loss": "0.08199",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6914",
"completion_length": "225",
"clipped_ratio": "0.75",
"learning_rate": "3.5e-05",
"grad_norm": "0.7589",
"epoch": "0.372"
},
{
"episode": 187,
"loss": "0.01244",
"reward": "0",
"reward_std": "0",
"kl": "0.6683",
"completion_length": "198.5",
"clipped_ratio": "0.5",
"learning_rate": "3.489e-05",
"grad_norm": "0.02421",
"epoch": "0.374"
},
{
"episode": 188,
"loss": "0.009995",
"reward": "0",
"reward_std": "0",
"kl": "0.5007",
"completion_length": "243",
"clipped_ratio": "0.75",
"learning_rate": "3.478e-05",
"grad_norm": "0.0273",
"epoch": "0.376"
},
{
"episode": 189,
"loss": "0.07081",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.5754",
"completion_length": "228.5",
"clipped_ratio": "0.75",
"learning_rate": "3.467e-05",
"grad_norm": "0.5827",
"epoch": "0.378"
},
{
"episode": 190,
"loss": "-0.2955",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.5758",
"completion_length": "189",
"clipped_ratio": "0.5",
"learning_rate": "3.456e-05",
"grad_norm": "0.9176",
"epoch": "0.38"
},
{
"episode": 191,
"loss": "0.01553",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.7765",
"completion_length": "256",
"clipped_ratio": "1",
"learning_rate": "3.444e-05",
"grad_norm": "0.8604",
"epoch": "0.382"
},
{
"episode": 192,
"loss": "0.01256",
"reward": "0",
"reward_std": "0",
"kl": "0.6766",
"completion_length": "182.2",
"clipped_ratio": "0.25",
"learning_rate": "3.433e-05",
"grad_norm": "0.01865",
"epoch": "0.384"
},
{
"episode": 193,
"loss": "-0.06049",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.5448",
"completion_length": "236.5",
"clipped_ratio": "0.75",
"learning_rate": "3.422e-05",
"grad_norm": "0.6642",
"epoch": "0.386"
},
{
"episode": 194,
"loss": "0.01536",
"reward": "0",
"reward_std": "0",
"kl": "0.8527",
"completion_length": "160.8",
"clipped_ratio": "0.25",
"learning_rate": "3.411e-05",
"grad_norm": "0.03851",
"epoch": "0.388"
},
{
"episode": 195,
"loss": "0.03194",
"reward": "0",
"reward_std": "0",
"kl": "1.676",
"completion_length": "193",
"clipped_ratio": "0.25",
"learning_rate": "3.4e-05",
"grad_norm": "2.288",
"epoch": "0.39"
},
{
"episode": 196,
"loss": "-0.03057",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.5017",
"completion_length": "249.2",
"clipped_ratio": "0.75",
"learning_rate": "3.389e-05",
"grad_norm": "0.6679",
"epoch": "0.392"
},
{
"episode": 197,
"loss": "0.01438",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.6339",
"completion_length": "255.5",
"clipped_ratio": "0.75",
"learning_rate": "3.378e-05",
"grad_norm": "0.6842",
"epoch": "0.394"
},
{
"episode": 198,
"loss": "0.01817",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.5629",
"completion_length": "252.5",
"clipped_ratio": "0.75",
"learning_rate": "3.367e-05",
"grad_norm": "0.699",
"epoch": "0.396"
},
{
"episode": 199,
"loss": "0.05561",
"reward": "-0.05",
"reward_std": "0.05774",
"kl": "0.5969",
"completion_length": "235.5",
"clipped_ratio": "0.5",
"learning_rate": "3.356e-05",
"grad_norm": "0.662",
"epoch": "0.398"
},
{
"episode": 200,
"loss": "0.01062",
"reward": "0",
"reward_std": "0",
"kl": "0.5544",
"completion_length": "223",
"clipped_ratio": "0.5",
"learning_rate": "3.344e-05",
"grad_norm": "0.03785",
"epoch": "0.4"
},
{
"episode": 201,
"loss": "-0.09729",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.4514",
"completion_length": "239",
"clipped_ratio": "0.75",
"learning_rate": "3.333e-05",
"grad_norm": "0.6039",
"epoch": "0.402"
},
{
"episode": 202,
"loss": "0.01084",
"reward": "0",
"reward_std": "0",
"kl": "0.5435",
"completion_length": "249.8",
"clipped_ratio": "0.75",
"learning_rate": "3.322e-05",
"grad_norm": "0.05489",
"epoch": "0.404"
},
{
"episode": 203,
"loss": "0.01082",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.5408",
"completion_length": "256",
"clipped_ratio": "1",
"learning_rate": "3.311e-05",
"grad_norm": "0.5738",
"epoch": "0.406"
},
{
"episode": 204,
"loss": "0.01224",
"reward": "-0.025",
"reward_std": "0.05",
"kl": "0.6122",
"completion_length": "256",
"clipped_ratio": "1",
"learning_rate": "3.3e-05",
"grad_norm": "0.6763",
"epoch": "0.408"
}
]
}