Instructions to use socius/Smoltaur-0.4B-LoRA-r64 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use socius/Smoltaur-0.4B-LoRA-r64 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/SmolLM2-360M") model = PeftModel.from_pretrained(base_model, "socius/Smoltaur-0.4B-LoRA-r64") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use socius/Smoltaur-0.4B-LoRA-r64 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for socius/Smoltaur-0.4B-LoRA-r64 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for socius/Smoltaur-0.4B-LoRA-r64 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for socius/Smoltaur-0.4B-LoRA-r64 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="socius/Smoltaur-0.4B-LoRA-r64", max_seq_length=2048, )
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.5325168075617387, | |
| "eval_steps": 500, | |
| "global_step": 1000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.005325168075617386, | |
| "grad_norm": 1.179490566253662, | |
| "learning_rate": 4.787234042553191e-06, | |
| "loss": 0.7552515983581543, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.010650336151234773, | |
| "grad_norm": 0.7021263837814331, | |
| "learning_rate": 1.0106382978723404e-05, | |
| "loss": 0.7758663654327392, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.01597550422685216, | |
| "grad_norm": 0.6242384314537048, | |
| "learning_rate": 1.5425531914893617e-05, | |
| "loss": 0.620504903793335, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.021300672302469546, | |
| "grad_norm": 0.4310513138771057, | |
| "learning_rate": 2.074468085106383e-05, | |
| "loss": 0.6261196613311768, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.026625840378086935, | |
| "grad_norm": 0.5022103786468506, | |
| "learning_rate": 2.6063829787234046e-05, | |
| "loss": 0.6593732833862305, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.03195100845370432, | |
| "grad_norm": 0.6999115943908691, | |
| "learning_rate": 3.1382978723404254e-05, | |
| "loss": 0.687755012512207, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.037276176529321706, | |
| "grad_norm": 0.4458341598510742, | |
| "learning_rate": 3.670212765957447e-05, | |
| "loss": 0.6062395572662354, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.04260134460493909, | |
| "grad_norm": 0.5636934638023376, | |
| "learning_rate": 4.2021276595744684e-05, | |
| "loss": 0.6789586544036865, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.04792651268055648, | |
| "grad_norm": 0.47693607211112976, | |
| "learning_rate": 4.734042553191489e-05, | |
| "loss": 0.5777320384979248, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.05325168075617387, | |
| "grad_norm": 0.5000275373458862, | |
| "learning_rate": 4.985986547085202e-05, | |
| "loss": 0.5979567527770996, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.058576848831791255, | |
| "grad_norm": 0.7978994250297546, | |
| "learning_rate": 4.9579596412556055e-05, | |
| "loss": 0.5918041229248047, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.06390201690740864, | |
| "grad_norm": 0.6180557012557983, | |
| "learning_rate": 4.9299327354260097e-05, | |
| "loss": 0.6245941162109375, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.06922718498302603, | |
| "grad_norm": 0.8771600723266602, | |
| "learning_rate": 4.9019058295964125e-05, | |
| "loss": 0.5516412258148193, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.07455235305864341, | |
| "grad_norm": 0.570806622505188, | |
| "learning_rate": 4.8738789237668166e-05, | |
| "loss": 0.6044556140899658, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.0798775211342608, | |
| "grad_norm": 0.5548396110534668, | |
| "learning_rate": 4.84585201793722e-05, | |
| "loss": 0.5861228466033935, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.08520268920987818, | |
| "grad_norm": 0.3578498661518097, | |
| "learning_rate": 4.8178251121076236e-05, | |
| "loss": 0.5874335289001464, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.09052785728549557, | |
| "grad_norm": 0.6209887266159058, | |
| "learning_rate": 4.789798206278027e-05, | |
| "loss": 0.5836649894714355, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.09585302536111295, | |
| "grad_norm": 0.5073224902153015, | |
| "learning_rate": 4.7617713004484306e-05, | |
| "loss": 0.5651541233062745, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.10117819343673035, | |
| "grad_norm": 0.5013888478279114, | |
| "learning_rate": 4.733744394618834e-05, | |
| "loss": 0.5798611164093017, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.10650336151234774, | |
| "grad_norm": 0.2958514094352722, | |
| "learning_rate": 4.705717488789238e-05, | |
| "loss": 0.5263164520263672, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.11182852958796512, | |
| "grad_norm": 0.5098234415054321, | |
| "learning_rate": 4.677690582959641e-05, | |
| "loss": 0.6066572189331054, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.11715369766358251, | |
| "grad_norm": 0.68392413854599, | |
| "learning_rate": 4.649663677130045e-05, | |
| "loss": 0.501525592803955, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.12247886573919989, | |
| "grad_norm": 0.5342642068862915, | |
| "learning_rate": 4.621636771300449e-05, | |
| "loss": 0.5538065910339356, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.12780403381481728, | |
| "grad_norm": 0.46322742104530334, | |
| "learning_rate": 4.593609865470852e-05, | |
| "loss": 0.6028264999389649, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.13312920189043467, | |
| "grad_norm": 0.5507689714431763, | |
| "learning_rate": 4.565582959641256e-05, | |
| "loss": 0.524617338180542, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.13845436996605207, | |
| "grad_norm": 0.5451244711875916, | |
| "learning_rate": 4.537556053811659e-05, | |
| "loss": 0.5184399604797363, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.14377953804166943, | |
| "grad_norm": 0.4679802656173706, | |
| "learning_rate": 4.509529147982063e-05, | |
| "loss": 0.5906213760375977, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.14910470611728682, | |
| "grad_norm": 0.4486578702926636, | |
| "learning_rate": 4.481502242152467e-05, | |
| "loss": 0.5088740348815918, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.15442987419290422, | |
| "grad_norm": 0.3085339665412903, | |
| "learning_rate": 4.4534753363228704e-05, | |
| "loss": 0.5231688499450684, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.1597550422685216, | |
| "grad_norm": 0.8423092365264893, | |
| "learning_rate": 4.425448430493274e-05, | |
| "loss": 0.5785892963409424, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.165080210344139, | |
| "grad_norm": 0.8173497319221497, | |
| "learning_rate": 4.3974215246636774e-05, | |
| "loss": 0.5546716690063477, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.17040537841975636, | |
| "grad_norm": 0.4842700958251953, | |
| "learning_rate": 4.369394618834081e-05, | |
| "loss": 0.5258895874023437, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.17573054649537376, | |
| "grad_norm": 0.645687460899353, | |
| "learning_rate": 4.3413677130044844e-05, | |
| "loss": 0.5903552532196045, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.18105571457099115, | |
| "grad_norm": 0.5248221755027771, | |
| "learning_rate": 4.313340807174888e-05, | |
| "loss": 0.5313117027282714, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.18638088264660854, | |
| "grad_norm": 0.4039202928543091, | |
| "learning_rate": 4.2853139013452914e-05, | |
| "loss": 0.5434175491333008, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.1917060507222259, | |
| "grad_norm": 0.6575778126716614, | |
| "learning_rate": 4.257286995515695e-05, | |
| "loss": 0.5336236476898193, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.1970312187978433, | |
| "grad_norm": 0.6030762791633606, | |
| "learning_rate": 4.229260089686099e-05, | |
| "loss": 0.5873087406158447, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.2023563868734607, | |
| "grad_norm": 0.36645743250846863, | |
| "learning_rate": 4.201233183856502e-05, | |
| "loss": 0.44643635749816896, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.20768155494907808, | |
| "grad_norm": 0.38583752512931824, | |
| "learning_rate": 4.173206278026906e-05, | |
| "loss": 0.48238911628723147, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.21300672302469548, | |
| "grad_norm": 0.3569328486919403, | |
| "learning_rate": 4.1451793721973096e-05, | |
| "loss": 0.5249658107757569, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.21833189110031284, | |
| "grad_norm": 0.5705183744430542, | |
| "learning_rate": 4.117152466367713e-05, | |
| "loss": 0.5840038299560547, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.22365705917593023, | |
| "grad_norm": 0.5844929218292236, | |
| "learning_rate": 4.0891255605381166e-05, | |
| "loss": 0.49370269775390624, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.22898222725154763, | |
| "grad_norm": 0.4003148376941681, | |
| "learning_rate": 4.061098654708521e-05, | |
| "loss": 0.5035266876220703, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.23430739532716502, | |
| "grad_norm": 0.4637913405895233, | |
| "learning_rate": 4.0330717488789236e-05, | |
| "loss": 0.4923057556152344, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.2396325634027824, | |
| "grad_norm": 0.41266828775405884, | |
| "learning_rate": 4.005044843049328e-05, | |
| "loss": 0.48969035148620604, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.24495773147839978, | |
| "grad_norm": 0.6229465007781982, | |
| "learning_rate": 3.977017937219731e-05, | |
| "loss": 0.5537493228912354, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.25028289955401717, | |
| "grad_norm": 0.3518058657646179, | |
| "learning_rate": 3.948991031390135e-05, | |
| "loss": 0.5104994297027587, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.25560806762963456, | |
| "grad_norm": 0.3331281840801239, | |
| "learning_rate": 3.920964125560538e-05, | |
| "loss": 0.48421249389648435, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.26093323570525195, | |
| "grad_norm": 0.6162995100021362, | |
| "learning_rate": 3.8929372197309424e-05, | |
| "loss": 0.5097816944122314, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.26625840378086935, | |
| "grad_norm": 0.7575991153717041, | |
| "learning_rate": 3.864910313901345e-05, | |
| "loss": 0.538728666305542, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.27158357185648674, | |
| "grad_norm": 0.6776933073997498, | |
| "learning_rate": 3.8368834080717494e-05, | |
| "loss": 0.48033552169799804, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.27690873993210413, | |
| "grad_norm": 0.46453195810317993, | |
| "learning_rate": 3.808856502242152e-05, | |
| "loss": 0.502266263961792, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.28223390800772147, | |
| "grad_norm": 0.6419550776481628, | |
| "learning_rate": 3.7808295964125564e-05, | |
| "loss": 0.6008513450622559, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.28755907608333886, | |
| "grad_norm": 0.5964445471763611, | |
| "learning_rate": 3.75280269058296e-05, | |
| "loss": 0.5803821086883545, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.29288424415895625, | |
| "grad_norm": 0.5661990642547607, | |
| "learning_rate": 3.7247757847533634e-05, | |
| "loss": 0.534914493560791, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.29820941223457365, | |
| "grad_norm": 0.5758841037750244, | |
| "learning_rate": 3.696748878923767e-05, | |
| "loss": 0.5404681205749512, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.30353458031019104, | |
| "grad_norm": 0.38775309920310974, | |
| "learning_rate": 3.668721973094171e-05, | |
| "loss": 0.4564009666442871, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.30885974838580843, | |
| "grad_norm": 0.48926347494125366, | |
| "learning_rate": 3.640695067264574e-05, | |
| "loss": 0.5140261650085449, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.3141849164614258, | |
| "grad_norm": 0.512454092502594, | |
| "learning_rate": 3.612668161434978e-05, | |
| "loss": 0.5441798686981201, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.3195100845370432, | |
| "grad_norm": 0.6558932065963745, | |
| "learning_rate": 3.5846412556053815e-05, | |
| "loss": 0.5184391021728516, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3248352526126606, | |
| "grad_norm": 0.5081777572631836, | |
| "learning_rate": 3.556614349775785e-05, | |
| "loss": 0.4453147888183594, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.330160420688278, | |
| "grad_norm": 0.4490305483341217, | |
| "learning_rate": 3.5285874439461885e-05, | |
| "loss": 0.48638916015625, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.33548558876389534, | |
| "grad_norm": 0.6985098123550415, | |
| "learning_rate": 3.500560538116593e-05, | |
| "loss": 0.5312550067901611, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.34081075683951273, | |
| "grad_norm": 0.6176907420158386, | |
| "learning_rate": 3.4725336322869955e-05, | |
| "loss": 0.4945085525512695, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.3461359249151301, | |
| "grad_norm": 0.5329240560531616, | |
| "learning_rate": 3.4445067264574e-05, | |
| "loss": 0.5552109241485595, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.3514610929907475, | |
| "grad_norm": 0.5098716020584106, | |
| "learning_rate": 3.4164798206278025e-05, | |
| "loss": 0.534635353088379, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.3567862610663649, | |
| "grad_norm": 0.5351388454437256, | |
| "learning_rate": 3.388452914798207e-05, | |
| "loss": 0.5524871349334717, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.3621114291419823, | |
| "grad_norm": 0.2978927195072174, | |
| "learning_rate": 3.36042600896861e-05, | |
| "loss": 0.4628488063812256, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.3674365972175997, | |
| "grad_norm": 0.29183733463287354, | |
| "learning_rate": 3.3323991031390137e-05, | |
| "loss": 0.49717202186584475, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.3727617652932171, | |
| "grad_norm": 0.35929256677627563, | |
| "learning_rate": 3.304372197309417e-05, | |
| "loss": 0.5281675338745118, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.3780869333688345, | |
| "grad_norm": 0.45750725269317627, | |
| "learning_rate": 3.2763452914798206e-05, | |
| "loss": 0.4717850208282471, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.3834121014444518, | |
| "grad_norm": 0.3303137719631195, | |
| "learning_rate": 3.248318385650224e-05, | |
| "loss": 0.4823610782623291, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.3887372695200692, | |
| "grad_norm": 0.3863198161125183, | |
| "learning_rate": 3.2202914798206276e-05, | |
| "loss": 0.44127840995788575, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.3940624375956866, | |
| "grad_norm": 0.4643816351890564, | |
| "learning_rate": 3.192264573991032e-05, | |
| "loss": 0.5454273700714112, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.399387605671304, | |
| "grad_norm": 0.49157482385635376, | |
| "learning_rate": 3.1642376681614346e-05, | |
| "loss": 0.5360610008239746, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.4047127737469214, | |
| "grad_norm": 0.4481538236141205, | |
| "learning_rate": 3.136210762331839e-05, | |
| "loss": 0.5228201389312744, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.4100379418225388, | |
| "grad_norm": 0.3987141251564026, | |
| "learning_rate": 3.108183856502242e-05, | |
| "loss": 0.5480076313018799, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.41536310989815617, | |
| "grad_norm": 0.3665584921836853, | |
| "learning_rate": 3.080156950672646e-05, | |
| "loss": 0.5201095104217529, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.42068827797377356, | |
| "grad_norm": 0.803251326084137, | |
| "learning_rate": 3.052130044843049e-05, | |
| "loss": 0.5136742115020752, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.42601344604939095, | |
| "grad_norm": 0.35160404443740845, | |
| "learning_rate": 3.0241031390134535e-05, | |
| "loss": 0.4411343574523926, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.43133861412500835, | |
| "grad_norm": 0.29174962639808655, | |
| "learning_rate": 2.9960762331838566e-05, | |
| "loss": 0.44309115409851074, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.4366637822006257, | |
| "grad_norm": 0.5460541844367981, | |
| "learning_rate": 2.9680493273542605e-05, | |
| "loss": 0.435715389251709, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.4419889502762431, | |
| "grad_norm": 0.5169834494590759, | |
| "learning_rate": 2.9400224215246636e-05, | |
| "loss": 0.4440354347229004, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.44731411835186047, | |
| "grad_norm": 0.6184332370758057, | |
| "learning_rate": 2.9119955156950674e-05, | |
| "loss": 0.5376930713653565, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.45263928642747786, | |
| "grad_norm": 0.6049388647079468, | |
| "learning_rate": 2.8839686098654713e-05, | |
| "loss": 0.5526479244232178, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.45796445450309525, | |
| "grad_norm": 0.5835752487182617, | |
| "learning_rate": 2.8559417040358744e-05, | |
| "loss": 0.4482475757598877, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.46328962257871265, | |
| "grad_norm": 0.6599181890487671, | |
| "learning_rate": 2.8279147982062783e-05, | |
| "loss": 0.4716318607330322, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.46861479065433004, | |
| "grad_norm": 1.169771432876587, | |
| "learning_rate": 2.7998878923766818e-05, | |
| "loss": 0.484691858291626, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.47393995872994743, | |
| "grad_norm": 0.7327702045440674, | |
| "learning_rate": 2.7718609865470853e-05, | |
| "loss": 0.49949216842651367, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.4792651268055648, | |
| "grad_norm": 0.355288565158844, | |
| "learning_rate": 2.743834080717489e-05, | |
| "loss": 0.47687301635742185, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.48459029488118216, | |
| "grad_norm": 0.4060805141925812, | |
| "learning_rate": 2.7158071748878926e-05, | |
| "loss": 0.49724478721618653, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.48991546295679955, | |
| "grad_norm": 0.3232281506061554, | |
| "learning_rate": 2.687780269058296e-05, | |
| "loss": 0.4345158576965332, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.49524063103241694, | |
| "grad_norm": 0.2930939495563507, | |
| "learning_rate": 2.6597533632286996e-05, | |
| "loss": 0.5002622604370117, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.5005657991080343, | |
| "grad_norm": 0.27968496084213257, | |
| "learning_rate": 2.6317264573991034e-05, | |
| "loss": 0.41611757278442385, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.5058909671836518, | |
| "grad_norm": 0.36835038661956787, | |
| "learning_rate": 2.6036995515695066e-05, | |
| "loss": 0.4969151973724365, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.5112161352592691, | |
| "grad_norm": 0.2818012535572052, | |
| "learning_rate": 2.5756726457399104e-05, | |
| "loss": 0.4511505126953125, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.5165413033348865, | |
| "grad_norm": 0.405793160200119, | |
| "learning_rate": 2.5476457399103142e-05, | |
| "loss": 0.4167983055114746, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.5218664714105039, | |
| "grad_norm": 0.3238755762577057, | |
| "learning_rate": 2.5196188340807174e-05, | |
| "loss": 0.43145551681518557, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.5271916394861212, | |
| "grad_norm": 0.38960742950439453, | |
| "learning_rate": 2.4915919282511212e-05, | |
| "loss": 0.435044527053833, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.5325168075617387, | |
| "grad_norm": 1.2799712419509888, | |
| "learning_rate": 2.4635650224215247e-05, | |
| "loss": 0.5337179183959961, | |
| "step": 1000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1878, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.185382709003059e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |