Text Generation
PEFT
Safetensors
clinical-trial
reinforcement-learning
REINFORCE
lora
qwen3
openenv
hackathon
theme-2
conversational
Instructions to use pratimassaravanan/clinical-qwen3-4b-sft-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use pratimassaravanan/clinical-qwen3-4b-sft-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen3-4B-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "pratimassaravanan/clinical-qwen3-4b-sft-lora") - Notebooks
- Google Colab
- Kaggle
Download training_evidence/debug_trial_results.json from pratimassaravanan/clinical-qwen3-4b-sft-lora: direct link, hf CLI and curl.
- Browser
- Download file 1.19 kB
-
https://huggingface.co/pratimassaravanan/clinical-qwen3-4b-sft-lora/resolve/main/training_evidence/debug_trial_results.json
- Command line
-
hf download hf://pratimassaravanan/clinical-qwen3-4b-sft-lora/training_evidence/debug_trial_results.json
-
curl -L -o debug_trial_results.json https://huggingface.co/pratimassaravanan/clinical-qwen3-4b-sft-lora/resolve/main/training_evidence/debug_trial_results.json
1.19 kB
| { | |
| "method": "DEBUG TRIAL \u2014 REINFORCE v3 (fresh LoRA, heuristic override)", | |
| "base_model": "Qwen/Qwen3-4B", | |
| "config": { | |
| "episodes": 3, | |
| "max_steps": 15, | |
| "lr": 5e-05, | |
| "temperature": 1.0 | |
| }, | |
| "gpu": "NVIDIA L40S", | |
| "vram_gb": 47.7, | |
| "episodes": [ | |
| { | |
| "episode": 0, | |
| "task": "easy_bench", | |
| "total_reward": 6.6147, | |
| "enrolled": 5, | |
| "target": 80, | |
| "steps": 15, | |
| "unique_action_types": 2, | |
| "positive_rl_steps": 15, | |
| "action_dist": { | |
| "screen_patient": 6, | |
| "allocate_to_site": 9 | |
| } | |
| }, | |
| { | |
| "episode": 1, | |
| "task": "easy_bench", | |
| "total_reward": 6.6147, | |
| "enrolled": 5, | |
| "target": 80, | |
| "steps": 15, | |
| "unique_action_types": 2, | |
| "positive_rl_steps": 15, | |
| "action_dist": { | |
| "screen_patient": 6, | |
| "allocate_to_site": 9 | |
| } | |
| }, | |
| { | |
| "episode": 2, | |
| "task": "easy_bench", | |
| "total_reward": 7.4131, | |
| "enrolled": 1, | |
| "target": 80, | |
| "steps": 15, | |
| "unique_action_types": 2, | |
| "positive_rl_steps": 15, | |
| "action_dist": { | |
| "screen_patient": 14, | |
| "allocate_to_site": 1 | |
| } | |
| } | |
| ] | |
| } |