"""Production-ready standalone Maris human training Space.""" from __future__ import annotations import hashlib import html import json import logging import os import secrets import subprocess import sys import tempfile from datetime import UTC, datetime from pathlib import Path from threading import Lock from typing import Any, Literal from fastapi import FastAPI, Header, HTTPException from fastapi.middleware.cors import CORSMiddleware from fastapi.responses import HTMLResponse from pydantic import BaseModel, ConfigDict, Field, field_validator REPO_ROOT = Path(__file__).resolve().parent.parent CORE_PYTHON_DIR = REPO_ROOT / "core-python" if str(CORE_PYTHON_DIR) not in sys.path: sys.path.insert(0, str(CORE_PYTHON_DIR)) from huggingface_human_training_space.studio_store import ( # noqa: E402 archive_draft, get_artifact, get_draft, get_run, index_artifacts, list_artifacts, list_drafts, list_runs, save_draft, save_run, update_run, ) from maris_core.training.human_training import ( # noqa: E402 HumanTrainingExecuteRequest, HumanTrainingRequest, build_human_training_launch_spec, load_human_training_manifest, publish_human_training_artifacts, stage_human_training_artifacts, ) from maris_core.training.space_ui import ( # noqa: E402 SpaceTrainingRequest, build_space_training_command, build_space_training_env, has_completed_training_artifacts, list_space_model_choices, parse_training_progress, resolve_output_dir, tail_log, terminate_process_tree, ) from maris_core.utils.env import get_env_any_or_default, get_hf_token # noqa: E402 logger = logging.getLogger(__name__) ROLE_GUIDES: dict[str, dict[str, object]] = { "owner": { "label": "Owner", "headline": "Vada kvalitāti, riskus un gala lēmumus pirms publicēšanas.", "responsibilities": [ "Apstiprina mērķi, kvalitātes robežas un release kritērijus.", "Izvērtē riskus un pieņem gala lēmumu par publicēšanu.", "Seko līdzi vai treniņa rezultāts atbilst biznesa vajadzībām.", ], "workflow": [ "Definē success metrics un ko komanda grib iemācīt modelim.", "Pārskata staging preview un dataset kvalitātes reportus.", "Dod gala atļauju publicēšanai un treniņa startam.", ], "examples": [ "Apstiprini, vai šis datasets ir gatavs produkcijas treniņam.", "Parādi galvenos riskus pirms publish + train.", "Sagatavo īsu owner-ready kopsavilkumu par progresu.", ], }, "secretary": { "label": "Secretary", "headline": "Sakārto ievadi, dokumentē lēmumus un uztur procesu disciplinētu.", "responsibilities": [ "Savāc prasības, piezīmes un stakeholder feedback vienā formātā.", "Normalizē instrukcijas un pārbauda vai dokumentācija ir pilna.", "Uztur checklists, onboarding materiālus un darba secību.", ], "workflow": [ "Pārvērš neformālu ievadi strukturētos treniņa blokos.", "Pārbauda, vai nekas svarīgs nav izlaists staging etapā.", "Fiksē nākamos soļus komandai pēc preview un pēc train run.", ], "examples": [ "Sakārto sapulces piezīmes profesionālā treniņa ievadē.", "Izveido checklist pirms human training publicēšanas.", "Apvieno feedback vienā skaidrā dokumentētā paketē.", ], }, "trainee": { "label": "Trainee", "headline": "Veido piemērus, preference pairs un eval scenārijus praktiskam progresam.", "responsibilities": [ "Raksta kvalitatīvus conversation, preference un eval piemērus.", "Atzīmē neskaidros vai konfliktējošos gadījumus pārskatam.", "Pārbauda vai atbildes ir skaidras, konsekventas un profesionālas.", ], "workflow": [ "Izveido konkrētus scenārijus ar reālu lietošanas kontekstu.", "Salīdzina chosen un rejected atbildes ar skaidru pamatojumu.", "Pievieno eval piemērus, kas pārbauda svarīgāko kvalitāti.", ], "examples": [ "Izveido 5 klientu atbalsta scenārijus ar pareizajām atbildēm.", "Salīdzini labu un sliktu atbildi vienam jautājumam.", "Pievieno eval piemēru skaidrai latviešu valodai.", ], }, "user": { "label": "User", "headline": "Sniedz reālos scenārijus un atgriezenisko saiti par rezultāta lietojamību.", "responsibilities": [ "Apraksta vajadzību, kontekstu un vēlamo iznākumu.", "Novērtē, vai atbildes palīdz sasniegt mērķi praksē.", "Norāda, kas ir neskaidrs, lieks vai neprofesionāls.", ], "workflow": [ "Iesniedz skaidru problēmu un gaidīto rezultātu.", "Dod reālus piemērus ar savu kontekstu.", "Apstiprina, kas jāuztur un kas jāuzlabo nākamajā iterācijā.", ], "examples": [ "Man vajag profesionālu atbildi klientam latviski un angliski.", "Šis rezultāts ir pārāk garš — saīsini līdz 5 punktiem.", "Dod piemēru, kā pareizi strukturēt onboarding instrukciju.", ], }, } PLATFORM_SECTIONS = { "workflow": [ { "title": "1. Ievade", "summary": "Savāc profila faktus, preferences, instrukcijas un reālus piemērus.", }, { "title": "2. Staging preview", "summary": "Pārskati manifestu, dataset kvalitāti un publicēšanas gatavību.", }, { "title": "3. Publish + train", "summary": "Publicē artefaktus dataset repozitorijā un palaid treniņu tikai apstiprinātai versijai.", }, { "title": "4. Rezultāts", "summary": "Komanda saņem skaidru statusu, logus un nākamos soļus.", }, ], "documentation": [ { "title": "Onboarding guide", "summary": "Paskaidro, kā katra loma sāk darbu bez liekiem pieņēmumiem.", }, { "title": "Role playbook", "summary": "Nosaka, ko dara owner, secretary, trainee un user katrā posmā.", }, { "title": "Quality checklist", "summary": "Palīdz pārbaudīt datu kvalitāti, saprotamību un publicēšanas gatavību.", }, { "title": "Example library", "summary": "Dod gatavus conversation, preference un eval piemēru modeļus.", }, ], } STUDIO_TEMPLATES: dict[str, dict[str, object]] = { "customer-support-lv": { "label": "Klientu atbalsts LV", "summary": "Profesionālas, īsas un mierīgas atbildes klientu apkalpošanai latviešu valodā.", "payload": { "profile_facts": [ "Asistents strādā kā Maris AI klientu atbalsta speciālists.", "Primārā valoda ir latviešu valoda, bet vajadzības gadījumā var dot īsu EN kopsavilkumu.", "Atbildēs nedrīkst solīt to, ko komanda nevar izpildīt praksē.", ], "profile_preferences": [ "Sāc ar tiešu atbildi un tad dod 2-4 skaidrus soļus.", "Nesodi klientu un neizmanto pasīvi agresīvu toni.", "Ja pietrūkst informācijas, uzdod vienu precizējošu jautājumu.", ], "response_instructions": [ "Prioritāte ir skaidrība, profesionāls tonis un droša informācija.", "Ja ir kļūda vai incidents, skaidri pasaki, ko komanda dara tālāk.", "Ja atbilde ir gara, beigās iedod īsu kopsavilkumu.", ], "conversation_examples": [ { "user": "Mums klients raksta, ka sistēma nestrādā kopš rīta. Kā atbildēt?", "assistant": "Atvainojamies par traucējumiem. Šobrīd pārbaudām incidentu un jau strādājam pie risinājuma. Lūdzu atsūti ietekmēto lietotāju vai konta piemēru, lai varam prioritizēt pārbaudi. Tiklīdz būs konkrēts atjauninājums, paziņosim nekavējoties.", } ], "preference_pairs": [ { "prompt": "Atbildi klientam par kavētu piegādi.", "chosen": "Paldies, ka uzrakstīji. Redzam, ka piegāde kavējas, un jau pārbaudām statusu ar partneri. Atgriezīsimies ar precīzu atjauninājumu tuvākajā laikā.", "rejected": "Tas nav mūsu ziņā, gaidiet.", } ], "eval_examples": [ { "prompt": "Klients ir neapmierināts ar lēnu atbalstu.", "completion": "Atbildei jābūt empātiskai, konkrētai un ar skaidru nākamo soli bez aizsargājoša toņa.", } ], }, }, "onboarding-coach": { "label": "Onboarding coach", "summary": "Skaidra iekšējā onboarding un rokasgrāmatu rakstīšana jaunajiem komandas biedriem.", "payload": { "profile_facts": [ "Asistents palīdz strukturēt onboarding saturu jaunajiem darbiniekiem.", "Mērķis ir no haotiskām piezīmēm izveidot skaidru darbību secību.", "Svarīga ir konsekventa terminoloģija un vienāds dokumentu stils.", ], "profile_preferences": [ "Atbildi strukturē ar sadaļām, checklistēm un īsiem paskaidrojumiem.", "Izcel riskus, piekļuves atkarības un kas jāzina pirmajā dienā.", "Nelieto neskaidrus saīsinājumus bez paskaidrojuma.", ], "response_instructions": [ "Pirms soļiem uzraksti mērķi un sagaidāmo rezultātu.", "Ja informācija ir nepilna, norādi tieši, kas vēl jāsaņem.", "Izvairies no marketinga valodas; prioritāte ir praktiska lietojamība.", ], "conversation_examples": [ { "user": "No šīm piezīmēm izveido saprotamu onboarding plānu jaunam operatoram.", "assistant": "Zemāk ir strukturēts onboarding plāns ar pirmās dienas uzdevumiem, nepieciešamajām piekļuvēm, kvalitātes checkpointiem un jautājumiem, kas jāprecizē pirms starta.", } ], "preference_pairs": [ { "prompt": "Sakārto onboarding instrukciju.", "chosen": "Instrukcija sākas ar mērķi, pēc tam dod secīgu checklisti, atbildīgās lomas un sagaidāmo rezultātu.", "rejected": "Te ir dažas idejas, paskaties pats, kas der.", } ], "eval_examples": [ { "prompt": "Kā jāizskatās labai onboarding instrukcijai?", "completion": "Tai jābūt secīgai, auditējamai un saprotamai arī cilvēkam bez iepriekšēja konteksta.", } ], }, }, "executive-briefing": { "label": "Executive briefing", "summary": "Owner/secretary režīms īsiem vadības kopsavilkumiem ar riskiem, lēmumiem un nākamajiem soļiem.", "payload": { "profile_facts": [ "Asistents gatavo vadības līmeņa kopsavilkumus par progresu un riskiem.", "Galvenais lasītājs ir owner vai lēmumu pieņēmējs ar mazu laiku.", "Svarīgākais ir signāls, nevis lieka detaļu pārslodze.", ], "profile_preferences": [ "Sāc ar statusu vienā teikumā.", "Dod 3-5 punktus par riskiem, progresu un vajadzīgo lēmumu.", "Ja iespējams, pievieno skaidru recommendation.", ], "response_instructions": [ "Nekopē neapstrādātus logus vai garus citātus.", "Ja nav datu lēmumam, pasaki, kas pietrūkst.", "Saglabā profesionālu, mierīgu un precīzu toni.", ], "conversation_examples": [ { "user": "Sagatavo owner-ready kopsavilkumu par human training progresu.", "assistant": "Statuss: staging artefakti ir gatavi pārskatam, publicēšanas tokens ir pieejams, un pirms treniņa starta jāapstiprina divi kvalitātes riski.", } ], "preference_pairs": [ { "prompt": "Apraksti statusu vadībai.", "chosen": "Statuss ir īss, ar skaidru recommendation un konkrētu nākamo soli.", "rejected": "Te ir viss pilnais konteksts 20 rindkopās bez prioritātēm.", } ], "eval_examples": [ { "prompt": "Kādam jābūt owner-ready update?", "completion": "Īsam, prioritizētam un orientētam uz lēmumu vai risku, nevis uz detalizētu iekšējo darba dienasgrāmatu.", } ], }, }, } LOGO_URL = "https://github.com/user-attachments/assets/347ded6a-40dc-4991-9cc7-4207cffdf452" PERSISTENT_DIR = Path( get_env_any_or_default("MARIS_PERSISTENT_DIR", "HF_PERSISTENT_DIR", default="/data") ) USERS_FILE = PERSISTENT_DIR / "human-training-users.json" USER_STORE_FALLBACK_DIRNAME = "maris-human-training-space" TRAIN_SCRIPT = str(REPO_ROOT / "huggingface" / "train-hf.sh") LOG_DIR = Path( get_env_any_or_default( "MARIS_HUMAN_TRAINING_LOG_DIR", "HF_SPACE_LOG_DIR", default=f"{PERSISTENT_DIR}/human-training-space-logs", ) ) DEFAULT_DATASET_REPO = get_env_any_or_default( "MARIS_MEMORY_REPO", "MARIS_DATASET_REPO", "HF_DATASET_REPO", default="MarisUK/maris-ai-lv-memory", ) DEFAULT_HUB_MODEL_ID = get_env_any_or_default( "MARIS_HUMAN_TRAINING_MODEL_REPO", "MARIS_MODEL_REPO", "HF_MODEL_REPO", default="MarisUK/maris-ai-lv", ) DEFAULT_OUTPUT_SUBDIR = get_env_any_or_default( "MARIS_HUMAN_TRAINING_OUTPUT_SUBDIR", default="maris-ai-lv", ) AUTH_REQUIRED = get_env_any_or_default( "MARIS_HUMAN_TRAINING_REQUIRE_AUTH", "MARIS_HUMAN_TRAINING_REQUIRE_LOGIN", default="false", ).strip().lower() in {"1", "true", "yes", "on"} DEFAULT_PRIVATE_ROLE = ( get_env_any_or_default( "MARIS_HUMAN_TRAINING_PRIVATE_ROLE", default="owner", ) .strip() .lower() ) if DEFAULT_PRIVATE_ROLE not in ROLE_GUIDES: logger.warning("Unknown private role '%s'; falling back to owner.", DEFAULT_PRIVATE_ROLE) DEFAULT_PRIVATE_ROLE = "owner" APP = FastAPI(title="Maris AI Human Training Space", version="2.0.0") APP.add_middleware( CORSMiddleware, allow_origins=["*"], allow_methods=["*"], allow_headers=["*"], ) SESSION_LOCK = Lock() USER_LOCK = Lock() STATE_LOCK = Lock() SESSION_STORE: dict[str, str] = {} TRAINING_STATE: dict[str, Any] = { "process": None, "log_path": "", "log_handle": None, "started_at": None, "finished_at": None, "request": None, "stop_requested": False, } PRIVATE_SPACE_REGISTERED_AT = datetime.now(UTC).replace(microsecond=0).isoformat() PRIVATE_SPACE_TOKEN = "private-space" class RegisterRequest(BaseModel): model_config = ConfigDict(str_strip_whitespace=True) full_name: str = Field(min_length=2, max_length=120) email: str = Field(min_length=5, max_length=160) password: str = Field(min_length=8, max_length=256) role: Literal["owner", "secretary", "trainee", "user"] @field_validator("email") @classmethod def validate_email(cls, value: str) -> str: normalized = value.strip().lower() if "@" not in normalized or normalized.startswith("@") or normalized.endswith("@"): raise ValueError("Norādi derīgu e-pastu.") return normalized class LoginRequest(BaseModel): model_config = ConfigDict(str_strip_whitespace=True) email: str = Field(min_length=5, max_length=160) password: str = Field(min_length=8, max_length=256) @field_validator("email") @classmethod def validate_email(cls, value: str) -> str: normalized = value.strip().lower() if "@" not in normalized or normalized.startswith("@") or normalized.endswith("@"): raise ValueError("Norādi derīgu e-pastu.") return normalized class SessionResponse(BaseModel): token: str user: dict[str, str] role_guide: dict[str, object] platform: dict[str, object] class StudioDraftSaveRequest(BaseModel): model_config = ConfigDict(str_strip_whitespace=True) name: str = Field(min_length=2, max_length=120) payload: HumanTrainingRequest draft_id: str = "" def _timestamp() -> str: return datetime.now(UTC).replace(microsecond=0).isoformat() def _env_flag(*names: str, default: bool = False) -> bool: return get_env_any_or_default( *names, default="true" if default else "false" ).strip().lower() in { "1", "true", "yes", "on", } def _env_int(*names: str, default: int) -> int: value = get_env_any_or_default(*names, default=str(default)).strip() try: return int(value) except ValueError as exc: raise RuntimeError( f"Nederīga vesela skaitļa vērtība env laukam {'/'.join(names)}: {value}" ) from exc def _has_publish_token() -> bool: return bool(get_hf_token()) def _resolve_user_store_path() -> Path: try: USERS_FILE.parent.mkdir(parents=True, exist_ok=True) except PermissionError: fallback_root = Path(tempfile.gettempdir()) / USER_STORE_FALLBACK_DIRNAME try: fallback_root.mkdir(parents=True, exist_ok=True) except PermissionError as exc: raise HTTPException( status_code=500, detail="Lietotāju glabātuve nav pieejama ne primārajā, ne rezerves vietā.", ) from exc return fallback_root / USERS_FILE.name return USERS_FILE def _ensure_user_store() -> Path: users_file = _resolve_user_store_path() if not users_file.exists(): users_file.write_text("{}\n", encoding="utf-8") return users_file def _load_users() -> dict[str, dict[str, str]]: users_file = _ensure_user_store() try: payload = json.loads(users_file.read_text(encoding="utf-8")) except json.JSONDecodeError as exc: raise HTTPException(status_code=500, detail="Lietotāju glabātuve nav nolasāma.") from exc return payload if isinstance(payload, dict) else {} def _save_users(users: dict[str, dict[str, str]]) -> None: users_file = _ensure_user_store() users_file.write_text(json.dumps(users, ensure_ascii=False, indent=2) + "\n", encoding="utf-8") def _hash_password(password: str, salt_hex: str | None = None) -> tuple[str, str]: salt = bytes.fromhex(salt_hex) if salt_hex else secrets.token_bytes(16) digest = hashlib.pbkdf2_hmac("sha256", password.encode("utf-8"), salt, 120000) return digest.hex(), salt.hex() def _verify_password(password: str, *, password_hash: str, password_salt: str) -> bool: calculated_hash, _ = _hash_password(password, password_salt) return secrets.compare_digest(calculated_hash, password_hash) def _public_user(record: dict[str, str]) -> dict[str, str]: return { "full_name": record["full_name"], "email": record["email"], "role": record["role"], "registered_at": record["registered_at"], } def _build_session_response(record: dict[str, str], token: str) -> SessionResponse: role = record["role"] return SessionResponse( token=token, user=_public_user(record), role_guide=ROLE_GUIDES[role], platform={ "workflow": PLATFORM_SECTIONS["workflow"], "documentation": PLATFORM_SECTIONS["documentation"], "examples": ROLE_GUIDES[role]["examples"], }, ) def _build_private_space_session() -> SessionResponse: return _build_session_response( { "full_name": "Private Space Team", "email": "private-space@maris.ai", "role": DEFAULT_PRIVATE_ROLE, "registered_at": PRIVATE_SPACE_REGISTERED_AT, }, token=PRIVATE_SPACE_TOKEN, ) def _create_session(email: str) -> str: token = secrets.token_urlsafe(24) with SESSION_LOCK: SESSION_STORE[token] = email return token def _require_user(session_token: str | None) -> dict[str, str]: if not AUTH_REQUIRED: return _build_private_space_session().user if not session_token: raise HTTPException( status_code=401, detail="Pieslēdzies platformai, lai izmantotu human.training rīkus." ) with SESSION_LOCK: email = SESSION_STORE.get(session_token) if not email: raise HTTPException(status_code=401, detail="Sesija nav derīga. Pieslēdzies vēlreiz.") record = _load_users().get(email) if record is None: raise HTTPException(status_code=401, detail="Lietotāja ieraksts nav atrasts.") return record def _user_email(record: dict[str, str] | None) -> str: if record and record.get("email"): return str(record["email"]).strip().lower() return "private-space@maris.ai" def _request_payload_dict(request: Any) -> dict[str, Any]: if hasattr(request, "model_dump"): return request.model_dump() return dict(request) def _close_log_handle_unlocked() -> None: handle = TRAINING_STATE.get("log_handle") if handle is not None: handle.close() TRAINING_STATE["log_handle"] = None def _write_log_line_unlocked(message: str) -> None: handle = TRAINING_STATE.get("log_handle") if handle is None: return handle.write(message + "\n") handle.flush() def _sync_training_state_unlocked() -> None: process = TRAINING_STATE.get("process") if process is None or process.poll() is None: return TRAINING_STATE["process"] = None TRAINING_STATE["finished_at"] = TRAINING_STATE.get("finished_at") or _timestamp() _close_log_handle_unlocked() def _save_huggingface_repo_text_file( *, repo_id: str, repo_type: str, path_in_repo: str, content: str, commit_message: str, ) -> dict[str, Any]: token = get_hf_token() if not token: raise RuntimeError("Hugging Face token nav iestatīts publicēšanai.") try: from huggingface_hub import HfApi except ImportError as exc: # pragma: no cover raise RuntimeError("huggingface_hub nav pieejams Space vidē.") from exc payload = content.encode("utf-8") api = HfApi(token=token) try: api.upload_file( path_or_fileobj=payload, path_in_repo=path_in_repo, repo_id=repo_id, repo_type=repo_type, commit_message=commit_message, ) except Exception as exc: # noqa: BLE001 detail = str(exc).strip() or type(exc).__name__ raise RuntimeError( f"Neizdevās saglabāt failu Hugging Face repozitorijā: {detail}." ) from exc return { "repo_id": repo_id, "repo_type": repo_type, "path": path_in_repo, "size_bytes": len(payload), "commit_message": commit_message, "saved": True, } def _training_defaults() -> dict[str, Any]: return { "dataset_repo": DEFAULT_DATASET_REPO, "hub_model_id": DEFAULT_HUB_MODEL_ID, "model_preset": "balanced", "model_name": "", "num_epochs": 3, "all_branches": False, "push_to_hub": True, "output_subdir": DEFAULT_OUTPUT_SUBDIR, "continue_from_latest_artifact": True, "continue_model_path": DEFAULT_OUTPUT_SUBDIR, } def _training_runtime_payload() -> dict[str, Any]: model_choices = [ { "id": preset_id, "label": f"{preset_id} — {config['model_name']}", **config, } for preset_id, config in list_space_model_choices().items() ] return { "model_choices": model_choices, "has_publish_token": _has_publish_token(), "defaults": _training_defaults(), } def _auto_training_request() -> SpaceTrainingRequest: defaults = _training_defaults() output_subdir = get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_OUTPUT_SUBDIR", "MARIS_SPACE_AUTO_TRAIN_OUTPUT_SUBDIR", default=str(defaults["output_subdir"]), ).strip() continue_model_path = get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_CONTINUE_MODEL_PATH", "MARIS_SPACE_AUTO_TRAIN_CONTINUE_MODEL_PATH", "MARIS_TRAIN_CONTINUE_MODEL_PATH", "HF_TRAIN_CONTINUE_MODEL_PATH", default="", ).strip() model_name = get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_NAME", "MARIS_SPACE_AUTO_TRAIN_MODEL_NAME", "MARIS_TRAIN_BASE_MODEL", "HF_TRAIN_BASE_MODEL", default="", ).strip() model_preset = get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_PRESET", "MARIS_SPACE_AUTO_TRAIN_MODEL_PRESET", "MARIS_TRAIN_MODEL_PRESET", "HF_TRAIN_MODEL_PRESET", default=str(defaults["model_preset"]), ).strip() return SpaceTrainingRequest( dataset_repo=get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_DATASET_REPO", "MARIS_MEMORY_REPO", "MARIS_DATASET_REPO", "HF_DATASET_REPO", default=str(defaults["dataset_repo"]), ), model_repo=get_env_any_or_default( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_REPO", "MARIS_HUMAN_TRAINING_MODEL_REPO", "MARIS_MODEL_REPO", "HF_MODEL_REPO", default=str(defaults["hub_model_id"]), ), model_preset="" if model_name else model_preset, model_name=model_name, num_epochs=_env_int( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_NUM_EPOCHS", "MARIS_TRAIN_NUM_EPOCHS", "HF_TRAIN_NUM_EPOCHS", default=int(defaults["num_epochs"]), ), all_branches=_env_flag( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_ALL_BRANCHES", "MARIS_SPACE_AUTO_TRAIN_ALL_BRANCHES", default=bool(defaults["all_branches"]), ), push_to_hub=_env_flag( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_PUSH_TO_HUB", "MARIS_SPACE_AUTO_TRAIN_PUSH_TO_HUB", "MARIS_TRAIN_PUBLISH", "HF_TRAIN_PUSH_TO_HUB", default=bool(defaults["push_to_hub"]), ), output_subdir=output_subdir, continue_from_latest_artifact=_env_flag( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_CONTINUE_FROM_LATEST", "MARIS_SPACE_AUTO_TRAIN_CONTINUE_FROM_LATEST", "MARIS_TRAIN_CONTINUE_FROM_LATEST", "HF_TRAIN_CONTINUE_FROM_LATEST", default=bool(defaults["continue_from_latest_artifact"]), ), continue_model_path=continue_model_path, ) def _maybe_start_automatic_training() -> None: if not _env_flag( "MARIS_HUMAN_TRAINING_AUTO_TRAIN", "MARIS_SPACE_AUTO_TRAIN", "HF_SPACE_AUTO_TRAIN", ): return try: request = _auto_training_request() output_dir = resolve_output_dir(str(PERSISTENT_DIR), request.output_subdir) force_start = _env_flag( "MARIS_HUMAN_TRAINING_AUTO_TRAIN_FORCE", "MARIS_SPACE_AUTO_TRAIN_FORCE", "HF_SPACE_AUTO_TRAIN_FORCE", default=False, ) if not force_start and has_completed_training_artifacts(output_dir): logger.info( "Izlaižu human training Space auto-startu, jo output jau satur pabeigta skrējiena artefaktus: %s", output_dir, ) return result = _start_training_process(request) logger.info( "Human training Space automātiskais treniņš palaists: pid=%s log=%s", result["pid"], result["log_path"], ) except Exception: # noqa: BLE001 logger.exception("Neizdevās automātiski palaist human training Space treniņu starta laikā.") @APP.on_event("startup") def _startup_auto_training() -> None: _maybe_start_automatic_training() def _start_training_process(request: Any, *, run_id: str | None = None) -> dict[str, Any]: if bool(getattr(request, "push_to_hub", False)) and not _has_publish_token(): raise HTTPException( status_code=400, detail="Hugging Face token nav iestatīts, bet publicēšana uz Hub ir ieslēgta.", ) if not Path(TRAIN_SCRIPT).is_file(): raise HTTPException( status_code=500, detail="Treniņa skripts nav atrasts Space bundle vidē." ) LOG_DIR.mkdir(parents=True, exist_ok=True) request_payload = _request_payload_dict(request) if run_id: request_payload["run_id"] = run_id with STATE_LOCK: _sync_training_state_unlocked() process = TRAINING_STATE.get("process") if process is not None: raise HTTPException(status_code=409, detail="Treniņš jau darbojas.") _close_log_handle_unlocked() started_at = _timestamp() log_path = LOG_DIR / f"training-{started_at.replace(':', '-').replace('+00:00', 'Z')}.log" log_handle = log_path.open("a", encoding="utf-8") TRAINING_STATE.update( { "process": None, "log_path": str(log_path), "log_handle": log_handle, "started_at": started_at, "finished_at": None, "request": request_payload, "stop_requested": False, } ) _write_log_line_unlocked("Starting training request") _write_log_line_unlocked(json.dumps(request_payload, ensure_ascii=False)) env = build_space_training_env(os.environ.copy(), request, str(PERSISTENT_DIR)) command = build_space_training_command(TRAIN_SCRIPT, request) process = subprocess.Popen( # noqa: S603 command, cwd=str(REPO_ROOT), env=env, stdout=log_handle, stderr=subprocess.STDOUT, start_new_session=True, ) TRAINING_STATE["process"] = process return { "message": "Treniņš palaists human.training Space vidē.", "log_path": str(log_path), "pid": process.pid, } def _load_training_status() -> dict[str, Any]: with STATE_LOCK: _sync_training_state_unlocked() process = TRAINING_STATE.get("process") running = process is not None and process.poll() is None exit_code = None if process is None else process.poll() log_path = str(TRAINING_STATE.get("log_path") or "") request = TRAINING_STATE.get("request") started_at = TRAINING_STATE.get("started_at") finished_at = TRAINING_STATE.get("finished_at") requested_stop = bool(TRAINING_STATE.get("stop_requested")) log_text = tail_log(log_path, max_chars=32000) if log_path else "" progress = parse_training_progress( log_text, request=request, running=running, exit_code=exit_code ) run_id = "" if isinstance(request, dict): run_id = str(request.get("run_id") or "") if run_id and not running and exit_code is not None: update_run( PERSISTENT_DIR, run_id=run_id, status="completed" if exit_code == 0 else "failed", finished_at=finished_at or _timestamp(), exit_code=exit_code, ) return { "running": running, "exit_code": exit_code, "log_path": log_path, "log_tail": tail_log(log_path) if log_path else "", "request": request, "started_at": started_at, "finished_at": finished_at, "requested_stop": requested_stop, "can_stop": running, "has_publish_token": _has_publish_token(), "progress": progress, } def _render_cards(items: list[dict[str, str]], *, kind: str) -> str: cards: list[str] = [] for item in items: title = html.escape(item["title"]) summary = html.escape(item["summary"]) cards.append( "\n".join( [ f'
', f'
{kind}
', f"

{title}

", f"

{summary}

", "
", ] ) ) return "\n".join(cards) def _render_role_cards() -> str: cards: list[str] = [] for role_id, guide in ROLE_GUIDES.items(): label = html.escape(str(guide["label"])) headline = html.escape(str(guide["headline"])) safe_role_id = html.escape(role_id) responsibilities = "".join( f"
  • {html.escape(str(item))}
  • " for item in guide["responsibilities"] ) cards.append( f"""
    {label} {safe_role_id}

    {label}

    {headline}

    """ ) return "\n".join(cards) def _render_list_items(items: list[str]) -> str: if not items: return "
  • Vēl nav datu.
  • " return "".join(f"
  • {html.escape(str(item))}
  • " for item in items) def _initial_workspace_payload() -> dict[str, object]: if not AUTH_REQUIRED: session = _build_private_space_session().model_dump() return { "active_class": "active", "title": f"{session['role_guide']['label']} workspace", "summary": str(session["role_guide"]["headline"]), "responsibilities": list(session["role_guide"]["responsibilities"]), "workflow": list(session["role_guide"]["workflow"]), "examples": list(session["platform"]["examples"]), "docs": [str(item["title"]) for item in session["platform"]["documentation"]], "session": session, } return { "active_class": "", "title": "Sveicināti platformā", "summary": "Izvēlies lomu vai izmanto privāto pieeju, lai sāktu darbu.", "responsibilities": [], "workflow": [], "examples": [], "docs": [], "session": None, } def _render_template_options() -> str: return "\n".join( f'' for template_id, template in STUDIO_TEMPLATES.items() ) def _access_panel() -> str: if not AUTH_REQUIRED: private_guide = ROLE_GUIDES[DEFAULT_PRIVATE_ROLE] private_label = html.escape(str(private_guide["label"])) return f""" """ role_options = "\n".join( f'' for role_id, guide in ROLE_GUIDES.items() ) return f""" """ def _runtime_payload() -> dict[str, Any]: return { "roles": ROLE_GUIDES, "workflow": PLATFORM_SECTIONS["workflow"], "documentation": PLATFORM_SECTIONS["documentation"], "templates": STUDIO_TEMPLATES, "studio_features": ["saved-drafts", "run-history", "artifact-browser"], "training": _training_runtime_payload(), "auth_required": AUTH_REQUIRED, "private_session": _build_private_space_session().model_dump() if not AUTH_REQUIRED else None, } def _render_index() -> str: workspace_bootstrap = _initial_workspace_payload() runtime_json = json.dumps(_runtime_payload(), ensure_ascii=False).replace(" Maris AI Human Training
    Maris AI logo

    Maris AI Human Training

    Profesionāli pārbūvēta atsevišķa platforma priekš MarisUK/maris.ai.human.training ar skaidru onboarding, preview, publish un reālu train izpildi.

    Dedicated Space Private Space Professional workflow Publish + train

    Šis Space ir būvēts tā, lai komanda vienā vietā sagatavotu human training ievadi, pārskatītu artefaktu manifestu, publicētu to dataset repozitorijā un droši palaistu treniņu ar dzīvu statusu.

    {_access_panel()}
    Roles

    Lomas un atbildības

    Owner, secretary, trainee un user katrs redz saprotamu atbildības zonu jau no pirmās dienas.

    {_render_role_cards()}
    Documentation

    Platformas dokumentācija

    Praktiski materiāli, lai darbs būtu vienots, auditējams un profesionāls.

    {_render_cards(PLATFORM_SECTIONS["documentation"], kind="doc")}
    Workflow

    Darba plūsma

    Vienkārša secība no ievades līdz apstiprinātam treniņa startam.

    {_render_cards(PLATFORM_SECTIONS["workflow"], kind="workflow")}
    Role dashboard

    {workspace_title}

    {workspace_summary}

      {_render_list_items(workspace_bootstrap["responsibilities"])}
    What to do next

    Nākamie soļi

      {_render_list_items(workspace_bootstrap["workflow"])}
    Examples

    Lomas piemēri

      {_render_list_items(workspace_bootstrap["examples"])}
    Documentation

    Kas jāizlasa

      {_render_list_items(workspace_bootstrap["docs"])}
    Studio mode

    Ātra starta vadība

    Izvēlies gatavu studijas šablonu, lai forma uzreiz piepildās ar profesionālu sākuma saturu.

    Dataset: {default_dataset_repo_html} Model: {default_hub_model_id_html} Persistent dir: {persistent_dir_html}
    • Izvēlies vai pielāgo studio template.
    • Pārskati dataset/model repo un output path.
    • Build preview, tad publicē artefaktus un tikai pēc tam startē treniņu.
    Review summary

    Staging pārskats

    Kad izveidosi preview, te parādīsies galvenie kvalitātes signāli un artefaktu kopa.

    Train
    0ieraksti preview
    Eval
    0eval piemēri
    Prefs
    0preference pāri
    Duplicates
    0izņemtie dublikāti
    • Artefakti vēl nav publicēti.Pēc publish šeit redzēsi katra artefakta repo ceļu.
    Human training builder

    Profesionāla advanced konfigurācija

    Sagatavo kvalitātīvu preview, publicē artefaktus un tikai tad palaid treniņu.

    Gatavs staging priekšskatam.

    Collect → review → publish → train

    Preview & live status

    Manifests un treniņa statuss

    Hub publish token: {"pieejams" if _has_publish_token() else "nav iestatīts"}

    Artefaktu manifests parādīsies šeit.

    Treniņa logs

    Kad startēsi treniņu, te parādīsies dzīvais loga izgriezums.
    Saved drafts

    Saglabātie drafts

    Saglabā darba versijas, ielādē tās atpakaļ formā un turpini no pēdējā stāvokļa.

    • Drafts vēl nav.Saglabā pirmo draft, lai sāktu versiju vēsturi.
    Run history

    Run history

    Redzi staged, published, running un pabeigtos run ierakstus vienā vietā.

    • Run history vēl nav.Build preview izveidos pirmo run ierakstu.
    Artifact browser

    Artifact browser

    Pārlūko staged un publicētos artefaktus ar sample preview un repo ceļiem.

    • Artefakti vēl nav indeksēti.Build preview vai publish pievienos artefaktu browser ierakstus.

    Artifact preview

    Izvēlies artefaktu no saraksta, lai redzētu preview.
    """ @APP.get("/", response_class=HTMLResponse) def index() -> HTMLResponse: return HTMLResponse(_render_index()) @APP.get("/api/health") def health() -> dict[str, str]: return {"service": "maris-human-training-space", "status": "ok"} @APP.get("/api/runtime") def runtime() -> dict[str, object]: return { "service": "maris-human-training-space", "roles": ROLE_GUIDES, "workflow": PLATFORM_SECTIONS["workflow"], "documentation": PLATFORM_SECTIONS["documentation"], "templates": STUDIO_TEMPLATES, "studio_features": ["saved-drafts", "run-history", "artifact-browser"], "training": _training_runtime_payload(), "auth_required": AUTH_REQUIRED, "private_session": _build_private_space_session().model_dump() if not AUTH_REQUIRED else None, } @APP.post("/api/auth/register", response_model=SessionResponse) def register(payload: RegisterRequest) -> SessionResponse: with USER_LOCK: users = _load_users() if payload.email in users: raise HTTPException(status_code=409, detail="Konts ar šo e-pastu jau eksistē.") password_hash, password_salt = _hash_password(payload.password) users[payload.email] = { "full_name": payload.full_name, "email": payload.email, "role": payload.role, "password_hash": password_hash, "password_salt": password_salt, "registered_at": _timestamp(), } _save_users(users) token = _create_session(payload.email) return _build_session_response(users[payload.email], token) @APP.post("/api/auth/login", response_model=SessionResponse) def login(payload: LoginRequest) -> SessionResponse: with USER_LOCK: users = _load_users() record = users.get(payload.email) if record is None or not _verify_password( payload.password, password_hash=record["password_hash"], password_salt=record["password_salt"], ): raise HTTPException(status_code=401, detail="Nepareizs e-pasts vai parole.") token = _create_session(payload.email) return _build_session_response(record, token) @APP.get("/api/studio/drafts") def studio_drafts( x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) return {"drafts": list_drafts(PERSISTENT_DIR, user_email=_user_email(user))} @APP.post("/api/studio/drafts") def studio_save_draft( request: StudioDraftSaveRequest, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) draft = save_draft( PERSISTENT_DIR, user_email=_user_email(user), name=request.name, payload=request.payload.model_dump(), draft_id=request.draft_id or None, ) return {"message": "Draft saglabāts.", "draft": draft} @APP.get("/api/studio/drafts/{draft_id}") def studio_get_draft( draft_id: str, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) draft = get_draft(PERSISTENT_DIR, draft_id) if not draft or draft.get("owner_email") != _user_email(user) or draft.get("archived"): raise HTTPException(status_code=404, detail="Draft nav atrasts.") return {"draft": draft} @APP.delete("/api/studio/drafts/{draft_id}") def studio_archive_draft( draft_id: str, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) draft = archive_draft(PERSISTENT_DIR, draft_id=draft_id, user_email=_user_email(user)) if not draft: raise HTTPException(status_code=404, detail="Draft nav atrasts.") return {"message": "Draft arhivēts.", "draft": draft} @APP.get("/api/studio/runs") def studio_runs( x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) return {"runs": list_runs(PERSISTENT_DIR, user_email=_user_email(user))} @APP.get("/api/studio/runs/{run_id}") def studio_run( run_id: str, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) run = get_run(PERSISTENT_DIR, run_id) if not run or run.get("owner_email") != _user_email(user): raise HTTPException(status_code=404, detail="Run nav atrasts.") return {"run": run} @APP.get("/api/studio/artifacts") def studio_artifacts( x_session_token: str | None = Header(default=None, alias="X-Session-Token"), run_id: str | None = None, ) -> dict[str, Any]: user = _require_user(x_session_token) return { "artifacts": list_artifacts( PERSISTENT_DIR, user_email=_user_email(user), run_id=run_id, ) } @APP.get("/api/studio/artifacts/{artifact_id}") def studio_artifact( artifact_id: str, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) artifact = get_artifact(PERSISTENT_DIR, artifact_id) if not artifact or artifact.get("owner_email") != _user_email(user): raise HTTPException(status_code=404, detail="Artefakts nav atrasts.") return {"artifact": artifact} @APP.post("/api/human-training/build") def build_human_training( request: HumanTrainingRequest, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), draft_id: str | None = None, ) -> dict[str, Any]: user = _require_user(x_session_token) manifest = stage_human_training_artifacts(request, persistent_dir=str(PERSISTENT_DIR)) run_record = save_run( PERSISTENT_DIR, manifest=manifest, user_email=_user_email(user), draft_id=draft_id, ) artifacts = index_artifacts( PERSISTENT_DIR, manifest=manifest, user_email=_user_email(user), ) return { "message": "Human training artefakti sagatavoti staging pārskatam.", "run_id": manifest["run_id"], "manifest": manifest, "run": run_record, "artifacts": artifacts, } @APP.post("/api/human-training/execute") def execute_human_training( request: HumanTrainingExecuteRequest, x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: user = _require_user(x_session_token) if request.publish_artifacts and not _has_publish_token(): raise HTTPException( status_code=400, detail="Hugging Face token nav iestatīts, tāpēc nevar publicēt human training artefaktus.", ) try: manifest = load_human_training_manifest(str(PERSISTENT_DIR), request.run_id) except FileNotFoundError as exc: raise HTTPException(status_code=404, detail=str(exc)) from exc try: published = ( publish_human_training_artifacts(manifest, save_file=_save_huggingface_repo_text_file) if request.publish_artifacts else [] ) except RuntimeError as exc: raise HTTPException(status_code=502, detail=str(exc)) from exc training_result = None if request.publish_artifacts: index_artifacts( PERSISTENT_DIR, manifest=manifest, user_email=_user_email(user), published=published, ) update_run( PERSISTENT_DIR, run_id=request.run_id, status="published" if not request.start_training else "starting", published_at=_timestamp(), ) if request.start_training: training_result = _start_training_process( build_human_training_launch_spec(manifest), run_id=request.run_id, ) update_run( PERSISTENT_DIR, run_id=request.run_id, status="running", training_started_at=_timestamp(), ) return { "message": "Human training staging izpildīts.", "run_id": manifest["run_id"], "published": published, "training": training_result, } @APP.get("/api/training/status") def training_status( x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: _require_user(x_session_token) return _load_training_status() @APP.post("/api/training/stop") def stop_training( x_session_token: str | None = Header(default=None, alias="X-Session-Token"), ) -> dict[str, Any]: _require_user(x_session_token) with STATE_LOCK: _sync_training_state_unlocked() process = TRAINING_STATE.get("process") if process is None or process.poll() is not None: raise HTTPException(status_code=409, detail="Nav aktīva treniņa, ko apturēt.") TRAINING_STATE["stop_requested"] = True _write_log_line_unlocked("Stop requested by user") exit_code = terminate_process_tree(process) with STATE_LOCK: _write_log_line_unlocked("Training stopped by user") run_id = "" request = TRAINING_STATE.get("request") if isinstance(request, dict): run_id = str(request.get("run_id") or "") TRAINING_STATE["process"] = None TRAINING_STATE["finished_at"] = _timestamp() _close_log_handle_unlocked() if run_id: update_run( PERSISTENT_DIR, run_id=run_id, status="stopped", finished_at=_timestamp(), exit_code=exit_code, ) return { "message": "Treniņa apturēšanas signāls nosūtīts.", "exit_code": exit_code, } app = APP