{title}
", f"{summary}
", """"Production-ready standalone Maris human training Space."""
from __future__ import annotations
import hashlib
import html
import json
import logging
import os
import secrets
import subprocess
import sys
import tempfile
from datetime import UTC, datetime
from pathlib import Path
from threading import Lock
from typing import Any, Literal
from fastapi import FastAPI, Header, HTTPException
from fastapi.middleware.cors import CORSMiddleware
from fastapi.responses import HTMLResponse
from pydantic import BaseModel, ConfigDict, Field, field_validator
REPO_ROOT = Path(__file__).resolve().parent.parent
CORE_PYTHON_DIR = REPO_ROOT / "core-python"
if str(CORE_PYTHON_DIR) not in sys.path:
sys.path.insert(0, str(CORE_PYTHON_DIR))
from huggingface_human_training_space.studio_store import ( # noqa: E402
archive_draft,
get_artifact,
get_draft,
get_run,
index_artifacts,
list_artifacts,
list_drafts,
list_runs,
save_draft,
save_run,
update_run,
)
from maris_core.training.human_training import ( # noqa: E402
HumanTrainingExecuteRequest,
HumanTrainingRequest,
build_human_training_launch_spec,
load_human_training_manifest,
publish_human_training_artifacts,
stage_human_training_artifacts,
)
from maris_core.training.space_ui import ( # noqa: E402
SpaceTrainingRequest,
build_space_training_command,
build_space_training_env,
has_completed_training_artifacts,
list_space_model_choices,
parse_training_progress,
resolve_output_dir,
tail_log,
terminate_process_tree,
)
from maris_core.utils.env import get_env_any_or_default, get_hf_token # noqa: E402
logger = logging.getLogger(__name__)
ROLE_GUIDES: dict[str, dict[str, object]] = {
"owner": {
"label": "Owner",
"headline": "Vada kvalitāti, riskus un gala lēmumus pirms publicēšanas.",
"responsibilities": [
"Apstiprina mērķi, kvalitātes robežas un release kritērijus.",
"Izvērtē riskus un pieņem gala lēmumu par publicēšanu.",
"Seko līdzi vai treniņa rezultāts atbilst biznesa vajadzībām.",
],
"workflow": [
"Definē success metrics un ko komanda grib iemācīt modelim.",
"Pārskata staging preview un dataset kvalitātes reportus.",
"Dod gala atļauju publicēšanai un treniņa startam.",
],
"examples": [
"Apstiprini, vai šis datasets ir gatavs produkcijas treniņam.",
"Parādi galvenos riskus pirms publish + train.",
"Sagatavo īsu owner-ready kopsavilkumu par progresu.",
],
},
"secretary": {
"label": "Secretary",
"headline": "Sakārto ievadi, dokumentē lēmumus un uztur procesu disciplinētu.",
"responsibilities": [
"Savāc prasības, piezīmes un stakeholder feedback vienā formātā.",
"Normalizē instrukcijas un pārbauda vai dokumentācija ir pilna.",
"Uztur checklists, onboarding materiālus un darba secību.",
],
"workflow": [
"Pārvērš neformālu ievadi strukturētos treniņa blokos.",
"Pārbauda, vai nekas svarīgs nav izlaists staging etapā.",
"Fiksē nākamos soļus komandai pēc preview un pēc train run.",
],
"examples": [
"Sakārto sapulces piezīmes profesionālā treniņa ievadē.",
"Izveido checklist pirms human training publicēšanas.",
"Apvieno feedback vienā skaidrā dokumentētā paketē.",
],
},
"trainee": {
"label": "Trainee",
"headline": "Veido piemērus, preference pairs un eval scenārijus praktiskam progresam.",
"responsibilities": [
"Raksta kvalitatīvus conversation, preference un eval piemērus.",
"Atzīmē neskaidros vai konfliktējošos gadījumus pārskatam.",
"Pārbauda vai atbildes ir skaidras, konsekventas un profesionālas.",
],
"workflow": [
"Izveido konkrētus scenārijus ar reālu lietošanas kontekstu.",
"Salīdzina chosen un rejected atbildes ar skaidru pamatojumu.",
"Pievieno eval piemērus, kas pārbauda svarīgāko kvalitāti.",
],
"examples": [
"Izveido 5 klientu atbalsta scenārijus ar pareizajām atbildēm.",
"Salīdzini labu un sliktu atbildi vienam jautājumam.",
"Pievieno eval piemēru skaidrai latviešu valodai.",
],
},
"user": {
"label": "User",
"headline": "Sniedz reālos scenārijus un atgriezenisko saiti par rezultāta lietojamību.",
"responsibilities": [
"Apraksta vajadzību, kontekstu un vēlamo iznākumu.",
"Novērtē, vai atbildes palīdz sasniegt mērķi praksē.",
"Norāda, kas ir neskaidrs, lieks vai neprofesionāls.",
],
"workflow": [
"Iesniedz skaidru problēmu un gaidīto rezultātu.",
"Dod reālus piemērus ar savu kontekstu.",
"Apstiprina, kas jāuztur un kas jāuzlabo nākamajā iterācijā.",
],
"examples": [
"Man vajag profesionālu atbildi klientam latviski un angliski.",
"Šis rezultāts ir pārāk garš — saīsini līdz 5 punktiem.",
"Dod piemēru, kā pareizi strukturēt onboarding instrukciju.",
],
},
}
PLATFORM_SECTIONS = {
"workflow": [
{
"title": "1. Ievade",
"summary": "Savāc profila faktus, preferences, instrukcijas un reālus piemērus.",
},
{
"title": "2. Staging preview",
"summary": "Pārskati manifestu, dataset kvalitāti un publicēšanas gatavību.",
},
{
"title": "3. Publish + train",
"summary": "Publicē artefaktus dataset repozitorijā un palaid treniņu tikai apstiprinātai versijai.",
},
{
"title": "4. Rezultāts",
"summary": "Komanda saņem skaidru statusu, logus un nākamos soļus.",
},
],
"documentation": [
{
"title": "Onboarding guide",
"summary": "Paskaidro, kā katra loma sāk darbu bez liekiem pieņēmumiem.",
},
{
"title": "Role playbook",
"summary": "Nosaka, ko dara owner, secretary, trainee un user katrā posmā.",
},
{
"title": "Quality checklist",
"summary": "Palīdz pārbaudīt datu kvalitāti, saprotamību un publicēšanas gatavību.",
},
{
"title": "Example library",
"summary": "Dod gatavus conversation, preference un eval piemēru modeļus.",
},
],
}
STUDIO_TEMPLATES: dict[str, dict[str, object]] = {
"customer-support-lv": {
"label": "Klientu atbalsts LV",
"summary": "Profesionālas, īsas un mierīgas atbildes klientu apkalpošanai latviešu valodā.",
"payload": {
"profile_facts": [
"Asistents strādā kā Maris AI klientu atbalsta speciālists.",
"Primārā valoda ir latviešu valoda, bet vajadzības gadījumā var dot īsu EN kopsavilkumu.",
"Atbildēs nedrīkst solīt to, ko komanda nevar izpildīt praksē.",
],
"profile_preferences": [
"Sāc ar tiešu atbildi un tad dod 2-4 skaidrus soļus.",
"Nesodi klientu un neizmanto pasīvi agresīvu toni.",
"Ja pietrūkst informācijas, uzdod vienu precizējošu jautājumu.",
],
"response_instructions": [
"Prioritāte ir skaidrība, profesionāls tonis un droša informācija.",
"Ja ir kļūda vai incidents, skaidri pasaki, ko komanda dara tālāk.",
"Ja atbilde ir gara, beigās iedod īsu kopsavilkumu.",
],
"conversation_examples": [
{
"user": "Mums klients raksta, ka sistēma nestrādā kopš rīta. Kā atbildēt?",
"assistant": "Atvainojamies par traucējumiem. Šobrīd pārbaudām incidentu un jau strādājam pie risinājuma. Lūdzu atsūti ietekmēto lietotāju vai konta piemēru, lai varam prioritizēt pārbaudi. Tiklīdz būs konkrēts atjauninājums, paziņosim nekavējoties.",
}
],
"preference_pairs": [
{
"prompt": "Atbildi klientam par kavētu piegādi.",
"chosen": "Paldies, ka uzrakstīji. Redzam, ka piegāde kavējas, un jau pārbaudām statusu ar partneri. Atgriezīsimies ar precīzu atjauninājumu tuvākajā laikā.",
"rejected": "Tas nav mūsu ziņā, gaidiet.",
}
],
"eval_examples": [
{
"prompt": "Klients ir neapmierināts ar lēnu atbalstu.",
"completion": "Atbildei jābūt empātiskai, konkrētai un ar skaidru nākamo soli bez aizsargājoša toņa.",
}
],
},
},
"onboarding-coach": {
"label": "Onboarding coach",
"summary": "Skaidra iekšējā onboarding un rokasgrāmatu rakstīšana jaunajiem komandas biedriem.",
"payload": {
"profile_facts": [
"Asistents palīdz strukturēt onboarding saturu jaunajiem darbiniekiem.",
"Mērķis ir no haotiskām piezīmēm izveidot skaidru darbību secību.",
"Svarīga ir konsekventa terminoloģija un vienāds dokumentu stils.",
],
"profile_preferences": [
"Atbildi strukturē ar sadaļām, checklistēm un īsiem paskaidrojumiem.",
"Izcel riskus, piekļuves atkarības un kas jāzina pirmajā dienā.",
"Nelieto neskaidrus saīsinājumus bez paskaidrojuma.",
],
"response_instructions": [
"Pirms soļiem uzraksti mērķi un sagaidāmo rezultātu.",
"Ja informācija ir nepilna, norādi tieši, kas vēl jāsaņem.",
"Izvairies no marketinga valodas; prioritāte ir praktiska lietojamība.",
],
"conversation_examples": [
{
"user": "No šīm piezīmēm izveido saprotamu onboarding plānu jaunam operatoram.",
"assistant": "Zemāk ir strukturēts onboarding plāns ar pirmās dienas uzdevumiem, nepieciešamajām piekļuvēm, kvalitātes checkpointiem un jautājumiem, kas jāprecizē pirms starta.",
}
],
"preference_pairs": [
{
"prompt": "Sakārto onboarding instrukciju.",
"chosen": "Instrukcija sākas ar mērķi, pēc tam dod secīgu checklisti, atbildīgās lomas un sagaidāmo rezultātu.",
"rejected": "Te ir dažas idejas, paskaties pats, kas der.",
}
],
"eval_examples": [
{
"prompt": "Kā jāizskatās labai onboarding instrukcijai?",
"completion": "Tai jābūt secīgai, auditējamai un saprotamai arī cilvēkam bez iepriekšēja konteksta.",
}
],
},
},
"executive-briefing": {
"label": "Executive briefing",
"summary": "Owner/secretary režīms īsiem vadības kopsavilkumiem ar riskiem, lēmumiem un nākamajiem soļiem.",
"payload": {
"profile_facts": [
"Asistents gatavo vadības līmeņa kopsavilkumus par progresu un riskiem.",
"Galvenais lasītājs ir owner vai lēmumu pieņēmējs ar mazu laiku.",
"Svarīgākais ir signāls, nevis lieka detaļu pārslodze.",
],
"profile_preferences": [
"Sāc ar statusu vienā teikumā.",
"Dod 3-5 punktus par riskiem, progresu un vajadzīgo lēmumu.",
"Ja iespējams, pievieno skaidru recommendation.",
],
"response_instructions": [
"Nekopē neapstrādātus logus vai garus citātus.",
"Ja nav datu lēmumam, pasaki, kas pietrūkst.",
"Saglabā profesionālu, mierīgu un precīzu toni.",
],
"conversation_examples": [
{
"user": "Sagatavo owner-ready kopsavilkumu par human training progresu.",
"assistant": "Statuss: staging artefakti ir gatavi pārskatam, publicēšanas tokens ir pieejams, un pirms treniņa starta jāapstiprina divi kvalitātes riski.",
}
],
"preference_pairs": [
{
"prompt": "Apraksti statusu vadībai.",
"chosen": "Statuss ir īss, ar skaidru recommendation un konkrētu nākamo soli.",
"rejected": "Te ir viss pilnais konteksts 20 rindkopās bez prioritātēm.",
}
],
"eval_examples": [
{
"prompt": "Kādam jābūt owner-ready update?",
"completion": "Īsam, prioritizētam un orientētam uz lēmumu vai risku, nevis uz detalizētu iekšējo darba dienasgrāmatu.",
}
],
},
},
}
LOGO_URL = "https://github.com/user-attachments/assets/347ded6a-40dc-4991-9cc7-4207cffdf452"
PERSISTENT_DIR = Path(
get_env_any_or_default("MARIS_PERSISTENT_DIR", "HF_PERSISTENT_DIR", default="/data")
)
USERS_FILE = PERSISTENT_DIR / "human-training-users.json"
USER_STORE_FALLBACK_DIRNAME = "maris-human-training-space"
TRAIN_SCRIPT = str(REPO_ROOT / "huggingface" / "train-hf.sh")
LOG_DIR = Path(
get_env_any_or_default(
"MARIS_HUMAN_TRAINING_LOG_DIR",
"HF_SPACE_LOG_DIR",
default=f"{PERSISTENT_DIR}/human-training-space-logs",
)
)
DEFAULT_DATASET_REPO = get_env_any_or_default(
"MARIS_MEMORY_REPO",
"MARIS_DATASET_REPO",
"HF_DATASET_REPO",
default="MarisUK/maris-ai-lv-memory",
)
DEFAULT_HUB_MODEL_ID = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_MODEL_REPO",
"MARIS_MODEL_REPO",
"HF_MODEL_REPO",
default="MarisUK/maris-ai-lv",
)
DEFAULT_OUTPUT_SUBDIR = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_OUTPUT_SUBDIR",
default="maris-ai-lv",
)
AUTH_REQUIRED = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_REQUIRE_AUTH",
"MARIS_HUMAN_TRAINING_REQUIRE_LOGIN",
default="false",
).strip().lower() in {"1", "true", "yes", "on"}
DEFAULT_PRIVATE_ROLE = (
get_env_any_or_default(
"MARIS_HUMAN_TRAINING_PRIVATE_ROLE",
default="owner",
)
.strip()
.lower()
)
if DEFAULT_PRIVATE_ROLE not in ROLE_GUIDES:
logger.warning("Unknown private role '%s'; falling back to owner.", DEFAULT_PRIVATE_ROLE)
DEFAULT_PRIVATE_ROLE = "owner"
APP = FastAPI(title="Maris AI Human Training Space", version="2.0.0")
APP.add_middleware(
CORSMiddleware,
allow_origins=["*"],
allow_methods=["*"],
allow_headers=["*"],
)
SESSION_LOCK = Lock()
USER_LOCK = Lock()
STATE_LOCK = Lock()
SESSION_STORE: dict[str, str] = {}
TRAINING_STATE: dict[str, Any] = {
"process": None,
"log_path": "",
"log_handle": None,
"started_at": None,
"finished_at": None,
"request": None,
"stop_requested": False,
}
PRIVATE_SPACE_REGISTERED_AT = datetime.now(UTC).replace(microsecond=0).isoformat()
PRIVATE_SPACE_TOKEN = "private-space"
class RegisterRequest(BaseModel):
model_config = ConfigDict(str_strip_whitespace=True)
full_name: str = Field(min_length=2, max_length=120)
email: str = Field(min_length=5, max_length=160)
password: str = Field(min_length=8, max_length=256)
role: Literal["owner", "secretary", "trainee", "user"]
@field_validator("email")
@classmethod
def validate_email(cls, value: str) -> str:
normalized = value.strip().lower()
if "@" not in normalized or normalized.startswith("@") or normalized.endswith("@"):
raise ValueError("Norādi derīgu e-pastu.")
return normalized
class LoginRequest(BaseModel):
model_config = ConfigDict(str_strip_whitespace=True)
email: str = Field(min_length=5, max_length=160)
password: str = Field(min_length=8, max_length=256)
@field_validator("email")
@classmethod
def validate_email(cls, value: str) -> str:
normalized = value.strip().lower()
if "@" not in normalized or normalized.startswith("@") or normalized.endswith("@"):
raise ValueError("Norādi derīgu e-pastu.")
return normalized
class SessionResponse(BaseModel):
token: str
user: dict[str, str]
role_guide: dict[str, object]
platform: dict[str, object]
class StudioDraftSaveRequest(BaseModel):
model_config = ConfigDict(str_strip_whitespace=True)
name: str = Field(min_length=2, max_length=120)
payload: HumanTrainingRequest
draft_id: str = ""
def _timestamp() -> str:
return datetime.now(UTC).replace(microsecond=0).isoformat()
def _env_flag(*names: str, default: bool = False) -> bool:
return get_env_any_or_default(
*names, default="true" if default else "false"
).strip().lower() in {
"1",
"true",
"yes",
"on",
}
def _env_int(*names: str, default: int) -> int:
value = get_env_any_or_default(*names, default=str(default)).strip()
try:
return int(value)
except ValueError as exc:
raise RuntimeError(
f"Nederīga vesela skaitļa vērtība env laukam {'/'.join(names)}: {value}"
) from exc
def _has_publish_token() -> bool:
return bool(get_hf_token())
def _resolve_user_store_path() -> Path:
try:
USERS_FILE.parent.mkdir(parents=True, exist_ok=True)
except PermissionError:
fallback_root = Path(tempfile.gettempdir()) / USER_STORE_FALLBACK_DIRNAME
try:
fallback_root.mkdir(parents=True, exist_ok=True)
except PermissionError as exc:
raise HTTPException(
status_code=500,
detail="Lietotāju glabātuve nav pieejama ne primārajā, ne rezerves vietā.",
) from exc
return fallback_root / USERS_FILE.name
return USERS_FILE
def _ensure_user_store() -> Path:
users_file = _resolve_user_store_path()
if not users_file.exists():
users_file.write_text("{}\n", encoding="utf-8")
return users_file
def _load_users() -> dict[str, dict[str, str]]:
users_file = _ensure_user_store()
try:
payload = json.loads(users_file.read_text(encoding="utf-8"))
except json.JSONDecodeError as exc:
raise HTTPException(status_code=500, detail="Lietotāju glabātuve nav nolasāma.") from exc
return payload if isinstance(payload, dict) else {}
def _save_users(users: dict[str, dict[str, str]]) -> None:
users_file = _ensure_user_store()
users_file.write_text(json.dumps(users, ensure_ascii=False, indent=2) + "\n", encoding="utf-8")
def _hash_password(password: str, salt_hex: str | None = None) -> tuple[str, str]:
salt = bytes.fromhex(salt_hex) if salt_hex else secrets.token_bytes(16)
digest = hashlib.pbkdf2_hmac("sha256", password.encode("utf-8"), salt, 120000)
return digest.hex(), salt.hex()
def _verify_password(password: str, *, password_hash: str, password_salt: str) -> bool:
calculated_hash, _ = _hash_password(password, password_salt)
return secrets.compare_digest(calculated_hash, password_hash)
def _public_user(record: dict[str, str]) -> dict[str, str]:
return {
"full_name": record["full_name"],
"email": record["email"],
"role": record["role"],
"registered_at": record["registered_at"],
}
def _build_session_response(record: dict[str, str], token: str) -> SessionResponse:
role = record["role"]
return SessionResponse(
token=token,
user=_public_user(record),
role_guide=ROLE_GUIDES[role],
platform={
"workflow": PLATFORM_SECTIONS["workflow"],
"documentation": PLATFORM_SECTIONS["documentation"],
"examples": ROLE_GUIDES[role]["examples"],
},
)
def _build_private_space_session() -> SessionResponse:
return _build_session_response(
{
"full_name": "Private Space Team",
"email": "private-space@maris.ai",
"role": DEFAULT_PRIVATE_ROLE,
"registered_at": PRIVATE_SPACE_REGISTERED_AT,
},
token=PRIVATE_SPACE_TOKEN,
)
def _create_session(email: str) -> str:
token = secrets.token_urlsafe(24)
with SESSION_LOCK:
SESSION_STORE[token] = email
return token
def _require_user(session_token: str | None) -> dict[str, str]:
if not AUTH_REQUIRED:
return _build_private_space_session().user
if not session_token:
raise HTTPException(
status_code=401, detail="Pieslēdzies platformai, lai izmantotu human.training rīkus."
)
with SESSION_LOCK:
email = SESSION_STORE.get(session_token)
if not email:
raise HTTPException(status_code=401, detail="Sesija nav derīga. Pieslēdzies vēlreiz.")
record = _load_users().get(email)
if record is None:
raise HTTPException(status_code=401, detail="Lietotāja ieraksts nav atrasts.")
return record
def _user_email(record: dict[str, str] | None) -> str:
if record and record.get("email"):
return str(record["email"]).strip().lower()
return "private-space@maris.ai"
def _request_payload_dict(request: Any) -> dict[str, Any]:
if hasattr(request, "model_dump"):
return request.model_dump()
return dict(request)
def _close_log_handle_unlocked() -> None:
handle = TRAINING_STATE.get("log_handle")
if handle is not None:
handle.close()
TRAINING_STATE["log_handle"] = None
def _write_log_line_unlocked(message: str) -> None:
handle = TRAINING_STATE.get("log_handle")
if handle is None:
return
handle.write(message + "\n")
handle.flush()
def _sync_training_state_unlocked() -> None:
process = TRAINING_STATE.get("process")
if process is None or process.poll() is None:
return
TRAINING_STATE["process"] = None
TRAINING_STATE["finished_at"] = TRAINING_STATE.get("finished_at") or _timestamp()
_close_log_handle_unlocked()
def _save_huggingface_repo_text_file(
*,
repo_id: str,
repo_type: str,
path_in_repo: str,
content: str,
commit_message: str,
) -> dict[str, Any]:
token = get_hf_token()
if not token:
raise RuntimeError("Hugging Face token nav iestatīts publicēšanai.")
try:
from huggingface_hub import HfApi
except ImportError as exc: # pragma: no cover
raise RuntimeError("huggingface_hub nav pieejams Space vidē.") from exc
payload = content.encode("utf-8")
api = HfApi(token=token)
try:
api.upload_file(
path_or_fileobj=payload,
path_in_repo=path_in_repo,
repo_id=repo_id,
repo_type=repo_type,
commit_message=commit_message,
)
except Exception as exc: # noqa: BLE001
detail = str(exc).strip() or type(exc).__name__
raise RuntimeError(
f"Neizdevās saglabāt failu Hugging Face repozitorijā: {detail}."
) from exc
return {
"repo_id": repo_id,
"repo_type": repo_type,
"path": path_in_repo,
"size_bytes": len(payload),
"commit_message": commit_message,
"saved": True,
}
def _training_defaults() -> dict[str, Any]:
return {
"dataset_repo": DEFAULT_DATASET_REPO,
"hub_model_id": DEFAULT_HUB_MODEL_ID,
"model_preset": "balanced",
"model_name": "",
"num_epochs": 3,
"all_branches": False,
"push_to_hub": True,
"output_subdir": DEFAULT_OUTPUT_SUBDIR,
"continue_from_latest_artifact": True,
"continue_model_path": DEFAULT_OUTPUT_SUBDIR,
}
def _training_runtime_payload() -> dict[str, Any]:
model_choices = [
{
"id": preset_id,
"label": f"{preset_id} — {config['model_name']}",
**config,
}
for preset_id, config in list_space_model_choices().items()
]
return {
"model_choices": model_choices,
"has_publish_token": _has_publish_token(),
"defaults": _training_defaults(),
}
def _auto_training_request() -> SpaceTrainingRequest:
defaults = _training_defaults()
output_subdir = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_OUTPUT_SUBDIR",
"MARIS_SPACE_AUTO_TRAIN_OUTPUT_SUBDIR",
default=str(defaults["output_subdir"]),
).strip()
continue_model_path = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_CONTINUE_MODEL_PATH",
"MARIS_SPACE_AUTO_TRAIN_CONTINUE_MODEL_PATH",
"MARIS_TRAIN_CONTINUE_MODEL_PATH",
"HF_TRAIN_CONTINUE_MODEL_PATH",
default="",
).strip()
model_name = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_NAME",
"MARIS_SPACE_AUTO_TRAIN_MODEL_NAME",
"MARIS_TRAIN_BASE_MODEL",
"HF_TRAIN_BASE_MODEL",
default="",
).strip()
model_preset = get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_PRESET",
"MARIS_SPACE_AUTO_TRAIN_MODEL_PRESET",
"MARIS_TRAIN_MODEL_PRESET",
"HF_TRAIN_MODEL_PRESET",
default=str(defaults["model_preset"]),
).strip()
return SpaceTrainingRequest(
dataset_repo=get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_DATASET_REPO",
"MARIS_MEMORY_REPO",
"MARIS_DATASET_REPO",
"HF_DATASET_REPO",
default=str(defaults["dataset_repo"]),
),
model_repo=get_env_any_or_default(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_MODEL_REPO",
"MARIS_HUMAN_TRAINING_MODEL_REPO",
"MARIS_MODEL_REPO",
"HF_MODEL_REPO",
default=str(defaults["hub_model_id"]),
),
model_preset="" if model_name else model_preset,
model_name=model_name,
num_epochs=_env_int(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_NUM_EPOCHS",
"MARIS_TRAIN_NUM_EPOCHS",
"HF_TRAIN_NUM_EPOCHS",
default=int(defaults["num_epochs"]),
),
all_branches=_env_flag(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_ALL_BRANCHES",
"MARIS_SPACE_AUTO_TRAIN_ALL_BRANCHES",
default=bool(defaults["all_branches"]),
),
push_to_hub=_env_flag(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_PUSH_TO_HUB",
"MARIS_SPACE_AUTO_TRAIN_PUSH_TO_HUB",
"MARIS_TRAIN_PUBLISH",
"HF_TRAIN_PUSH_TO_HUB",
default=bool(defaults["push_to_hub"]),
),
output_subdir=output_subdir,
continue_from_latest_artifact=_env_flag(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_CONTINUE_FROM_LATEST",
"MARIS_SPACE_AUTO_TRAIN_CONTINUE_FROM_LATEST",
"MARIS_TRAIN_CONTINUE_FROM_LATEST",
"HF_TRAIN_CONTINUE_FROM_LATEST",
default=bool(defaults["continue_from_latest_artifact"]),
),
continue_model_path=continue_model_path,
)
def _maybe_start_automatic_training() -> None:
if not _env_flag(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN",
"MARIS_SPACE_AUTO_TRAIN",
"HF_SPACE_AUTO_TRAIN",
):
return
try:
request = _auto_training_request()
output_dir = resolve_output_dir(str(PERSISTENT_DIR), request.output_subdir)
force_start = _env_flag(
"MARIS_HUMAN_TRAINING_AUTO_TRAIN_FORCE",
"MARIS_SPACE_AUTO_TRAIN_FORCE",
"HF_SPACE_AUTO_TRAIN_FORCE",
default=False,
)
if not force_start and has_completed_training_artifacts(output_dir):
logger.info(
"Izlaižu human training Space auto-startu, jo output jau satur pabeigta skrējiena artefaktus: %s",
output_dir,
)
return
result = _start_training_process(request)
logger.info(
"Human training Space automātiskais treniņš palaists: pid=%s log=%s",
result["pid"],
result["log_path"],
)
except Exception: # noqa: BLE001
logger.exception("Neizdevās automātiski palaist human training Space treniņu starta laikā.")
@APP.on_event("startup")
def _startup_auto_training() -> None:
_maybe_start_automatic_training()
def _start_training_process(request: Any, *, run_id: str | None = None) -> dict[str, Any]:
if bool(getattr(request, "push_to_hub", False)) and not _has_publish_token():
raise HTTPException(
status_code=400,
detail="Hugging Face token nav iestatīts, bet publicēšana uz Hub ir ieslēgta.",
)
if not Path(TRAIN_SCRIPT).is_file():
raise HTTPException(
status_code=500, detail="Treniņa skripts nav atrasts Space bundle vidē."
)
LOG_DIR.mkdir(parents=True, exist_ok=True)
request_payload = _request_payload_dict(request)
if run_id:
request_payload["run_id"] = run_id
with STATE_LOCK:
_sync_training_state_unlocked()
process = TRAINING_STATE.get("process")
if process is not None:
raise HTTPException(status_code=409, detail="Treniņš jau darbojas.")
_close_log_handle_unlocked()
started_at = _timestamp()
log_path = LOG_DIR / f"training-{started_at.replace(':', '-').replace('+00:00', 'Z')}.log"
log_handle = log_path.open("a", encoding="utf-8")
TRAINING_STATE.update(
{
"process": None,
"log_path": str(log_path),
"log_handle": log_handle,
"started_at": started_at,
"finished_at": None,
"request": request_payload,
"stop_requested": False,
}
)
_write_log_line_unlocked("Starting training request")
_write_log_line_unlocked(json.dumps(request_payload, ensure_ascii=False))
env = build_space_training_env(os.environ.copy(), request, str(PERSISTENT_DIR))
command = build_space_training_command(TRAIN_SCRIPT, request)
process = subprocess.Popen( # noqa: S603
command,
cwd=str(REPO_ROOT),
env=env,
stdout=log_handle,
stderr=subprocess.STDOUT,
start_new_session=True,
)
TRAINING_STATE["process"] = process
return {
"message": "Treniņš palaists human.training Space vidē.",
"log_path": str(log_path),
"pid": process.pid,
}
def _load_training_status() -> dict[str, Any]:
with STATE_LOCK:
_sync_training_state_unlocked()
process = TRAINING_STATE.get("process")
running = process is not None and process.poll() is None
exit_code = None if process is None else process.poll()
log_path = str(TRAINING_STATE.get("log_path") or "")
request = TRAINING_STATE.get("request")
started_at = TRAINING_STATE.get("started_at")
finished_at = TRAINING_STATE.get("finished_at")
requested_stop = bool(TRAINING_STATE.get("stop_requested"))
log_text = tail_log(log_path, max_chars=32000) if log_path else ""
progress = parse_training_progress(
log_text, request=request, running=running, exit_code=exit_code
)
run_id = ""
if isinstance(request, dict):
run_id = str(request.get("run_id") or "")
if run_id and not running and exit_code is not None:
update_run(
PERSISTENT_DIR,
run_id=run_id,
status="completed" if exit_code == 0 else "failed",
finished_at=finished_at or _timestamp(),
exit_code=exit_code,
)
return {
"running": running,
"exit_code": exit_code,
"log_path": log_path,
"log_tail": tail_log(log_path) if log_path else "",
"request": request,
"started_at": started_at,
"finished_at": finished_at,
"requested_stop": requested_stop,
"can_stop": running,
"has_publish_token": _has_publish_token(),
"progress": progress,
}
def _render_cards(items: list[dict[str, str]], *, kind: str) -> str:
cards: list[str] = []
for item in items:
title = html.escape(item["title"])
summary = html.escape(item["summary"])
cards.append(
"\n".join(
[
f' {summary}{title}
",
f"
{headline}
Profesionāli pārbūvēta atsevišķa platforma priekš MarisUK/maris.ai.human.training ar skaidru onboarding, preview, publish un reālu train izpildi.
Šis Space ir būvēts tā, lai komanda vienā vietā sagatavotu human training ievadi, pārskatītu artefaktu manifestu, publicētu to dataset repozitorijā un droši palaistu treniņu ar dzīvu statusu.
Owner, secretary, trainee un user katrs redz saprotamu atbildības zonu jau no pirmās dienas.
Praktiski materiāli, lai darbs būtu vienots, auditējams un profesionāls.
Vienkārša secība no ievades līdz apstiprinātam treniņa startam.
{workspace_summary}
Izvēlies gatavu studijas šablonu, lai forma uzreiz piepildās ar profesionālu sākuma saturu.
Kad izveidosi preview, te parādīsies galvenie kvalitātes signāli un artefaktu kopa.
Sagatavo kvalitātīvu preview, publicē artefaktus un tikai tad palaid treniņu.
Gatavs staging priekšskatam.
Collect → review → publish → train
Hub publish token: {"pieejams" if _has_publish_token() else "nav iestatīts"}
Artefaktu manifests parādīsies šeit.
Kad startēsi treniņu, te parādīsies dzīvais loga izgriezums.
Saglabā darba versijas, ielādē tās atpakaļ formā un turpini no pēdējā stāvokļa.
Redzi staged, published, running un pabeigtos run ierakstus vienā vietā.
Pārlūko staged un publicētos artefaktus ar sample preview un repo ceļiem.
Izvēlies artefaktu no saraksta, lai redzētu preview.