Instructions to use tokimoa/shokuba-probe-2b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use tokimoa/shokuba-probe-2b with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("tokimoa/shokuba-probe-2b") config = load_config("tokimoa/shokuba-probe-2b") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use tokimoa/shokuba-probe-2b with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "tokimoa/shokuba-probe-2b"
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "tokimoa/shokuba-probe-2b" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent new
How to use tokimoa/shokuba-probe-2b with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "tokimoa/shokuba-probe-2b"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default tokimoa/shokuba-probe-2b
Run Hermes
hermes
- OpenClaw new
How to use tokimoa/shokuba-probe-2b with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "tokimoa/shokuba-probe-2b"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "tokimoa/shokuba-probe-2b" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
shokuba-probe-2b
職場点検OSS shokuba-lens の追加確認(probe)用にtokimoaがファインチューニングした2B VLMです。写真に対する点検質問(例: ヘルメット未着用者の人数)に、短い構造化回答で答えます。4bit量子化+アダプタ同梱で約1.7GB、Apple Silicon(MLX)で動作します。
汎用VLMは点検質問に対して「見逃さないが数え過ぎる」傾向があり(実測でprecision 0.57)、点検データでの学習によりこれを解消しています。今後も学習を重ねて対応ドメインと汎化性能を広げていきます(モデル名は据え置きで更新します)。
対応している点検質問(12種)
ヘルメット着用 / 安全ベスト着用 / 安全帯(フルハーネス) / 火・煙の有無 / 消火器の本数 / 転倒者の有無 / マスク着用 / ヘアネット着用(厨房) / 手袋着用(厨房) / フォークリフトの台数(倉庫・物流) / パレットトラックの台数(倉庫・物流) / カゴパレットの有無(倉庫・物流)
実測(学習と分離したテストデータ・画像単位)
| 点検質問 | テスト | ベース(Qwen3-VL-2B 4bit) | shokuba-probe-2b |
|---|---|---|---|
| ヘルメット未着用者の指摘 | SHEL5K 400枚 | F1 0.520 | F1 0.843 |
| 安全ベスト未着用者の指摘 | 55枚 | F1 0.415 | F1 0.946 |
| 安全帯の確認 | 150枚 | F1 0.650 | F1 0.892 |
| マスク着用状況 | 236枚(街頭+厨房) | 一致率 0.216 | 一致率 0.653 |
| ヘアネット未着用の指摘 | 150枚 | F1 0.100 | F1 0.964 |
| 素手(手袋なし)の指摘 | 150枚 | F1 0.538 | F1 0.933 |
| 火・煙の有無 | 200枚 | 一致率 0.660 | 一致率 0.855 |
| 消火器の本数 | 300枚 | 一致率 0.000 | 一致率 0.930 |
| 転倒者の指摘 | 450枚 | 一致率 0.000 | 一致率 0.982 |
| フォークリフトの台数 | LOCO 150枚 | 一致率 0.000 | 一致率 0.807 |
| パレットトラックの台数 | LOCO 150枚 | 一致率 0.000 | 一致率 0.687 |
| カゴパレットの有無 | LOCO 150枚 | 一致率 0.273 | 一致率 0.847 |
消火器・転倒・倉庫3種のテストは対象が写っていない画像を含みます(誤検知側も測定)。転倒は撮影環境の異なる2データセット(Roboflow・CAUCAFall)で、倉庫3種は学習と撮影環境が異なる物流拠点(LOCO公式val分割)で評価しています。転倒の学習には監視カメラ実映像由来の紛らわしい姿勢(座りかけ・立ち上がりかけ)の陰性も含めています。
学習に一切使っていないデータセット(SHWD 安全ヘルメット検出 150枚・学習画像との重複なしをハッシュ検証済み)のヘルメット判定でも F1 0.954 です。写真だけでなく模式図・図解の読み取りにも対応しています。
使い方
shokuba-lensから:
python -m shokuba_lens.analyze --images site1.jpg \
--rules rules/construction_ppe.yaml \
--probe-model tokimoa/shokuba-probe-2b
単体で:
from mlx_vlm import load, generate
from mlx_vlm.prompt_utils import apply_chat_template
from mlx_vlm.utils import load_config
repo = "tokimoa/shokuba-probe-2b" # ローカルにDL済みならそのパス
model, processor = load(repo, adapter_path=repo) # アダプタ同梱
config = load_config(repo)
q = "この画像に写っている人を数えてください。全体の人数、そのうちヘルメット(保護帽)を着用している人数、着用していない人数を「人数:N人、着用:N人、未着用:N人」の形式で答えてください。"
prompt = apply_chat_template(processor, config, q, num_images=1)
print(generate(model, processor, prompt, image=["site.jpg"], max_tokens=60, temperature=0.0).text)
質問文は上記の形式(「人数:N人、着用:N人、未着用:N人」等の回答形式指定つき)が最も安定します。
更新履歴
- 2026-08-04: 対応点検を9種→12種に拡張(倉庫・物流3種を新設・マルチデータセット学習 第3回)。安全ベストF1 0.897→0.946・マスク一致率0.627→0.653・転倒学習に監視カメラ実映像の紛らわしい姿勢陰性を追加
- 2026-08-03: 対応点検を8種→9種に拡張(安全帯を新設・マルチデータセット学習 第2回・11データセット)。未学習データセットへの汎化 F1 0.967(SHWD)・模式図読み取り対応・火/煙0.810→0.865・手袋F1 0.875→0.944
- 2026-08-02: 対応点検を1種→8種に拡張(マルチデータセット学習 第1回)。SHEL5K F1 0.837→0.858
- 2026-07-31: 初版公開(ヘルメット着用のみ・SHEL5K F1 0.837)
データと帰属
学習・評価は以下データセットのアノテーションから導出しています(評価分は学習から除外):
- SHEL5K(CC BY 4.0, Otgonbold, M.E. et al.)
- Construction Site Safety(CC BY 4.0, Roboflow Universe)
- Fall Detection(CC BY 4.0, Roboflow Universe)
- FireExtinguisher(CC BY 4.0, Roboflow Universe)
- Face Mask Detection(CC0)
- Kitchen Hygiene Gear(CC BY 4.0, Roboflow Universe)
- CAUCAFall(CC BY 4.0, Universidad del Cauca — Eraso Guerrero, J.C. et al., "Dataset for human fall recognition in an uncontrolled environment", Data in Brief, 2022)
- D-Fire(de Venâncio, P.V.A.B. et al., "An automatic fire detection system based on deep convolutional neural networks for low-power, resource-constrained devices", Neural Computing and Applications, 2022)
- Work at Height Safety Dataset(CC BY 4.0, Universidad Carlos III de Madrid)
- PPE検出データセット(CC BY 4.0)
- LOCO(Logistics Objects in Context)(CC0, Mayershofer, C. et al., "LOCO: Logistics Objects in Context", IEEE ICMLA 2020)
- MEVA(Multiview Extended Video with Activities)(CC BY 4.0, Corona, K. et al., WACV 2021 — 転倒質問の陰性フレームに使用)
- 汎化評価: SHWD(Safety Helmet Wearing Dataset)(MIT)
- ベース:
Qwen/Qwen3-VL-2B-Instruct(Apache-2.0)
Developed by tokimoa — データを外に出さないAI活用を支援しています
- Downloads last month
- 27
4-bit
Model tree for tokimoa/shokuba-probe-2b
Base model
Qwen/Qwen3-VL-2B-Instruct