scorelens-dd2
Feingetunte Variante von dart-sense (Basismodell, Lizenz CC BY-NC 4.0) für FreeDarts/ScoreLens.
Training auf Modal (T4-GPU), Datensatz DeepDarts D1+D2 (CC BY 4.0).
Nicht besser als die Baseline (siehe Metriken unten) — dieses Modell wird nicht in der App verwendet.
Trainingsdaten
| Datensatz | DeepDarts D1+D2 |
| Bildgröße | 800px |
| Trainingsbilder | 5.536 |
| Validierungsbilder | 615 |
| Epochen | 30 |
| Freeze | kein Freeze (volles Finetuning) |
Metriken (Validierung)
| Metrik | Baseline (dart-sense) | dd2 (feingetunt) |
|---|---|---|
| mAP50 | 0,9940 | 0,9932 |
| mAP50-95 | 0,8802 | 0,9057 |
| Precision | 0,9981 | 0,9966 |
| Recall | 0,9940 | 0,9942 |
| Tip Recall @10px | 0,9609 | 0,9688 |
| Tip Precision @10px | 0,9853 | 0,9751 |
| Tip Recall @10px (nur D2) | 0,9364 | 0,9449 |
| Tip Precision @10px (nur D2) | 0,9736 | 0,9654 |
Tip Recall steigt leicht, Tip Precision sinkt leicht — in Summe kein klarer Vorteil gegenüber der Baseline, daher nicht produktiv eingesetzt.
Harter Benchmark: Schrägsicht + Verderbung kombiniert
Dieselben 615 echten DeepDarts-Val-Bilder, aber jedes einzelne mit starker Schrägsicht (45–60°) und
Realitäts-Verderbung (dunkel, unscharf, verrauscht, JPEG, Schatten) zugleich — kein leichter Fall bleibt übrig.
Aufbau in tools/finetune/bench_hard.py, gemessen auf Modal (T4). Fairer Vergleich über alle Läufe hinweg,
weil identisch für jedes Modell gebaut.
| Kriterium | Wert |
|---|---|
| Spitzen gefunden / richtig @10px (conf 0,3) | 42.7 % / 56.7 % |
| dito @5px | 37.4 % / 49.6 % |
| Board erkannt (alle 4 Kalibrierpunkte) | 2.6 % |
| Wurf komplett richtig gezählt (Kalibrier-Schwelle 0,6) | 4.7 % |
| Darts im richtigen Feld | 5.2 % |
| Enge Spitzen (unter 24 px auseinander) | 31.0 % Recall |
| Drei Darts im Bild | 40.9 % Recall |
| Übersehene Darts / Fehlalarme (von 615 Bildern) | 20 / 4 |
Fremde Fotos (300 unveränderte Bilder aus dem Roboflow-Datensatz dartsync/darts-bjj98-minfw, keines davon im Training gesehen): Wurf richtig gezählt 92.3 %, Darts im Feld 96.7 %, enge Spitzen 90.0 % Recall, 10 übersehene Darts.
Dateien
best.pt,last.pt— Checkpoints (Ultralytics-Format)results.csv— Trainingsverlauf je Epochemetrics.json— Baseline- vs. Ergebnis-Vergleich (Rohdaten für obige Tabelle)