jzpOCR · 古琴减字谱识别模型

减字谱(古琴谱)的自动识别模型。本仓库放的是 jzpOCR 目前能拿出来的三个权重, 按能力分三个子目录。

⚠️ 先把这一页读完再下载。 三个模型解决的是不同的问题, 有的只在特定输入下才有意义,而且其中两个的数字互不可比(口径不同)。

三个模型

子目录 认什么 输入 输出 数
atom-right/ 右手谱字 一个谱字的裁图 ATOM|F:大;H:七八;R:抹;S:七 76/132 = 57.58%
atom-right-f12/ 右手谱字 一个谱字的裁图 同上 83/132 = 62.88%
lc-parent-b/ 左手走手音 一整幅左手母图 上三三(原样串) 122/239 = 51.05%

共同点:都不是整页 OCR。 三者的输入都是已经切好的小图—— 整页要先做版面检测把框切出来。本仓库不含检测模型。

什么时候用哪个

  • 要右手、要最新:atom-right-f12/ —— 上一代的生产候选,数最高(62.88%), 但不是本项目训练的,且预处理要用 canonical。
  • 要右手、要本项目自研的:atom-right/ —— jzpOCR 自主训练系统的产出(57.58%)。
  • 要左手:lc-parent-b/ —— 三个里唯一的左手模型。

⚠️ 那两个右手的数字不可直接比

62.88% 与 57.58% 看着能排序,但它们的预处理口径不同:

归一化模式 输入尺度
atom-right-f12/ canonical [-1, 1]
atom-right/ inkfit [0, 1]

各在自己训练的工况上。换口径,同一批 132 条上 atom-right-f12 会从 83 掉到 58 —— 所以"哪个更好"这个问题,在当前口径下没有干净的答案。两个 README 里都写清了各自的边界。

怎么用

每个子目录都是自洽的:cd 进去、装依赖、跑 infer.py 就行,不需要本仓库的其它部分。

# 右手(二选一)
cd atom-right-f12 && pip install -r requirements.txt && python infer.py 谱字裁图.png
cd atom-right      && pip install -r requirements.txt && python infer.py 谱字裁图.png

# 左手
cd lc-parent-b     && pip install -r requirements.txt && python infer.py 母图.png

也可以只下子目录:

hf download grydlmq/jzpocr --repo-type model --include "atom-right-f12/*" --local-dir ./f12

atom-right* 要 torch,lc-parent-b 要 paddlepaddle。

这些数字是什么

右手两个用的是同一个评测集 fixed_dev,132 条,由两个正式冻结 benchmark 的子集拼成 (PackageA 72 + real110 60,均为 benchmark_only=1 / training_eligible=0,永久排除训练)。 指标是 whole_exact —— 一条读法的每个字段全对才算对。

左手那个用 239 幅母图的 holdout,指标是整串严格相等。

三者都是 crop / 母框级,没有一个是页级端到端数字。 样本量都小(132 / 132 / 239), 单轮 8 个百分点以下的差异不足以说明问题。

溯源与许可

  • atom-right/ 由 jzpOCR 自主训练系统训练,训练图全部是《琴曲集成》的谱字裁图。
  • atom-right-f12/、lc-parent-b/ 是上一代系统的权重,本仓库原样打包发布; 它们的训练图像清单没有随包提供,谱本来源未经核实。
  • 《琴曲集成》是今人整理影印本,不是公有领域刊本。发布者未对模型权重是否构成 该出版物的衍生作品作出法律判断,也未取得相关权利人授权。

本仓库按未授予开源许可(license: other)发布:可以使用与评估, 但不构成对训练数据上游权利的任何许可。底层琴谱本身(明清刻本)多属公有领域; 受限的是这一版的影印与整理。商业使用或再分发前请自行厘清上游权利。

关于 jzpOCR

jzpOCR 是一个 AI 自主训练系统,目标是「真实谱页扫描件 → 结构化谱字序列」这条链路。 交付物是一个命令行工具 jzpocr。本仓库是它的模型侧产物。

各子目录的 README 里有该模型的完整身份、字段表、清理过的边界条件和逐文件校验值。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support